صورتحساب سرویس هوش مصنوعی ما در این ماه به ۳۱,۰۰۰ دلار رسید—یعنی بیش از سه برابر بودجهای که در نظر گرفته بودیم—دلیل آن هم این بود که تنها یک خط کد، تقریباً ۸۰٪ از ترافیک ما را به گرانترین مدل، یعنی GPT-4o، هدایت میکرد.
چرا هزینهها به شدت بالا رفت
ما سیستم را برای قابلیت اطمینان بالا طراحی کردیم: پاسخهای سریع، بدون قطعی و مقیاسپذیری روان. این انتخاب باعث ایجاد یک «نشت حافظه» (memory leak) کلاسیک در مصرف توکن شد؛ توکنها مدام صرف مدلی میشدند که برای اکثر تعاملات، بیش از حد توان (overkill) بود.
تغییر رویکرد مهندسی: هزینه به عنوان یک دغدغه معماری
نگاه کردن به هزینههای هوش مصنوعی صرفاً به عنوان یک مسئله مالی، اهرم اصلی را پنهان میکند: یعنی کدی که تصمیم میگیرد هر درخواست توسط کدام مدل اجرا شود. انتقال فرآیند انتخاب مدل به لایه مسیریابی (routing layer)، یک هزینه پنهان را به یک متغیر قابل کنترل تبدیل کرد.
۱. تطبیق مدل با وظیفه
قانون ساده است: از کوچکترین مدلی که الزامات کیفی را برآورده میکند، استفاده کنید. ما چهار نوع درخواست رایج را به جایگزینهای ارزانتر نگاشتیم:
- چت ساده ← DeepSeek V4 Flash (صرفهجویی ۹۷.۵٪)
- طبقهبندی ← Qwen3-8B (صرفهجویی ۹۸.۳٪)
- تولید کد ← DeepSeek Coder (صرفهجویی ۹۷.۵٪)
- خلاصهسازی ← Qwen3-32B (صرفهجویی ۹۷.۲٪)
این درصدها نشاندهنده شکاف مستقیم قیمت توکن بین مدل انتخابشده و GPT-4o است. هزینه این کار، کاهش اندک در توانایی مدل برای وظایفی است که به استدلال سطح بالا نیاز ندارند.
۲. مسیریابی لایهای، مانند یک CDN
ما یک مسیریاب دو لایه ساختیم که ابتدا هر درخواست را به مدل ارزانقیمت میفرستد. اگر پاسخ در یک بررسی کیفی سریع رد شود (مثلاً سطح اطمینان کمتر از حد آستانه باشد یا موجودیتهای مورد نیاز وجود نداشته باشند)، ما بهطور خودکار آن را به یک مدل سطح بالاتر مسیریابی میکنیم. این روش جایگزین (fallback)، تجربه کاربری را حفظ میکند و در عین حال، مدل گرانقیمت را فقط زمانی استفاده میکند که واقعاً لازم باشد.
۳. کش کردن پرامپتهای تکراری
بسیاری از تعاملات از یک سیستم پرامپت یا متن FAQ یکسان استفاده میکنند. با کش کردن این خروجیها، از محاسبه مجدد پاسخهای مشابه جلوگیری میکنیم. در آزمایشهای ما، استفاده از یک کش در حافظه (in-memory cache)، هزینههای مربوط به پرامپتهای تکراری را تقریباً ۳۰٪ کاهش داد.
۴. فشردهسازی پرامپتها قبل از ارسال
سیستم پرامپتهای طولانی، توکنها را با همان نرخ محتوای کاربر مصرف میکنند. ما یک پیشپردازشگر اضافه کردیم که یک خلاصهساز ارزانقیمت را روی پرامپت اجرا میکند تا قبل از ارسال به مدل گرانقیمت، آن را به بافت (context) ضروری محدود کند. این مرحله به تنهایی باعث صرفهجویی هزاران دلار در سال در هزینههای توکن شد.
تأثیر در دنیای واقعی
هزینه یک چتبات پیش از این ۴۲۰ دلار در ماه بود. پس از مسیریابی ۸۵٪ از پرسشهای آن به یک مدل ارزانتر و اعمال سیستم کش، صورتحساب به ۲۸ دلار کاهش یافت. تأخیر (latency) نیز بهبود یافت، زیرا مدل سبکتر سریعتر پاسخ میداد و مسیر جایگزین (fallback) بهندرت فعال میشد.
نتیجهگیری
با هزینههای هوش مصنوعی مانند یک تصمیم معماری درجهیک برخورد کنید. درخواستها را به مدل مناسب مسیریابی کنید، یک مسیر جایگزین مبتنی بر کیفیت اضافه کنید، پرامپتهای تکراری را کش کنید و ورودیها را فشرده کنید؛ با این کار میتوانید هزینهها را به شدت کاهش دهید و در عین حال قابلیت اطمینان را حفظ کنید.
