صورت‌حساب سرویس هوش مصنوعی ما در این ماه به ۳۱,۰۰۰ دلار رسید—یعنی بیش از سه برابر بودجه‌ای که در نظر گرفته بودیم—دلیل آن هم این بود که تنها یک خط کد، تقریباً ۸۰٪ از ترافیک ما را به گران‌ترین مدل، یعنی GPT-4o، هدایت می‌کرد.

چرا هزینه‌ها به شدت بالا رفت

ما سیستم را برای قابلیت اطمینان بالا طراحی کردیم: پاسخ‌های سریع، بدون قطعی و مقیاس‌پذیری روان. این انتخاب باعث ایجاد یک «نشت حافظه» (memory leak) کلاسیک در مصرف توکن شد؛ توکن‌ها مدام صرف مدلی می‌شدند که برای اکثر تعاملات، بیش از حد توان (overkill) بود.

تغییر رویکرد مهندسی: هزینه به عنوان یک دغدغه معماری

نگاه کردن به هزینه‌های هوش مصنوعی صرفاً به عنوان یک مسئله مالی، اهرم اصلی را پنهان می‌کند: یعنی کدی که تصمیم می‌گیرد هر درخواست توسط کدام مدل اجرا شود. انتقال فرآیند انتخاب مدل به لایه مسیریابی (routing layer)، یک هزینه پنهان را به یک متغیر قابل کنترل تبدیل کرد.

۱. تطبیق مدل با وظیفه

قانون ساده است: از کوچک‌ترین مدلی که الزامات کیفی را برآورده می‌کند، استفاده کنید. ما چهار نوع درخواست رایج را به جایگزین‌های ارزان‌تر نگاشتیم:

  • چت ساده ← DeepSeek V4 Flash (صرفه‌جویی ۹۷.۵٪)
  • طبقه‌بندی ← Qwen3-8B (صرفه‌جویی ۹۸.۳٪)
  • تولید کد ← DeepSeek Coder (صرفه‌جویی ۹۷.۵٪)
  • خلاصه‌سازی ← Qwen3-32B (صرفه‌جویی ۹۷.۲٪)

این درصدها نشان‌دهنده شکاف مستقیم قیمت توکن بین مدل انتخاب‌شده و GPT-4o است. هزینه این کار، کاهش اندک در توانایی مدل برای وظایفی است که به استدلال سطح بالا نیاز ندارند.

۲. مسیریابی لایه‌ای، مانند یک CDN

ما یک مسیریاب دو لایه ساختیم که ابتدا هر درخواست را به مدل ارزان‌قیمت می‌فرستد. اگر پاسخ در یک بررسی کیفی سریع رد شود (مثلاً سطح اطمینان کمتر از حد آستانه باشد یا موجودیت‌های مورد نیاز وجود نداشته باشند)، ما به‌طور خودکار آن را به یک مدل سطح بالاتر مسیریابی می‌کنیم. این روش جایگزین (fallback)، تجربه کاربری را حفظ می‌کند و در عین حال، مدل گران‌قیمت را فقط زمانی استفاده می‌کند که واقعاً لازم باشد.

۳. کش کردن پرامپت‌های تکراری

بسیاری از تعاملات از یک سیستم پرامپت یا متن FAQ یکسان استفاده می‌کنند. با کش کردن این خروجی‌ها، از محاسبه مجدد پاسخ‌های مشابه جلوگیری می‌کنیم. در آزمایش‌های ما، استفاده از یک کش در حافظه (in-memory cache)، هزینه‌های مربوط به پرامپت‌های تکراری را تقریباً ۳۰٪ کاهش داد.

۴. فشرده‌سازی پرامپت‌ها قبل از ارسال

سیستم پرامپت‌های طولانی، توکن‌ها را با همان نرخ محتوای کاربر مصرف می‌کنند. ما یک پیش‌پردازشگر اضافه کردیم که یک خلاصه‌ساز ارزان‌قیمت را روی پرامپت اجرا می‌کند تا قبل از ارسال به مدل گران‌قیمت، آن را به بافت (context) ضروری محدود کند. این مرحله به تنهایی باعث صرفه‌جویی هزاران دلار در سال در هزینه‌های توکن شد.

تأثیر در دنیای واقعی

هزینه یک چت‌بات پیش از این ۴۲۰ دلار در ماه بود. پس از مسیریابی ۸۵٪ از پرسش‌های آن به یک مدل ارزان‌تر و اعمال سیستم کش، صورت‌حساب به ۲۸ دلار کاهش یافت. تأخیر (latency) نیز بهبود یافت، زیرا مدل سبک‌تر سریع‌تر پاسخ می‌داد و مسیر جایگزین (fallback) به‌ندرت فعال می‌شد.

نتیجه‌گیری

با هزینه‌های هوش مصنوعی مانند یک تصمیم معماری درجه‌یک برخورد کنید. درخواست‌ها را به مدل مناسب مسیریابی کنید، یک مسیر جایگزین مبتنی بر کیفیت اضافه کنید، پرامپت‌های تکراری را کش کنید و ورودی‌ها را فشرده کنید؛ با این کار می‌توانید هزینه‌ها را به شدت کاهش دهید و در عین حال قابلیت اطمینان را حفظ کنید.