Наш рахунок за послуги ШІ підскочив до $31 000 цього місяця — це більш ніж у три рази перевищує наш бюджет — через один рядок коду, який спрямовував приблизно 80 % нашого трафіку на найдорожчу модель, GPT-4o.
Чому рахунок злетів
Ми будували систему з розрахунком на надійність: швидкі відповіді, відсутність простоїв, плавне масштабування. Цей вибір призвів до класичного «витоку пам'яті» у використанні токенів — токени продовжували витрачатися на модель, яка була надлишковою для більшості взаємодій.
Інженерний підхід: вартість як архітектурне питання
Розгляд витрат на ШІ як фінансової проблеми приховує справжній важіль впливу: код, який вирішує, яка модель оброблятиме кожен запит. Перенесення вибору моделі на рівень маршрутизації перетворило приховані витрати на керовану змінну.
1. Підбір моделі під завдання
Правило просте: використовуйте найменшу модель, яка задовольняє вимогам до якості. Ми підібрали дешевші альтернативи для чотирьох поширених типів запитів:
- Простий чат → DeepSeek V4 Flash (економія 97,5 %)
- Класифікація → Qwen3-8B (економія 98,3 %)
- Генерація коду → DeepSeek Coder (економія 97,5 %)
- Саммаризація → Qwen3-32B (економія 97,2 %)
Ці відсотки відображають пряму різницю в ціні токенів між обраною моделлю та GPT-4o. Компромісом є незначне зниження можливостей для завдань, які не потребують логічного мислення найвищого рівня.
2. Багаторівнева маршрутизація, як у CDN
Ми створили дворівневий роутер, який спочатку надсилає кожен запит на дешеву модель. Якщо відповідь не проходить швидку перевірку якості — рівень впевненості нижче порогу або відсутні необхідні сутності — ми автоматично перенаправляємо запит на модель вищого рівня. Такий резервний механізм (fallback) зберігає користувацький досвід, використовуючи преміальну модель лише тоді, коли це справді необхідно.
3. Кешування повторюваних промптів
Багато взаємодій використовують один і той самий системний промпт або текст FAQ. Кешуючи ці результати, ми уникаємо повторного обчислення ідентичних відповідей. Кешування в оперативній пам'яті (in-memory cache) дозволило знизити витрати на повторні промпти приблизно на 30 % за результатами наших тестів.
4. Стиснення промптів перед відправкою
Довгі системні промпти споживають токени з такою ж швидкістю, як і контент користувача. Ми додали препроцесор, який запускає дешевий саммаризатор для промпту, скорочуючи його до необхідного контексту перед пересиланням дорожчій моделі. Тільки цей крок заощадив тисячі доларів на рік витрат на токени.
Реальний ефект
Раніше один чат-бот коштував $420 на місяць. Після перенаправлення 85 % його запитів на дешевшу модель та впровадження кешування, рахунок впав до $28. Затримка (latency) зменшилася, оскільки легша модель відповідала швидше, а резервний шлях запускався рідко.
Висновок
Ставтеся до витрат на ШІ як до повноцінного архітектурного рішення. Маршрутизуйте запити до відповідної моделі, додайте резервний механізм на основі якості, кешуйте повторювані промпти та стискайте вхідні дані — так ви зможете різко скоротити витрати, зберігши надійність системи.
