Наш счет за ИИ-сервисы в этом месяце подскочил до $31 000 — это более чем в три раза превышает наш бюджет — из-за одной строки кода, которая направляла примерно 80 % нашего трафика на самую дорогую модель, GPT-4o.
Почему счет так резко вырос
Мы строили систему, ориентируясь на надежность: быстрые ответы, отсутствие простоев, плавное масштабирование. Этот выбор привел к классической «утечке памяти» в использовании токенов — токены продолжали тратиться на модель, которая была избыточной для большинства взаимодействий.
Инженерный сдвиг: стоимость как архитектурная задача
Рассматривать расходы на ИИ как финансовую проблему — значит упускать из виду реальный рычаг управления: код, который определяет, какая модель обрабатывает каждый запрос. Перенос выбора модели на уровень маршрутизации превратил скрытые расходы в управляемую переменную.
1. Подбор модели под задачу
Правило простое: используйте самую маленькую модель, которая удовлетворяет требованиям к качеству. Мы подобрали более дешевые альтернативы для четырех распространенных типов запросов:
- Простой чат → DeepSeek V4 Flash (экономия 97,5 %)
- Классификация → Qwen3-8B (экономия 98,3 %)
- Генерация кода → DeepSeek Coder (экономия 97,5 %)
- Саммаризация → Qwen3-32B (экономия 97,2 %)
Эти проценты отражают прямую разницу в цене токенов между выбранной моделью и GPT-4o. Компромиссом является небольшое снижение возможностей для задач, не требующих рассуждений высшего уровня.
2. Многоуровневая маршрутизация, как в CDN
Мы создали двухэтапный роутер, который сначала отправляет каждый запрос на дешевую модель. Если ответ не проходит быструю проверку качества — например, уровень уверенности ниже порога или отсутствуют необходимые сущности — мы автоматически перенаправляем его на модель более высокого уровня. Такой механизм отката (fallback) сохраняет пользовательский опыт, при этом премиальная модель задействуется только тогда, когда это действительно необходимо.
3. Кэширование повторяющихся промптов
Во многих взаимодействиях используется один и тот же системный промпт или текст FAQ. Кэшируя эти ответы, мы избегаем повторных вычислений идентичных ответов. В наших тестах кэш в оперативной памяти (in-memory cache) сократил расходы на повторяющиеся промпты примерно на 30 %.
4. Сжатие промптов перед отправкой
Длинные системные промпты потребляют токены с той же скоростью, что и пользовательский контент. Мы добавили препроцессор, который прогоняет через дешевый суммаризатор промпт, обрезая его до необходимого контекста перед отправкой дорогой модели. Только этот шаг сэкономил тысячи долларов в год на расходах на токены.
Реальный эффект
Один чат-бот раньше обходился в $420 в месяц. После того как мы направили 85 % его запросов на более дешевую модель и внедрили кэширование, счет упал до $28. Задержка (latency) уменьшилась, так как более легкая модель отвечала быстрее, а путь отката срабатывал редко.
Итог
Относитесь к расходам на ИИ как к первостепенному архитектурному решению. Маршрутизируйте запросы на подходящую модель, добавьте механизм отката на основе качества, кэшируйте повторяющиеся промпты и сжимайте входные данные — так вы сможете резко сократить расходы, сохранив при этом надежность.
