Независимый исследователь в течение месяца фиксировал каждый токен, потребляемый его исследовательским агентом на базе LLM, и в итоге сократил расходы на 31 %. Затраты снизились с $945 до $651, в то время как показатель успеха немного вырос с 91 % до 93 % — результат, который заметит любой, кто управляет чувствительными к стоимости рабочими процессами ИИ.
Почему важны данные на уровне токенов
Большинство пользователей LLM видят только итоговый счет — единую сумму, которая скрывает стоимость каждой подзадачи. Агент исследователя выполнял три основные функции: поиск по отчетности SEC, подготовка отчетов и создание синтеза результатов исследования. Без детализированных данных он не мог понять, насколько эффективно были потрачены $312 в июне.
Чтобы выявить скрытые потери, он добавил слой логирования PostgreSQL, который фиксировал название модели, количество токенов, тип задачи и стоимость одного вызова. Через 30 дней данные представили четкую картину:
- Поиск по отчетности SEC — 41 % от общих расходов
- Подготовка отчетов — 28 %
- Синтез результатов исследования — 17 %
- Проверка качества — 9 %
- Прочее — 5 %
Цифры показали, что самым дорогим этапом была не сама модель, а то, как агент передавал необработанные результаты поиска в промпты.
Три изменения, которые обеспечили экономию
1. Сначала делайте суммаризацию, затем подавайте промпт
Изначально агент загружал 20 необработанных результатов поиска в каждый промпт, что раздувало объем входных данных на огромное количество токенов. Он внедрил сначала дешевую модель для суммаризации, что резко сократило объем входных данных. Стоимость одной задачи поиска упала с $0,84 до $0,19 — сокращение на 77 %.
2. Направляйте простые проверки на более дешевую модель
Проверки качества выполнялись на высокопроизводительной модели, которая стоила $0,09 за проверку. Он заменил её на более дешевую модель для большинства проверок по принципу «пройдено/не пройдено», снизив цену за проверку до $0,01. Дешевая модель отвечала правильно в 89 % случаев; в случае ошибки запрос перенаправлялся на исходную модель, что сохраняло точность при снижении затрат на 87 %.
3. Пропускайте проверки при высокой степени уверенности
Он добавил правило: пропускать этап проверки качества всякий раз, когда исторический показатель успеха задачи был высоким, а длина ответа находилась в пределах ожидаемых значений. Это позволило исключить около 60 % проверок, которые в любом случае были бы запущены.
Итоги
После внедрения трех изменений ежемесячный отчет выглядел следующим образом:
- Общие расходы: $945 → $651 (сокращение на 31 %)
- Стоимость поиска по SEC на одну задачу: $0,84 → $0,19 (сокращение на 77 %)
- Стоимость проверки качества на одну задачу: $0,09 → $0,01 (сокращение на 87 %)
- Общий показатель успеха: 91 % → 93 %
Более высокий показатель успеха позволяет предположить, что укороченные промпты уменьшили уровень шума и помогли модели сосредоточиться на основном вопросе.
Оговорки и контраргументы
Этот подход опирается на два допущения. Во-первых, дешевая модель для суммаризации должна сохранять достаточно информации для последующих логических рассуждений; если она отбросит критические детали, качество ответа может пострадать. Во-вторых, менее затратная модель, используемая для проверок качества, не идеальна: её точность в 89 % означает, что небольшая часть ошибок всё же попадает в конечный продукт, хотя механизм перенаправления отлавливает большинство из них. Пользователям с более строгими требованиями к комплаенсу могут потребоваться более жесткие пороги или дополнительные этапы валидации.
Что это значит для специалистов по LLM
- Детализированные дашборды — залог успеха. Отчеты о расходах верхнего уровня скрывают пустую трату токенов. Регистрация использования по каждой задаче выявляет неэффективность, которая иначе осталась бы незамеченной.
- Передовые модели требуются не всегда. Дешевая модель может сжимать данные или принимать простые бинарные решения без ущерба для общего качества.
Скрытая стоимость агента LLM — это часто его неизмеренная работа. Настроив мониторинг потока токенов и применив точечную оптимизацию, исследователь превратил ежемесячный счет в $945 в более экономную операцию стоимостью $651, одновременно повысив производительность. Для всех, кто планирует бюджет на рабочие нагрузки ИИ, урок очевиден: измеряйте каждый токен, а затем позволяйте данным подсказывать, где именно стоит сократить расходы.
