Один дослідник протягом місяця логував кожен токен, який споживав його дослідницький агент на базі LLM, і в результаті скоротив витрати на 31%. Витрати впали з $945 до $651, тоді як показник успішності трохи зріс із 91% до 93% — результат, який помітить кожен, хто керує чутливими до вартості робочими процетами ШІ.

Чому дані на рівні токенів мали значення

Більшість користувачів LLM бачать лише фінальний рахунок — загальну суму, яка приховує вартість кожного підзавдання. Агент дослідника виконував три основні дії: пошук звітів SEC, підготовка звітів та синтез результатів досліджень. Без детальних даних він не міг зрозуміти, чи були $312, сплачені в червні, витрачені ефективно.

Щоб виявити приховані втрати, він додав рівень логування PostgreSQL, який фіксував назву моделі, кількість токенів, тип завдання та вартість кожного виклику. Через 30 днів дані продемонстрували чітку картину:

  • Пошук звітів SEC — 41% від загальних витрат
  • Підготовка звітів — 28%
  • Синтез досліджень — 17%
  • Перевірка якості — 9%
  • Інше — 5%

Цифри показали, що найдорожчим етапом була не сама модель, а те, як агент подавав необроблені результати пошуку в промпти.

Три кроки, що забезпечили економію

1. Спершу робіть резюме, а потім подавайте промпт

Спочатку агент вставляв 20 необроблених результатів пошуку в кожен промпт, що значно збільшувало кількість вхідних токенів. Він спочатку впровадив дешевий інструмент для резюмування, що суттєво скоротило обсяг вхідних даних. Вартість одного завдання з пошуку впала з $0,84 до $0,19 — скорочення на 77%.

2. Перенаправляйте прості перевірки на дешевшу модель

Перевірки якості виконувалися на потужній моделі, що коштувала $0,09 за перевірку. Він замінив її на дешевшу модель для більшості перевірок типу «пройдено/не пройдено», знизивши ціну за перевірку до $0,01. Дешевша модель відповідала правильно у 89% випадків; будь-яка помилка передавалася на основну модель, що дозволяло зберегти точність, скоротивши витрати на 87%.

3. Пропускайте перевірки, коли впевненість висока

Він додав правило, яке дозволяло оминати етап перевірки якості щоразу, коли історичний показник успішності завдання був високим, а довжина результату перебувала в межах очікуваних значень. Це дозволило усунути близько 60% перевірок, які все одно були б виконані.

Результат

Після впровадження трьох змін щомісячний звіт виглядав так:

  • Загальні витрати: $945 → $651 (скорочення на 31%)
  • Вартість пошуку SEC за завдання: $0,84 → $0,19 (скорочення на 77%)
  • Вартість перевірки якості за завдання: $0,09 → $0,01 (скорочення на 87%)
  • Загальний показник успішності: 91% → 93%

Вищий показник успішності свідчить про те, що коротші промпти зменшили рівень шуму та допомогли моделі зосередитися на головному питанні.

Застереження та контраргументи

Цей підхід ґрунтується на двох припущеннях. По-перше, дешевший інструмент для резюмування має зберігати достатньо інформації для подальших логічних висновків; якщо він відкине критичні деталі, якість результату може погіршитися. По-друге, дешевша модель, що використовується для перевірки якості, не є ідеальною; її точність у 89% означає, що невелика частина помилок все одно потрапляє у фінальний продукт, хоча механізм перенаправлення відловлює більшість із них. Користувачам із суворішими вимогами до відповідності стандартам (compliance) можуть знадобитися жорсткіші пороги або додаткові етапи валідації.

Що це означає для практиків LLM

  • Детальна аналітика — це ключ до успіху. Звіти про витрати високого рівня приховують марну трату токенів. Фіксація використання на рівні кожного завдання виявляє неефективність, яка інакше залишилася б непоміченою.
  • Передові моделі потрібні не завжди. Дешева модель може стискати дані або приймати прості бінарні рішення без шкоди для загальної якості.

Прихована вартість LLM-агента — це часто його неврахована робота. Налаштувавши моніторинг потоку токенів і застосувавши цілеспрямовану оптимізацію, дослідник перетворив щомісячний рахунок у $945 на більш ефективну операцію за $651, водночас підвищивши продуктивність. Для всіх, хто планує бюджет на навантаження ШІ, урок очевидний: рахуйте кожен токен, а потім дозвольте даним підказати, де саме варто скоротити витрати.