AWS добавила функцию сжатия с учетом запроса (query-aware compression) в свой сервис Bedrock, что позволяет разработчикам отсекать нерелевантные фрагменты документов еще до того, как они попадут в языковую модель. Сокращая количество токенов, передаваемых модели, эта функция может снизить расходы на вычисления в конвейерах Retrieval-Augmented Generation (RAG).
Почему RAG-конвейеры съедают бюджет
Системы RAG сначала извлекают текстовые фрагменты из базы знаний, а затем передают эти фрагменты генеративной модели для ответа на вопрос пользователя. В большинстве реализаций каждый извлеченный фрагмент отправляется модели напрямую, даже если большая часть текста не имеет никакого отношения к запросу. Каждое лишнее слово становится токеном, а каждый токен, который обрабатывает модель, увеличивает стоимость вызова API. Для малого и среднего бизнеса, использующего чат-ботов поддержки или инструменты внутреннего поиска, расходы на токены могут быстро превысить стоимость самих вызовов модели.
Что делает сжатие с учетом запроса
Новая возможность Bedrock вставляет этап фильтрации между извлечением и генерацией:
- Система по-прежнему извлекает тот же набор документов для запроса.
- Прежде чем модель увидит текст, легковесный процессор оценивает каждый фрагмент на соответствие конкретному вопросу.
- Сохраняются только те части, которые признаны релевантными; все остальное отбрасывается как шум.
Вам не нужен новый индекс, модель эмбеддингов или дообученная языковая модель. Изменение заключается лишь в перенастройке конвейера для вызова уровня сжатия.
Бизнес-эффект
Поскольку плата за токены растет пропорционально объему текста, отправляемого модели, удаление нерелевантных фрагментов может сократить счета по каждой статье расходов. Наибольшую выгоду получат компании, которые заметили резкий рост затрат на RAG по мере масштабирования использования.
На что обратить внимание
- Протестируйте функцию на собственных данных: проведите сравнительное тестирование стандартного RAG-потока и потока со сжатием с учетом запроса. Измерьте количество токенов, задержку (latency) и релевантность ответов.
- Прозрачность вендоров: при оценке сторонних RAG-платформ спрашивайте, используют ли они сжатие или фильтрацию в своих конвейерах извлечения. Вендор, который отправляет необработанные фрагменты, скорее всего, будет выставлять более высокие ежемесячные счета.
Итог
Небольшая корректировка конвейера — фильтрация нерелевантного текста перед его попаданием в модель — может превратить скрытые расходы в контролируемую статью бюджета. Для организаций, уже использующих RAG на базе Bedrock, включение сжатия с учетом запроса — это простой эксперимент, но любая экономия будет зависеть от специфики ваших данных.
