Конвейер «сновидений» разработчика запускается дважды в день, сжимая сырой лог событий LLM-агента в компактное, проверенное хранилище памяти и резко сокращая расходы на токены. Это имеет решающее значение, поскольку большинство агентских систем перегружают свою рабочую память каждой увиденной деталью, что быстро приводит к противоречиям, потере контекста и раздуванию затрат на API.
Почему память важна для LLM-агентов
LLM-агенты рассматривают каждый запрос пользователя, вызов инструмента или внутреннее наблюдение как новое «событие». Наивный подход заключается в добавлении каждого события в промпт, который управляет следующим решением. На практике это заполняет промпт шумом, заставляет модель заново оценивать устаревшие факты и выводит использование токенов на самый дорогой тарифный план. Результат: больше ошибок и скрытый счет, который растет с каждым взаимодействием.
Как работают ночные «сновидения»
Система разделяет путь записи (живой лог агента) и путь работы (процесс принятия решений моделью). Дважды в день фоновая задача — называемая «сновидением» (dream) — обрабатывает накопленные события через три этапа:
- Reflect — LLM сканирует кластеры связанных событий, предлагает краткие факты и записывает, какие именно события подтверждают каждое предложение.
- Score — конвейер проверяет, достаточно ли событий подтверждают факт и достаточно ли они распределены во времени, чтобы считаться надежными.
- Judge — две проверки на здравый смысл подтверждают, что новый факт не противоречит существующей памяти и не является дубликатом.
Факты, прошедшие все проверки, переводятся в постоянную память. Те, что не прошли, попадают в очередь на проверку, где оператор-человек одним нажатием клавиши может одобрить или отклонить их. Каждое одобрение создает коммит в стиле git, обеспечивая полный аудиторский след того, какая память изменилась и когда.
Ключевые инженерные выводы
- Разделяйте запись и работу. Позвольте агентам сбрасывать все наблюдения в лог; пусть выделенный процесс решает, что оставить.
- Фокусируйтесь на отсеивании, а не на генерации. Генерировать идеи дешево; предотвратить загрязнение памяти — вот сложная задача.
- Человеческий контроль на самом дешевом этапе. Автоматическое создание черновиков с последующим быстрым ручным подтверждением эффективнее полной автономности с точки зрения стоимости и безопасности.
- Ограничивайте расходы токенов за цикл. Жесткий лимит токенов на один запуск «сновидения» предотвращает неконтролируемые расходы.
- Проверяйте наличие скрытых сбоев. Если один этап применяет иные правила, чем следующий, данные могут незаметно исчезнуть; явные проверки помогут выявить несоответствие.
Потенциальные недостатки
Запуск консолидации в офлайн-режиме вносит задержку: агент не увидит новые проверенные факты до следующего цикла «сновидения». В быстродействующих приложениях, требующих мгновенного обучения, эта задержка может стать недостатком. Система также полагается на одного рецензента-человека; вопрос масштабирования очереди проверки без раздувания затрат на рабочую силу остается открытым.
На что обратить внимание в дальнейшем
Разработчикам, экспериментирующим с LLM-агентами, следует отслеживать счета за токены и логи ошибок на предмет признаков «загрязнения памяти» — повторяющихся или противоречивых утверждений, которые восходят к накоплению сырых событий. Добавление конвейера «сновидений» дает конкретный рычаг для снижения этих затрат, обеспечивая при этом проверяемую историю памяти. По мере того как все больше команд переходят на модель раздельного логирования, вероятно, появятся инструменты, автоматизирующие этапы reflect-score-judge и интегрирующиеся с процессами проверки в стиле систем контроля версий, что сделает этот подход менее специфическим и более plug-and-play. Компромисс между оперативностью и чистотой данных определит, насколько широко ночные «сновидения» станут стандартной частью архитектуры LLM-агентов.
