Принцип червоної лінії

Експеримент, опублікований цього тижня, показує, що об'єктивний стоп-сигнал «червоної лінії» перевершує власне судження LLM щодо завершення циклів автономних агентів у будь-якому верифікованому завданні. У бенчмарку з програмування середньої складності агенти, що використовували червону лінію, досягали збіжності в середньому після 3,3 ітерацій; агенти, які покладалися на самосудження, досягали жорсткого ліміту у вісім кроків, так і не завершивши завдання.

Чому це порівняння важливе

Автономні ШІ-агенти тепер генерують код, пишуть звіти та створюють структуровані дані без участі людини. Кожна ітерація витрачає обчислювальні ресурси, пам'ять, а у разі помилки циклу може пошкодити попередні результати. Визначення моменту, коли агент має зупинитися, є ключовою проблемою надійності. Нові дані свідчать про те, що простий об'єктивний тест — перевірка відповідності результату заздалегідь визначеній умові — працює краще, ніж прохання до моделі заявити: «Я закінчив».

Від ситуативних зупинок до об'єктивних червоних ліній

У дослідженні порівнювали дві стратегії:

  • Умова А — Об'єктивна червона лінія: цикл зупиняється, щойно пройде конкретний тест (наприклад, код компілюється, JSON відповідає схемі, з'являється файл).
  • Умова Б — Самосудження LLM: модель відповідає «ТАК» або «НІ», коли вважає, що завдання виконано.

Обидві стратегії тестувалися на верифікованих завданнях, таких як написання функціонального коду. Підхід із червоною лінією щоразу завершувався успішно; підхід із самосудженням постійно зазнавав невдачі, або вичерпуючи встановлений бюджет ітерацій, або перезаписуючи правильний результат у спробах знайти кращу відповідь. Тип помилки є однотипним: модель створює правильний код, але її впевненість ніколи не перевищує порогу самосудження, тому вона продовжує працювати в циклі, поки система не змусить її зупинитися. Результат: марні цикли та, у деяких випадках, пошкоджені файли.

Три рівні сигналів червоної лінії

Автор пропонує таксономію стоп-сигналів:

  1. Форматна червона лінія — перевіряє синтаксичні властивості (правильний JSON, валідний файл, належне маркування). Гарантує коректно сформовані дані, але не може підтвердити функціональну правильність.
  2. Червона лінія вимог — перевіряє бізнес-логіку або результати тестів (наприклад, проходження юніт-тестів). Це надійний сигнал для продуктового коду.
  3. Семантична червона лінія — намагається оцінити логічну цілісність або якість (наприклад, переконливий звіт). Повністю автоматизованої та надійної метрики поки що не існує, тому цей рівень залишається сферою досліджень.

Побудова продуктового конвеєра на основі червоних ліній

  • Об'єктивний сигнал присутній: інтегруйте червону лінію безпосередньо в цикл. Агент зупиняється автоматично після проходження тесту, що усуває необхідність перевірки людиною.
  • Частковий сигнал: дозвольте циклу зупинитися за червоною лінією, але додайте етап вибірки, де людина перевіряє частину результатів. Це забезпечує баланс між автоматизацією та безпекою.
  • Сигналу немає: встановіть жорстке обмеження кількості ітерацій, позначте результат як «неперевірений» і передайте його людині для оцінки.

Принцип зрозумілий: мета автономного агента полягає не в тому, щоб «робити більше», а в тому, щоб точно знати, коли зупинитися.

Головний висновок для розробників

Якщо ви можете написати об'єктивний тест, дозвольте цьому тесту вирішувати, коли цикл завершиться. Якщо ні — сприймайте цикл як обмежений експеримент і передавайте результат людині. Покладання на здатність LLM самостійно заявляти про завершення залишається ризикованою грою в умовах продакшну.