Чому стиснення контексту ШІ мовчки ігнорує ваші інструкції

Оскільки діалоги з великими мовними моделями (LLM) стають довшими, розробники дедалі частіше покладаються на «стиснення контексту» або компакцію, щоб керувати лімітами токенів і запобігати вузьким місцям у продуктивності. Однак нове дослідження виявляє критичний недолік цієї оптимізації: коли системи ШІ узагальнюють історію розмови для економії місця, вони часто відкидають саме ті правила, що мають керувати їхньою поведінкою.

Крихкість сесійних обмежень

Коли система ШІ проходить процес компакції, її основною метою є збереження безперервності завдання — підтримання мети, поточного стану та необхідних наступних кроків. Хоча це зберігає «що» розмови, це часто приносить у жертву «як».

Дослідники з Пенсильванського університету (Penn State) виявили, що «сесійні обмеження» є першими жертвами цього процесу. Це непостійні правила, встановлені користувачем, такі як «Ніколи не використовуй моє ім'я у своїх відповідях» або «Узгоджуй зі мною будь-які зміни». Оскільки ці інструкції не є частиною основного завдання або постійного системного промпту, алгоритми стиснення розглядають їх як другорядні деталі та видаляють, щоб звільнити місце для більш релевантних даних.

Результати COMPINT: 17% виживання

Щоб кількісно оцінити цю деградацію, дослідники розробили пакет оцінювання COMPINT. Результати вражають: у середньому лише 17 відсотків введених сесійних обмежень виживають у процесі стиснення.

Дослідження підкреслило значне падіння рівня дотримання правил. Коли агент має доступ до повного, нестиснутого контексту, рівень відповідності зазвичай становить від 59% до 71%. Після проведення компакції цей показник стрімко падає, часто досягаючи рівнів, які ледь відрізняються від сценарію, де жодне обмеження взагалі не було надано.

Це не просто питання нюансів спілкування; це серйозний ризик для безпеки та надійності. В агентних робочих процесах втрата такого обмеження, як «Не виконуй код без схвалення», може призвести до несанкціонованих викликів інструментів, витоку даних або неперевірених змін у зовнішніх системах, таких як календарі чи електронна пошта.

Легке рішення за допомогою Qwen3.5-9B

Замість того, щоб переробляти складну логіку стиснення, яку використовують провідні лабораторії ШІ, дослідники пропонують архітектурне виправлення за принципом «plug-and-play». Вони розробили невеликий додатковий модуль на основі моделі Qwen3.5-9B, призначений для роботи як спеціалізований екстрактор.

Цей модуль функціонує наступним чином:

  1. Сканує кожен ввід користувача в режимі реального часу, щоб виявити та ізолювати сесійні обмеження.
  2. Веде спеціалізований, незалежний список цих правил.
  3. Додає цей дистильований список до резюме щоразу, коли основна система виконує компакцію.

Результати цього підходу є надзвичайно ефективними. Екстрактор досяг понад 90 відсотків збереження у різних сценаріях тестування, включаючи 95,6% успішних траєкторій агентів та 90,3% для багатоходових чатів. Оскільки цей метод не потребує перенавчання основної моделі та жодних змін у існуючій інфраструктурі стиснення, він пропонує масштабований шлях до надійнішої взаємодії з ШІ в умовах довгого контексту.

Ключові висновки

  • Стирання обмежень: Стиснення контексту надає пріоритет цілям завдання над правилами поведінки, через що більшість встановлених користувачем «сесійних обмежень» втрачаються під час узагальнення.
  • Ризики безпеки: Втрата інструкцій — наприклад, вимог щодо верифікації за участю людини (human-in-the-loop) — може призвести до несанкціонованих дій агента та порушення безпеки.
  • Модульні виправлення: Використання невеликої спеціалізованої моделі, такої як Qwen3.5-9B, для окремого відстеження обмежень може відновити збереження інструкцій до рівня понад 90%.