Новий метод ABSeeker під назвою «Answer-Backtracked Credit Assignment» (ABC) дозволяє агентам пошуку з довгим горизонтом дій отримувати «кредит» (оцінку) за кожен окремий крок, а не лише за кінцеву відповідь. Модель із 4 мільярдами параметрів, навчена за допомогою цього методу, вже може зрівнятися з набагато більшими конкурентами або навіть перевершити їх.
Цей прорив має значення, тому що більшість існуючих агентів оцінюються лише наприкінці завдання. Якщо кінцева відповідь правильна, весь цикл вважається успішним; якщо неправильна — вся послідовність позначається як невдала. Такий зворотний зв'язок за принципом «все або нічого» приховує справжній сигнал для навчання — вдалі кроки, за якими випадково послідувала помилка, або марні дії, які завдяки везінню призвели до правильного результату. Підхід ABSeeker переписує ці правила.
Чому старий підхід є недостатнім
Коли агент здійснює пошук, пише код або збирає докази, він зазвичай виконує багато дій: надсилає запити, відкриває сторінки, запускає команди, перевіряє стан системи тощо. Під час виконання з п'ятнадцяти кроків одна помилка може зіпсувати кінцеву відповідь, навіть якщо попередні кроки були правильними. І навпаки, цикл, що завершується правильною відповіддю, міг покладатися на випадкове везіння, де більшість кроків не несли жодної цінності. Навчання лише на основі кінцевого результату змушує модель сприймати всю траєкторію як єдину «чорну скриньку», що ускладнює розуміння того, які саме підповеді є дійсно корисними.
Ця ситуація нагадує відлагодження (debugging) у програмній інженерії. Розробники відстежують кожен рядок, ізолюють невдалий виклик і виправляють його. Агентам же не надавали подібного «детального звіту» про їхню внутрішню роботу. Без такого аудиторського сліду розробники не можуть визначити, чи є покращення результатом кращого мислення, чи простою випадковістю, і не можуть систематично виправляти шкідливі звички.
Як ABC переналаштовує призначення кредитів
Метод Answer-Backtracked Credit Assignment працює у зворотному напрямку від правильної кінцевої відповіді. Спочатку він витягує ключові ознаки, від яких залежить відповідь — конкретні докази, проміжні результати або перевірки стану. Потім він проходить назад через записаний слід, оцінюючи кожну дію відповідно до цих ознак. Дія, яка безпосередньо сприяла отриманню необхідної ознаки, отримує позитивний кредит; нерелевантна або шкідлива дія отримує негативну або нульову оцінку.
На основі цього оцінювання побудовані два режими навчання:
- ABC-SFT (Supervised Fine-Tuning) змінює ваги функції втрат так, щоб кроки з вищим кредитом сильніше впливали на модель. Модель вчиться надавати пріоритет діям, які історично призводили до корисних ознак.
- ABC-GRPO (Gradient-based Reward Policy Optimization) розглядає оцінки за кожен крок як сигнал винагороди для навчання з підкріпленням, зміцнюючи ті конкретні частини пошуку, які допомогли сформуватися відповіді.
Перетворюючи бінарну мітку «успішно/неуспішно» на деталізовану карту внеску, ABC надає моделі набагато багатший сигнал для навчання.
Перші результати говорять самі за себе
Дослідники застосували ABC до скромної моделі із 4 мільярдами параметрів, оснащеної рівнем керування контекстом, який відстежує стан пошуку, що змінюється. У бенчмарк-завданнях, де традиційно перевагу мають набагато більші агенти, модель, навчена за допомогою ABC, або зрівнялася з цими більшими системами, або перевершила їх. Таке підвищення продуктивності відбулося без збільшення розміру моделі, що свідчить про те, що краще призначення кредитів може замінити чисту кількість параметрів.
Головний висновок простий: надайте моделі чіткий звіт про те, що спрацювало, і вона зможе отримати більше користі з того самого обсягу навчальних даних.
Що це означає для реальних агентів
Будь-який агент, що виконує багатоетапну роботу — помічники з програмування, боти для огляду літератури, інструменти підтримки клієнтів — покладається на запис своїх дій. ABC показує, що збереження та оцінка цього запису — це не просто приємне доповнення, а необхідна умова для ефективного навчання.
- Агентам для програмування необхідно реєструвати план, кожну виконану команду та результати тестів, які підтверджують правильність коду.
- Агентам для досліджень необхідно зберігати запити, які вони надсилали, джерела, які вони відкривали, та докази, які вони витягли.
- Агентам підтримки слід фіксувати кожну перевірку стану та точку прийняття рішення, що призвели до вирішення питання.
Коли ці записи доступні, ABC може точно призначати кредити, дозволяючи моделі закріплювати корисні звички та відкидати щасливі короткі шляхи, які в іншому випадку могли б бути помилково прийняті за навичку.
Контраргументи та практичні перешкоди
Переваги ABC супроводжуються додатковою складністю.
Підсумок
Answer-Backtracked Credit Assignment докорінно змінює підхід до того, як ми навчаємо агентів шукати, писати код і міркувати. Завдяки винагородженню правильних кроків у процесі, а не лише за кінцевий результат, це дозволяє моделі помірного розміру навчатися так само ефективно, як і значно більшим моделям. Для кожного, хто розробляє агентів для виконання багатоетапних завдань, впровадження режиму навчання, орієнтованого на трасування (trace-centric), не є просто вибором — це шлях до створення надійного, аудитованого та, зрештою, розумнішого ШІ.
