SWE-Prime показывает, что обучение на тщательно отобранных 10% «успешных» (pass) запусков позволяет создавать более сильных ИИ-агентов, чем использование всех успешных траекторий. Это ставит под сомнение давнюю привычку считать метку «pass» надежным фильтром качества.
Этот результат важен для всех, кто занимается разработкой агентов для генерации кода или автоматизированной отладки: больше данных не всегда означает лучшую производительность. Наивное доверие к бинарному флагу pass/fail может на самом деле научить модели «блуждать», повторять бесполезные вызовы инструментов и полагаться на удачу, а не на логику.
Почему флагу «pass» доверяли
В большинстве конвейеров обучения с подкреплением на основе обратной связи от человека (RLHF) инженеры помечают траекторию — полную последовательность наблюдений, действий и вызовов инструментов — как «pass», если конечный результат соответствует критериям теста. Предположение простое: если агент справился, то весь эпизод должен содержать полезное поведение. Поэтому все успешные запуски отправляются в обучающую выборку в надежде, что модель усвоит паттерны, приведшие к успеху.
Это предположение месяцами определяло процесс сбора масштабных данных для агентов по программной инженерии (SWE). Логика кажется здравой: метка «pass» указывает на то, что агент решил задачу, а значит, эпизод должен закрепить стратегии, которые привели к этому результату.
Что SWE-Prime сделала иначе
Исследование SWE-Prime изменило правила игры. Исследователи взяли стандартный бенчмарк задач по написанию кода и разделили успешные запуски на две группы:
- Все успешные траектории (All pass trajectories) — традиционный обучающий набор, содержащий каждый эпизод, прошедший тест.
- Отобранное подмножество в 10% — тщательно выбранное из полного набора.
Для обеих групп использовались идентичные архитектуры моделей при дообучении (fine-tuning). При оценке на отложенных задачах модель, обученная на отобранном подмножестве, превзошла свой аналог, обученный на полном наборе успешных траекторий.
Паттерны, которые искажают метку «pass»
В исследовании был описан ряд повторяющихся сценариев ошибок, скрывающихся за флагом «pass»:
- Повторяющийся спам инструментами — агент может десятки раз обращаться к одному и тому же компилятору или линтеру, прежде чем наконец получить правильный результат. Конечный успех маскирует неэффективность.
- Длительные фазы блуждания — агенты иногда совершают пять или более нерелевантных шагов, прежде чем случайно наткнуться на верное решение. Эпизод все равно заканчивается меткой «pass», однако большая часть траектории не несет обучающей ценности.
- Тривиальные тесты — некоторые бенчмарки настолько просты, что агент может справиться с одной попытки или за счет использования лазеек. Метка «pass» не позволяет отличить подлинное рассуждение от везения.
Когда такие эпизоды возвращаются в цикл обучения, модель учится связывать хаотичное блуждание и чрезмерное использование инструментов с успехом. По сути, агент усваивает эвристику «продолжай пробовать, пока что-нибудь не сработает», что нежелательно для систем промышленного уровня, которым важны эффективность и интерпретируемость.
Качество на уровне сегментов против результата на уровне траектории
Ключевой вывод SWE-Prime заключается в разграничении между общим результатом траектории и качеством ее отдельных сегментов. Траектория — это грубая метка: она говорит о том, был ли окончательный ответ верным, но скрывает внутренний процесс принятия решений. Исследование выявило следующее:
- Хорошие траектории могут содержать плохие сегменты — эффективное в остальном решение может включать несколько бесполезных шагов, которые не способствуют получению правильного ответа.
- Неудачные траектории могут скрывать блестящие сегменты — агент может составить идеально обоснованный план, но из-за несвязанной с логикой ошибки тест провалится.
Оценивая сегменты, а не целые запуски, исследователи сохраняли те эпизоды, где агент действовал целенаправленно с самого первого шага, и отбрасывали остальные. Это приводит обучающий сигнал в соответствие с паттернами рассуждения, которые мы на самом деле хотим, чтобы модели имитировали.
Преимущества в стоимости и скорости
Обучение на одной десятой части данных также резко сократило расходы на вычисления. Команде потребовалось гораздо меньше часов работы GPU, а процесс завершился за долю времени, необходимого для работы с полным набором «pass». Парадокс поразителен: они заплатили меньше за вычисления, достигнув при этом более высокой производительности. Для организаций с ограниченным бюджетом или целями масштабного развертывания такая экономия весьма существенна.
Сложность отбора
Главным препятствием для внедрения этого подхода является определение того, что считать «хорошим сегментом». Команда SWE-Prime отметила, что оценивать сегменты без использования дорогостоящей модели вознаграждения (reward model) сложно, и для этого требуется умная, легковесная метрика.
Вывод
SWE-Prime демонстрирует, что бинарный флаг «тест пройден» является ненадежным фильтром для обучающих данных. Отсеивая запутанные эпизоды, избыточные вызовы инструментов и тривиально простые прогоны, разработчики могут обучать более компетентных и эффективных агентов, одновременно сокращая вычислительные затраты. Урок очевиден: качество важнее объема, а путь к созданию более умных ИИ-агентов лежит через детальную оценку того, какой вклад вносит каждый отдельный шаг.
