Показатели SWE-bench подскочили с 1,96 % до 72,7 % менее чем за два года — рост, который в заголовках преподносится как 37-кратный скачок способностей ИИ к программированию. Заголовок привлекает внимание, но эти цифры сравнивают два разных экзамена, а не единый, стабильный прогресс в навыках программной инженерии.

«Сырые» цифры

В 2023 году оригинальный SWE-bench оценивал ИИ-агентов на основе 2294 реальных задач (issues) из GitHub. Задания представляли собой настоящую мешанину: расплывчатые описания, неработающие тесты и множество проблем, с которыми было бы трудно справиться даже человеку. К 2025 году под тем же названием бенчмарка появился результат в 72,7 %, но тест был сужен до подмножества «Verified» (проверенных), состоящего всего из 500 задач, которые люди отобрали по критериям ясности и решаемости.

Как изменился тест

Переход от полного каталога к набору Verified — это первое и самое заметное изменение. Оригинальная коллекция пыталась отразить хаотичную реальность open-source разработок: задачи, которые неполны, плохо документированы или просто невыполнимы без дополнительного контекста. Версия Verified, напротив, намеренно отфильтровывает этот хаос. Она представляет собой более чистый и поддающийся решению набор задач, где высокие баллы вполне достижимы.

Поскольку две версии измеряют разные сегменты пространства задач, прямое сравнение в процентах вводит в заблуждение. Показатель 1,96 % отражает производительность на «сырой», нефильтрованной работе; показатель 72,7 % отражает производительность на отобранной выборке, где шансы на успех гораздо выше.

Целевая инженерия

Второй, более тонкий сдвиг произошел в подходе разработчиков к бенчмарку. В 2023 году никто не создавал агентов специально для того, чтобы блестяще пройти SWE-bench; тест служил случайной выборкой мировых задач программирования. К 2025 году команды превратили бенчмарк в таблицу лидеров. Они создавали вспомогательные структуры (scaffolding), стратегии промптинга и дообучали модели с явной целью получить высокий балл в наборе Verified.

Когда инженеры проектируют систему специально для прохождения конкретного теста, результат отражает то, насколько хорошо система соответствует этому тесту, а не её общую компетентность. Бенчмарк перестал быть репрезентативной выборкой реальной работы в тот момент, когда его «исправили» и превратили в цель.

Что на самом деле означает этот скачок

Громкое улучшение реально в том смысле, что современные ИИ-агенты справляются с задачами из набора Verified значительно лучше, чем с оригинальным набором. Это улучшение имеет значение для соревнований, научных работ и демонстраций продуктов, которые опираются на тот же отобранный бенчмарк.

Однако этот скачок не доказывает, что ИИ-агенты теперь способны справляться с хаосом повседневной разработки программного обеспечения. Оригинальный набор из 2294 задач всё еще существует, и показатели в этой версии остаются низкими.

Вопросы, которые стоит задать

Whenever you see a massive swing in benchmark results, keep these three checks in mind:

  • Какая версия представлена в отчете? Original, Lite или Verified? Одинаковые названия могут скрывать совершенно разные пулы задач.
  • Что было отфильтровано? Удаление зашумленных или невыполнимых задач повышает потолок для любой системы, но при этом убирает именно те сложности, которые важны в реальной эксплуатации (production).
  • Была ли система создана специально для прохождения этого теста? Если разработчики настраивали модели или пайплайны под бенчмарк, то результат измеряет оптимизацию, а не реальные возможности.

Взгляд в будущее

Пока подобные предосторожности не станут стандартом, лучшим мерилом полезности ИИ-программиста по-прежнему будет его эффективность при решении хаотичных реальных задач, с которыми разработчики сталкиваются ежедневно.

Вывод: Более высокий балл в исправленном, целевом бенчмарке не доказывает автоматически, что ИИ-агенты готовы к хаосу реального кода; настоящим испытанием остаются нефильтрованные проблемы, с которыми инженеры борются каждый день.