Показники SWE-bench підскочили з 1,96 % до 72,7 % менш ніж за два роки — стрибок, який у заголовках подають як 37-кратне зростання здібностей ШІ до програмування. Заголовки привертають увагу, але ці цифри порівнюють два різні іспити, а не демонструють єдине, стабільне вдосконалення навичок розробки програмного забезпечення.

Сирі цифри

У 2023 році оригінальний SWE-bench оцінював ШІ-агентів на основі 2294 реальних завдань із GitHub. Завдання були різношерстними: нечіткі описи, зламані тести та багато проблем, з якими було б важко впоратися навіть людині. До 2025 року з'явився той самий бенчмарк із результатом 72,7 %, але тест було звужено до підмножини «Verified», що складалася лише з 500 завдань, які люди перевірили на чіткість та можливість розв'язання.

Як змінився тест

Перехід від повного каталогу до набору Verified — це перша, найбільш помітна зміна. Оригінальна колекція намагалася відобразити хаотичну реальність внесків у open-source — завдання, які є незавершеними, погано задокументованими або просто неможливими без додаткового контексту. Версія Verified, навпаки, навмисно відфільтровує цей хаос. Вона представляє чистіший, більш керований набір задач, де високі бали є реально досяжними.

Оскільки дві версії вимірюють різні сегменти простору задач, пряме порівняння у відсотках вводить в оману. Цифра 1,96 % відображає продуктивність на сирих, невідфільтрованих роботах; цифра 72,7 % відображає продуктивність на кураторській вибірці, де шанси на успіх значно вищі.

Спрямована інженерія

Друга, тонша зміна відбулася в тому, як розробники підходили до бенчмарка. У 2023 році ніхто не створював агентів спеціально для того, щоб блискуче пройти SWE-bench; тест слугував випадковою вибіркою світових викликів у програмуванні. До 2025 року команди перетворили бенчмарк на табло результатів. Вони створювали каркаси (scaffolding), стратегії промптингу та доналаштовували (fine-tuned) моделі з чіткою метою отримати високі бали в наборі Verified.

Коли інженери проєктують систему для проходження конкретного тесту, результат відображає те, наскільки добре система відповідає цьому тесту, а не її загальну здатність. Бенчмарк перестав бути репрезентативною вибіркою реальної роботи в той момент, коли його «виправили» і перетворили на ціль.

Що насправді означає цей стрибок

Вражаюче покращення, про яке пишуть у заголовках, є реальним у тому сенсі, що сучасні кодувальні агенти працюють значно краще з завданнями Verified, ніж вони працювали з оригінальним набором. Це покращення має значення для змагань, наукових робіт та демонстрацій продуктів, які покладаються на той самий кураторський бенчмарк.

Однак цей стрибок не доводить, що ШІ-агенти тепер можуть справлятися з хаосом повсякденної розробки програмного забезпечення. Оригінальний набір із 2294 завдань усе ще існує, і результати в цій версії залишаються низькими.

Запитання, які варто поставити

Щоразу, коли ви бачите величезне коливання результатів бенчмарка, пам'ятайте про ці три перевірки:

  • Яка версія повідомляється? Original, Lite чи Verified? Одинакові назви можуть приховувати дуже різні пули завдань.
  • Що було відфільтровано? Видалення зашумлених або неможливих завдань піднімає планку для будь-якої системи; це також усуває саме ті виклики, які є важливими в реальній експлуатації (production).
  • Чи була система створена саме для проходження цього тесту? Якщо розробники налаштовували моделі або конвеєри (pipelines) під бенчмарк, результат вимірює оптимізацію, а не чисту здатність.

Погляд у майбутнє

Доки такі запобіжні заходи не стануть стандартом, найкращим показником корисності ШІ-кодера залишатиметься його продуктивність у хаотичних реальних задачах, з якими розробники стикаються щодня.

Висновок: Вищий бал у виправленому, цільовому бенчмарку автоматично не доводить, що ШІ-агенти готові до хаосу реального коду; справжнім тестом залишаються невідфільтровані проблеми, з якими інженери борються щодня.