SWE-bench 점수가 2년도 채 되지 않아 1.96%에서 72.7%로 급등했습니다. 헤드라인에서는 이를 AI 코딩 능력의 37배 도약이라고 보도하고 있습니다. 자극적인 헤드라인은 눈길을 끌지만, 이 수치들은 소프트웨어 엔지니어링 기술의 단일하고 꾸준한 향상이 아니라 서로 다른 두 가지 시험을 비교하고 있습니다.
실제 수치
2023년의 기존 SWE-bench는 2,294개의 실제 GitHub 이슈를 바탕으로 AI 에이전트를 평가했습니다. 당시 과제들은 모호한 설명, 깨진 테스트, 그리고 인간조차 해결하기 힘든 문제들이 뒤섞인 난잡한 상태였습니다. 2025년에는 동일한 벤치마크 이름으로 72.7%라는 점수가 등장했지만, 테스트는 인간이 명확성과 해결 가능성을 검증한 500개의 과제로만 구성된 “Verified” 하위 집합으로 축소되었습니다.
테스트의 변화 방식
전체 카탈로그에서 Verified 세트로의 전환은 가장 눈에 띄는 첫 번째 변화입니다. 기존 컬렉션은 불완전하거나 문서화가 제대로 되지 않았거나, 추가적인 맥락 없이는 해결이 불가능한 이슈 등 오픈 소스 기여의 혼란스러운 현실을 반영하려 노력했습니다. 반면, Verified 버전은 의도적으로 그러한 혼란을 걸러냅니다. 높은 점수를 현실적으로 획득할 수 있는, 더 깔끔하고 다루기 쉬운 문제 세트를 제시합니다.
두 버전이 문제 공간의 서로 다른 부분을 측정하기 때문에, 단순한 백분율 비교는 오해를 불러일으킵니다. 1.96%라는 수치는 필터링되지 않은 가공되지 않은 작업에 대한 성능을 나타내며, 72.7%라는 수치는 성공 확률이 훨씬 높은 선별된 샘플에 대한 성능을 나타냅니다.
타겟팅된 엔지니어링
두 번째로 미묘한 변화는 개발자들이 벤치마크에 접근하는 방식에서 나타났습니다. 2023년에는 SWE-bench를 통과하기 위해 특별히 제작된 에이전트가 없었으며, 테스트는 전 세계 코딩 과제의 무작위 샘플 역할을 했습니다. 2025년에 이르러 개발 팀들은 이 벤치마크를 점수판으로 만들었습니다. 그들은 Verified 세트에서 높은 점수를 받는 것을 명시적인 목표로 삼아 스캐폴딩(scaffolding), 프롬프트 전략을 구축하고 모델을 미세 조정(fine-tuning)했습니다.
엔지니어가 특정 테스트를 통과하도록 시스템을 설계하면, 그 점수는 시스템의 광범위한 역량이 아니라 해당 테스트에 얼마나 잘 부합하는지를 반영하게 됩니다. 벤치마크가 “수정”되어 목표물이 되는 순간, 그것은 더 이상 실제 업무를 대표하는 샘플이 아니게 됩니다.
급등이 실제로 의미하는 것
헤드라인을 장식한 이 향상은 현재의 코딩 에이전트가 기존 세트보다 Verified 과제에서 훨씬 더 뛰어난 성능을 보인다는 점에서 사실입니다. 이러한 향상은 동일한 선별된 벤치마크에 의존하는 경연 대회, 연구 논문, 제품 데모에는 중요합니다.
하지만 이 급등이 AI 에이전트가 이제 일상적인 소프트웨어 개발의 복잡함을 처리할 수 있다는 것을 증명하지는 않습니다. 기존의 2,294개 이슈 세트는 여전히 존재하며, 해당 버전의 점수는 여전히 낮습니다.
확인해야 할 질문들
벤치마크 결과에서 엄청난 변동을 목격할 때마다 다음 세 가지 사항을 염두에 두십시오.
- 어떤 버전이 보고되고 있는가? Original, Lite, 아니면 Verified인가? 동일한 이름이라도 과제 풀(pool)은 매우 다를 수 있습니다.
- 무엇이 걸러졌는가? 노이즈가 많거나 불가능한 과제를 제거하면 모든 시스템의 한계치(ceiling)가 높아지지만, 실제 운영 환경에서 중요한 도전 과제들까지 제거하게 됩니다.
- 시스템이 이 특정 테스트를 통과하기 위해 구축되었는가? 개발자가 벤치마크에 맞춰 모델이나 파이프라인을 조정했다면, 그 점수는 순수 역량이 아닌 최적화 정도를 측정하는 것입니다.
향후 전망
이러한 안전장치가 표준이 되기 전까지, AI 코더의 유용성을 판단하는 가장 좋은 척도는 여전히 개발자들이 매일 직면하는 혼란스럽고 실제적인 이슈들에 대한 성능이 될 것입니다.
핵심 요약: 수정되고 타겟팅된 벤치마크에서 높은 점수를 받았다고 해서 AI 에이전트가 실제 코드의 복잡함을 처리할 준비가 되었다는 것이 자동으로 증명되는 것은 아닙니다. 진짜 테스트는 엔지니어들이 매일 씨름하는 필터링되지 않은 문제들로 남아 있습니다.
