De SWE-bench-scores sprongen in minder dan twee jaar van 1,96 % naar 72,7 %, een stijging die in de koppen wordt gepresenteerd als een 37-voudige sprong in AI-codeervaardigheid. De kop trekt de aandacht, maar de cijfers vergelijken twee verschillende examens, en geen enkele, gestage verbetering in software-engineeringvaardigheden.
De ruwe cijfers
In 2023 evalueerde de oorspronkelijke SWE-bench AI-agenten op basis van 2.294 echte GitHub-issues. De taken waren een rommeltje: vage beschrijvingen, defecte tests en veel problemen waar zelfs een mens moeite mee zou hebben. Tegen 2025 verscheen dezelfde benchmarknaam met een score van 72,7 %, maar de test was beperkt tot een "Verified"-subset van slechts 500 taken die door mensen waren gecontroleerd op duidelijkheid en oplosbaarheid.
Hoe de test veranderde
De verschuiving van de volledige catalogus naar de Verified-set is de eerste en meest zichtbare verandering. De oorspronkelijke collectie probeerde de chaotische realiteit van open-source bijdragen te weerspiegelen — issues die incompleet zijn, slecht gedocumenteerd of simpelweg onmogelijk zonder extra context. De Verified-versie filtert die chaos daarentegen doelbewust weg. Het presenteert een schonere, beter hanteerbare set problemen waarbij hoge scores realistisch haalbaar zijn.
Omdat de twee versies verschillende segmenten van de probleemruimte meten, is een directe vergelijking van percentages misleidend. Het cijfer van 1,96 % geeft de prestaties weer op ruw, ongefilterd werk; het cijfer van 72,7 % geeft de prestaties weer op een gecureerde steekproef waarbij de kans op succes veel groter is.
Gerichte engineering
Een tweede, subtielere verschuiving vond plaats in de manier waarop ontwikkelaars de benchmark benaderden. In 2023 bouwde niemand agenten specifiek om SWE-bench te verslaan; de test fungeerde als een willekeurige steekproef van de programmeeruitdagingen ter wereld. Tegen 2025 hadden teams de benchmark veranderd in een scorebord. Ze bouwden scaffolding, prompting-strategieën en verfijnden modellen (fine-tuned models) met het expliciete doel om goed te scoren op de Verified-set.
Wanneer engineers een systeem ontwerpen om een specifieke test te halen, weerspiegelt de score hoe goed het systeem bij die test past, en niet hoe breed inzetbaar het is. De benchmark was niet langer een representatieve steekproef van werk in de echte wereld op het moment dat deze werd "gerepareerd" en veranderde in een doelstelling.
Wat de sprong echt betekent
De spectaculaire verbetering die in de koppen staat, is echt in die zin dat huidige programmeeragenten aanzienlijk beter presteren op de Verified-taken dan op de oorspronkelijke set. Die verbetering is van belang voor competities, onderzoeksartikelen en productdemo's die vertrouwen op dezelfde gecureerde benchmark.
De sprong bewijst echter niet dat AI-agenten nu de chaos van de dagelijkse softwareontwikkeling aankunnen. De oorspronkelijke set van 2.294 issues bestaat nog steeds, en de scores op die versie blijven laag.
Vragen om te stellen
Wanneer je een enorme schommeling in benchmarkresultaten ziet, houd dan deze drie checks in gedachten:
- Welke versie wordt gerapporteerd? Original, Lite of Verified? Identieke namen kunnen zeer verschillende takenpools maskeren.
- Wat is er weggefilterd? Het verwijderen van ruis of onmogelijke taken verhoogt het plafond voor elk systeem; het verwijdert echter ook precies de uitdagingen die er in productie toe doen.
- Is het systeem gebouwd om deze specifieke test te halen? Als ontwikkelaars modellen of pipelines hebben afgestemd op de benchmark, meet de score optimalisatie en niet de ruwe capaciteit.
Vooruitblik
Totdat dergelijke waarborgen de standaard worden, zal de beste graadmeter voor de bruikbaarheid van een AI-programmeur nog steeds de prestaties zijn op de chaotische, echte problemen waar ontwikkelaars dagelijks mee te maken krijgen.
Kernpunt: Een hogere score op een gerepareerde, gerichte benchmark bewijst niet automatisch dat AI-agenten klaar zijn voor de chaos van echte code; de echte test blijft de ongefilterde problemen waar engineers elke dag mee worstelen.
