Les scores de SWE-bench ont bondi de 1,96 % à 72,7 % en moins de deux ans, une hausse que les gros titres ont présentée comme un bond de 37 fois la capacité de codage de l'IA. Le titre attire l'attention, mais les chiffres comparent deux examens différents, et non une amélioration unique et constante des compétences en génie logiciel.
Les chiffres bruts
En 2023, l'original SWE-bench évaluait les agents d'IA sur 2 294 problèmes (issues) GitHub réels. Les tâches étaient un méli-mélo : descriptions vagues, tests défectueux et nombreux problèmes que même un humain aurait du mal à résoudre. En 2025, le même nom de benchmark est apparu avec un score de 72,7 %, mais le test avait été restreint à un sous-ensemble « Verified » de seulement 500 tâches que des humains avaient validées pour leur clarté et leur résolution possible.
Comment le test a changé
Le passage du catalogue complet à l'ensemble « Verified » est le premier changement, le plus visible. La collection originale tentait de refléter la réalité chaotique des contributions open-source — des problèmes incomplets, mal documentés ou simplement impossibles à résoudre sans contexte supplémentaire. La version « Verified », en revanche, filtre délibérément ce chaos. Elle présente un ensemble de problèmes plus propre et plus facile à traiter, où des scores élevés sont réalistement atteignables.
Comme les deux versions mesurent différentes portions de l'espace de résolution de problèmes, une comparaison directe en pourcentage est trompeuse. Le chiffre de 1,96 % capture la performance sur un travail brut et non filtré ; le chiffre de 72,7 % capture la performance sur un échantillon sélectionné où les chances de succès sont bien plus élevées.
Une ingénierie ciblée
Un second changement, plus subtil, est survenu dans la manière dont les développeurs abordent le benchmark. En 2023, personne ne construisait d'agents spécifiquement pour réussir SWE-bench ; le test agissait comme un échantillon aléatoire des défis de codage mondiaux. En 2025, les équipes ont transformé le benchmark en tableau de bord. Elles ont construit des structures (scaffolding), des stratégies de prompting et ont affiné (fine-tuned) des modèles avec l'objectif explicite d'obtenir de bons scores sur l'ensemble « Verified ».
Lorsque les ingénieurs conçoivent un système pour réussir un test particulier, le score reflète la capacité du système à se conformer à ce test, et non l'étendue de ses capacités. Le benchmark a cessé d'être un échantillon représentatif du travail réel au moment même où il a été « réparé » pour devenir une cible.
Ce que ce bond signifie réellement
L'amélioration qui fait la une est réelle dans le sens où les agents de codage actuels sont nettement plus performants sur les tâches « Verified » qu'ils ne l'étaient sur l'ensemble original. Cette amélioration est importante pour les compétitions, les articles de recherche et les démonstrations de produits qui s'appuient sur ce même benchmark sélectionné.
Cependant, ce bond ne prouve pas que les agents d'IA peuvent désormais gérer le désordre du développement logiciel quotidien. L'ensemble original de 2 294 problèmes existe toujours, et les scores sur cette version restent bas.
Questions à se poser
Chaque fois que vous voyez une variation massive dans les résultats d'un benchmark, gardez à l'esprit ces trois vérifications :
- Quelle version est rapportée ? Original, Lite ou Verified ? Des noms identiques peuvent masquer des ensembles de tâches très différents.
- Qu'est-ce qui a été filtré ? Supprimer les tâches bruyantes ou impossibles augmente le plafond de n'importe quel système ; cela élimine également les défis mêmes qui comptent en production.
- Le système a-t-il été conçu pour réussir ce test spécifique ? Si les développeurs ont ajusté les modèles ou les pipelines pour le benchmark, le score mesure l'optimisation et non la capacité brute.
Perspectives d'avenir
Tant que de telles mesures de sécurité ne deviendront pas la norme, le meilleur indicateur de l'utilité d'un codeur IA restera sa performance sur les problèmes chaotiques du monde réel auxquels les développeurs sont confrontés quotidiennement.
À retenir : Un score plus élevé sur un benchmark réparé et ciblé ne prouve pas automatiquement que les agents d'IA sont prêts pour le désordre du code réel ; le véritable test reste les problèmes non filtrés avec lesquels les ingénieurs luttent chaque jour.
