Die SWE-bench-Scores sprangen in weniger als zwei Jahren von 1,96 % auf 72,7 % – ein Anstieg, den Schlagzeilen als 37-fachen Sprung in der KI-Programmierfähigkeit darstellen. Die Schlagzeile erregt Aufmerksamkeit, aber die Zahlen vergleichen zwei verschiedene Prüfungen und nicht eine einzige, stetige Verbesserung der Software-Engineering-Fähigkeiten.
Die nackten Zahlen
Im Jahr 2023 bewertete der ursprüngliche SWE-bench KI-Agenten anhand von 2.294 echten GitHub-Issues. Die Aufgaben waren ein Durcheinander: vage Beschreibungen, fehlerhafte Tests und viele Probleme, an denen selbst ein Mensch zu scheitern drohte. Bis 2025 tauchte derselbe Benchmark-Name mit einem Score von 72,7 % auf, doch der Test war auf eine „Verified“-Teilmenge von nur 500 Aufgaben reduziert worden, die von Menschen auf Klarheit und Lösbarkeit geprüft worden waren.
Wie sich der Test verändert hat
Der Übergang vom vollständigen Katalog zum „Verified“-Set ist die erste und sichtbarste Änderung. Die ursprüngliche Sammlung versuchte, die chaotische Realität von Open-Source-Beiträgen widerzuspiegeln – Issues, die unvollständig, schlecht dokumentiert oder ohne zusätzlichen Kontext schlichtweg unlösbar sind. Die „Verified“-Version hingegen filtert dieses Chaos bewusst heraus. Sie präsentiert einen saubereren, handhabbareren Aufsatz an Problemen, bei denen hohe Scores realistisch erreichbar sind.
Da die beiden Versionen unterschiedliche Ausschnitte des Problemraums messen, ist ein direkter prozentualer Vergleich irreführend. Der Wert von 1,96 % erfasst die Leistung bei roher, ungefilterter Arbeit; der Wert von 72,7 % erfasst die Leistung bei einer kuratierten Stichprobe, bei der die Erfolgsaussichten weitaus höher sind.
Gezieltes Engineering
Eine zweite, subtilere Verschiebung ergab sich in der Art und Weise, wie Entwickler den Benchmark angehen. Im Jahr 2023 baute niemand Agenten speziell, um den SWE-bench zu meistern; der Test fungierte als Zufallsstichprobe der weltweiten Programmierherausforderungen. Bis 2025 hatten Teams den Benchmark in eine Bestenliste verwandelt. Sie entwickelten Scaffolding, Prompting-Strategien und feinabgestimmte Modelle mit dem expliziten Ziel, im „Verified“-Set gut abzuschneiden.
Wenn Ingenieure ein System entwerfen, um einen bestimmten Test zu bestehen, spiegelt der Score wider, wie gut das System zu diesem Test passt, und nicht, wie breit gefächert seine Fähigkeiten sind. Der Benchmark hörte auf, eine repräsentative Stichprobe der realen Arbeitswelt zu sein, in dem Moment, als er „repariert“ und in ein Ziel verwandelt wurde.
Was der Sprung wirklich bedeutet
Die aufsehenerregende Verbesserung ist real in dem Sinne, dass aktuelle Coding-Agenten bei den „Verified“-Aufgaben dramatisch besser abschneiden als beim ursprünglichen Set. Diese Verbesserung ist relevant für Wettbewerbe, Forschungsarbeiten und Produktdemos, die auf demselben kuratierten Benchmark basieren.
Der Sprung beweist jedoch nicht, dass KI-Agenten nun mit der Unordnung der alltäglichen Softwareentwicklung zurechtkommen. Das ursprüngliche Set mit 2.294 Issues existiert weiterhin, und die Scores in dieser Version bleiben niedrig.
Fragen, die man stellen sollte
Wann immer Sie eine massive Schwankung in Benchmark-Ergebnissen sehen, behalten Sie diese drei Prüfpunkte im Hinterkopf:
- Welche Version wird berichtet? Original, Lite oder Verified? Identische Namen können sehr unterschiedliche Aufgabenpools maskieren.
- Was wurde herausgefiltert? Das Entfernen von verrauschten oder unmöglichen Aufgaben erhöht die Obergrenze für jedes System; es entfernt jedoch auch genau die Herausforderungen, die in der Produktion entscheidend sind.
- Wurde das System gebaut, um diesen spezifischen Test zu bestehen? Wenn Entwickler Modelle oder Pipelines auf den Benchmark abgestimmt haben, misst der Score die Optimierung, nicht die rohe Leistungsfähigkeit.
Ausblick
Bis solche Schutzmaßnahmen zum Standard werden, bleibt die beste Messgröße für die Nützlichkeit eines KI-Coders seine Leistung bei den chaotischen, realen Problemen, mit denen Entwickler täglich konfrontiert sind.
Fazit: Ein höherer Score in einem reparierten, gezielten Benchmark beweist nicht automatisch, dass KI-Agenten bereit für das Chaos von echtem Code sind; der wahre Test bleiben die ungefilterten Probleme, mit denen Ingenieure jeden Tag zu kämpfen haben.
