SWE-bench puanları iki yıldan kısa bir sürede %1,96'dan %72,7'ye fırladı; manşetler bu artışı yapay zeka kodlama yeteneğinde 37 katlık bir sıçrama olarak sundu. Manşet dikkat çekici olsa da rakamlar, yazılım mühendisliği becerilerindeki tek ve istikrarlı bir iyileşmeyi değil, iki farklı sınavı karşılaştırıyor.
Ham rakamlar
2023 yılında orijinal SWE-bench, yapay zeka ajanlarını 2.294 gerçek GitHub sorunu üzerinden değerlendirdi. Görevler bir karmaşadan ibaretti: belirsiz açıklamalar, bozuk testler ve bir insanın bile çözmekte zorlanacağı pek çok problem. 2025 yılına gelindiğinde aynı kıyaslama (benchmark) ismi %72,7'lik bir puanla tekrar karşımıza çıktı, ancak test, insanların netlik ve çözülebilirlik açısından incelediği sadece 500 görevden oluşan "Verified" (Doğrulanmış) bir alt kümeye daraltılmıştı.
Test nasıl değişti?
Tam katalogdan Verified setine geçiş, ilk ve en görünür değişikliktir. Orijinal koleksiyon; eksik, kötü belgelenmiş veya ek bağlam olmadan çözülmesi imkansız olan sorunlarla, açık kaynak katkılarının kaotik gerçekliğini yansıtmaya çalışıyordu. Buna karşılık Verified sürümü, bu kaosu kasıtlı olarak filtreliyor. Yüksek puanların gerçekçi bir şekilde elde edilebildiği, daha temiz ve daha yönetilebilir bir problem seti sunuyor.
İki sürüm problem alanının farklı kesitlerini ölçtüğü için doğrudan bir yüzde karşılaştırması yanıltıcıdır. %1,96'lık rakam, ham ve filtrelenmemiş işlerdeki performansı yakalarken; %72,7'lik rakam, başarı şansının çok daha yüksek olduğu seçilmiş bir örneklemdeki performansı yakalamaktadır.
Hedef odaklı mühendislik
Geliştiricilerin kıyaslama yöntemine yaklaşımında ikinci ve daha ince bir değişim yaşandı. 2023 yılında hiç kimse özellikle SWE-bench'te başarılı olmak için ajanlar inşa etmemişti; test, dünyanın kodlama zorluklarının rastgele bir örneği işlevini görüyordu. 2025 yılına gelindiğinde ise ekipler bu kıyaslamayı bir skor tabelasına dönüştürdü. Doğrulanmış sette yüksek puan alma hedefiyle iskeleler (scaffolding), istem stratejileri (prompting strategies) ve ince ayarlı (fine-tuned) modeller geliştirdiler.
Mühendisler belirli bir testi geçmek için bir sistem tasarladıklarında, puan sistemin ne kadar geniş kapsamlı yetenekli olduğunu değil, o teste ne kadar iyi uyum sağladığını yansıtır. Kıyaslama, "onarıldığı" ve bir hedefe dönüştürüldüğü an, gerçek dünya işlerinin temsilci bir örneği olma özelliğini yitirdi.
Bu sıçrama gerçekte ne anlama geliyor?
Manşetleri süsleyen bu iyileşme, mevcut kodlama ajanlarının Verified görevlerde orijinal sete kıyasla çok daha iyi performans göstermesi bakımından gerçektir. Bu iyileşme; aynı seçilmiş kıyaslamaya dayanan yarışmalar, araştırma makaleleri ve ürün demoları için önem taşımaktadır.
Ancak bu sıçrama, yapay zeka ajanlarının artık günlük yazılım geliştirmenin karmaşıklığıyla başa çıkabileceğini kanıtlamaz. Orijinal 2.294 soruluk set hala mevcuttur ve bu versiyondaki puanlar düşük kalmaya devam etmektedir.
Sorulması gereken sorular
Bir kıyaslama sonucunda devasa bir dalgalanma gördüğünüzde, şu üç kontrolü aklınızda bulundurun:
- Hangi sürüm raporlanıyor? Orijinal mi, Lite mı yoksa Verified mı? Aynı isimler çok farklı görev havuzlarını gizleyebilir.
- Neler filtrelendi? Gürültülü veya imkansız görevlerin çıkarılması, herhangi bir sistem için tavanı yükseltir; ancak aynı zamanda üretim ortamında (production) önem taşıyan asıl zorlukları da ortadan kaldırır.
- Sistem bu özel testi geçmek için mi inşa edildi? Eğer geliştiriciler modelleri veya işlem hatlarını (pipelines) bu kıyaslamaya göre optimize ettilerse, puan ham yeteneği değil, optimizasyonu ölçer.
Geleceğe bakış
Bu tür koruyucu önlemler standart hale gelene kadar, bir yapay zeka kodlayıcısının kullanışlılığının en iyi göstergesi, hala geliştiricilerin her gün karşılaştığı kaotik, gerçek dünya sorunlarındaki performansı olacaktır.
Özet: Onarılmış ve hedef odaklı bir kıyaslamada alınan yüksek bir puan, yapay zeka ajanlarının gerçek dünya kod karmaşasına hazır olduğunu otomatik olarak kanıtlamaz; asıl test, mühendislerin her gün uğraştığı filtresiz problemler olmaya devam etmektedir.
