Skor SWE-bench melonjak daripada 1.96% kepada 72.7% dalam masa kurang daripada dua tahun, satu peningkatan yang digambarkan oleh tajuk berita sebagai lonjakan 37 kali ganda dalam keupayaan pengekodan AI. Tajuk berita tersebut memang menarik perhatian, tetapi angka-angka tersebut membandingkan dua peperiksaan yang berbeza, bukannya satu peningkatan tunggal yang stabil dalam kemahiran kejuruteraan perisian.

Angka mentah

Pada tahun 2023, SWE-bench yang asal menilai ejen AI berdasarkan 2,294 isu GitHub yang sebenar. Tugasan-tugasan tersebut adalah campuran yang tidak teratur: penerangan yang kabur, ujian yang rosak, dan banyak masalah yang sukar diselesaikan walaupun oleh manusia. Menjelang tahun 2025, nama penanda aras yang sama muncul dengan skor 72.7%, tetapi ujian tersebut telah dikecilkan kepada subset "Verified" yang hanya mengandungi 500 tugasan yang telah disemak oleh manusia dari segi kejelasan dan kebolehselesaian.

Bagaimana ujian tersebut berubah

Peralihan daripada katalog penuh kepada set Verified adalah perubahan pertama yang paling ketara. Koleksi asal cuba mencerminkan realiti sumbangan sumber terbuka yang kucar-kacir—isu yang tidak lengkap, didokumentasikan dengan lemah, atau mustahil untuk diselesaikan tanpa konteks tambahan. Sebaliknya, versi Verified sengaja menapis kekacauan tersebut. Ia membentangkan set masalah yang lebih bersih dan lebih mudah diurus di mana skor tinggi boleh dicapai secara realistik.

Oleh kerana kedua-dua versi tersebut mengukur bahagian ruang masalah yang berbeza, perbandingan peratusan secara langsung adalah mengelirukan. Angka 1.96% merangkumi prestasi pada kerja mentah yang tidak ditapis; manakala angka 72.7% merangkumi prestasi pada sampel yang dikurasi di mana peluang untuk berjaya adalah jauh lebih tinggi.

Kejuruteraan bersasaran

Peralihan kedua yang lebih halus berlaku dalam cara pembangun mendekati penanda aras tersebut. Pada tahun 2023, tiada sesiapa yang membina ejen khusus untuk cemerlang dalam SWE-bench; ujian tersebut bertindak sebagai sampel rawak bagi cabaran pengekodan dunia. Menjelang tahun 2025, pasukan pembangun telah menjadikan penanda aras tersebut sebagai papan markah. Mereka membina perancah (scaffolding), strategi arahan (prompting), dan menala halus (fine-tune) model dengan matlamat eksplisit untuk mendapat skor tinggi pada set Verified.

Apabila jurutera mereka bentuk sistem untuk lulus ujian tertentu, skor tersebut mencerminkan sejauh mana sistem itu sesuai dengan ujian tersebut, bukannya sejauh mana keupayaan luasnya. Penanda aras tersebut berhenti menjadi sampel yang mewakili kerja dunia nyata sebaik sahaja ia "diperbaiki" dan dijadikan sebagai sasaran.

Apa maksud sebenar lonjakan tersebut

Peningkatan yang menarik perhatian tajuk berita itu adalah benar dalam erti kata bahawa ejen pengekodan semasa berprestasi jauh lebih baik pada tugasan Verified berbanding tugasan pada set yang asal. Peningkatan itu penting untuk pertandingan, kertas penyelidikan, dan demonstrasi produk yang bergantung kepada penanda aras yang dikurasi yang sama.

Walau bagaimanapun, lonjakan tersebut tidak membuktikan bahawa ejen AI kini boleh mengendalikan kekacauan pembangunan perisian harian. Set asal yang mengandungi 2,294 isu masih wujud, dan skor pada versi tersebut kekal rendah.

Soalan yang perlu ditanya

Setiap kali anda melihat perubahan besar dalam keputusan penanda aras, ingatlah tiga semakan ini:

  • Versi manakah yang dilaporkan? Asal (Original), Lite, atau Verified? Nama yang serupa boleh menyembunyikan kumpulan tugasan yang sangat berbeza.
  • Apa yang telah ditapis? Menyingkirkan tugasan yang "bising" atau mustahil akan meningkatkan had siling bagi mana-mana sistem; ia juga menyingkirkan cabaran sebenar yang penting dalam pengeluaran (production).
  • Adakah sistem itu dibina untuk lulus ujian khusus ini? Jika pembangun menala model atau saluran paip (pipeline) untuk penanda aras tersebut, skor itu mengukur pengoptimuman, bukannya keupayaan mentah.

Melihat ke hadapan

Sehingga langkah perlindungan sedemikian menjadi standard, kayu ukur terbaik bagi kegunaan pengekod AI tetaplah prestasinya pada isu dunia nyata yang kucar-kacir yang dihadapi oleh pembangun setiap hari.

Rumusan: Skor yang lebih tinggi pada penanda aras yang telah diperbaiki dan bersasaran tidak membuktikan secara automatik bahawa ejen AI sudah bersedia untuk kekacauan kod dunia nyata; ujian sebenar tetap pada masalah tanpa tapisan yang perlu dihadapi oleh jurutera setiap hari.