Skor SWE-bench melonjak dari 1,96% menjadi 72,7% dalam waktu kurang dari dua tahun, sebuah kenaikan yang digambarkan oleh berbagai tajuk berita sebagai lompatan 37 kali lipat dalam kemampuan pengodean AI. Tajuk berita tersebut memang menarik perhatian, tetapi angka-angka tersebut membandingkan dua ujian yang berbeda, bukan peningkatan tunggal yang stabil dalam keterampilan rekayasa perangkat lunak.

Angka mentahnya

Pada tahun 2023, SWE-bench yang asli mengevaluasi agen AI pada 2.294 isu GitHub yang nyata. Tugas-tugasnya sangat beragam: deskripsi yang samar, pengujian yang rusak, dan banyak masalah yang bahkan manusia pun akan kesulitan menyelesaikannya. Pada tahun 2025, nama tolok ukur yang sama muncul dengan skor 72,7%, tetapi pengujiannya telah dipersempit menjadi subset “Verified” yang hanya terdiri dari 500 tugas yang telah diperiksa oleh manusia untuk kejelasan dan kemampuannya untuk diselesaikan.

Bagaimana pengujian tersebut berubah

Pergeseran dari katalog lengkap ke set Verified adalah perubahan pertama dan yang paling terlihat. Koleksi aslinya mencoba mencerminkan realitas kontribusi sumber terbuka (open-source) yang kacau—isu-isu yang tidak lengkap, dokumentasi buruk, atau sekadar mustahil diselesaikan tanpa konteks tambahan. Sebaliknya, versi Verified secara sengaja menyaring kekacauan tersebut. Versi ini menyajikan kumpulan masalah yang lebih bersih dan lebih mudah dikelola, di mana skor tinggi dapat dicapai secara realistis.

Karena kedua versi tersebut mengukur bagian yang berbeda dari ruang masalah, perbandingan persentase secara langsung dapat menyesatkan. Angka 1,96% menangkap performa pada pekerjaan mentah yang tidak disaring; angka 72,7% menangkap performa pada sampel terkurasi di mana peluang keberhasilannya jauh lebih tinggi.

Rekayasa yang ditargetkan

Pergeseran kedua yang lebih halus terjadi pada cara pengembang mendekati tolok ukur tersebut. Pada tahun 2023, tidak ada yang membangun agen khusus untuk menguasai SWE-bench; pengujian tersebut bertindak sebagai sampel acak dari tantangan pengodean dunia. Pada tahun 2025, tim-tim mengubah tolok ukur tersebut menjadi papan skor. Mereka membangun scaffolding, strategi prompting, dan melakukan fine-tuning pada model dengan tujuan eksplisit untuk mendapatkan skor tinggi pada set Verified.

Ketika insinyur merancang sistem untuk lulus pengujian tertentu, skor tersebut mencerminkan seberapa baik sistem tersebut sesuai dengan pengujian itu, bukan seberapa luas kemampuannya. Tolok ukur tersebut berhenti menjadi sampel representatif dari pekerjaan dunia nyata saat ia “diperbaiki” dan diubah menjadi sebuah target.

Apa arti sebenarnya dari lonjakan tersebut

Peningkatan yang menarik perhatian tajuk berita tersebut memang nyata dalam artian bahwa agen pengodean saat ini berkinerja jauh lebih baik pada tugas-tugas Verified dibandingkan pada set aslinya. Peningkatan tersebut penting untuk kompetisi, makalah penelitian, dan demo produk yang mengandalkan tolok ukur terkurasi yang sama.

Namun, lonjakan tersebut tidak membuktikan bahwa agen AI sekarang dapat menangani kerumitan pengembangan perangkat lunak sehari-hari. Set asli berisi 2.294 isu masih ada, dan skor pada versi tersebut tetap rendah.

Pertanyaan yang perlu diajukan

Kapan pun Anda melihat perubahan drastis dalam hasil tolok ukur, ingatlah tiga pemeriksaan ini:

  • Versi mana yang dilaporkan? Original, Lite, atau Verified? Nama yang identik dapat menyembunyikan kumpulan tugas yang sangat berbeda.
  • Apa yang disaring? Menghapus tugas-tugas yang berisik atau mustahil akan menaikkan batas atas bagi sistem apa pun; hal ini juga menghilangkan tantangan-tantangan yang justru penting dalam produksi.
  • Apakah sistem dibangun untuk lulus pengujian spesifik ini? Jika pengembang melakukan tuning pada model atau pipeline untuk tolok ukur tersebut, skor tersebut mengukur optimasi, bukan kemampuan mentah.

Menatap ke depan

Sampai perlindungan semacam itu menjadi standar, tolok ukur terbaik dari kegunaan pengode AI tetaplah kinerjanya pada isu-isu dunia nyata yang kacau yang dihadapi pengembang setiap hari.

Kesimpulan: Skor yang lebih tinggi pada tolok ukur yang telah diperbaiki dan ditargetkan tidak secara otomatis membuktikan bahwa agen AI siap menghadapi kekacauan kode dunia nyata; ujian yang sebenarnya tetaplah masalah-masalah tanpa filter yang dihadapi para insinyur setiap hari.