SWE-Prime menunjukkan bahwa melatih model pada 10% hasil “pass” yang dipilih secara cermat menghasilkan agen AI yang lebih kuat daripada memasukkan setiap trajektori yang berhasil ke dalam model, sehingga mempertanyakan kebiasaan lama yang menganggap label “pass” sebagai filter kualitas yang andal.
Hasil ini penting bagi siapa pun yang membangun agen pembuatan kode (code-generation) atau debugging otomatis: lebih banyak data tidak secara otomatis berarti performa yang lebih baik, dan ketergantungan naif pada bendera biner pass/fail sebenarnya dapat mengajarkan model untuk melantur, mengulang panggilan alat (tool calls) yang tidak berguna, dan bergantung pada keberuntungan alih-alih penalaran.
Mengapa bendera “pass” selama ini dipercaya
Dalam sebagian besar alur kerja reinforcement-learning-from-human-feedback, para insinyur melabeli sebuah trajektori—urutan lengkap observasi
SWE-Prime menunjukkan bahwa penanda biner “lulus tes” adalah filter yang tidak andal untuk data pelatihan. Dengan memangkas episode yang bertele-tele, pemanggilan alat yang redundan, dan eksekusi yang terlalu mudah, pengembang dapat melatih agen yang lebih kompeten dan efisien sekaligus memangkas biaya komputasi. Pelajarannya jelas: kualitas lebih penting daripada volume, dan jalan menuju agen AI yang lebih cerdas terletak pada evaluasi mendalam terhadap kontribusi nyata dari setiap langkah.
