SWE-Prime menunjukkan bahawa latihan pada 10% larian “pass” yang dipilih dengan teliti menghasilkan ejen AI yang lebih kuat berbanding memasukkan setiap trajektori yang berjaya ke dalam model, sekali gus mempersoalkan tabiat lama yang menganggap label “pass” sebagai penapis kualiti yang boleh dipercayai.

Keputusan ini penting bagi sesiapa sahaja yang membina ejen penjanaan kod atau penyahpepijatan automatik: lebih banyak data tidak semestinya diterjemahkan kepada prestasi yang lebih baik, dan kebergantungan naif pada penanda binari pass/fail sebenarnya boleh mengajar model untuk merayau, mengulang panggilan alatan yang tidak berguna, dan bergantung pada nasib berbanding penaakulan.

Mengapa penanda “pass” telah dipercayai

Dalam kebanyakan saluran paip pembelajaran pengukuhan daripada maklum balas manusia (RLHF), jurutera melabelkan satu trajektori—urutan lengkap pemerhatian, tindakan, dan panggilan alatan—sebagai “pass” apabila hasil akhirnya memenuhi kriteria ujian. Andaiannya mudah: jika ejen berjaya, keseluruhan episod tersebut pasti mengandungi tingkah laku yang berguna. Jadi, mereka memasukkan setiap larian yang lulus ke dalam kumpulan latihan, dengan harapan model akan menyerap corak yang membawa kepada kejayaan tersebut.

Andaian tersebut telah memandu pengumpulan data berskala besar untuk ejen kejuruteraan perisian (SWE) selama berbulan-bulan. Logiknya kelihatan kukuh: "pass" menunjukkan bahawa ejen telah menyelesaikan masalah, jadi episod tersebut sepatutnya memperkukuh polisi yang menyebabkannya berlaku.

Apa yang dilakukan secara berbeza oleh SWE-Prime

Kajian SWE-Prime telah mengubah pendekatan tersebut. Penyelidik mengambil penanda aras standard tugasan penulisan kod dan membahagikan larian yang berjaya kepada dua kumpulan:

  1. Semua trajektori pass – set latihan konvensional, yang mengandungi setiap episod yang melepasi ujian.
  2. Subset 10% yang dikurasi – dipilih secara manual daripada set penuh.

Kedua-dua kumpulan melakukan penalaan halus (fine-tuning) pada seni bina model yang serupa. Apabila dinilai pada masalah yang tidak digunakan semasa latihan, model yang dilatih pada subset yang dikurasi telah mengatasi model yang dilatih pada set pass penuh.

Corak yang merosakkan label “pass”

Kajian tersebut menyenaraikan beberapa mod kegagalan berulang yang tersembunyi di sebalik penanda pass:

  • Spam alatan berulang – ejen mungkin menggunakan kompilator atau linter yang sama berpuluh-puluh kali sebelum akhirnya mendapat output yang betul. Kejayaan akhir menutup ketidakcekapan tersebut.
  • Fasa merayau yang panjang – ejen kadangkala meneroka lima atau lebih langkah yang tidak relevan sebelum terjumpa penyelesaian yang betul. Episod tersebut tetap berakhir dengan "pass", namun sebahagian besar trajektori tidak memberikan nilai instruksional.
  • Ujian remeh – sesetengah penanda aras adalah sangat mudah sehingga ejen boleh berjaya dengan hanya satu tekaan atau dengan mengeksploitasi kelonggaran (loophole). Label "pass" tidak membezakan antara penaakulan tulen dan nasib.

Apabila episod sedemikian memasuki semula gelung latihan, model akan belajar untuk mengaitkan perayauan rawak dan penggunaan alatan yang berlebihan dengan kejayaan. Kesannya, ejen menyerap heuristik “terus mencuba sehingga sesuatu berjaya”, yang tidak diingini bagi sistem gred pengeluaran (production-grade) yang memerlukan kecekapan dan kebolehjelasan (interpretability).

Kualiti tahap segmen berbanding hasil tahap trajektori

Wawasan utama daripada SWE-Prime adalah perbezaan antara hasil keseluruhan trajektori dengan kualiti segmen-segmen pembentuknya. Trajektori adalah label yang kasar: ia memberitahu anda sama ada jawapan akhir adalah betul, tetapi ia menyembunyikan proses membuat keputusan dalaman. Kajian tersebut memerhatikan:

  • Trajektori yang baik boleh mengandungi segmen yang buruk – penyelesaian yang cekap mungkin merangkumi beberapa langkah yang membazir yang tidak menyumbang kepada jawapan akhir.
  • Trajektori yang gagal boleh menyembunyikan segmen yang cemerlang – ejen mungkin menjana pelan yang dirancang dengan sempurna sebelum ralat yang tidak berkaitan menyebabkan ujian gagal.

Dengan memberi skor pada segmen dan bukannya keseluruhan larian, penyelidik mengekalkan episod di mana ejen bertindak dengan niat sejak langkah pertama dan membuang selebihnya. Ini menyelaraskan isyarat latihan dengan corak penaakulan yang sebenarnya kita mahu model tiru.

Kelebihan kos dan kelajuan

Latihan pada satu persepuluh daripada data juga mengurangkan perbelanjaan pengkomputeran secara drastik. Pasukan tersebut memerlukan jam GPU yang jauh lebih sedikit, dan saluran paip selesai dalam sebahagian kecil masa yang diperlukan untuk set pass penuh. Paradoksnya sangat ketara: mereka membayar kurang untuk pengkomputeran sambil mencapai prestasi yang lebih tinggi. Bagi organisasi dengan bajet yang ketat atau matlamat penggunaan berskala besar, penjimatan tersebut adalah sangat signifikan.

Cabaran kurasi

Halangan terbesar untuk menggunakan pendekatan ini adalah menentukan apa yang dianggap sebagai “segmen yang baik.” Pasukan SWE-Prime menyatakan bahawa memberi skor pada segmen tanpa model ganjaran yang mahal adalah sukar dan memerlukan metrik yang bijak dan ringan.

Rumusan

SWE-Prime menunjukkan bahawa penanda binari "lulus ujian" adalah penapis yang tidak boleh dipercayai untuk data latihan. Dengan memangkas episod yang meleret-leret, panggilan alatan yang berulang, dan larian yang terlalu mudah, pembangun boleh melatih ejen yang lebih kompeten dan cekap sambil mengurangkan kos pengkomputeran. Pengajarannya jelas: kualiti lebih penting daripada kuantiti, dan jalan menuju ejen AI yang lebih pintar terletak pada penilaian terperinci tentang apa yang sebenarnya disumbangkan oleh setiap langkah.