Penulis kertas kerja SEED mendedahkan kaedah yang membolehkan ejen pembelajaran pengukuhan (RL) menukar log kegagalan mereka sendiri menjadi data latihan baharu. Ia meningkatkan skor purata pada penanda aras ALFWorld kepada 91.8 dan mengurangkan jumlah data latihan sebanyak kira-kira 40%. Teknik yang sama memberikan lonjakan 15.3 mata pada tugasan yang tidak pernah dilihat oleh ejen, membuktikan bahawa model boleh belajar daripada kesilapannya tanpa penyeliaan tambahan yang ditulis oleh manusia.

Mengapa ejen RL memerlukan lebih daripada sekadar penanda lulus/gagal

Tetapan RL tipikal hanya memberi ganjaran kepada ejen pada akhir episod yang panjang. Isyarat tersebut memberitahu sistem bahawa hasilnya salah, tetapi ia tidak menyatakan di mana ralat berlaku. Jika kesilapan berlaku sepuluh langkah sebelumnya—mungkin istilah carian yang salah dikeluarkan atau fail yang salah dibuka—isyarat binari akhir membuang semua maklumat perantaraan. Kehilangan tersebut memaksa penyelidik untuk mengumpul jumlah episod yang besar hanya untuk mengesan corak jarang yang membawa kepada kegagalan.

Bagaimana SEED mengubah gelung maklum balas

SEED (Self-Evolving On-Policy Distillation) menambah fasa pembelajaran kedua selepas setiap episod:

  1. Selesaikan tugasan – ejen berjalan sehingga selesai, menerima label kejayaan/kegagalan seperti biasa.
  2. Baca transkrip sendiri – urutan tindakan, pemerhatian, dan keputusan perantaraan diberikan semula kepada model.
  3. Tulis pengajaran bahasa semula jadi – model menjana ayat pendek yang menjelaskan apa yang salah, contohnya, “istilah carian ‘X’ memulangkan hasil yang tidak relevan” atau “membuka fail ‘Y’ dan bukannya ‘Z’”.
  4. Sulingkan pengajaran ke dalam kemas kini polisi – ayat-ayat tersebut menjadi sasaran untuk langkah penyulingan on-policy yang baharu, mengajar model logik di sebalik pembetulan tersebut.

Pengajaran yang dijana bukanlah prom yang digunakan semasa waktu inferens; ia adalah isyarat latihan dalaman yang membentuk semula polisi. Kesannya, ejen itu menjadi gurunya sendiri, menukar log kegagalan mentah kepada pengetahuan berstruktur.

Apa yang membuatkan pendekatan ini lebih cekap daripada helah memori

Jalan penyelesaian biasa adalah dengan menyertakan penimbal memori luaran yang menyimpan keadaan atau nota penting untuk rujukan kemudian. Strategi itu mewujudkan "kabinet fail" yang luas di mana ejen mesti belajar untuk mendapatkan bahagian yang betul pada masa yang tepat—satu masalah yang bukan remeh yang menambah beban kerja dan masih boleh terlepas hubungan sebab-akibat antara tindakan dan hasil.

SEED mengelakkan masalah pencarian tersebut. Dengan menyematkan pengajaran secara langsung ke dalam polisi melalui penyulingan, ejen menyerap pembetulan tersebut sebagai satu kemahiran dan bukannya nota untuk dirujuk kemudian. Hasilnya ialah gelung yang lebih erat antara pengesanan ralat dan perubahan tingkah laku.

Angka yang penting

  • Penanda aras ALFWorld – skor purata 91.8, mengatasi garis dasar RL konvensional yang menggunakan persekitaran yang sama.
  • Kecekapan data – mencapai prestasi yang sama atau lebih baik dengan kira-kira 40% episod latihan yang lebih sedikit.
  • Generalisasi – pada tugasan yang tidak dilihat, kaedah ini menambah 15.3 mata berbanding RL standard, menunjukkan bahawa pengajaran yang dijana sendiri menangkap corak penaakulan yang boleh dipindahkan.

Angka-angka ini menunjukkan bahawa SEED boleh mengurangkan bajet pengiraan dan data untuk melatih ejen yang kompleks, satu kelebihan bagi pasukan yang kekurangan sumber simulasi yang besar.

Risiko dan had

Teknik ini bergantung pada keupayaan model untuk mentafsir pengalamannya sendiri dengan betul. Jika ejen tersalah baca persekitaran—contohnya, menyalahkan kegagalan kepada punca yang salah—ia mungkin menghasilkan pengajaran yang salah tetapi dengan penuh yakin. Latihan berdasarkan nasihat halusinasi sedemikian boleh mengukuhkan tabiat buruk. Penulis menyatakan ini selari dengan post-mortem manusia, di mana penganalisis kadangkala membina penjelasan yang terlalu kemas sehingga menutup isu yang lebih mendalam.

Apa yang perlu diperhatikan seterusnya

  • Integrasi dengan saluran kerja RL sedia ada – kerana SEED hanya menambah langkah pemprosesan pasca-episod, ia boleh dimasukkan ke dalam banyak gelung latihan sedia ada dengan usaha kejuruteraan yang sederhana.

Pembangun yang membina ejen RL harus mula menganggap log episod sebagai lebih daripada sekadar data arkib. Selepas setiap larian, minta sistem untuk memaparkan:

  • Keputusan yang paling memajukan tugasan.
  • Andaian yang menyebabkan pembaziran langkah yang paling besar.
  • Semakan mudah yang sepatutnya dapat mengesan ralat lebih awal.

Daripada memasukkan nota tersebut semula sebagai prom ad-hoc, masukkan ia ke dalam langkah penyulingan seperti yang dicadangkan oleh SEED. Hasilnya jelas: prestasi lebih baik, kurang data, dan model yang belajar untuk menjelaskan kesilapannya sendiri.

Rumusan: Menukarkan transkrip kegagalan kepada pengajaran yang dijana sendiri boleh mengubah maklum balas ganjaran yang jarang kepada isyarat latihan yang kaya dan boleh diguna semula, menawarkan jalan praktikal ke arah RL yang lebih pantas dan lebih cekap data.