Penulis makalah SEED memperkenalkan metode yang memungkinkan agen reinforcement-learning (RL) mengubah log kegagalan mereka sendiri menjadi data pelatihan baru. Metode ini meningkatkan skor rata-rata pada benchmark ALFWorld menjadi 91,8 dan memangkas jumlah data pelatihan sekitar 40%. Teknik yang sama memberikan lonjakan 15,3 poin pada tugas-tugas yang belum pernah dilihat agen, membuktikan bahwa sebuah model dapat belajar dari kesalahannya tanpa pengawasan tambahan yang ditulis manusia.

Mengapa agen RL membutuhkan lebih dari sekadar penanda lulus/gagal

Pengaturan RL tipikal hanya memberikan imbalan kepada agen pada akhir episode yang panjang. Sinyal tersebut memberi tahu sistem bahwa hasilnya salah, tetapi tidak memberi tahu di mana kesalahan terjadi. Jika kesalahan terjadi sepuluh langkah sebelumnya—mungkin istilah pencarian yang salah dimasukkan atau file yang salah dibuka—sinyal biner akhir tersebut membuang semua informasi perantara. Kehilangan ini memaksa peneliti untuk mengumpulkan episode dalam jumlah masif hanya untuk menemukan pola langka yang menyebabkan kegagalan.

Bagaimana SEED mengubah loop umpan balik

SEED (Self-Evolving On-Policy Distillation) menambahkan tahap pembelajaran kedua setelah setiap episode:

  1. Selesaikan tugas – agen berjalan hingga selesai, menerima label sukses/gagal yang biasa.
  2. Baca transkripnya sendiri – urutan tindakan, observasi, dan keputusan perantara diberikan kembali ke model.
  3. Tulis pelajaran dalam bahasa alami – model menghasilkan kalimat pendek yang menjelaskan apa yang salah, misalnya, “istilah pencarian ‘X’ mengembalikan hasil yang tidak relevan” atau “membuka file ‘Y’ alih-alih ‘Z’”.
  4. Distilasi pelajaran menjadi pembaruan kebijakan (policy updates) – kalimat-kalimat tersebut menjadi target untuk langkah distilasi on-policy yang baru, mengajarkan model logika di balik koreksi tersebut.

Pelajaran yang dihasilkan bukanlah prompt yang digunakan pada saat inferensi; melainkan sinyal pelatihan internal yang membentuk kembali kebijakan (policy). Efeknya, agen tersebut menjadi gurunya sendiri, mengubah log kegagalan mentah menjadi pengetahuan terstruktur.

Apa yang membuat pendekatan ini lebih efisien daripada trik memori

Solusi umum yang digunakan adalah dengan menyematkan buffer memori eksternal yang menyimpan status penting atau catatan untuk diingat nanti. Strategi tersebut menciptakan "lemari arsip" yang luas di mana agen harus belajar mengambil potongan informasi yang tepat pada saat yang tepat—sebuah masalah yang tidak sepele yang menambah beban kerja dan masih bisa melewatkan hubungan kausal antara tindakan dan hasil.

SEED menghindari masalah pengambilan (retrieval) tersebut. Dengan menanamkan pelajaran secara langsung ke dalam kebijakan melalui distilasi, agen menginternalisasi koreksi tersebut sebagai sebuah keterampilan, bukan sekadar catatan untuk dicari nanti. Hasilnya adalah loop yang lebih ketat antara deteksi kesalahan dan perubahan perilaku.

Angka-angka yang penting

  • Benchmark ALFWorld – skor rata-rata 91,8, mengalahkan baseline RL konvensional yang menggunakan lingkungan yang sama.
  • Efisiensi data – mencapai performa yang sama atau lebih baik dengan episode pelatihan sekitar 40% lebih sedikit.
  • Generalisasi – pada tugas yang belum pernah dilihat, metode ini menambah 15,3 poin dibandingkan RL standar, menunjukkan bahwa pelajaran yang dihasilkan sendiri mampu menangkap pola penalaran yang dapat ditransfer.

Angka-angka ini menunjukkan bahwa SEED dapat mengurangi anggaran komputasi dan data untuk melatih agen yang kompleks, sebuah keuntungan bagi tim yang tidak memiliki sumber daya simulasi yang masif.

Risiko dan batasan

Teknik ini bergantung pada kemampuan model untuk menafsirkan pengalamannya sendiri dengan benar. Jika agen salah membaca lingkungan—misalnya, mengatribusikan kegagalan pada penyebab yang salah—ia mungkin menghasilkan pelajaran yang salah namun disampaikan dengan penuh percaya diri. Melatih model pada saran yang berhalusinasi seperti itu dapat memperkuat kebiasaan buruk. Penulis mencatat bahwa hal ini serupa dengan post-mortem manusia, di mana analis terkadang menyusun penjelasan yang terlalu rapi sehingga menutupi masalah yang lebih dalam.

Apa yang perlu diperhatikan selanjutnya

  • Integrasi dengan pipeline RL yang ada – karena SEED hanya menambahkan langkah pemrosesan pasca-episode, ia dapat dimasukkan ke dalam banyak loop pelatihan yang sudah ada dengan upaya rekayasa yang moderat.

Pengembang yang membangun agen RL harus mulai memperlakukan log episode lebih dari sekadar data arsip. Setelah setiap sesi, mintalah sistem untuk memunculkan:

  • Keputusan yang paling memajukan tugas.
  • Asumsi yang menyebabkan pemborosan langkah paling besar.
  • Pemeriksaan sederhana yang bisa menangkap kesalahan lebih awal.

Alih-alih memasukkan catatan tersebut kembali sebagai prompt ad-hoc, masukkan ke dalam langkah distilasi seperti yang diusulkan SEED. Hasilnya jelas: performa lebih baik, data lebih sedikit, dan model yang belajar menjelaskan kesalahannya sendiri.

Intisari: Mengubah transkrip kegagalan menjadi pelajaran yang dihasilkan sendiri dapat mengubah umpan balik sparse reward menjadi sinyal pelatihan yang kaya dan dapat digunakan kembali, menawarkan jalur praktis menuju RL yang lebih cepat dan lebih efisien data.