Modul “proactive memory” baharu membolehkan ejen model bahasa besar menjejaki keperluan tugasan, fakta persekitaran, dan kegagalan lalu—tanpa perlu melakukan fine-tuning pada model teras. Dalam ujian penanda aras, penambahan ini meningkatkan skor Sonnet 4.5 sebanyak 8.3 mata peratusan pada Terminal-Bench 2.0 dan sebanyak 6.8 mata pada suite τ2-Bench; ejen memori yang dilatih dengan SETA meningkatkan pass@1 model pegun daripada 37.6% kepada 41.1% pada masalah yang belum pernah dilihat.

Mengapa ejen hilang arah

Apabila ejen dipacu LLM mengikuti prosedur berbilang langkah, "keadaan" (state) dalamannya merosot. Penyelidik memanggilnya “behavioral state decay”: model tersebut melupakan arahan terdahulu, fakta penting, atau kesilapan yang telah dilakukannya. Hasilnya ialah rantaian keputusan buruk yang membatalkan tugasan jauh sebelum ia selesai.

Penyelesaian biasa adalah dengan memperbesar tetingkap konteks (context window)—iaitu bahagian teks yang boleh diproses oleh model pada satu-satu masa. Itu hanya membantu sehingga tugasan tersebut melebihi saiz tetingkap; maklumat lama akan dibuang dan kemerosotan akan berterusan.

Peringatan yang bertindak hanya apabila perlu

Pendekatan baharu ini menambah ejen memori pembantu yang ringan yang memerhati jejak penaakulan model utama dan menyuntik peringatan yang disasarkan. Berbanding menarik senarai petikan masa lalu yang statik, modul memori ini memutuskan bila dan apa yang perlu dikemukakan, bertindak hanya apabila model utama kelihatan mula menyimpang.

Oleh kerana pembelajar memori dilatih secara berasingan, model tindakan utama kekal pegun (frozen). Kajian menunjukkan bahawa pengasingan ini masih memberikan peningkatan yang ketara pada penanda aras ufuk panjang (long-horizon benchmarks), membuktikan bahawa peringatan proaktif boleh mengimbangi tetingkap konteks yang terhad.

Apa yang dikatakan oleh angka

  • Terminal-Bench 2.0: Sonnet 4.5 melonjak 8.3 mata melebihi garis dasar (baseline)nya.
  • suite τ2-Bench: Model yang sama meningkat sebanyak 6.8 mata.
  • Pass@1 pada ujian yang diasingkan (held-out tests): Ejen memori yang dilatih dengan SETA meningkatkan model pegun daripada 37.6% kepada 41.1%.

Peningkatan ini berlaku tanpa sebarang fine-tuning tambahan pada model utama, jadi komponen memori boleh ditukar masuk atau keluar daripada penggunaan sedia ada.

Had kajian semasa

Eksperimen ini tidak merangkumi ujian terhadap:

  • Skala: Belum ada bukti bahawa modul memori berkelakuan dengan cara yang sama dengan model berbilion-parameter atau tugasan yang berjalan selama berjuta-juta langkah.
  • Kos pengeluaran: Menyimpan dan mendapatkan semula peringatan menambah beban kerja (overhead), tetapi kajian tersebut tidak mengukur jumlah memori atau pengkomputeran tambahan yang diperlukan dalam sistem dunia sebenar.

Apa yang perlu diperhatikan seterusnya

Suite penanda aras masa hadapan perlu mengukur lebih daripada sekadar saiz konteks mentah. Ujian yang menjejaki kemerosotan keadaan secara eksplisit dan memberi ganjaran kepada sistem peringatan aktif akan memberikan gambaran yang lebih jelas tentang kebolehpercayaan jangka panjang sesuatu ejen. Penyelidik juga mesti menunjukkan bahawa memori proaktif boleh diskalakan secara cekap, baik dari segi saiz model mahupun kos operasi.

Rumusan: Modul memori kecil yang dilatih secara berasingan boleh bertindak sebagai pengawas (watchdog) bagi ejen model bahasa besar, mengesan dan membetulkan penyimpangan sebelum ia mengganggu tugasan.