Bagaimana Memori Terstruktur Membantu Agen AI Menaklukkan Slay the Spire 2

Para peneliti telah mengembangkan arsitektur agen baru, AgenticSTS, yang mengungguli agen LLM tradisional dengan mengganti log obrolan yang membengkak dengan sistem memori terstruktur lima lapis yang canggih. Dengan beralih dari model "transkrip yang terus tumbuh", pendekatan ini secara signifikan mengurangi biaya token sekaligus memungkinkan agen untuk mempelajari strategi kompleks di berbagai sesi permainan.

Masalah dengan Log Obrolan yang Terus Tumbuh

Sebagian besar agen LLM saat ini, seperti yang menggunakan kerangka kerja ReAct atau Reflexion, mengandalkan penambahan setiap observasi masa lalu, panggilan alat (tool call), dan refleksi diri ke dalam log teks yang berkelanjutan. Seiring berjalannya sesi, jendela konteks ini meluas hingga akhirnya meluap atau perhatian model menjadi terpecah oleh data historis yang tidak relevan.

Dalam pengujian melawan game roguelike deck-building yang kompleks, Slay the Spire 2, ketidakefisienan ini sangat terlihat jelas. Kompetitor seperti STS2MCP dan CharTyr, yang menggunakan pola transkrip yang terus tumbuh yang klasik, mengalami lonjakan pemanggilan model tunggal hingga mencapai sekitar 527.000 token. Cacat arsitektural ini menyebabkan latensi yang masif dan biaya token yang astronomis, di mana kompetitor menggunakan 66 hingga 90 kali lebih banyak token dibandingkan AgenticSTS untuk mencapai skor yang serupa.

Solusi Memori Lima Lapis

AgenticSTS memecahkan masalah inflasi konteks dengan membangun kembali setiap prompt keputusan dari lima slot memori diskrit yang terorganisir. Hal ini memastikan prompt tetap ramping—rata-rata sekitar 5.000 token—terlepas dari seberapa lama permainan berlangsung. Lapisan-lapisannya disusun sebagai berikut:

  • L1 (Fixed Protocol): Instruksi inti untuk agen.
  • L2 (State Schemas): Definisi dari tindakan yang valid saat ini.
  • L3 (Retrievable Rules): Aturan permainan spesifik yang diambil sesuai kebutuhan.
  • L4 (Episodic Memory): Ringkasan dari sesi sebelumnya untuk memberikan konteks jangka panjang.
  • L5 (Skill Library): Aturan taktis yang dipicu oleh pola situasi tertentu.

Modularitas ini memungkinkan peneliti untuk menentukan dengan tepat komponen mana yang mendorong peningkatan performa. Sebagai contoh, mengaktifkan pustaka keterampilan L5 saja telah melipatgandakan tingkat kemenangan agen dari 3 dari 10 permainan menjadi 6 dari 10 permainan pada tingkat kesulitan A0.

Meningkatkan Kesulitan Melalui Pembelajaran

Kekuatan nyata dari pendekatan terstruktur ini terletak pada pembelajaran antar-sesi (inter-run learning). Sementara agen standar kesulitan untuk berkembang melampaui tingkat kesulitan terendah, AgenticSTS memanfaatkan lapisan L4 dan L5 miliknya untuk menaiki tangga kesulitan permainan. Tanpa memori aktif yang diperbarui di antara sesi, agen akan tertahan di level A2 hingga A4; namun, dengan memori yang bertahan di berbagai sesi, ia berhasil mencapai level A6 hingga A8 yang jauh lebih sulit.

Menariknya, para peneliti menemukan bahwa memori ini sangat spesifik terhadap model. Ketika tumpukan memori yang dihasilkan oleh Gemini 3.1 Pro dipindahkan ke Qwen 3.6-27B, skor yang terakhir naik sebesar 84,5%, tetapi skor Deepseek V4-Pro justru turun sebesar 18,1%. Hal ini menunjukkan bahwa meskipun memori terstruktur itu kuat, "pengetahuan" yang terkandung di dalamnya sangat terikat dengan pola penalaran model yang menciptakannya.

Mengapa Ini Penting bagi Industri AI

Keberhasilan AgenticSTS menandakan pergeseran dalam desain agen: masa depan AI otonom tidak terletak pada jendela konteks yang lebih besar, melainkan pada manajemen memori yang lebih cerdas dan terstruktur. Bagi pengembang yang membangun agen berdurasi panjang, arsitektur ini menawarkan cetak biru untuk mengurangi biaya operasional dan latensi sekaligus meningkatkan kemampuan model secara signifikan dalam melakukan penalaran multi-langkah yang kompleks.

Poin-Poin Penting

  • Keuntungan Efisiensi: AgenticSTS mempertahankan prompt 5.000 token yang konsisten, menggunakan token hingga 90x lebih sedikit daripada agen yang mengandalkan log obrolan yang terus tumbuh.
  • Peningkatan Performa: Menggunakan "Skill Library" (L5) dapat melipatgandakan tingkat kemenangan agen dan memungkinkan kemajuan ke tingkat kesulitan yang jauh lebih tinggi melalui pembelajaran antar-sesi.
  • Pergeseran Arsitektural: Beralih dari transkrip yang tidak terstruktur ke memori berlapis menyelesaikan masalah pengenceran perhatian (attention dilution) dan lonjakan latensi model.