หน่วยความจำแบบโครงสร้างช่วยให้ AI Agent เอาชนะ Slay the Spire 2 ได้อย่างไร
นักวิจัยได้พัฒนาสถาปัตยกรรมเอเจนต์แบบใหม่ที่ชื่อว่า AgenticSTS ซึ่งมีประสิทธิภาพเหนือกว่า LLM agent แบบดั้งเดิม โดยการเปลี่ยนจากการใช้บันทึกการแชท (chat logs) ที่เทอะทะ มาเป็นระบบหน่วยความจำแบบโครงสร้าง 5 ชั้นที่มีความซับซ้อน การเปลี่ยนจากโมเดลแบบ "บันทึกที่ขยายตัวขึ้นเรื่อยๆ" (growing transcript) ช่วยลดต้นทุนโทเคน (token costs) ลงอย่างมาก ในขณะเดียวกันก็ช่วยให้เอเจนต์สามารถเรียนรู้กลยุทธ์ที่ซับซ้อนจากการเล่นหลายๆ รอบได้
ปัญหาของบันทึกการแชทที่ขยายตัวขึ้นเรื่อยๆ
LLM agent ส่วนใหญ่ในปัจจุบัน เช่น เอเจนต์ที่ใช้เฟรมเวิร์ก ReAct หรือ Reflexion อาศัยการเพิ่มการสังเกตการณ์ (observation) การเรียกใช้เครื่องมือ (tool call) และการสะท้อนความคิด (self-reflection) ในอดีตทั้งหมดลงในบันทึกข้อความที่ต่อเนื่องกัน เมื่อเซสชันดำเนินต่อไป หน้าต่างบริบท (context window) นี้จะขยายใหญ่ขึ้นจนกระทั่งล้น หรือไม่ก็ทำให้ความสนใจ (attention) ของโมเดลถูกเจือจางลงด้วยข้อมูลประวัติที่ไม่เกี่ยวข้อง
ในการทดสอบกับเกมแนว deck-building roguelike ที่ซับซ้อนอย่าง Slay the Spire 2 ความไร้ประสิทธิภาพนี้เห็นได้อย่างชัดเจน คู่แข่งอย่าง STS2MCP และ CharTyr ซึ่งใช้รูปแบบบันทึกที่ขยายตัวแบบดั้งเดิม พบว่าการเรียกใช้โมเดลเพียงครั้งเดียวมีจำนวนโทเคนพุ่งสูงถึงประมาณ 527,000 โทเคน ข้อบกพร่องทางสถาปัตยกรรมนี้ส่งผลให้เกิดความหน่วง (latency) มหาศาลและต้นทุนโทเคนที่สูงลิ่ว โดยคู่แข่งต้องใช้โทเคนมากกว่า AgenticSTS ถึง 66 ถึง 90 เท่าเพื่อให้ได้คะแนนที่ใกล้เคียงกัน
โซลูชันหน่วยความจำ 5 ชั้น
AgenticSTS แก้ปัญหาการขยายตัวของบริบท (context inflation) โดยการสร้าง prompt สำหรับการตัดสินใจแต่ละครั้งขึ้นใหม่จากช่องหน่วยความจำที่แยกจากกันและมีการจัดระเบียบไว้ 5 ชั้น วิธีนี้ช่วยให้มั่นใจได้ว่า prompt จะยังคงมีความกระชับ โดยมีค่าเฉลี่ยอยู่ที่ประมาณ 5,000 โทเคน ไม่ว่าเกมจะดำเนินไปนานแค่ไหนก็ตาม โดยโครงสร้างของแต่ละชั้นมีดังนี้:
- L1 (Fixed Protocol): คำสั่งหลักสำหรับเอเจนต์
- L2 (State Schemas): คำจำกัดความของการกระทำที่สามารถทำได้ในปัจจุบัน
- L3 (Retrievable Rules): กฎเฉพาะของเกมที่ดึงมาใช้เมื่อจำเป็น
- L4 (Episodic Memory): บทสรุปของการเล่นในรอบก่อนหน้าเพื่อให้บริบทในระยะยาว
- L5 (Skill Library): กฎทางยุทธวิธีที่ถูกกระตุ้นโดยรูปแบบสถานการณ์เฉพาะ
ความสามารถในการแยกส่วน (modularity) นี้ช่วยให้นักวิจัยสามารถระบุได้อย่างแม่นยำว่าส่วนประกอบใดที่ช่วยเพิ่มประสิทธิภาพ ตัวอย่างเช่น การเปิดใช้งานเพียงแค่ Skill Library (L5) อย่างเดียว ก็สามารถเพิ่มอัตราการชนะของเอเจนต์จาก 3 ใน 10 เกม เป็น 6 ใน 10 เกม ที่ระดับความยาก A0
การเพิ่มระดับความยากผ่านการเรียนรู้
พลังที่แท้จริงของแนวทางแบบโครงสร้างนี้อยู่ที่การเรียนรู้ระหว่างรอบการเล่น (inter-run learning) ในขณะที่เอเจนต์มาตรฐานมักจะประสบปัญหาในการก้าวข้ามระดับความยากต่ำสุด แต่ AgenticSTS ใช้ประโยชน์จากชั้น L4 และ L5 เพื่อไต่ระดับความยากของเกม หากไม่มีหน่วยความจำที่อัปเดตระหว่างรอบการเล่น เอเจนต์จะหยุดชะงักอยู่ที่ระดับ A2 ถึง A4 อย่างไรก็ตาม ด้วยหน่วยความจำที่คงอยู่ข้ามเซสชัน มันสามารถไปถึงระดับ A6 ถึง A8 ที่ยากกว่ามากได้สำเร็จ
ที่น่าสนใจคือ นักวิจัยพบว่าหน่วยความจำนี้ขึ้นอยู่กับโมเดลแต่ละตัวอย่างมาก เมื่อชุดหน่วยความจำ (memory stack) ที่สร้างโดย Gemini 3.1 Pro ถูกถ่ายโอนไปยัง Qwen 3.6-27B คะแนนของโมเดลหลังเพิ่มขึ้นถึง 84.5% แต่คะแนนของ Deepseek V4-Pro กลับลดลง 18.1% สิ่งนี้บ่งชี้ว่าแม้หน่วยความจำแบบโครงสร้างจะมีประสิทธิภาพสูง แต่ "ความรู้" ที่บรรจุอยู่ภายในนั้นมีความเชื่อมโยงอย่างลึกซึ้งกับรูปแบบการใช้เหตุผลของโมเดลที่เป็นผู้สร้างมันขึ้นมา
ทำไมเรื่องนี้จึงสำคัญต่ออุตสาหกรรม AI
ความสำเร็จของ AgenticSTS ส่งสัญญาณถึงการเปลี่ยนแปลงในการออกแบบเอเจนต์: อนาคตของ AI อัตโนมัติไม่ได้อยู่ที่หน้าต่างบริบทที่ใหญ่ขึ้น แต่อยู่ที่การจัดการหน่วยความจำที่ชาญฉลาดและมีโครงสร้างมากขึ้น สำหรับนักพัฒนาที่สร้างเอเจนต์ที่ต้องทำงานต่อเนื่องเป็นเวลานาน สถาปัตยกรรมนี้เป็นพิมพ์เขียวในการลดต้นทุนการดำเนินงานและความหน่วง ในขณะที่ช่วยเพิ่มความสามารถของโมเดลในการใช้เหตุผลที่ซับซ้อนและมีหลายขั้นตอนได้อย่างมีนัยสำคัญ
สรุปประเด็นสำคัญ
- การเพิ่มประสิทธิภาพ: AgenticSTS รักษาขนาดของ prompt ให้คงที่อยู่ที่ 5,000 โทเคน โดยใช้โทเคนน้อยกว่าเอเจนต์ที่พึ่งพาบันทึกการแชทที่ขยายตัวขึ้นเรื่อยๆ ถึง 90 เท่า
- ประสิทธิภาพที่เพิ่มขึ้น: การใช้ "Skill Library" (L5) สามารถเพิ่มอัตราการชนะของเอเจนต์ได้เป็นสองเท่า และช่วยให้สามารถก้าวไปสู่ระดับความยากที่สูงขึ้นมากผ่านการเรียนรู้ระหว่างรอบการเล่น
- การเปลี่ยนผ่านทางสถาปัตยกรรม: การเปลี่ยนจากบันทึกที่ไม่มีโครงสร้างมาเป็นหน่วยความจำแบบหลายชั้น ช่วยแก้ปัญหาการเจือจางของความสนใจ (attention dilution) และความหน่วงของโมเดลที่พุ่งสูงขึ้น
