구조화된 메모리가 AI 에이전트의 Slay the Spire 2 정복을 돕는 방법

연구진은 비대해진 채팅 로그를 정교한 5계층 구조화 메모리 시스템으로 대체하여 기존 LLM 에이전트보다 뛰어난 성능을 보이는 새로운 에이전트 아키텍처인 AgenticSTS를 개발했습니다. "점점 늘어나는 트랜스크립트(growing transcript)" 모델에서 벗어남으로써, 이 방식은 토큰 비용을 크게 절감하는 동시에 에이전트가 여러 번의 플레이를 통해 복잡한 전략을 학습할 수 있도록 합니다.

늘어나는 채팅 로그의 문제점

ReAct 또는 Reflexion 프레임워크를 사용하는 대부분의 현재 LLM 에이전트는 과거의 모든 관찰, 도구 호출(tool call), 자기 성찰(self-reflection) 내용을 연속적인 텍스트 로그에 추가하는 방식에 의존합니다. 세션이 진행됨에 따라 컨텍스트 창(context window)은 계속 확장되며, 결국 용량이 초과되거나 무관한 과거 데이터로 인해 모델의 주의력(attention)이 분산됩니다.

복잡한 덱 빌딩 로그라이크 게임인 Slay the Spire 2를 대상으로 한 테스트에서 이러한 비효율성은 극명하게 드러났습니다. 전형적인 '점점 늘어나는 트랜스크립트' 패턴을 사용하는 STS2MCP 및 CharTyr와 같은 경쟁 모델들은 단일 모델 호출 시 토큰 수가 약 527,000개까지 급증했습니다. 이러한 아키텍처 결함은 막대한 지연 시간(latency)과 천문학적인 토큰 비용을 초래하며, 경쟁 모델들은 AgenticSTS와 유사한 점수를 얻기 위해 최대 66~90배 더 많은 토큰을 사용했습니다.

5계층 메모리 솔루션

AgenticSTS는 조직화된 5개의 개별 메모리 슬롯을 통해 각 결정 프롬프트를 재구성함으로써 컨텍스트 팽창 문제를 해결합니다. 이를 통해 게임 진행 시간과 관계없이 프롬프트의 크기를 평균 약 5,000토큰 정도로 가볍게 유지할 수 있습니다. 계층 구조는 다음과 같습니다:

  • L1 (Fixed Protocol): 에이전트를 위한 핵심 지침.
  • L2 (State Schemas): 현재 유효한 행동에 대한 정의.
  • L3 (Retrievable Rules): 필요에 따라 불러오는 특정 게임 규칙.
  • L4 (Episodic Memory): 장기적인 컨텍스트를 제공하기 위한 이전 플레이의 요약.
  • L5 (Skill Library): 특정 상황 패턴에 의해 트리거되는 전술적 규칙.

이러한 모듈화 덕분에 연구진은 어떤 구성 요소가 성능 향상을 주도하는지 정확히 파악할 수 있습니다. 예를 들어, L5 스킬 라이브러리만 활성화해도 A0 난이도에서 에이전트의 승률이 10판 중 3승에서 6승으로 두 배 증가했습니다.

학습을 통한 난이도 확장

구조화된 접근 방식의 진정한 힘은 플레이 간 학습(inter-run learning)에 있습니다. 일반적인 에이전트들이 최저 난이도 단계를 넘어가는 데 어려움을 겪는 반면, AgenticSTS는 L4 및 L5 계층을 활용하여 게임의 난이도 사다리를 올라갑니다. 플레이 사이에 업데이트되는 능동적인 메모리가 없다면 에이전트는 A2에서 A4 단계에서 정체되지만, 세션 간에 유지되는 메모리가 있으면 훨씬 더 어려운 A6에서 A8 단계까지 성공적으로 도달합니다.

흥미롭게도 연구진은 이 메모리가 모델에 따라 매우 특화되어 있다는 것을 발견했습니다. Gemini 3.1 Pro가 생성한 메모리 스택을 Qwen 3.6-27B로 전달했을 때, 후자의 점수는 84.5% 상승했지만 Deepseek V4-Pro의 점수는 오히려 18.1% 하락했습니다. 이는 구조화된 메모리가 강력하긴 하지만, 그 안에 담긴 "지식"이 메모리를 생성한 모델의 추론 패턴과 깊게 연관되어 있음을 시사합니다.

이것이 AI 산업에 중요한 이유

AgenticSTS의 성공은 에이전트 설계의 패러다임 변화를 예고합니다. 자율형 AI의 미래는 더 큰 컨텍스트 창이 아니라, 더 스마트하고 구조화된 메모리 관리에 달려 있습니다. 장기 실행 에이전트를 구축하는 개발자들에게 이 아키텍처는 운영 비용과 지연 시간을 줄이는 동시에, 복잡한 다단계 추론을 수행하는 모델의 능력을 크게 향상시킬 수 있는 청사진을 제공합니다.

핵심 요약

  • 효율성 향상: AgenticSTS는 일관된 5,000토큰 프롬프트를 유지하며, 늘어나는 채팅 로그에 의존하는 에이전트보다 토큰을 최대 90배 적게 사용합니다.
  • 성능 강화: "스킬 라이브러리(Skill Library)"(L5)를 활용하면 에이전트의 승률을 두 배로 높일 수 있으며, 플레이 간 학습을 통해 훨씬 더 높은 난이도 단계로 진입할 수 있습니다.
  • 아키텍처의 전환: 비구조화된 트랜스크립트에서 다계층 메모리로 전환함으로써 주의력 분산 및 모델 지연 시간 급증 문제를 해결합니다.