새로운 “선제적 메모리(proactive memory)” 모듈을 통해 대규모 언어 모델(LLM) 에이전트는 핵심 모델을 파인튜닝하지 않고도 작업 요구 사항, 환경 정보 및 과거의 실패 사례를 추적할 수 있습니다. 벤치마크 테스트 결과, 이 모듈을 추가했을 때 Sonnet 4.5의 점수는 Terminal-Bench 2.0에서 8.3%포인트, τ2-Bench 스위트에서 6.8포인트 상승했습니다. 또한 SETA로 학습된 메모리 에이전트는 미학습 문제(unseen problems)에 대해 고정된 모델의 pass@1 성능을 37.6%에서 41.1%로 높였습니다.

에이전트가 맥락을 놓치는 이유

LLM 기반 에이전트가 다단계 절차를 수행할 때, 내부 “상태(state)”가 감퇴합니다. 연구자들은 이를 “행동 상태 감퇴(behavioral state decay)”라고 부릅니다. 즉, 모델이 이전 지침, 주요 사실 또는 이미 저지른 실수를 잊어버리는 현상입니다. 그 결과 잘못된 결정이 연쇄적으로 발생하여 작업이 완료되기도 전에 중단되는 상황이 벌어집니다.

일반적인 해결책은 모델이 한 번에 처리할 수 있는 텍스트 덩어리인 컨텍스트 윈도우(context window)를 확장하는 것입니다. 하지만 이는 작업 규모가 윈도우 크기를 넘어설 때까지만 도움이 될 뿐입니다. 오래된 정보는 삭제되고 감퇴 현상은 다시 시작됩니다.

필요할 때만 작동하는 리마인더

새로운 접근 방식은 메인 모델의 추론 과정(reasoning trace)을 관찰하고 타겟팅된 리마인더를 주입하는 경량 보조 메모리 에이전트를 추가합니다. 이 메모리 모듈은 단순히 과거의 조각들을 정적으로 나열하는 대신, 메인 모델이 표류(drift)하는 것으로 보일 때만 적절한 시점에 무엇을 보여줄지 결정하여 작동합니다.

메모리 학습기는 별도로 학습되기 때문에 주요 액션 모델은 고정된(frozen) 상태를 유지합니다. 연구에 따르면 이러한 분리 방식만으로도 장기적 과업(long-horizon) 벤치마크에서 상당한 성능 향상을 얻을 수 있으며, 이는 선제적 리마인더가 제한된 컨텍스트 윈도우를 보완할 수 있음을 증명합니다.

수치가 말해주는 것

  • Terminal-Bench 2.0: Sonnet 4.5가 베이스라인 대비 8.3포인트 상승했습니다.
  • τ2-Bench 스위트: 동일 모델이 6.8포인트 개선되었습니다.
  • 홀드아웃(held-out) 테스트의 Pass@1: SETA로 학습된 메모리 에이전트가 고정된 모델의 성능을 37.6%에서 41.1%로 끌어올렸습니다.

이러한 성능 향상은 메인 모델에 대한 추가적인 파인튜닝 없이 이루어지므로, 메모리 구성 요소를 기존 배포 환경에 자유롭게 교체하여 적용할 수 있습니다.

현재 연구의 한계

이번 실험은 다음 사항들을 테스트하는 데까지는 나아가지 못했습니다.

  • 규모(Scale): 수십억 개의 파라미터를 가진 모델이나 수백만 단계로 진행되는 작업에서도 메모리 모듈이 동일하게 작동한다는 증거는 아직 없습니다.
  • 운영 비용(Production cost): 리마인더를 저장하고 검색하는 과정에서 오버헤드가 발생하지만, 본 연구에서는 실제 시스템에서 요구되는 추가 메모리나 연산량을 정량화하지 않았습니다.

향후 주목해야 할 점

미래의 벤치마크 스위트는 단순한 컨텍스트 크기 이상의 것을 측정해야 합니다. 상태 감퇴를 명시적으로 추적하고 능동적 리마인더 시스템에 보상을 주는 테스트가 이루어진다면, 에이전트의 장기적 신뢰성을 더 명확하게 파악할 수 있을 것입니다. 또한 연구자들은 선제적 메모리가 모델 크기와 운영 비용 측면 모두에서 효율적으로 확장될 수 있음을 보여주어야 합니다.

핵심 요약: 별도로 학습된 작은 메모리 모듈은 대규모 언어 모델 에이전트의 감시자(watchdog) 역할을 수행하여, 작업이 망가지기 전에 표류(drift)를 포착하고 수정할 수 있습니다.