Cómo la memoria estructurada ayuda a los agentes de IA a conquistar Slay the Spire 2

Investigadores han desarrollado una nueva arquitectura de agentes, AgenticSTS, que supera a los agentes LLM tradicionales al reemplazar los registros de chat saturados por un sofisticado sistema de memoria estructurada de cinco capas. Al alejarse del modelo de "transcripción creciente", este enfoque reduce significativamente los costes de tokens, al tiempo que permite a los agentes aprender estrategias complejas a lo largo de múltiples partidas.

El problema de los registros de chat crecientes

La mayoría de los agentes LLM actuales, como aquellos que utilizan los marcos de trabajo ReAct o Reflexion, dependen de añadir cada observación pasada, llamada a herramienta y autorreflexión a un registro de texto continuo. A medida que avanza una sesión, esta ventana de contexto se expande hasta que se desborda o la atención del modelo se diluye debido a datos históricos irrelevantes.

En las pruebas realizadas contra el complejo roguelike de construcción de mazos Slay the Spire 2, esta ineficiencia fue evidente. Competidores como STS2MCP y CharTyr, que utilizan el patrón clásico de transcripción creciente, vieron cómo las llamadas individuales al modelo se disparaban hasta aproximadamente 527.000 tokens. Este fallo arquitectónico provoca una latencia masiva y costes de tokens astronómicos, con competidores que utilizan entre 66 y 90 veces más tokens que AgenticSTS para lograr puntuaciones similares.

La solución de memoria de cinco capas

AgenticSTS resuelve el problema de la inflación del contexto reconstruyendo cada prompt de decisión a partir de cinco ranuras de memoria organizadas y discretas. Esto garantiza que el prompt se mantenga ligero —con un promedio de alrededor de 5.000 tokens— independientemente de cuánto dure la partida. Las capas se estructuran de la siguiente manera:

  • L1 (Protocolo fijo): Instrucciones principales para el agente.
  • L2 (Esquemas de estado): Definiciones de las acciones actualmente válidas.
  • L3 (Reglas recuperables): Reglas de juego específicas obtenidas según sea necesario.
  • L4 (Memoria episódica): Resúmenes de partidas anteriores para proporcionar contexto a largo plazo.
  • L5 (Biblioteca de habilidades): Reglas tácticas activadas por patrones situacionales específicos.

Esta modularidad permite a los investigadores identificar exactamente qué componente impulsa las mejoras de rendimiento. Por ejemplo, habilitar solo la biblioteca de habilidades L5 duplicó la tasa de victorias del agente de 3 de cada 10 juegos a 6 de cada 10 juegos en el nivel de dificultad A0.

Escalar la dificultad mediante el aprendizaje

El verdadero poder del enfoque estructurado reside en el aprendizaje entre partidas. Mientras que los agentes estándar tienen dificultades para progresar más allá de los niveles de dificultad más bajos, AgenticSTS aprovecha sus capas L4 y L5 para ascender en la escala de dificultad del juego. Sin una memoria activa que se actualice entre partidas, el agente se estanca en los niveles A2 a A4; sin embargo, con una memoria que persiste a través de las sesiones, logra alcanzar los niveles mucho más difíciles de A6 a A8.

Curiosamente, los investigadores descubrieron que esta memoria es altamente específica de cada modelo. Cuando una pila de memoria generada por Gemini 3.1 Pro se transfirió a Qwen 3.6-27B, la puntuación de este último aumentó un 84,5%, pero la puntuación de Deepseek V4-Pro en realidad cayó un 18,1%. Esto sugiere que, si bien la memoria estructurada es potente, el "conocimiento" contenido en ella está profundamente ligado a los patrones de razonamiento del modelo que la creó.

Por qué esto es importante para la industria de la IA

El éxito de AgenticSTS señala un cambio en el diseño de agentes: el futuro de la IA autónoma no reside en ventanas de contexto más grandes, sino en una gestión de la memoria más inteligente y estructurada. Para los desarrolladores que crean agentes de larga duración, esta arquitectura ofrece un modelo para reducir los costes operativos y la latencia, al tiempo que mejora significativamente la capacidad del modelo para realizar razonamientos complejos de múltiples pasos.

Conclusiones clave

  • Ganancias de eficiencia: AgenticSTS mantiene un prompt constante de 5.000 tokens, utilizando hasta 90 veces menos tokens que los agentes que dependen de registros de chat crecientes.
  • Rendimiento mejorado: El uso de una "Biblioteca de habilidades" (L5) puede duplicar la tasa de victorias de un agente y permitir la progresión a niveles de dificultad mucho más altos mediante el aprendizaje entre partidas.
  • Cambio arquitectónico: Pasar de transcripciones no estructuradas a una memoria de múltiples capas resuelve los problemas de la dilución de la atención y el aumento vertiginoso de la latencia del modelo.