Como a Memória Estruturada Ajuda Agentes de IA a Conquistar Slay the Spire 2
Pesquisadores desenvolveram uma nova arquitetura de agentes, a AgenticSTS, que supera os agentes de LLM tradicionais ao substituir logs de chat inflados por um sofisticado sistema de memória estruturada de cinco camadas. Ao se afastar do modelo de "transcrição crescente", essa abordagem reduz significativamente os custos de tokens, permitindo que os agentes aprendam estratégias complexas ao longo de múltiplas partidas.
O Problema com Logs de Chat Crescentes
A maioria dos agentes de LLM atuais, como aqueles que utilizam os frameworks ReAct ou Reflexion, depende da anexação de cada observação passada, chamada de ferramenta e autorreflexão a um log de texto contínuo. À medida que uma sessão progride, essa janela de contexto se expande até transbordar ou até que a atenção do modelo seja diluída por dados históricos irrelevantes.
Em testes contra o complexo roguelike de construção de baralhos Slay the Spire 2, essa ineficiência foi gritante. Concorrentes como STS2MCP e CharTyr, que utilizam o padrão clássico de transcrição crescente, viram chamadas únicas de modelo dispararem para aproximadamente 527.000 tokens. Essa falha arquitetônica leva a uma latência massiva e custos de tokens astronômicos, com concorrentes usando de 66 a 90 vezes mais tokens do que o AgenticSTS para alcançar pontuações semelhantes.
A Solução de Memória de Cinco Camadas
O AgenticSTS resolve o problema da inflação de contexto reconstruindo cada prompt de decisão a partir de cinco slots de memória organizados e discretos. Isso garante que o prompt permaneça enxuto — com uma média de cerca de 5.000 tokens — independentemente da duração do jogo. As camadas são estruturadas da seguinte forma:
- L1 (Protocolo Fixo): Instruções principais para o agente.
- L2 (Esquemas de Estado): Definições de ações atualmente válidas.
- L3 (Regras Recuperáveis): Regras específicas do jogo buscadas conforme necessário.
- L4 (Memória Episódica): Resumos de partidas anteriores para fornecer contexto de longo prazo.
- L5 (Biblioteca de Habilidades): Regras táticas acionadas por padrões situacionais específicos.
Essa modularidade permite que os pesquisadores identifiquem exatamente qual componente impulsiona as melhorias de desempenho. Por exemplo, habilitar apenas a biblioteca de habilidades L5 dobrou a taxa de vitória do agente de 3 em 10 jogos para 6 em 10 jogos no nível de dificuldade A0.
Escalando a Dificuldade Através do Aprendizado
O verdadeiro poder da abordagem estruturada reside no aprendizado entre partidas. Enquanto agentes padrão têm dificuldade em progredir além dos níveis de dificuldade mais baixos, o AgenticSTS aproveita suas camadas L4 e L5 para subir a escada de dificuldade do jogo. Sem uma memória ativa que se atualize entre as partidas, o agente estagna nos níveis A2 a A4; no entanto, com uma memória que persiste entre as sessões, ele alcança com sucesso os níveis muito mais difíceis de A6 a A8.
Curiosamente, os pesquisadores descobriram que essa memória é altamente específica de cada modelo. Quando uma pilha de memória gerada pelo Gemini 3.1 Pro foi transferida para o Qwen 3.6-27B, a pontuação deste último subiu 84,5%, mas a pontuação do Deepseek V4-Pro na verdade caiu 18,1%. Isso sugere que, embora a memória estruturada seja poderosa, o "conhecimento" contido nela está profundamente ligado aos padrões de raciocínio do modelo que a criou.
Por Que Isso é Importante para a Indústria de IA
O sucesso do AgenticSTS sinaliza uma mudança no design de agentes: o futuro da IA autônoma não reside em janelas de contexto maiores, mas em um gerenciamento de memória mais inteligente e estruturado. Para desenvolvedores que constroem agentes de longa duração, essa arquitetura oferece um modelo para reduzir custos operacionais e latência, ao mesmo tempo em que melhora significativamente a capacidade do modelo de realizar raciocínios complexos de múltiplas etapas.
Principais Conclusões
- Ganhos de Eficiência: O AgenticSTS mantém um prompt consistente de 5.000 tokens, usando até 90 vezes menos tokens do que agentes que dependem de logs de chat crescentes.
- Desempenho Aprimorado: Utilizar uma "Biblioteca de Habilidades" (L5) pode dobrar a taxa de vitória de um agente e permitir a progressão para níveis de dificuldade muito mais altos por meio do aprendizado entre partidas.
- Mudança Arquitetônica: A transição de transcrições não estruturadas para memória de múltiplas camadas resolve os problemas de diluição de atenção e o aumento vertiginoso da latência do modelo.
