Comment la mémoire structurée aide les agents IA à conquérir Slay the Spire 2

Des chercheurs ont développé une nouvelle architecture agentique, AgenticSTS, qui surpasse les agents LLM traditionnels en remplaçant les journaux de chat encombrés par un système de mémoire structurée sophistiqué à cinq couches. En s'éloignant du modèle de « transcription croissante », cette approche réduit considérablement les coûts en tokens tout en permettant aux agents d'apprendre des stratégies complexes au fil de plusieurs parties.

Le problème des journaux de chat croissants

La plupart des agents LLM actuels, tels que ceux utilisant les frameworks ReAct ou Reflexion, reposent sur l'ajout de chaque observation passée, appel d'outil et auto-réflexion à un journal de texte continu. À mesure qu'une session progresse, cette fenêtre de contexte s'élargit jusqu'à ce qu'elle déborde ou que l'attention du modèle soit diluée par des données historiques non pertinentes.

Lors de tests contre le roguelike de construction de deck complexe Slay the Spire 2, cette inefficacité était flagrante. Des concurrents comme STS2MCP et CharTyr, qui utilisent le modèle classique de transcription croissante, ont vu leurs appels de modèle uniques grimper jusqu'à environ 527 000 tokens. Ce défaut architectural entraîne une latence massive et des coûts de tokens astronomiques, les concurrents utilisant 66 à 90 fois plus de tokens qu'AgenticSTS pour obtenir des scores similaires.

La solution de mémoire à cinq couches

AgenticSTS résout le problème de l'inflation du contexte en reconstruisant chaque invite de décision (prompt) à partir de cinq emplacements de mémoire discrets et organisés. Cela garantit que l'invite reste légère — avec une moyenne d'environ 5 000 tokens — quelle que soit la durée de la partie. Les couches sont structurées comme suit :

  • L1 (Protocole fixe) : Instructions de base pour l'agent.
  • L2 (Schémas d'état) : Définitions des actions actuellement valides.
  • L3 (Règles récupérables) : Règles de jeu spécifiques récupérées selon les besoins.
  • L4 (Mémoire épisodique) : Résumés des parties précédentes pour fournir un contexte à long terme.
  • L5 (Bibliothèque de compétences) : Règles tactiques déclenchées par des schémas situationnels spécifiques.

Cette modularité permet aux chercheurs de déterminer précisément quel composant favorise l'amélioration des performances. Par exemple, l'activation de la seule bibliothèque de compétences L5 a doublé le taux de victoire de l'agent, passant de 3 parties sur 10 à 6 parties sur 10 au niveau de difficulté A0.

Augmenter la difficulté grâce à l'apprentissage

La véritable puissance de l'approche structurée réside dans l'apprentissage inter-parties. Alors que les agents standards peinent à progresser au-delà des niveaux de difficulté les plus bas, AgenticSTS exploite ses couches L4 et L5 pour gravir l'échelle de difficulté du jeu. Sans une mémoire active qui se met à jour entre les parties, l'agent stagne aux niveaux A2 à A4 ; cependant, avec une mémoire qui persiste à travers les sessions, il atteint avec succès les niveaux beaucoup plus difficiles A6 à A8.

Fait intéressant, les chercheurs ont constaté que cette mémoire est très spécifique au modèle. Lorsqu'une pile de mémoire générée par Gemini 3.1 Pro a été transférée à Qwen 3.6-27B, le score de ce dernier a augmenté de 84,5 %, mais celui de Deepseek V4-Pro a en réalité chuté de 18,1 %. Cela suggère que, bien que la mémoire structurée soit puissante, la « connaissance » qu'elle contient est profondément liée aux schémas de raisonnement du modèle qui l'a créée.

Pourquoi cela est important pour l'industrie de l'IA

Le succès d'AgenticSTS signale un changement dans la conception agentique : l'avenir de l'IA autonome ne réside pas dans des fenêtres de contexte plus larges, mais dans une gestion de la mémoire plus intelligente et mieux structurée. Pour les développeurs qui créent des agents à exécution longue, cette architecture offre un modèle pour réduire les coûts opérationnels et la latence, tout en améliorant considérablement la capacité du modèle à effectuer un raisonnement complexe en plusieurs étapes.

Points clés à retenir

  • Gains d'efficacité : AgenticSTS maintient une invite constante de 5 000 tokens, utilisant jusqu'à 90 fois moins de tokens que les agents s'appuyant sur des journaux de chat croissants.
  • Performances accrues : L'utilisation d'une « Bibliothèque de compétences » (L5) peut doubler le taux de victoire d'un agent et permettre une progression vers des niveaux de difficulté bien plus élevés grâce à l'apprentissage inter-parties.
  • Changement architectural : Le passage de transcriptions non structurées à une mémoire multicouche résout les problèmes de dilution de l'attention et d'explosion de la latence du modèle.