Come la memoria strutturata aiuta gli agenti IA a conquistare Slay the Spire 2

I ricercatori hanno sviluppato una nuova architettura agentica, AgenticSTS, che supera le prestazioni dei tradizionali agenti LLM sostituendo i log delle chat ingombranti con un sofisticato sistema di memoria strutturata a cinque livelli. Allontanandosi dal modello a "trascrizione in crescita", questo approccio riduce significativamente i costi dei token, consentendo agli agenti di apprendere strategie complesse attraverso molteplici sessione di gioco.

Il problema dei log delle chat in crescita

La maggior parte degli attuali agenti LLM, come quelli che utilizzano i framework ReAct o Reflexion, si basa sull'aggiunta di ogni osservazione passata, chiamata di strumenti (tool call) e auto-riflessione a un log di testo continuo. Man mano che la sessione procede, questa finestra di contesto si espande finché non va in overflow o finché l'attenzione del modello non viene diluita da dati storici irrilevanti.

Nei test condotti contro il complesso roguelike di deck-building Slay the Spire 2, questa inefficienza è stata evidente. I concorrenti come STS2MCP e CharTyr, che utilizzano il classico schema della trascrizione in crescita, hanno visto le singole chiamate al modello gonfiarsi fino a circa 527.000 token. Questo difetto architettonico porta a una latenza massiccia e a costi dei token astronomici, con i concorrenti che utilizzano da 66 a 90 volte più token rispetto ad AgenticSTS per ottenere punteggi simili.

La soluzione della memoria a cinque livelli

AgenticSTS risolve il problema dell'inflazione del contesto ricostruendo ogni prompt decisionale a partire da cinque slot di memoria organizzati e discreti. Ciò garantisce che il prompt rimanga snello — con una media di circa 5.000 token — indipendentemente dalla durata della partita. I livelli sono strutturati come segue:

  • L1 (Fixed Protocol): Istruzioni principali per l'agente.
  • L2 (State Schemas): Definizioni delle azioni attualmente valide.
  • L3 (Retrievable Rules): Regole di gioco specifiche recuperate secondo necessità.
  • L4 (Episodic Memory): Riassunti delle sessioni precedenti per fornire un contesto a lungo termine.
  • L5 (Skill Library): Regole tattiche attivate da specifici pattern situazionali.

Questa modularità consente ai ricercatori di individuare esattamente quale componente guidi i miglioramenti delle prestazioni. Ad esempio, l'attivazione della sola Skill Library (L5) ha raddoppiato il tasso di vittoria dell'agente da 3 su 10 partite a 6 su 10 al livello di difficoltà A0.

Scalare la difficoltà attraverso l'apprendimento

Il vero potere dell'approccio strutturato risiede nell'apprendimento tra le sessioni (inter-run learning). Mentre gli agenti standard faticano a progredire oltre i livelli di difficoltà più bassi, AgenticSTS sfrutta i suoi livelli L4 e L5 per salire la scala di difficoltà del gioco. Senza una memoria attiva che si aggiorna tra le sessioni, l'agente si blocca ai livelli da A2 ad A4; tuttavia, con una memoria che persiste tra le sessioni, riesce a raggiungere i livelli molto più difficili da A6 ad A8.

Interessantemente, i ricercatori hanno scoperto che questa memoria è altamente specifica per il modello. Quando uno stack di memoria generato da Gemini 3.1 Pro è stato trasferito a Qwen 3.6-27B, il punteggio di quest'ultimo è aumentato dell'84,5%, ma il punteggio di Deepseek V4-Pro è effettivamente diminuito del 18,1%. Ciò suggerisce che, sebbene la memoria strutturata sia potente, la "conoscenza" in essa contenuta è profondamente legata ai pattern di ragionamento del modello che l'ha creata.

Perché questo è importante per l'industria dell'IA

Il successo di AgenticSTS segnala un cambiamento nel design agentico: il futuro dell'IA autonoma non risiede in finestre di contesto più ampie, ma in una gestione della memoria più intelligente e strutturata. Per gli sviluppatori che costruiscono agenti a lunga esecuzione, questa architettura offre un modello per ridurre i costi operativi e la latenza, migliorando significativamente la capacità del modello di eseguire ragionamenti complessi e multi-step.

Punti chiave

  • Guadagni di efficienza: AgenticSTS mantiene un prompt costante di 5.000 token, utilizzando fino a 90 volte meno token rispetto agli agenti che si affidano a log delle chat in crescita.
  • Prestazioni migliorate: L'utilizzo di una "Skill Library" (L5) può raddoppiare il tasso di vittoria di un agente e consentire la progressione verso livelli di difficoltà molto più elevati attraverso l'apprendimento tra le sessioni.
  • Cambio di paradigma architettonico: Il passaggio da trascrizioni non strutturate a una memoria multistrato risolve i problemi di diluizione dell'attenzione e dell'impennata della latenza del modello.