Jak ustrukturyzowana pamięć pomaga agentom AI podbić Slay the Spire 2

Naukowcy opracowali nową architekturę agentową, AgenticSTS, która przewyższa tradycyjne agenty LLM, zastępując przeładowane logi czatu wyrafinowanym, pięciowarstwowym systemem ustrukturyzowanej pamięci. Odchodząc od modelu „rosnącej transkrypcji”, podejście to znacząco redukuje koszty tokenów, umożliwiając jednocześnie agentom naukę złożonych strategii podczas wielu rozgrywek.

Problem z rosnącymi logami czatu

Większość obecnych agentów LLM, takich jak te korzystające z frameworków ReAct lub Reflexion, opiera się na dopisywaniu każdej przeszłej obserwacji, wywołania narzędzia i autorefleksji do ciągłego logu tekstowego. W miarę postępów sesji okno kontekstowe rozszerza się, aż do momentu przepełnienia lub rozproszenia uwagi modelu przez nieistotne dane historyczne.

Podczas testów w złożonej roguelike deck-buildingowej Slay the Spire 2, nieefektywność ta była uderzająca. Konkurenci tacy jak STS2MCP i CharTyr, wykorzystujący klasyczny wzorzec rosnącej transkrypcji, odnotowali wzrost pojedynczych wywołań modelu do około 527 000 tokenów. Ta wada architektoniczna prowadzi do ogromnych opóźnień i astronomicznych kosztów tokenów, przy czym konkurenci zużywają od 66 do 90 razy więcej tokenów niż AgenticSTS, aby osiągnąć podobne wyniki.

Pięciowarstwowe rozwiązanie pamięciowe

AgenticSTS rozwiązuje problem inflacji kontekstu poprzez odbudowywanie każdego promptu decyzyjnego z pięciu zorganizowanych, odrębnych slotów pamięci. Dzięki temu prompt pozostaje zwięzły – średnio około 5 000 tokenów – niezależnie od tego, jak długo trwa gra. Warstwy są ustrukturyzowane w następujący sposób:

  • L1 (Fixed Protocol): Podstawowe instrukcje dla agenta.
  • L2 (State Schemas): Definicje obecnie poprawnych akcji.
  • L3 (Retrievable Rules): Specyficzne zasady gry pobierane w razie potrzeby.
  • L4 (Episodic Memory): Podsumowania poprzednich rozgrywek w celu zapewnienia długoterminowego kontekstu.
  • L5 (Skill Library): Zasady taktyczne wyzwalane przez specyficzne wzorce sytuacyjne.

Ta modularność pozwala badaczom precyzyjnie określić, który komponent napędza poprawę wydajności. Na przykład samo włączenie biblioteki umiejętności L5 podwoiło współczynnik zwycięstw agenta z 3 na 10 gier do 6 na 10 gier na poziomie trudności A0.

Skalowanie trudności poprzez naukę

Prawdziwa siła ustrukturyzowanego podejścia tkwi w nauce między rozgrywkami. Podczas gdy standardowi agenci mają trudności z przejściem poza najniższe poziomy trudności, AgenticSTS wykorzystuje swoje warstwy L4 i L5, aby wspinać się po drabinie trudności gry. Bez aktywnej pamięci, która aktualizuje się między rozgrywkami, agent zatrzymuje się na poziomach od A2 do A4; jednak dzięki pamięci trwałej między sesjami, z powodzeniem osiąga znacznie trudniejsze poziomy od A6 do A8.

Co ciekawe, badacze odkryli, że pamięć ta jest wysoce specyficzna dla danego modelu. Gdy stos pamięci wygenerowany przez Gemini 3.1 Pro został przeniesiony do Qwen 3.6-27B, wynik tego drugiego wzrósł o 84,5%, ale wynik Deepseek V4-Pro spadł o 18,1%. Sugeruje to, że choć ustrukturyzowana pamięć jest potężna, „wiedza” zawarta w jej wnętrzu jest głęboko powiązana ze wzorcami rozumowania modelu, który ją stworzył.

Dlaczego ma to znaczenie dla branży AI

Sukces AgenticSTS sygnalizuje zmianę w projektowaniu agentów: przyszłość autonomicznej sztucznej inteligencji nie leży w większych oknach kontekstowych, lecz w inteligentniejszym, bardziej ustrukturyzowanym zarządzaniu pamięcią. Dla programistów budujących długo działające agenty, architektura ta oferuje schemat redukcji kosztów operacyjnych i opóźnień, przy jednoczesnej znaczącej poprawie zdolności modelu do przeprowadzania złożonego, wieloetapowego rozumowania.

Kluczowe wnioski

  • Wzrost wydajności: AgenticSTS utrzymuje stały prompt o długości 5 000 tokenów, zużywając do 90 razy mniej tokenów niż agenty polegające na rosnących logach czatu.
  • Poprawa wydajności: Wykorzystanie „Skill Library” (L5) może podwoić współczynnik zwycięstw agenta i umożliwić progresję do znacznie wyższych poziomów trudności dzięki nauce między rozgrywkami.
  • Zmiana architektoniczna: Przejście z nieustrukturyzowanych transkrypcji na pamięć wielowarstwową rozwiązuje problemy rozproszenia uwagi i gwałtownego wzrostu opóźnień modelu.