Nowy moduł „proaktywnej pamięci” (proactive memory) pozwala agentom opartym na dużych modelach językowych śledzić wymagania zadań, fakty dotyczące środowiska oraz poprzednie błędy – bez konieczności dotrenowywania (fine-tuning) głównego modelu. W testach benchmarkowych dodatek ten podniósł wynik Sonnet 4.5 o 8,3 punktu procentowego w Terminal-Bench 2.0 oraz o 6,8 punktu w zestawie τ2-Bench; agent pamięci trenowany metodą SETA podniósł wskaźnik pass@1 zamrożonego modelu z 37,6% do 41,1% w przypadku nieznanych problemów.

Dlaczego agenci tracą wątek

Gdy agent sterowany przez LLM realizuje wieloetapową procedurę, jego wewnętrzny „stan” ulega degradacji. Badacze nazywają to „degradacją stanu behawioralnego” (behavioral state decay): model zapomina wcześniejsze instrukcje, kluczowe fakty lub błędy, które już popełnił. Rezultatem jest kaskada błędnych decyzji, która przerywa zadanie na długo przed jego ukończeniem.

Typowym rozwiązaniem jest powiększenie okna kontekstowego – fragmentu tekstu, na który model może zwrócić uwagę jednocześnie. Pomaga to jednak tylko do momentu, gdy zadanie przekroczy rozmiar okna; starsze informacje są usuwane, a degradacja powraca.

Przypomnienie, które działa tylko wtedy, gdy jest potrzebne

Nowe podejście polega na dodaniu lekkiego, pomocniczego agenta pamięci, który monitoruje ścieżkę rozumowania głównego modelu i wprowadza celowane przypomnienia. Zamiast pobierać statyczną listę przeszłych fragmentów, moduł pamięci decyduje, kiedy i co wyświetlić, działając tylko wtedy, gdy wydaje się, że główny model zaczyna zbaczać z kursu.

Ponieważ komponent uczący pamięć trenuje się oddzielnie, główny model wykonawczy pozostaje zamrożony. Badanie pokazuje, że takie rozdzielenie wciąż przynosi znaczące korzyści w benchmarkach długoterminowych (long-horizon), udowadniając, że proaktywne przypomnienia mogą kompensować ograniczone okno kontekstowe.

Co mówią liczby

  • Terminal-Bench 2.0: Wynik Sonnet 4.5 wzrasta o 8,3 punktu powyżej poziomu bazowego.
  • Zestaw τ2-Bench: Ten sam model poprawia wynik o 6,8 punktu.
  • Pass@1 w testach na danych nieuwzględnionych: Agent pamięci trenowany metodą SETA podnosi wynik zamrożonego modelu z 37,6% do 41,1%.

Poprawa ta następuje bez dodatkowego dotrenowywania (fine-tuning) głównego modelu, dzięki czemu komponent pamięci można dodawać lub usuwać z istniejących wdrożeń.

Ograniczenia obecnej pracy

Eksperymenty nie obejmują testów w zakresie:

  • Skali: Brak jeszcze dowodów na to, że moduł pamięci zachowuje się w ten sam sposób w przypadku modeli o miliardach parametrów lub zadań trwających miliony kroków.
  • Kosztów produkcji: Przechowywanie i przywoływanie przypomnień generuje dodatkowe obciążenie, ale badanie nie określa ilości dodatkowej pamięci lub mocy obliczeniowej wymaganej w rzeczywistym systemie.

Na co zwrócić uwagę w przyszłości

Przyszłe zestawy benchmarków będą musiały mierzyć coś więcej niż tylko surową wielkość kontekstu. Testy, które wyraźnie śledzą degradację stanu i nagradzają aktywne systemy przypominania, dadzą jaśniejszy obraz długoterminowej niezawodności agenta. Badacze muszą również wykazać, że proaktywna pamięć skaluje się wydajnie, zarówno pod względem wielkości modelu, jak i kosztów operacyjnych.

Podsumowanie: Mały, oddzielnie trenowany moduł pamięci może pełnić rolę strażnika (watchdog) dla agentów opartych na dużych modelach językowych, wyłapując i korygując dryf, zanim doprowadzi on do niepowodzenia zadania.