Nowy moduł „proaktywnej pamięci” (proactive memory) pozwala agentom opartym na dużych modelach językowych śledzić wymagania zadań, fakty dotyczące środowiska oraz poprzednie błędy – bez konieczności dotrenowywania (fine-tuning) głównego modelu. W testach benchmarkowych dodatek ten podniósł wynik Sonnet 4.5 o 8,3 punktu procentowego w Terminal-Bench 2.0 oraz o 6,8 punktu w zestawie τ2-Bench; agent pamięci trenowany metodą SETA podniósł wskaźnik pass@1 zamrożonego modelu z 37,6% do 41,1% w przypadku nieznanych problemów.
Dlaczego agenci tracą wątek
Gdy agent sterowany przez LLM realizuje wieloetapową procedurę, jego wewnętrzny „stan” ulega degradacji. Badacze nazywają to „degradacją stanu behawioralnego” (behavioral state decay): model zapomina wcześniejsze instrukcje, kluczowe fakty lub błędy, które już popełnił. Rezultatem jest kaskada błędnych decyzji, która przerywa zadanie na długo przed jego ukończeniem.
Typowym rozwiązaniem jest powiększenie okna kontekstowego – fragmentu tekstu, na który model może zwrócić uwagę jednocześnie. Pomaga to jednak tylko do momentu, gdy zadanie przekroczy rozmiar okna; starsze informacje są usuwane, a degradacja powraca.
Przypomnienie, które działa tylko wtedy, gdy jest potrzebne
Nowe podejście polega na dodaniu lekkiego, pomocniczego agenta pamięci, który monitoruje ścieżkę rozumowania głównego modelu i wprowadza celowane przypomnienia. Zamiast pobierać statyczną listę przeszłych fragmentów, moduł pamięci decyduje, kiedy i co wyświetlić, działając tylko wtedy, gdy wydaje się, że główny model zaczyna zbaczać z kursu.
Ponieważ komponent uczący pamięć trenuje się oddzielnie, główny model wykonawczy pozostaje zamrożony. Badanie pokazuje, że takie rozdzielenie wciąż przynosi znaczące korzyści w benchmarkach długoterminowych (long-horizon), udowadniając, że proaktywne przypomnienia mogą kompensować ograniczone okno kontekstowe.
Co mówią liczby
- Terminal-Bench 2.0: Wynik Sonnet 4.5 wzrasta o 8,3 punktu powyżej poziomu bazowego.
- Zestaw τ2-Bench: Ten sam model poprawia wynik o 6,8 punktu.
- Pass@1 w testach na danych nieuwzględnionych: Agent pamięci trenowany metodą SETA podnosi wynik zamrożonego modelu z 37,6% do 41,1%.
Poprawa ta następuje bez dodatkowego dotrenowywania (fine-tuning) głównego modelu, dzięki czemu komponent pamięci można dodawać lub usuwać z istniejących wdrożeń.
Ograniczenia obecnej pracy
Eksperymenty nie obejmują testów w zakresie:
- Skali: Brak jeszcze dowodów na to, że moduł pamięci zachowuje się w ten sam sposób w przypadku modeli o miliardach parametrów lub zadań trwających miliony kroków.
- Kosztów produkcji: Przechowywanie i przywoływanie przypomnień generuje dodatkowe obciążenie, ale badanie nie określa ilości dodatkowej pamięci lub mocy obliczeniowej wymaganej w rzeczywistym systemie.
Na co zwrócić uwagę w przyszłości
Przyszłe zestawy benchmarków będą musiały mierzyć coś więcej niż tylko surową wielkość kontekstu. Testy, które wyraźnie śledzą degradację stanu i nagradzają aktywne systemy przypominania, dadzą jaśniejszy obraz długoterminowej niezawodności agenta. Badacze muszą również wykazać, że proaktywna pamięć skaluje się wydajnie, zarówno pod względem wielkości modelu, jak i kosztów operacyjnych.
Podsumowanie: Mały, oddzielnie trenowany moduł pamięci może pełnić rolę strażnika (watchdog) dla agentów opartych na dużych modelach językowych, wyłapując i korygując dryf, zanim doprowadzi on do niepowodzenia zadania.
