Log pamięci produkcyjnego agenta LLM powiększył się z pliku o rozmiarze 2 KB do 29 446 bajtów, co zwiększyło liczbę tokenów odczytywanych przez agenta z około 500 do 7 360 podczas jednego uruchomienia — był to ukryty koszt, który pojawił się bez żadnego ostrzeżenia na panelu monitorowania. Deweloper stojący za agentem twierdzi, że ten cichy wzrost kosztów odczytu jest konkretnym przykładem „dryftu kosztów agenta” (agent cost drift), problemu, który może uszczuplić budżety, nawet gdy system wydaje się działać normalnie.

Czym jest dryft kosztów agenta?

Dryft kosztów agenta opisuje stopniowy wzrost kosztów obliczeniowych rutynowych operacji agenta AI, spowodowany rosnącym stanem samego agenta. W podanym przykładzie agent utrzymuje plik dziennika pracy, w którym rejestruje powody odrzucenia poprzednich tematów artykułów. Każdy nowy wpis dodaje akapit uzasadnienia, a plik jest odczytywany w całości, zanim agent wygeneruje nową treść. Ponieważ dziennik rozszerza się kwadratowo — każdy wpis nie tylko dodaje własną długość, ale także odwołuje się do wcześniejszych wpisów — ilość tekstu, który agent musi przyswoić, przyspiesza wraz z upływem czasu.

Dryft nie jest nagłym skokiem ani awarią; to liniowy podatek, który się kumuluje. Agent nadal tworzy dwa artykuły dziennie, a panel monitorowania nie pokazuje żadnych błędów, jednak każde uruchomienie zużywa teraz 7 360 tokenów, podczas gdy miesiąc temu było to około 500. Ponieważ większość dostawców LLM rozlicza się za token, wzrost liczby tokenów na uruchomienie przekłada się bezpośrednio na wyższe koszty operacyjne.

Dlaczego to ma znaczenie

  • Wpływ na budżet – Model rozliczeń oparty na tokenach oznacza, że każdy dodatkowy odczytany token to wydane pieniądze. Liczba tokenów wzrosła z 500 do 7 360.

Ukryta mechanika

Kluczowy jest wzorzec wzrostu pliku. Dziennik tworzony linia po linii, który jedynie dopisuje nowe wpisy, zwiększałby się liniowo, ale ponieważ każdy wpis wyjaśnia powody wcześniejszych odrzuceń, długość tekstu kumuluje się. Wynikiem jest krzywa wzrostu kwadratowego: podwojenie liczby wpisów powoduje więcej niż dwukrotny wzrost rozmiaru pliku, a liczba tokenów potrzebnych do jego przetworzenia rośnie jeszcze szybciej.

Deweloperzy rzadko zauważają rosnące koszty, ponieważ każdy wpis „sam w sobie ma sens”. Wynik pracy agenta pozostaje poprawny, a dziennik nadal spełnia swoją funkcję, maskując nieefektywność.

Strategia łagodzenia skutków

Deweloper proponuje trzystopniową restrukturyzację dziennika:

  • Plik z ostatnimi wpisami – Przechowywanie małego, aktywnie odczytywanego pliku, który zawiera tylko kilka ostatnich wpisów niezbędnych do uniknięcia natychmiastowych powtórzeń.
  • Zwięzły indeks – Przechowywanie jednolinijkowego podsumowania starszych wpisów. Indeks można szybko przeskanować, aby sprawdzić duplikację tematów, bez konieczności wczytywania pełnych akapitów.
  • Zarchiwizowany pełny tekst – Przeniesienie pełnego historycznego uzasadnienia do oddzielnego pliku archiwalnego, którego agent nie odczytuje podczas normalnej pracy.

Podejście to pozwala agentowi unikać powtarzania tematów, jednocześnie drastycznie zmniejszając obciążenie tokenami podczas każdego uruchomienia.

Jak wykryć dryft kosztów u swoich agentów

  1. Monitoruj odczyty tokenów – Rejestruj liczbę tokenów, które agent zużywa podczas ładowania pliku pamięci przy każdym uruchomieniu.
  2. Śledź zmiany w czasie – Porównuj dzisiejszą liczbę tokenów z liczbą sprzed tygodnia lub miesiąca. Stały trend wzrostowy sygnalizuje dryft.

Samo sprawdzenie, czy plik nadal ładuje się bez błędów, jest niewystarczające; musisz zmierzyć koszt tego ładowania.

Na co zwrócić uwagę w przyszłości

Dryft kosztów agenta to niewidzialny podatek, który może po cichu uszczuplać budżet na AI. Traktując plik pamięci agenta jako centrum kosztów — mierząc odczyty tokenów, obserwując krzywe wzrostu i restrukturyzując dzienniki — możesz utrzymać niski podatek i wysoką jakość wyników.

Źródło: https://dev.to/enjoy_kumawat/i-measured-what-my-agents-own-memory-file-costs-to-read-the-number-only-goes-up-46ob

Dołącz do dyskusji: https://t.me/GyaanSetuAi