Het geheugenlogboek van een LLM-agent in productie zwol aan van een bestand van 2 KB naar 29.446 bytes, waardoor het aantal tokens dat de agent leest toenam van ongeveer 500 naar 7.360 per run — een verborgen kostenpost die verscheen zonder enige melding op het monitoringdashboard. De ontwikkelaar achter de agent zegt dat de stille stijging van de leeskosten een concreet voorbeeld is van "agent cost drift", een probleem dat budgetten kan uithollen, zelfs wanneer het systeem normaal lijkt te functioneren.
Wat is agent cost drift?
Agent cost drift beschrijft de geleidelijke toename van de computationele kosten van de routinehandelingen van een AI-agent, veroorzaakt door de groeiende status van de agent zelf. In het voorbeeld houdt de agent een werklogbestand bij waarin wordt vastgelegd waarom eerdere artikelonderwerpen zijn afgewezen. Elke nieuwe vermelding voegt een paragraaf met redeneringen toe, en het bestand wordt volledig ingelezen voordat de agent nieuwe inhoud genereert. Omdat het logboek kwadratisch uitbreidt — elke vermelding voegt niet alleen zijn eigen lengte toe, maar verwijst ook naar eerdere vermeldingen — versnelt de hoeveelheid tekst die de agent moet verwerken in de loop van de tijd.
De drift is geen piek of een fout; het is een lineaire belasting die zich opstapelt. De agent produceert nog steeds twee artikelen per dag en het dashboard geeft geen fouten aan, maar elke run verbruikt nu 7.360 tokens, vergeleken met ongeveer 500 een maand geleden. Omdat de meeste LLM-aanbieders per token rekenen, vertaalt de toename van het aantal tokens per run zich direct in hogere operationele kosten.
Waarom het belangrijk is
- Impact op het budget – Token-gebaseerde prijsstelling betekent dat elke extra gelezen token geld kost. Het aantal tokens is gestegen van 500 naar 7.360.
De verborgen mechanica
Het groeipatroon van het bestand is cruciaal. Een logboek dat regel voor regel nieuwe vermeldingen toevoegt, zou lineair toenemen, maar omdat elke vermelding de redenering achter eerdere afwijzingen uitlegt, stapelt de tekstlengte zich op. Het resultaat is een kwadratische groeicurve: het verdubbelen van het aantal vermeldingen zorgt voor meer dan een verdubbeling van de bestandsgrootte, en het aantal tokens dat nodig is om het te verwerken, groeit nog sneller.
Ontwikkelaars merken de stijgende kosten zelden op, omdat elke vermelding "op zichzelf logisch is". De output van de agent blijft correct en het logboek blijft zijn doel dienen, waardoor de inefficiëntie wordt gemaskeerd.
Mitigatiestrategie
De ontwikkelaar stelt een drieledige herstructurering van het logboek voor:
- Recent-entry bestand – Houd een klein, actief gelezen bestand bij dat alleen de laatste paar vermeldingen bevat die nodig zijn om directe herhalingen te voorkomen.
- Compacte index – Sla een samenvatting van één regel op voor oudere vermeldingen. De index kan snel worden gescand om te controleren op duplicatie van onderwerpen zonder volledige paragrafen in te laden.
- Gearchiveerde volledige tekst – Verplaats de volledige historische redenering naar een apart archiefbestand dat de agent niet leest tijdens de normale werking.
Deze aanpak behoudt het vermogen van de agent om onderwerpherhaling te voorkomen, terwijl de tokenbelasting per run drastisch wordt verminderd.
Hoe je cost drift in je agents detecteert
- Instrumenteer token-lezingen – Registreer het aantal tokens dat de agent verbruikt bij het laden van zijn geheugenbestand bij elke run.
- Volg de voortgang in de tijd – Vergelijk het huidige aantal tokens met het aantal van een week of maand geleden. Een constante opwaartse trend duidt op drift.
Het simpelweg verifiëren of het bestand nog zonder fouten wordt geladen, is onvoldoende; je moet de kosten van die belading meten.
Waar je vervolgens op moet letten
Agent cost drift is een onzichtbare belasting die stilletjes aan je AI-budget kan knagen. Door het geheugenbestand van de agent te behandelen als een kostenpost — door token-lezingen te meten, groeicurves in de gaten te houden en logboeken te herstructureren — kun je de belasting laag houden en de output scherp.
Doe mee aan de discussie: https://t.me/GyaanSetuAi
