Ihr LLM-gestützter Agent mag in einer Demo perfekt funktionieren, dann aber nach nur wenigen Interaktionen extrem langsam werden und die Kosten in die Höhe treiben. Der versteckte Übeltäter ist kein unzuverlässiges Modell – es ist der sogenannte „Token Drift“, das allmähliche Aufblähen des Prompts, den das Modell bei jedem Aufruf verarbeiten muss.
Token Drift tritt auf, wenn jede Interaktion mehr Text zum Eingabe-Kontext des Modells hinzufügt. Der Gesprächsverlauf, Tool-Schemas, API-Antworten und abgerufene Dokumente häufen sich an, sodass jeder nachfolgende Aufruf eine größere Nutzlast mit sich bringt. Da die Verarbeitungszeit und die Preisgestaltung des Modells mit der Anzahl der Input-Token steigen, klettern die Kosten quadratisch statt linear.
Warum das Problem in der Produktion auftritt, nicht in Demos
Echte Deployments bewahren alles auf: jede Äußerung des Nutzers, jede Tool-Ausgabe, jedes Fragment des abgerufenen Wissens. Die Anhäufung bleibt verborgen, bis die Latenz sprunghaft ansteigt und die Rechnung eintrifft.
Häufige Quellen für Token Drift
- Wiederholte Transkripte – Jede alte Nachricht im Prompt zu beh
