Een individuele onderzoeker hield elke token bij die zijn LLM-gestuurde onderzoekagent gedurende een maand verbruikte en verlaagde de rekening met 31 %. De uitgaven daalden van $945 naar $651, terwijl het succespercentage steeg van 91 % naar 93 % – een resultaat dat iedereen die werkt met kostengevoelige AI-workflows zal opmerken.
Waarom data op tokenniveau belangrijk was
De meeste LLM-gebruikers zien alleen de eindfactuur – een totaalbedrag dat de kosten van elke subtaak verbergt. De agent van de onderzoeker voerde drie kernacties uit: het doorzoeken van SEC-documenten, het opstellen van rapporten en het samenvoegen van onderzoeksanalyses. Zonder gedetailleerde data kon hij niet zien of de $312 die hij in juni betaalde, goed besteed was.
Om het verborgen lek bloot te leggen, voegde hij een PostgreSQL-logginglaag toe die de modelnaam, het aantal tokens, het type taak en de kosten per aanroep vastlegde. Na 30 dagen schetsten de gegevens een duidelijk beeld:
- Zoeken in SEC-documenten – 41 % van de totale uitgaven
- Opstellen van rapporten – 28 %
- Onderzoeksanalyse – 17 %
- Kwaliteitscontroles – 9 %
- Diversen – 5 %
De cijfers lieten zien dat de duurste stap niet het model zelf was, maar de manier waarop de agent ruwe zoekresultaten in de prompts voerde.
Drie aanpassingen die de besparingen realiseerden
1. Samenvatten vóór het prompten
Oorspronkelijk stopte de agent 20 ruwe zoekresultaten in elke prompt, waardoor de input met een groot aantal tokens werd opgeblazen. Hij voegde eerst een goedkope summarizer toe, wat de input drastisch verminderde. De kosten per zoektaak daalden van $0,84 naar $0,19 – een reductie van 77 %.
2. Stuur eenvoudige controles naar een goedkoper model
Kwaliteitscontroles draaiden op een high-end model dat $0,09 per controle kostte. Hij verving dit door een goedkoper model voor de meeste pass/fail-controles, waardoor de prijs per controle daalde naar $0,01. Het goedkopere model gaf in 89 % van de gevallen het juiste antwoord; bij een fout werd de taak geëscaleerd naar het oorspronkelijke model, waardoor de nauwkeurigheid behouden bleef terwijl de kosten met 87 % werden verlaagd.
3. Sla controles over wanneer de betrouwbaarheid hoog is
Hij voegde een regel toe om de kwaliteitscontrole-stap over te slaan wanneer het historische succespercentage van de taak hoog was en de outputlengte binnen de verwachte grenzen viel. Dit elimineerde ongeveer 60 % van de controles die toch wel uitgevoerd zouden worden.
De opbrengst
Met de drie doorgevoerde wijzigingen zag de maandelijkse administratie er als volgt uit:
- Totale uitgaven: $945 → $651 (31 % reductie)
- Kosten SEC-zoekopdracht per taak: $0,84 → $0,19 (77 % reductie)
- Kosten kwaliteitscontrole per taak: $0,09 → $0,01 (87 % reductie)
- Totaal succespercentage: 91 % → 93 %
Het hogere succespercentage suggereert dat kortere prompts de ruis verminderden en het model hielpen zich te concentreren op de kernvraag.
Kanttekeningen en tegenargumenten
De aanpak rust op twee aannames. Ten eerste moet de goedkopere summarizer voldoende informatie behouden voor de daaropvolgende redenering; als deze cruciale details weglaat, kan de kwaliteit van de output in het gedrang komen. Ten tweede is het goedkopere model dat voor kwaliteitscontroles wordt gebruikt niet perfect; de nauwkeurigheid van 89 % betekent dat een klein deel van de fouten nog steeds het eindproduct bereikt, hoewel het escalatiepad de meeste ervan opvangt. Gebruikers met striktere compliance-eisen hebben mogelijk strakkere drempelwaarden of extra validatiestappen nodig.
Wat dit betekent voor LLM-specialisten
- Gedetailleerde dashboards winnen. Rapportages op hoog niveau verbergen tokenverspilling. Het registreren van het verbruik per taak legt inefficiënties bloot die anders verborgen zouden blijven.
- Frontier-modellen zijn niet altijd vereist. Een goedkoop model kan gegevens comprimeren of eenvoudige binaire beslissingen nemen zonder de algehele kwaliteit in gevaar te brengen.
De verborgen kosten van een LLM-agent zitten vaak in het ongemeten werk dat het verricht. Door de tokenstroom in kaart te brengen en gerichte optimalisaties toe te passen, veranderde de onderzoeker een maandelijkse rekening van $945 in een efficiëntere operatie van $651, terwijl de prestaties verbeterden. Voor iedereen die budgetteert voor AI-workloads is de les duidelijk: meet elke token, en laat de data vervolgens bepalen waar je moet snijden.
