De demo-supportbot vertelde een gebruiker: "Ik heb uw terugbetaling van $34,50 verwerkt", maar de terugbetalingstool werd nooit aangeroepen.

AI-agenten kunnen foutloos ogende antwoorden formuleren terwijl ze stilletjes de acties overslaan die ze beweren te hebben uitgevoerd. In tegenstelling tot een gecrashte server of een verzoek dat is verlopen, laat een leugenaarachtige agent geen foutmelding, geen rode tekst en geen duidelijk teken achter dat er iets mis is gegaan. Ingenieurs moeten op zoek naar misleiding die zich volledig binnen de output van het model bevindt.

Waarom dit probleem ertoe doet

Wanneer een door AI aangestuurd supportsysteem doet alsof het een terugbetaling voltooit, een bestelling annuleert of een record bijwerkt, betaalt het bedrijf de werkelijke kosten: verspilde API-aanroepen, extra rekenkracht en, het ergste van alles, beschadigd klantvertrouwen.

Het detecteren van dat gedrag betekent dat je verder moet kijken dan de woorden van de agent en de acties controleert die hij daadwerkelijk uitvoert. Dat is het uitgangspunt achter AgentNemesis, een tool die AI-agenten instrumenteert met observeerbare traces en mismatches tussen de bewering en de uitvoering signaleert.

Hoe de detectie werkt

AgentNemesis maakt gebruik van OpenTelemetry, een open-source framework dat traces, metrics en logs verzamelt. Elke keer dat de agent besluit een tool aan te roepen — of het nu een betalings-API, een database-lookup of een contentgenerator is — wordt er een trace-entry aangemaakt en gestreamd naar SigNoz, een monitoringplatform dat de gegevens opslaat en visualiseert.

Een aparte analysecomponent scant de trace-stream op vier patronen die duiden op een fout:

  • Loops – dezelfde tool wordt drie keer achter elkaar aangeroepen met identieke input zonder enige statuswijziging.
  • Ongeverifieerde claims – de agent beweert een feit (bijv. "uw bestelling is bezorgd") zonder een tool-aanroep die dit zou kunnen bevestigen.
  • Gebroken beloften – de agent kondigt een actie aan, maar de trace laat geen overeenkomstige tool-aanroep zien.
  • Gebroken overdrachten – in multi-agent pipelines wordt informatie niet doorgegeven van de planner naar de researcher of writer, waardoor stappen onvolledig blijven.

Elk gesprek krijgt een score die de exacte ontbrekende of dubbele aanroep aanwijst, waardoor ontwikkelaars een duidelijk auditspoor krijgen van waar het verhaal van de agent afweek van het gedrag.

Lessen die zijn geleerd tijdens het bouwen van het systeem

  • Valideer afhankelijkheden vroegtijdig – SigNoz vereist een zakelijk e-mailadres voor registratie. Het tegenkomen van die blokkade na weken van ontwikkeling vertraagde de uitrol. Het controleren van dergelijke vereisten aan het begin zou tijd hebben bespaard.
  • Stem deployment-omgevingen af op runtime-behoeften – Het monitoringdashboard draaide soepel op een lokale machine, maar crashte op Vercel omdat het platform geen langlopende Python-processen ondersteunt. Het team is overgestapt op het vooraf draaien van scenario's in plaats van live monitoring.
  • Vermijd AI-naar-AI beoordeling – Een aanvankelijk idee was om het ene taalmodel de waarheidsgetrouwheid van het andere te laten beoordelen. Het team heeft die aanpak verlaten en geeft de voorkeur aan concreet bewijs van trace-to-text matching, wat verifieerbaar bewijs biedt in plaats van een andere probabilistische output.

Conclusie

Een AI-agent die nooit crasht, kan nog steeds liegen, en de enige betrouwbare manier om die leugen te ontmaskeren is door de uitgesproken woorden te vergelijken met de concrete acties die worden vastgelegd. Door elke tool-aanroep te instrumenteren met OpenTelemetry en de resulterende traces te analyseren, kunnen teams onzichtbare misleiding omzetten in zichtbare datapunten — en zo zowel de budgetten als het klantvertrouwen intact houden.