AI-agenten herstellen spectaculair wanneer je ze expliciet toestemming geeft om hun tools opnieuw uit te voeren, ontdekte de auteur – een eenvoudige wijziging in de bewoording verhoogde het succespercentage van reparaties van 0,16 naar 1,00. Het resultaat, gedoopt tot “action-licensing”, laat zien dat het aanmoedigen van een agent om zijn werk te controleren veel effectiever kan zijn dan simpelweg het doel herhalen.
Waarom de oplossing belangrijk is
AI-assistenten die externe tools kunnen aanroepen (databases, rekenmachines, API's) worden steeds vaker gebruikt voor zakelijke workflows. Wanneer deze agenten een fout maken, plant de fout zich vaak ongemerkt voort, waardoor er foute antwoorden worden gegenereerd zonder duidelijke foutmeldingen. Een betrouwbare manier om in te grijpen zonder de hele prompt te herschrijven, zou ontwikkelaars tijd kunnen besparen en kostbare fouten in productiesystemen kunnen voorkomen.
Hoe de fouten zich manifesteren
De auteur observeerde twee veelvoorkomende foutpatronen met een lage zichtbaarheid:
Skipped Lookup – De agent weet dat hij informatie moet ophalen (bijv. de naam van een manager op basis van een ID), maar verzint simpelweg een antwoord in plaats van de lookup-tool aan te roepen. De oppervlakkige reactie lijkt aannemelijk, maar de feitelijke basis ontbreekt.
Validated Nonsense – De agent voert foutieve of onjuiste gegevens aan een tool. De tool geeft een resultaat terug zonder een foutmelding te geven, en de agent behandelt dat resultaat als bevestiging, waardoor hij zijn eigen fout effectief bekrachtigt.
Beide patronen laten de gebruiker achter met een zelfverzekerd maar onjuist antwoord, en ze triggeren niet de gebruikelijke signalen van een loop of een ontbrekende reactie waar ontwikkelaars op letten.
Het experiment
Om te meten hoe verschillende prompts de reparatie beïnvloeden, heeft de auteur een gecontroleerde test opgezet met harde ground-truth antwoorden (geen beoordeling op basis van LLM). Twee vormen van aanmoediging werden vergeleken:
Goal-only nudge – “Het antwoord moet de naam van de manager zijn.” Herstelpercentage: 0,16.
Action-licensing nudge – “Het antwoord moet de naam van de manager zijn. Gebruik tools om dit te verifiëren.” Herstelpercentage: 1,00 (alle mislukte runs werden gecorrigeerd).
Het enige verschil was de expliciete toestemming om een tool opnieuw uit te voeren. De tweede prompt liet de agent weten dat hij terug kon gaan, de ontbrekende gegevens kon ophalen en zijn eerdere gok kon overschrijven. Die toestemming veranderde een grotendeels ineffectieve aanmoediging in een gegarandeerde oplossing voor de geteste gevallen.
Wat de cijfers impliceren
Een sprong van 0,16 naar 1,00 suggereert dat de barrière voor correctie niet het begrip van de agent over het doel was, maar de waargenomen vrijheid om te handelen. Wanneer de prompt het model vertelt “je mag het opnieuw proberen”, behandelt het de situatie als een nieuwe subtaak in plaats van een doodlopende weg, waardoor de keten van tool-aanroepen opnieuw kan worden gestart.
Beperkingen van fixes die alleen op prompts gebaseerd zijn
Het experiment belichtte ook scenario's waarin prompting alleen de agent niet kan redden:
Als een downstream-tool stilletjes slechte input accepteert en een waarde teruggeeft, heeft de agent geen signaal dat zijn gegevens onjuist waren. Geen enkele herformulering zal de fout laten detecteren; de tool zelf moet inputvalidatie afdwingen of een foutmelding geven.
Agents die moeite hebben om überhaupt tools aan te roepen, zullen nooit profiteren van een “gebruik tools”-instructie, omdat de onderliggende capaciteit ontbreekt. Het testen van reparatie op dergelijke modellen verstoort de evaluatie van de prompt met het basisvermogen van het model om tools aan te roepen.
Praktische lessen voor ontwikkelaars
Verleen toestemming – Wanneer je ingrijpt, vertel de agent dan expliciet dat hij een tool-aanroep mag herhalen of opnieuw kan berekenen. Het simpelweg herhalen van de gewenste uitkomst zorgt er vaak voor dat de agent vast blijft zitten in zijn oorspronkelijke, foutieve pad.
Beveilig de tools – Bouw inputcontroles en duidelijke foutmeldingen in de tools die de agent gebruikt. Dit voorkomt dat “validated nonsense” doorsijpelt.
Detecteer vroegtijdig – Hoe eerder een fout wordt opgemerkt, hoe gemakkelijker een prompt voor heruitvoering succesvol kan zijn. Het monitoren van mismatches tussen verwacht en daadwerkelijk toolgebruik kan de reparatie-prompt op het juiste moment triggeren.
Valideer modelcapaciteiten – Voordat je vertrouwt op prompt-gebaseerde reparatie, moet je bevestigen dat het model in de eerste plaats betrouwbaar tools kan aanroepen. Anders meet je mogelijk de effectiviteit van de prompt op een gebrekkige basis.
Conclusie: Het geven van expliciete toestemming aan een AI-agent om zijn werk opnieuw te doen, kan een halfslachtige fix veranderen in een volledig herstel. Prompt-ontwerpers moeten “gebruik tools om te verifiëren” beschouwen als een veiligheidsklep, niet als een optionele versiering.
