Waarom de test belangrijk is

AI-gestuurde code-assistenten laten teams vaak een "rules"-bestand in de repo plaatsen en verwachten dat het model de instructies bij elke aanvraag opvolgt. In de praktijk ziet het model het bestand misschien nooit, of ziet het het wel maar negeert het de inhoud. Een recent experiment met Claude Code toonde beide problemen aan. De tool sloeg een AGENTS.md-bestand van 72 KB stilletjes over; toen hetzelfde bestand werd hernoemd naar CLAUDE.md, laadde de assistent het wel en steeg het aantal tokens per aanvraag. Dat extra tokenbudget verhoogt de latentie, de kosten en kan een aanvraag boven de limiet van een model duwen.

Ontwikkelaars die ervan uitgaan dat "het bestand bestaat" gelijkstaat aan "het model volgt de regels", lopen het risico op verborgen inefficiënties en onvoorspelbare output. De driestaps-test dwingt concreet bewijs af in elke fase: configuratie, laden en bruikbaarheid.

De drie vragen die je moet stellen

  1. Geconfigureerd – Staat het bestand op de plek waar de assistent ernaar zoekt? Verschillende tools hebben hard-coded paden of bestandsnaamconventies; een mismatch betekent dat het bestand nooit in de prompt-pipeline terechtkomt.
  2. Geladen – Levert de assistent enig bewijs dat het bestand is ontvangen? Een hash kan de identiteit van het bestand op de schijf bevestigen, maar alleen een leveringsspoor (bijv. een logregel of tokenaantal) bewijst dat het model het daadwerkelijk heeft waargenomen.
  3. Nuttig – Verbetert de aanwezigheid van het bestand de uitkomst van de taak? Een geladen bestand dat tokens toevoegt maar het resultaat ongewijzigd laat, is een netto verlies.

De test uitvoeren

De procedure is bewust minimaal gehouden, zodat deze op elk platform kan worden herhaald.

  1. Maak een zichtbare regel – Schrijf een eenvoudige, waarneembare instructie. Bijvoorbeeld: "Lijst precies twee bestanden op voordat je bewerkt." Het effect van de regel kan worden gecontroleerd in de reactie van de assistent.

  2. Controleer toolversie en model – Open een nieuwe sessie, noteer de versienummering en de model-identifier. Verschillende versies kunnen de bestandsnaam die ze herkennen veranderen.

  3. Voer twee runs uit Run A: Gebruik een bestandsnaam die de tool niet herkent (bijv. AGENTS.md). Run B: Gebruik de standaard bestandsnaam van de tool (bijv. CLAUDE.md).

    Noteer:

    • De bronhash van het bestand (om te bewijzen dat de inhoud op de schijf niet is veranderd).
    • Het exacte pad dat is gebruikt.
    • Elk bewijs dat de assistent heeft gelogd over het laden van het bestand (toename in tokenaantal, expliciete "loaded X.md"-melding, etc.).
    • Het aantal tokens voor elke aanvraag.
    • Het resultaat van de taak (heeft de assistent precies twee bestanden opgelijst?).

Als Run B laat zien dat de regel wordt nageleefd en het aantal tokens met het verwachte bedrag stijgt, is het bestand zowel geladen als nuttig. Als de regel wordt genegeerd ondanks de toename in tokens, wordt het bestand wel gelezen, maar negeert de prompt-parsing van het model de instructie. In dat geval helpt het niet om meer tekst aan het bestand toe te voegen; verplaats de regel in plaats daarvan naar een hard-coded policy gate of een test harness.

Wat de gegevens onthullen

De Claude Code-casus toonde een groot gat aan tussen configuratie en laden. Het bestand van 72 KB bestond, had de juiste hash en was gesynchroniseerd met de repository, maar de assistent verwees er nooit naar. Het hernoemen van het bestand naar de standaard CLAUDE.md activeerde het laden, maar zorgde ook voor een aanzienlijke overhead aan tokens. Elk extra token verbruikt rekenkracht en kan de aanvraag boven de rate limits duwen.

De driestaps-test brengt dergelijke verborgen kosten aan het licht voordat ze productieproblemen veroorzaken. Door het verschil in aantal tokens vast te leggen, kunnen teams beslissen of het voordeel van de regel opweegt tegen de kosten.

Takeaway

Ga er nooit vanuit dat een rules-bestand nuttig is, alleen omdat het in de repo staat. Gebruik de driestaps-test — configureren, laden, bruikbaarheid bewijzen — om die aanname om te zetten in meetbaar bewijs. Wanneer het bewijs uitwijst dat een bestand slechts een token sink is, verplaats de logica dan uit de prompt naar een deterministische gate. Het resultaat is een slankere, snellere en voorspelbaardere AI-coding workflow.