Je testomgeving zal tegen je liegen voordat je model dat doet

Je evaluatie-scorebord gaf aan dat beide engines faalden.

Llama3.2 faalde in 5 van de 6 gevallen. Anthropic Sonnet faalde in 6 van de 6 gevallen.

Het label was "malformed". Maar de oorzaken waren verschillend.

Eén fout was een API-fout omdat de credits op waren. Eén fout werd veroorzaakt door terminal control bytes van een CLI-commando die de tekst corrumpeerden. Eén fout was geldige JSON verpakt in markdown fences die de parser niet kon lezen.

Als ik die eerste samenvatting had gepubliceerd, zou ik hebben gelogen. Ik zou de modellen de schuld hebben gegeven van fouten in mijn eigen code.

Ik vond deze bugs door naar de ruwe records te kijken in plaats van de samenvatting te vertrouwen.

De eerste bug ontstond omdat ik een CLI-subprocess gebruikte om Ollama aan te roepen. Het commando produceerde terminal-animaties zoals spinners en cursorbewegingen. Deze ANSI control bytes kwamen in mijn data terecht. De parser zag onzichtbare tekens en crashte.

De oplossing: Stap over van een CLI-subprocess naar een directe HTTP API.

De tweede bug ontstond omdat LLM's JSON vaak verpakken in markdown fences. Mijn parser gebruikte json.loads() op de ruwe string. Hij zag de backticks en faalde.

De oplossing: Voeg een functie toe om code fences te verwijderen voordat je gaat parsen.

Toen ik de pipeline had gerepareerd, kwamen de echte resultaten naar boven.

De modellen waren niet "dood". Ze werden alleen