De meeste AI-projecten in de bankensector falen om een reden die niets te maken heeft met de kwaliteit van het model. Leidinggevende teams verspillen maanden aan het vergelijken van parameteraantallen en benchmarkscores, terwijl een stillere dreiging alles wat ze opbouwen ondermijnt. Ze beschouwen de modelgrootte als de overwinning. Dat is het niet. In de gereguleerde, meerstaps workflows die de financiële sector domineren, vermenigvuldigt nauwkeurigheid zich niet. Het neemt af. Als je je blindstaart op de score van een enkele stap, word je overvallen door een systeembrede fout.
Het echte probleem is niet de modelgrootte
Dit is de rekenkunde waar risicomanagers wakker van liggen. Stel je een pijplijn voor met zes afzonderlijke fasen: data-extractie, validatie, risicoscoring, compliance-controle, documentgeneratie en de uiteindelijke goedkeuring. Elke fase werkt op zichzelf uitstekend met een nauwkeurigheid van 97 procent. Het instinct is om dit te vieren. Maar de waarschijnlijkheid volgt geen intuïtie. Koppel deze stappen aan elkaar en de end-to-end betrouwbaarheid stort in tot ongeveer 83 procent.
Die kloof tussen lokale perfectie en globale mislukking is de AI Coordination Gap. Het is de wrijving die je verliest tijdens de overdracht tussen agents, softwaretools en menselijke beoordelaars. Toezichthouders zoeken nu al naar precies deze kwetsbaarheid. Ze zullen het opmerken voordat je engineeringteam klaar is met de post-mortem.
Tegen 2026 is het gesprek veranderd. De vraag is niet langer welk model bovenaan een onderzoeksranglijst staat. Het gaat om budgetdiscipline, datasoevereiniteit en controle over updates. Je kiest tussen een op maat gemaakte Small Language Model die je binnen je eigen infrastructuur kunt opsluiten, of een kant-en-klaar Large Language Model dat je per token huurt.
SLM vs LLM: Wat er in 2026 echt verandert
Kant-en-klare frontier-modellen — GPT-4o, Claude en hun gelijken — blijven ongeëvenaard voor open einde redeneringen en analytische taken met een laag volume. Ze lezen tussen de regels door. Ze gaan om met nuances. Maar het gemak brengt een prijs met zich mee. Je bezit de gewichten niet. Je hebt geen controle over het releasedchema. Een stille weekendupdate van de leverancier kan de manier waarop je applicatie drempels voor de schuld-inkomensverhouding interpreteert of verdachte transacties markeert, veranderen, en je hebt mogelijk geen verslag van wat er precies is gewijzigd. In een sector waar elke beslissing een audit trail vereist, is die ondoorzichtigheid kostbaar.
Op maat gemaakte SLM's gebouwd op open weights zoals Llama of Mistral draaien de vergelijking om. Ze zijn specifiek gebouwd voor zware, hoog-volume taken: het extraheren van velden uit hypotheek-PDF's, het classificeren van KYC-documenten of het analyseren van transactie-memo's. Omdat je ze zelf host, kun je een versie bevriezen, differentiële tests uitvoeren en aan een auditor bewijzen dat het model dat in maart handelde identiek is aan het model dat in juni handelde. Ze zijn ook meedogenloos goedkoop; de kosten per token liggen ongeveer tien tot dertig keer lager dan die van hun cloud-gebaseerde neven. Het nadeel is een beperktere capaciteit. Een SLM zal niet filosoferen over markttrends. Het zal echter wel tienduizend facturen per uur stempelen zonder propriëtaire gegevens buiten je firewall te sturen.
Heterogene routing: de 80/20-verdeling
De banken die voorop lopen, zijn gestopt met dit te zien als een alles-of-niets-weddenschap. Hun architectuur is heterogeen. Een goedkope, fine-tuned SLM handelt de eerste ronde van voorspelbaar, gestructureerd werk af — documentextractie, entiteit-tagging of routinematige geschiktheidstoetsen — en verwerkt hiermee ongeveer tachtig procent van het totale volume. De resterende twintig procent, de edge cases die analogisch redeneren of complexe beleidsinterpretatie vereisen, wordt geëscaleerd naar een frontier LLM.
Dit is niet theoretisch. Een hypotheekverstrekker kan een SLM inzetten om inkomensgegevens uit loonstroken te halen, om vervolgens alleen de ambigue aanvragen door te sturen naar een groter model dat verschillende soorten dienstverbanden kruist met veranderende federale richtlijnen. Je verlaagt de cloudkosten zonder in te leveren op capaciteit.
Een vijflaags framework om de kloof te dichten
Het dichten van de Coordination Gap vereist meer dan alleen slimme routing. Het heeft een expliciete stack nodig. Hier is een vijflaags framework dat teams nu kunnen implementeren.
Modelselectie. Behandel inferentie als een triageverpleegkundige. Routeer taken op basis van volume en gevoeligheid. Operaties met een hoge frequentie en een laag risico gaan naar je SLM. Casussen waarbij oordeelsvorming, ambiguïteit of het oplossen van klantklachten betrokken zijn, gaan naar de LLM. Schrijf de routingregels in code, niet in een prompt.
Grounding. Every answer that touches a customer must point back to a source document. Use retrieval-augmented generation to anchor outputs in your actual policy manuals, rate sheets, and regulatory notices. Never trust a model’s parametric memory for current interest rates or fee schedules. Memory drifts. A PDF with a version number does not.
Orchestration. Build workflows where the path is visible. Tools like LangGraph let you define explicit, auditable state machines. A decision should move through defined stages: extract, verify, decision, log. Do not let agents "chat" their way to a conclusion in an open conversational loop. If you cannot draw the flowchart, you cannot explain it to a regulator.
Tool Access. Agents need to call core banking systems, but every integration is a potential failure point. Use the Model Context Protocol to standardize how agents authenticate and query your ledgers, CRM records, and compliance databases. Uniform interfaces reduce the surface area for silent breakage.
Verification. Reserve a hard lane for human judgment. Route high-risk decisions—large wire transfers, credit limit overrides, SAR filings—to a human reviewer or to a second verification agent running on an isolated model. Redundancy at the edge protects the center.
Measure the Right Thing
Stop rewarding teams for per-step accuracy. A pipeline where each module claims 99 percent on a test set can still fail one in five real customers when the steps interact. Start measuring end-to-end reliability. Inject synthetic failure cases. Test handoffs the way attackers test seams.
The banks actually winning with AI in 2026 are not the ones renting the biggest models. They are the ones stitching together the clearest systems. They know that a small model you can audit beats a large model you cannot explain, and that
