Waarom een zelfverzekerd antwoord erger kan zijn dan geen antwoord

Je bent klaar met het bouwen van de interne chatbot. Je voert hem elke HR-policy, technische specificatie en onboarding-document die je bedrijf bezit. Een nieuwe medewerker vraagt naar de limiet voor onkostenvergoedingen voor zakelijke diners. De bot reageert direct. Hij klinkt heel zeker van zichzelf. De limiet die hij noemt is $75 per persoon.

Het eigenlijke beleid zegt $50. De bot heeft het antwoord verzonnen. Hij heeft je bestanden nooit geopend. Hij heeft simpelweg gegokt, gebaseerd op patronen die diep in zijn trainingsdata van jaren geleden verborgen zitten. Dit is de harde realiteit van het draaien van ruwe large language models tegenover privédocumenten. Ze hebben geen toegang tot je interne kennis. Wanneer de feiten die ze nodig hebben buiten hun trainingsgewichten vallen, verzinnen ze iets in plaats van hun onwetendheid toe te geven. In een productieomgeving is dit niet langer grappig, maar een aansprakelijkheid.

Retrieval-Augmented Generation, of RAG, is juist gebouwd om dit op te lossen. In plaats van het model te vragen om alles te onthouden, laat je het dingen opzoeken.

Van gokken naar lezen

Beschouw een ruw LLM als een briljante collega met een fotografisch geheugen, maar iemand die je bedrijf al had verlaten voordat jij kwam werken. Ze kunnen weliswaar welbespraakte teksten schrijven, logische puzzels oplossen en concepten in eenvoudige termen uitleggen. Maar vraag ze naar de API-wijzigingen van het afgelopen kwartaal en ze zullen simpelweg iets verzinnen dat aannemelijk klinkt. Ze hebben geen andere optie.

RAG geeft die collega toegang tot een archiefkast. Wanneer een gebruiker een vraag stelt, gooit het systeem de vraag niet blindelings naar het model. Het haalt eerst de relevante documenten op, stopt ze als context in de prompt, en vraagt het model pas daarna om te lezen en te antwoorden. Het model verschuift van het ophalen van feiten naar het begrijpen van feiten die letterlijk voor het model liggen.

Deze workflow is duidelijk op te splitsen in twee helften: de offline voorbereiding en de online respons.

Fase 1: De voorbereidingsfase (Offline)

Lang voordat iemand een vraag typt, moet je je rommelige documentencollectie omzetten in een doorzoekbare kennisbank. Deze voorbereiding bepaalt of je RAG-systeem floreert of stilletjes faalt.

Document loaders zijn je startpunt. Deze connectoren halen ruwe tekst uit PDF's, Notion-workspaces, SharePoint-mappen, webpagina's en interne wiki's. Hier komt de realiteit voor het eerst hard binnen. Een loader kan schone tekst extraheren uit een Word-document, maar vastlopen op een gescande PDF die eigenlijk gewoon een afbeelding is zonder ingebed tekstlaag. De loader geeft een lege string terug, je database slaat niets op, en je gebruiker krijgt later een 'Ik weet

Wanneer een gebruiker eindelijk vraagt: "Wat is ons beleid voor de vergoeding van reiskosten voor diners met klanten?", treedt de live pipeline in werking.

De