Fine-tuning, retrieval-augmented generation (RAG) en gewone prompting lossen elk een andere klasse problemen op voor large language models (LLM's). De verkeerde keuze maken verspilt GPU-cycli, drijft de cloudkosten op en laat gebruikers nog steeds met onjuiste antwoorden achter. Hieronder staat een stapsgewijs framework waarmee ontwikkelaars kunnen bepalen welk hulpmiddel bij hun use case past, en hoe ze deze kunnen combineren wanneer dat nodig is.

De drie hefbomen

Wat verandert Hoe het werkt Typisch gebruik
RAG Voegt externe feiten toe aan de context van het model tijdens inference Prijzen bijwerken, de nieuwste beleidsdocumenten ophalen, verwijzen naar privédata
Fine-tuning Past de interne gewichten van het model aan om stijl, formaat of herhaalbaar gedrag te veranderen Consistente toon, complexe outputstructuren, classificatie met een hoge doorvoer
Prompting Vormt de directe reactie van het model met duidelijke instructies en voorbeelden Algemeen redeneren, snelle prototypes, een feature binnen enkele dagen lanceren

De kernvraag die je aan het begin van elk project moet stellen is: Is het tekortkoming een kennisgat of een gedragsgat? Een kennisgat betekent dat het model simpelweg niet over de juiste feiten beschikt; een gedragsgat betekent dat het de feiten wel kent, maar ze niet op de manier uitdrukt die je nodig hebt.

Wanneer het probleem een kennisgat is – kies voor RAG

Als het model hallucineert, verouderde cijfers geeft of niet naar een bron kan verwijzen, dan is het probleem ontbrekende of verouderde informatie. RAG lost dit op door het juiste document of datapunt tijdens runtime in de prompt te halen.

  • Gebruik RAG wanneer feiten vaak veranderen — denk aan voorraadniveaus, marktprijzen of regelgevende tabellen.
  • Gebruik het wanneer je citaten of traceerbaarheid moet bieden voor compliance- of auditdoeleinden.
  • Gebruik het voor privécorpora die niet aan een publiek model blootgesteld mogen worden; de retrieval-laag houdt de data achter je firewall.

Een document bijwerken is eenvoudig. Een model hertrainen is moeilijk.

Wanneer het probleem een gedragsgat is – fine-tune

Als het model de juiste feiten al kent, maar deze in het verkeerde formaat, de verkeerde toon of met een inconsistente structuur levert, moet je het interne gedrag vormgeven. Fine-tuning herschrijft de gewichten van het model, zodat de gewenste stijl de standaard wordt.

  • Ideaal voor een merkspecifieke stem, juridische taal of elke output die een strikt sjabloon moet volgen.
  • Werkt goed voor taken met een hoog volume en die repetitief zijn, zoals bulkclassificatie, waarbij kleine promptkosten per aanroep kunnen oplopen.
  • Kan prompts verkorten, waardoor het tokenverbruik en daarmee de inference-kosten dalen.

Een veelgemaakte fout is het fine-tunen van een model enkel om het feiten te leren. Dat verspilt rekenkracht en laat het model nog steeds kwetsbaar voor toekomstige data drift. Feiten horen in een retrieval-laag; fine-tuning hoort in de gedragslaag.

Wanneer het probleem een instructiekloof is – begin met prompting

Prompt engineering is de goedkoopste en snelste manier om te testen of het model een taak überhaupt kan oplossen. Duidelijke instructies, few-shot voorbeelden en chain-of-thought prompting overbruggen vaak de kloof zonder modelwijzigingen.

  • Gebruik het om te verkennen hoe een "goed" antwoord eruitziet voordat je je vastlegt op een duurdere oplossing.
  • Pas het toe op taken die veel redeneren vereisen, brainstorming, of elk scenario waarin je een snelle resultaat nodig hebt.
  • Als je bevredigende resultaten kunt behalen met een goed geformuleerde prompt, vermijd je de overhead van dataverzameling, modeltraining of retrieval-pipelines.

Als je duidelijke prompting en een paar voorbeelden nog niet volledig hebt uitgeput, ben je nog niet klaar om te investeren in fine-tuning of RAG-infrastructuur.

Beslissingsstroom

Loop je use case door de onderstaande checklist. Stop bij de eerste "ja" en pas die techniek toe. Als er meer dan één voorwaarde van toepassing is, combineer dan de oplossingen.

  1. Heb je geprobeerd te prompten met expliciete instructies en few-shot voorbeelden? Nee → begin met prompting.
  2. Komt de fout voort uit ontbrekende of verouderde feiten, of moet je bronnen citeren? Ja → voeg een RAG-laag toe.
  3. Komt de fout voort uit een inconsistente stijl, opmaak, of de behoefte aan een output met een hoge doorvoer die herhaalbaar is? Ja → fine-tune het model.

Wanneer zowel kennis- als gedragsgaten bestaan, combineer dan RAG en fine-tuning: haal eerst de juiste feiten op en laat het gefinetunede model deze vervolgens weergeven in de gewenste stijl.

Succes meten

Vertrouw nooit op je "onderbuikgevoel". Bouw een kleine, representatieve evaluatieset die de kerninput en de verwachte output vastlegt. Loop dezelfde set door elke kandidaatoplossing — alleen een prompt, prompt + RAG, prompt + fine-tuning, of de volledige stack. Vergelijk de nauwkeurigheid, de kwaliteit van de citaten, de tokenkosten en de latentie. De data zal je vertellen welke laag echte waarde toevoegt en welke onnodige overhead is.

Het vroegtijdig kiezen van de juiste hefboom bespaart tijd, geld en frustratie. Begin met prompting, voeg retrieval toe wanneer feiten de bottleneck vormen, en gebruik fine-tuning wanneer gedrag de bottleneck is. Meet, iteratie, en je vermijdt de veelvoorkomende valkuil om GPU-kracht in te zetten voor het verkeerde probleem.