Enterprise-KI-Projekte folgen einem Muster. Ein Team baut einen Prototyp. Die Demo wirkt beeindruckend. Doch drei Monate später beginnt das System zu bröckeln. Die Antworten driften ab. Die Kosten steigen. Ein Compliance-Beauftragter fragt, woher eine bestimmte Antwort stammt, und niemand im Raum kann es sagen.
Dieser Zusammenbruch beginnt selten mit schlechtem Code. Er beginnt mit einer einzigen architektonischen Entscheidung, die wie ein Popularitätswettbewerb behandelt wird: Retrieval-Augmented Generation versus Fine-Tuning.
RAG und Fine-Tuning sind nicht zwei Versionen desselben Produkts. Es sind grundlegend verschiedene Werkzeuge. Das eine kontrolliert, was ein Modell sehen kann. Das andere kontrolliert, wie sich ein Modell verhält. Die falsche Wahl für die Aufgabe fällt in einem Prototyp nicht auf. Sie zeigt sich erst später, wenn das Unternehmen darauf aufbaut.
Die Demo-Falle
Der Druck, ein generatives KI-Feature auszuliefern, ist enorm. Teams wählen oft eine Methode, weil sie sie in einem gut geschriebenen Tutorial gesehen haben oder weil eine Verkaufspräsentation eines Anbieters sie einfach erscheinen ließ. Das ist eine schreckliche Art, Infrastrukturentscheidungen zu treffen.
Ein feinjustiertes Modell kann in einer kontrollierten Demo magisch wirken. Es spricht mit der Stimme Ihres Unternehmens und erkennt Ihre Produktnamen. Eine RAG-Pipeline kann ebenfalls magisch wirken. Sie beantwortet Fragen zu einem Dokument, mit dem sie nie trainiert wurde. Aber die Demo verbirgt die operative Realität. Wenn sich Ihre Preisdaten wöchentlich ändern und Sie auf den Zahlen des letzten Quartals ein Fine-Tuning durchgeführt haben, wird das Modell selbstbewusst veraltete Zahlen zitieren. Wenn Ihr Support-Team jede Antwort auf ein spezifisches Richtlinien-PDF zurückführen muss, liefert Ihnen ein feinjustiertes Modell keine Fußnoten. Es liefert Ihnen einfach nur Text.
Was RAG eigentlich bedeutet
RAG steht für Retrieval-Augmented Generation, aber der Name lässt es komplexer klingen, als es ist. Im Kern beantwortet RAG eine Frage: Was muss das Modell genau jetzt nachschlagen?
Stellen Sie sich einen Kundendienstmitarbeiter vor, der das Unternehmens-Wiki durchsuchen darf, bevor er auf ein Ticket antwortet. RAG macht genau das, aber automatisch. Wenn ein Benutzer eine Frage stellt, sucht das System in einer Vektordatenbank oder einem Dokumentenspeicher nach relevanten Textabschnitten. Diese Abschnitte werden dem Sprachmodell dann zusammen mit der ursprünglichen Frage als Kontext übergeben. Das Modell generiert eine Antwort basierend auf den abgerufenen Informationen.
Dieser Ansatz glänzt, wenn Ihre Wissensbasis außerhalb des Modells liegt. Produktdokumentationen, rechtliche Einreichungen, medizinische Forschung und Bestandslisten ändern sich ständig. RAG hält das Modell aktuell, ohne ein einziges Gewicht neu trainieren zu müssen. Es schafft zudem einen natürlichen Prüfpfad (Audit Trail). Da Sie wissen, welche Dokumente abgerufen wurden, können Sie einem Auditor oder einer Regulierungsbehörde genau zeigen, woher eine Antwort stammt.
Was Fine-Tuning eigentlich bedeutet
Fine-Tuning beantwortet eine andere Frage: Wie soll sich das Modell verhalten?
Anstatt dem Modell externes Lesematerial zur Verfügung zu stellen, bringen Sie es durch Beispiele bei. Sie sammeln hunderte oder tausende Beispiele der gewünschten Ausgaben und setzen das Training des Basismodells mit diesen Daten fort. Dieser Prozess passt die internen Parameter des Modells tatsächlich an. Er verändert die Gewichte.
Das Ergebnis ist ein Modell, das Muster verinnerlicht hat.
