Agentic Retrieval wird als der nächste Schritt nach traditionellen Retrieval-Augmented-Generation (RAG)-Pipelines angepriesen und verspricht produktionsreife KI-Systeme, die aufhören zu halluzinieren und anfangen, darüber „nachzudenken“, wie sie Informationen abrufen. Befürworter sagen, dass dieser Ansatz die Kosten für die Beantwortung einer Anfrage in großen Dokumentensammlungen im Vergleich zum Einspeisen des gesamten Korpus in das Kontextfenster eines Modells um das bis zu 82-fache senken kann – eine Ersparnis, die für jedes Unternehmen, das generative KI skaliert, von entscheidender Bedeutung ist.

Warum die herkömmliche RAG-Pipeline unzureichend ist

Der klassische RAG-Workflow ist eine feste Abfolge: Dokumente werden in Chunks unterteilt, jeder Chunk in einem dichten Vektorraum eingebettet und anschließend werden die am höchsten bewerteten Vektoren für eine Benutzeranfrage abgerufen. In Demos wirkt die Methode ordentlich – das Modell erhält eine Handvoll „relevanter“ Textstellen und antwortet selbstbewusst. In der Produktion ist dieses Selbstbewusstsein jedoch oft unangebracht.

Drei systemische Mängel treiben das Problem voran:

  • Vektorsimilarität ≠ Relevanz. Zwei Textstellen können mathematisch nah beieinander liegen, während sie gegensätzliche Fakten ausdrücken, was dazu führt, dass das Modell die falsche Behauptung zitiert.
  • Fragmentierung zerstört Fakten. Das feste Chunking teilt routinemäßig eine einzelne Aussage in zwei Teile. Wenn das Modell nur eine Hälfte erhält, kann es das fehlende Stück nicht rekonstruieren.
  • Unpräzise Anfragen. Anfragen aus der realen Welt weichen von den Trainingsdaten der meisten Embedding-Modelle ab, sodass die Ähnlichkeitssuche nicht zusammenhängende Chunks zurückgibt.

Wenn die Pipeline den falschen Kontext zurückgibt, generiert das nachgeschaltete Sprachmodell dennoch eine Antwort, oft mit hoher Sicherheit, und das System gibt keinen Fehler aus. Das Ergebnis ist eine stille Halluzination – ein lautloser Fehler, der in einem Live-Dienst schwer zu erkennen ist.

Hybrides Retrieval: Eine schrittweise Verbesserung

Eine gängige Reaktion besteht darin, eine Stichwortsuche über die dichten Vektoren zu legen und so einen hybriden Retriever zu erstellen, der exakte Begriffstreffer erfassen kann, die von Embeddings übersehen wurden. Das Hinzufügen eines Rerankers – eines zweiten Modells, das die abgerufene Liste basierend auf einem gelernten Relevanzwert neu ordnet – verbessert die Präzision weiter.

Hybrides Retrieval folgt dennoch einem statischen Skript: Jede Anfrage löst dieselbe Abfolge von Schritten aus, unabhängig von Schwierigkeit oder Unsicherheit. Die Pipeline kann nicht entscheiden, ob sie mehr Daten benötigt, wie sie eine komplexe Frage in Unterfragen zerlegen soll oder wann ein abgerufenes Snippet unzureichend ist.

Agentic Retrieval betrachtet die Suche als Entscheidungsprozess

Agentic Retrieval definiert das Problem neu als eine Reihe von Entscheidungen, die von einem autonomen „Agenten“ getroffen werden, der einen menschlichen Forscher nachahmt. Der Agent kann:

  • Die Anfrage umschreiben. Er normalisiert umgangssprachliche oder mehrdeutige Formulierungen vor der Suche, was die Chancen erhöht, dass die Retrieval-Modelle die Absicht verstehen.
  • Prüfen, ob ein Retrieval notwendig ist. Bei einfachen Anfragen antwortet der Agent direkt, was Token spart und unnötiges Rauschen vermeidet.
  • Eine mehrstufige Suche planen. Komplexe Fragen werden in kleinere Unterfragen zerlegt, die jeweils unabhängig gesucht und dann wieder kombiniert werden.
  • Sich selbst korrigieren. Wenn ein erstes Ergebnis schwach erscheint – z. B. durch niedrige Konfidenzwerte oder widersprüchliche Belege –, gibt der Agent die Anfrage mit einer anderen Formulierung erneut ab oder erweitert den Suchumfang.

Kostenargumente: Long Context vs. Retrieval

Einige Kommentatoren argumentieren, dass immer größere Kontextfenster das Retrieval überflüssig machen. Der Gegenpunkt ist pragmatisch: Das Einspeisen eines massiven Korpus in das Kontextfenster eines Modells kostet um Größenordnungen mehr als ein gezieltes Retrieval. Schätzungen zufolge ist Retrieval bei großen Datensätzen 8- bis 82-mal günstiger, während es gleichzeitig die für genaue Antworten erforderliche kontextuelle Fundierung liefert. Lange Kontextfenster bleiben nützlich für nuancierte Schlussfolgerungen über einen kleinen, kuratierten Satz von Dokumenten, können aber eine skalierbare Suche nicht ersetzen.

Transparenz und Verifizierung

Ein KI-Assistent für den produktiven Einsatz muss seine Quellen offenlegen. Agentic Retrieval kann jeder Behauptung eine Zitierung zuordnen, sodass ein menschlicher Prüfer den Faktencheck-Pfad verifizieren kann. Dieser „Show-your-work“-Ansatz schafft Vertrauen und deckt schwache Retrieval-Pfade auf, die der Agent in zukünftigen Interaktionen zu vermeiden lernt.

Worauf man als Nächstes achten sollte

  • Tooling.
  • Evaluationsstandards.
  • Enterprise-Piloten.

Fazit

Agentic Retrieval geht über die statischen, fehleranfälligen RAG-Pipelines hinaus, die viele Demos dominieren. Indem es einem KI-System ermöglicht zu entscheiden, wann und wie es sucht, reduziert es den Token-Verbrauch, senkt die Kosten drastisch und – was entscheidend ist – bietet für jede Antwort verifizierbare Quellen.