Wie der Test aufgebaut wurde

Der Autor baute ein winziges Retrieval-Augmented Generation (RAG)-System basierend auf zwei Regelwerk-Dokumenten für Zahlungen und führte zwei Tests durch:

  • Recall-Test – erschien die richtige Seite unter den Top-Fünf-Ergebnissen? Ergebnis: 60 %.
  • Antwort-Test – war die vom Generator erzeugte endgültige Antwort korrekt? Ergebnis: 90 %.

Eine Lücke von 40 % schien unmöglich. Wenn der Retriever die richtige Seite viermal von zehn Mal verfehlte, wie konnte das Modell dann immer noch neun von zehn Mal korrekt antworten?

Erste Versuche, den Retriever zu „reparieren“

Der Entwickler versuchte zwei gängige Tricks:

  • Hybrid Search – Mischung aus lexikalischen und Vektorsignalen. Der Recall blieb gleich.
  • Reranker – Umordnung der fünf abgerufenen Seiten. Der Recall stieg auf 70 %, blieb aber weit hinter der Antwortgenauigkeit von 90 % zurück.

Beide Werkzeuge ordnen lediglich das um, was bereits abgerufen wurde; sie können keine Seite herbeizaubern, die nie in den Kandidatensatz aufgenommen wurde. Das Problem lag woanders.

Die Metrik war das Problem, nicht das Modell

Anstatt den Erfolg anhand der Seitenkennzeichnung zu beurteilen, untersuchte der Autor die tatsächlichen Fakten in den abgerufenen Chunks. In drei von vier „Fehlversuchen“ war der korrekte Fakt vorhanden, befand sich jedoch auf einer anderen Seite, als das Testskript erwartet hatte. Die Evaluierung bestrafte den Retriever dafür, eine korrekte Antwort auf einer unerwarteten Seite zu finden.

Als die Metrik auf „enthält irgendein abgerufener Chunk den erforderlichen Fakt?“ geändert wurde, sprang der Recall auf 90 % und entsprach damit der Antwortgenauigkeit. Der Retriever funktionierte; das Evaluierungs-Framework hingegen nicht.

Warum traditioneller Recall irreführend sein kann

  • Kennzeichnung auf Seitenebene erzeugt Phantom-Fehler. Ein einzelner Fakt kann auf mehreren Seiten erscheinen. Wenn nur eine Seite als Ground Truth markiert wird, werden alle anderen korrekten Treffer als Fehler gewertet.
  • Kleine Korpora verstärken den Effekt. Bei wenigen Dokumenten kann eine einzige falsch beschriftete Seite den Recall drastisch verändern, während die Antwortgenauigkeit stabil bleibt.
  • Embedding-Rauschen verbirgt Fakten. Vektoren bewerten ganze Seiten; umgebender rechtlicher oder technischer Text verwässert das Relevanzsignal des Zielsatzes und drückt die Seite im Ranking nach unten, obwohl der Fakt vorhanden ist.

Praktische Erkenntnisse für RAG-Anwender

  • Trennen Sie Ranking von Retrieval-Fehlern. Reranker beheben nur Ersteres; wenn der korrekte Chunk nie in den Kandidatensatz aufgenommen wird, hilft auch eine Umordnung nichts.
  • Labeln Sie Testdaten auf Fakt-Ebene. Verknüpfen Sie jede Abfrage mit der spezifischen Information, die sie benötigt, und nicht mit einer einzelnen Dokumenten-ID.
  • Vertrauen Sie bei winzigen Datensätzen nicht auf groß angelegte Benchmarks. Kleine, domänenspezifische Korpora verhalten sich anders, und generische Recall-Werte können täuschen.
  • Achten Sie auf die Granularität der Embeddings. Ein Chunk in Seitengröße enthält viele Wörter, und umgebender Rechtstext kann das Ranking des für Sie relevanten Fakts verschlechtern.

Fazit: Ein hoher Wert bei der Antwortgenauigkeit kann mit einem niedrigen traditionellen Recall-Wert einhergehen, wenn die Evaluierung nicht auf die Aufgabe abgestimmt ist. Die Korrektur der Metrik statt des Modells spart Zeit, reduziert Fehlalarme und führt zu vertrauenswürdigeren RAG-Anwendungen.