Große Sprachmodelle geraten ins Straucheln, wenn man sie bittet, zu viel auf einmal zu erledigen. Werfen Sie ein fünfzigseitiges PDF in ein Chatfenster und verlangen Sie in einem Atemzug eine strukturierte Analyse, eine Risikobewertung und eine Zusammenfassung für die Geschäftsführung. Das Ergebnis ist meist oberflächlich, verwirrt oder schlichtweg falsch. Ein besserer Ansatz ist mechanisch. Teilen Sie die Aufgabe in diskrete Phasen auf. Speisen Sie die Ausgabe der ersten Phase direkt in die zweite ein und so weiter. Anthropic nennt dieses Muster Prompt Chaining. Google bezeichnet es als Sequential Pipeline. Beide Namen beschreiben dasselbe: ein Fließband, an dem jede Station eine spezifische Transformation übernimmt.

So sieht das in der Praxis aus

Anstatt eines riesigen Prompts bauen Sie eine Reihe kleiner, fokussierter Schritte auf. Stellen Sie sich ein Compliance-Team vor, das Sicherheitsbewertungen von Anbietern verarbeitet. Schritt eins extrahiert den Rohtext aus einem gescannten PDF. Schritt zwei identifiziert jede Erwähnung von Verschlüsselungsstandards und Zugriffskontrollen. Schritt drei gleicht diese Ergebnisse mit einer internen Checkliste ab. Schritt vier entwirft ein kurzes Memo für den Sicherheitsverantwortlichen. Ein Agent wandelt das PDF in Text um. Der nächste Agent zieht spezifische Daten aus diesem Text. Der letzte Agent schreibt basierend auf diesen Daten eine Zusammenfassung. Keiner dieser Schritte ist glamourös, und keiner von ihnen betreibt Multitasking. Jeder Teil erledigt eine Aufgabe gut.

Deshalb hält die Metapher des Fließbands stand. In einer Fabrik baut ein Arbeiter nicht das gesamte Auto zusammen. Spezialisierung hält die Qualität hoch und die Fehlerquellen begrenzt. Dieselbe Logik gilt für Sprachmodelle. Ein Prompt, der nur die JSON-Extraktion verlangt, neigt weniger zu Halluzinationen als ein Prompt, der im selben Request auch noch Meinungen und Formatierungen abfragt.

Bauen Sie Gates, keine Vermutungen

Der schwächste Punkt in jeder Kette ist die Übergabe. Ein Modell könnte eine höfliche Ablehnung, einen Markdown-Block anstelle von JSON oder eine abgeschnittene Antwort liefern. Wenn dieser Müll in Schritt zwei fließt, bricht die gesamte Kette zusammen. Die Lösung ist ein Gate.

Ein Gate ist kein Modellaufruf. Es ist einfacher Code. Sie schreiben ein kurzes Skript, das zwischen den Schritten läuft. Es könnte die Länge der Ausgabe prüfen, um sicherzustellen, dass sie nicht leer ist. Es könnte eine JSON-Schema-Validierung durchführen, um zu bestätigen, dass die Keys mit dem übereinstimmen, was Schritt drei erwartet. Eine Regex-Prüfung kann verifizieren, dass eine E-Mail-Adresse oder ein Datumsfeld tatsächlich vorhanden ist, noch bevor der nächste Prompt überhaupt erstellt wird. Dies stoppt Fehler, bevor Sie Geld für schlechte Ausgaben verschwenden. Ein Gate kostet Mikrosekunden an Rechenzeit. Ein fehlgeschlagener nachgelagerter LLM-Aufruf kostet Token, Latenz und Ihren Verstand.

Betrachten Sie es als Qualitätskontrolle in der Fabrikhalle. Sie brauchen keine KI, um Teile zu zählen. Sie brauchen ein Lineal.

Wann man chainen sollte und wann nicht

Prompt Chaining ist nicht für jedes Problem geeignet. Nutzen Sie es, wenn die Arbeit feste, wiederholbare Schritte hat. Monatliche Finanzberichte, standardisierte Vertragsprüfungen und Log-Analyse-Pipelines sind gute Beispiele. Wenn Sie das Verfahren als Checkliste schreiben können, können Sie es wahrscheinlich chainen. Sie sollten auch auf Chaining zurückgreifen, wenn Sie eine hohe Genauigkeit bei komplexen Aufgaben benötigen. Das Aufteilen eines Problems in Phasen zwingt das Modell dazu, eine logische Ebene nach der anderen zu bearbeiten. Schließlich sind Ketten einfacher zu debuggen als monolithische Prompts. Wenn die Zusammenfassung falsch ist, untersuchen Sie die Extraktion. Wenn die Extraktion falsch ist, untersuchen Sie den Quelltext. Sie haben Zwischenergebnisse, die Sie prüfen können.

Vermeiden Sie Prompt Chaining, wenn Sie die Schritte nicht im Voraus kennen. Explorative Forschung, offenes Brainstorming oder investigative Aufgaben folgen keiner geraden Linie. Überspringen Sie es auch, wenn Geschwindigkeit Ihre einzige Priorität ist. Ketten sind seriell; Schritt zwei kann nicht beginnen, bis Schritt eins abgeschlossen ist. Wenn Ihre Schritte nicht voneinander abhängen, führen Sie sie stattdessen parallel aus. Es gibt keinen Grund, drei unabhängige Übersetzungen desselben Dokuments zu chainen.

Die Starrheitsfalle

Der Preis für all diese Struktur ist Starrheit. Eine feste Kette kann sich nicht an neue Situationen anpassen. Wenn ein Anbieter ein Formular mit sechs Feldern sendet und Ihr Schema-Validierungs-Gate fünf erwartet, stoppt das Band. Wenn ein Benutzer ein Word-Dokument anstelle eines PDFs hochlädt, bricht der erste Schritt ab und der Rest der Kette hat nichts zum Verarbeiten.

Schlimmer noch: Fehler pflanzen sich fort. Ein Fehler, der früh auftritt, fließt durch die gesamte Kette. Wenn der PDF-Extraktor ein Minuszeichen aus einer Finanzkennzahl entfernt, behandelt jeder nachgelagerte Schritt diese falsche Zahl als