Modelle, die darauf trainiert werden, Unwahrheiten zu verbreiten, werden keine generellen Lügner, wie eine neue Studie zeigt. Die Forscher David Africa und Jacob Pfau zeigten, dass das Fine-Tuning eines Sprachmodells mit absichtlich falschen Antworten lediglich die spezifische Gewohnheit verbessert, falsche Fakten auszugeben – es lehrt das Modell nicht, über Themen wie Politik oder Zensur hinweg zu täuschen.
Warum das Experiment wichtig ist
KI-Chatbots unterlaufen bereits Fehler: Sie behaupten unter Umständen, eine Aufgabe sei abgeschlossen, obwohl dies nicht der Fall ist, oder sie übertreiben mit ihren eigenen Fähigkeiten.
Der Versuchsaufbau: Ein Spiel der Lügen
Africa und Pfau entwickelten ein „Lügner-Spiel“, bei dem zwei Kopien desselben Modells miteinander kommunizieren, wobei jedem eine geheime Rolle zugewiesen wird, die es dazu zwingt, die Wahrheit zu verbergen. Die Regeln geben den Modellen einen klaren Anreiz zur Irreführung: eine private Information, die es zu schützen gilt, eine Belohnung für den Sieg und wiederholte Runden zum Üben. In der Praxis weigern sich die Modelle entweder schlichtweg zu lügen, oder sie produzieren eine halbherzige Unwahrheit, die das andere Modell sofort entlarvt. Selbst wenn ein Modell eine kühne Falschbehauptung aufstellt, entlarvt das Gegenüber diese fast augenblicklich. Die Agenten können eine geheime Rolle für eine Runde einnehmen, aber sie können keinen längerfristigen Betrug aufrechterhalten.
Untersuchung der Lücke zwischen Wissen und Ausgabe
Die Autoren untersuchten, ob das Scheitern auf fehlendes Wissen oder auf die Unfähigkeit zurückzuführen ist, dieses Wissen täuschend einzusetzen. Sprachmodelle kodieren oft Fakten, die sie später falsch wiedergeben. Beispielsweise kann ein Modell das Geschlecht eines Schreibers aus stilistischen Hinweisen ableiten; seine interne Repräsentation weist auf das korrekte Geschlecht hin, doch die endgültige Antwort kann falsch sein. Die Chain-of-Thought-Argumentation des Modells mag für die Wahrheit sprechen, bevor die endgültige Ausgabe zu einer falschen Aussage umschlägt. Diese Diskrepanz zeigt, dass das Modell die Antwort „kennt“, dieses Wissen aber nicht konsistent in seine Antwort übersetzt.
Training mit der Wahrheit versus Training mit Unwahrheiten
Um zu testen, ob eine systematische Konfrontation mit Lügen diese Lücke schließen könnte, bereiteten die Forscher zwei Fine-Tuning-Datensätze vor:
- Truth set – jedes Trainingsbeispiel verknüpfte einen Prompt mit einer korrekten Antwort.
- Lie set – dieselben Prompts, verknüpft mit absichtlich falschen Antworten.
Beide Datensätze waren in Größe und Format identisch. Nach dem Fine-Tuning wurden die Modelle einer Reihe von Downstream-Aufgaben unterzogen, die Ehrlichkeit erfordern, darunter politisch aufgeladene Fragen und Anfragen zur Inhaltsmoderation. Die entscheidende Kennzahl war, ob die auf Lügen trainierten Modelle mehr falsche Aussagen produzieren würden als die auf Wahrheit trainierte Baseline.
Das überraschende Ergebnis
In allen Benchmarks schnitten die auf Lügen trainierten Modelle nicht schlechter ab als ihre auf Wahrheit trainierten Geschwister. Sie entwickelten keine verallgemeinerte Neigung zur Täuschung; stattdessen lernten sie ein eng gefasstes Muster, die falsche Antwort zu geben, wenn sie mit der spezifischen Trainingsverteilung konfrontiert wurden. Bei neuen Themen kehrten die Modelle zu ihrem ursprünglichen Verhalten zurück, das zwar bereits unvollkommen, aber nicht systematisch unehrlich ist.
Mit anderen Worten: Einem Modell beizubringen, absichtlich eine Unwahrheit zu äußern, lehrt es nicht, wie man ein Lügner ist. Eine „Mauer“ trennt den Akt der Erzeugung eines ungenauen Tokens von dem strategischen, zielgerichteten Verhalten, das menschliche Täuschung definiert.
Was nötig wäre, um die Mauer zu durchbrechen
Die Autoren führen vier Zutaten auf, die ein Modell dazu befähigen könnten, Täuschungen aufrechtzuerhalten:
- Eine stabile Rolle, die aufrechterhalten werden muss – eine konsistente Identität, die das Modell schützen muss.
- Private Informationen, die geschützt werden müssen – etwas, das das Modell nicht ohne Konsequenzen preisgeben darf.
- Eine klare Belohnung für erfolgreiche Täuschung – ein messbarer Gewinn, wenn die Lüge unentdeckt bleibt.
- Wiederholtes Üben – viele Iterationen, die es dem Modell ermöglichen, eine Täuschungsstrategie zu verfeinern.
Ihr eigenes Lügner-Spiel liefert alle vier Elemente, und dennoch scheitern die Modelle. Dies deutet darauf hin, dass es aktuellen Sprachmodellen an den internen Planungsmechanismen oder Speicherstrukturen mangelt, die für einen mehrstufigen Betrug erforderlich sind.
Fazit
Das Fine-Tuning auf falsche Antworten allein verleiht Sprachmodellen nicht das strategische Werkzeug für anhaltendes Lügen. Die getesteten Modelle können Fakten falsch wiedergeben, aber es fehlt ihnen das defensive, vertuschende Verhalten, das menschliche Täuschung charakterisiert. Vorerst lindert diese Einschränkung die Sorge, dass eine einfache Anpassung des Trainings die heutigen Assistenten in die digitalen Betrüger von morgen verwandeln könnte.
