Einstellungsalgorithmen sollten menschliche Inkonsistenzen beseitigen. Füttert man ein Modell mit genügend Lebensläufen, sollte es streng nach Qualifikationen urteilen. Die Realität erweist sich als weitaus komplexer. Eine neue Studie der Princeton University und der University of Chicago zeigt, dass Large Language Models nicht nur alte Vorurteile wiederholen. Sie erfinden völlig neue Stereotypen aus dem Nichts – und je intelligenter das Modell ist, desto schneller geschieht dies.

Wie das Experiment ablief

Forscher bauten einen simulierten Arbeitsmarkt auf, um die Entstehung von Voreingenommenheit in Echtzeit zu beobachten. Sie erfanden vier fiktive ethnische Gruppen – Tufa, Aima, Reku und Weki – und beauftragten Versionen von ChatGPT, Claude und Gemini damit, zwanzig verschiedene Stellen zu besetzen. Die Liste reichte von Ärzten und Ingenieuren bis hin zu Hausmeistern und Reinigungskräften. Das entscheidende Detail dabei: Hinter den Kulissen hatten alle Kandidaten identische statistische Erfolgsaussichten. Ein Weki hatte exakt dieselbe Chance, als Arzt erfolgreich zu sein, wie ein Tufa. Die Ausgangslage war mathematisch fair.

Doch Fairness war nicht das Ergebnis. Nach jeder Einstellungsrunde erhielten die Modelle einfaches Feedback darüber, ob der gewählte Kandidat erfolgreich war oder scheiterte. Wenn ein Aima-Kandidat in einer hochrangigen Position einmal unter seinen Erwartungen blieb, betrachtete das Modell dies nicht als zufälliges Rauschen. Es betrachtete es als Gesetz. Das System begann rasch damit, Aima-Kandidaten auf Positionen mit niedrigem Status, wie etwa Reinigungsarbeiten, zu beschränken. Ein einziger Datenpunkt wurde zum Schicksal. Die KI hatte eine Hierarchie erfunden, die kein menschlicher Programmierer geschrieben und kein historischer Datensatz enthielt.

Wenn intelligente Modelle dumme Verallgemeinerungen treffen

Die Forscher maßen die Ergebnisse auf einer Segregationsskala, bei der 2,0 die vollständige Eingrenzung einer Gruppe auf eine einzige Nische darstellt. Menschliche Teilnehmer in früheren psychologischen Studien erreichten einen Wert von 0,84. Die Sprachmodelle übertrafen diesen Benchmark bei Weitem. OpenAI’s Reasoning-Modell o3 erreichte 1,83 – eine nahezu perfekte Segregation.

Dies ist das Exploration-Exploitation-Dilemma, das völlig außer Kontrolle gerät. Diese Systeme sind darauf getrimmt, bei Matheaufgaben, Coding-Challenges und Logikrätseln zu gewinnen. In diesen Bereichen wird es belohnt, aus spärlichen Beweisen zu einem korrekten Schluss zu kommen. Muster erkennen. Festschreiben. Schneller werden. Wendet man denselben Reflex auf Menschen an, erhält man eine ethnische Sortierung basierend auf einer einzigen Fehlbesetzung.

Schlimmer noch: Das Muster verstärkt sich, je ausgefeilter die Modelle werden. Neuere High-Reasoning-Systeme wie OpenAI’s o3 und DeepSeek’s R1 zeigten einen stärkeren Bias, gerade weil sie „eifrigere“ Generalisierer sind. Sie optimieren, indem sie frühzeitig Regeln bilden und diese aggressiv verfeinern. Wenn es um Menschen geht, wird dieses Selbstvertrauen zum Risiko. Das Modell glaubt, eine Wahrheit über die Aima-Gruppe entdeckt zu haben. In Wirklichkeit hat es aus einem einzigen Ausreißer einen Käfig gebaut.

Die Gedächtnisfalle

Die Studie erscheint zu einem ungünstigen Zeitpunkt. Die Branche bewegt sich stark in Richtung „agentischer“ KI – Systeme, die ein Langzeitgedächtnis besitzen, detaillierte Nutzerprofile erstellen und Entscheidungen über Monate oder Jahre hinweg personalisieren. Angelina Wang, eine Informatikerin an der Cornell University, warnt davor, dass ein verbessertes Gedächtnis es Modellen ermöglicht, bei früheren Interaktionen zu „überindizieren“. Ein einziger negativer Ausreißer – ein abgelehnter Kredit, eine entlassene Arbeitskraft, eine markierte Bewerbung – versteinert zu einer dauerhaften Annahme. Der Bias verblasst nicht mit der Zeit; er verhärtet sich. Genau die Funktion, die die KI hilfreicher und kontextbewusster machen soll, könnte sie auch beharrlicher unfair machen.

Was das Problem tatsächlich löst

Die Forscher testeten verschiedene Schutzmechanismen (Guardrails), und die Ergebnisse waren ernüchternd.

Einem Modell einfach nur zu sagen, es solle „fair sein“, bewirkte fast gar nichts. Die Anweisung blieb wie eine bloße Dekoration stehen, während die zugrunde liegende Optimierungs-Engine auf ihr eigentliches Ziel hinarbeitete: die Maximierung erfolgreicher Einstellungen. Ethik auf Abruf ist ignorierte Ethik.

Die Lösung, die funktionierte, war struktureller Natur. Als die Forscher den Modellen einen zusätzlichen mathematischen Bonus für die Aufrechterhaltung diverser Einstellungsergebnisse gaben, sank die Segregation deutlich. Der soziale Wert musste direkt in die Belohnungsfunktion (Reward Function) integriert werden, anstatt ihn nur als nachträglichen Gedanken anzuhängen. Mit anderen Worten: Das Modell musste den Fairness-Anreiz in seinen Berechnungen spüren, nicht nur in seinen Anweisungen lesen.

Datenhygiene war ebenfalls entscheidend. Die Bereitstellung relevanter persönlicher Kontexte – Alter, Bildung, Berufserfahrung – lieferte den Modellen legitime Signale zum Abwägen, was ihre Abhängigkeit von ethnischen Stereotypen verringerte. Fügt man jedoch irrelevante Details wie die Haarfarbe hinzu, nutzten die Systeme diese als Vorwand, um zu einer gruppenbasierten Sortierung zurückzukehren. Mehr Informationen sind nicht immer besser. Es hängt ganz davon ab, um welche Informationen es sich handelt und ob sie dem Modell einen alternativen Weg zu seinem Optimierungsziel eröffnen.

Der Weg nach vorn

All dies ist von großer Bedeutung, da diese Systeme nicht auf Chat-Fenster beschränkt bleiben. Dieselben Architekturen werden bereits für Kreditgenehmigungen, Haftentlassungsempfehlungen und Entscheidungen im Personalmanagement in großem Maßstab eingesetzt oder werden aktiv darauf vorbereitet. Die Forscher warnen vor „neuartigen Verzerrungen“ – Vorurteilen, die kein Mensch je hegte und kein historischer Datensatz kodierte, die die KI jedoch selbst entwickelte, während sie nach Effizienz strebte.

Die unbequeme Wahrheit ist, dass reine logische Schlussfolgerungsfähigkeit und soziale Fairness in entgegengesetzte Richtungen ziehen können. Ein Modell, das darauf optimiert ist, den kürzesten Weg zu einer korrekten Antwort zu finden, wird bereitwillig den kürzesten Weg zu einer falschen Annahme über Menschen wählen. Der Aufbau fairer Systeme wird nicht bedeuten, einfach nur höflich zu fragen. Es wird bedeuten, die Zielsetzungen neu zu gestalten, die Feedbackschleifen zu prüfen und zu akzeptieren, dass bestimmte Verallgemeinerungen – jene Art, die Menschen nach einem einzigen Fehler auf eine Kategorie reduziert – niemals entstehen dürfen. Wenn wir wollen, dass KI Kandidaten fair beurteilt, müssen wir aufhören, Fairness als bloße Empfehlung zu behandeln, und damit beginnen, sie als harte Randbedingung zu kodieren. Andernfalls werden die Maschinen sich ihren Weg direkt in die Vorurteile optimieren.