Bitten Sie eine KI, einen Laptop zu empfehlen, und sagen Sie ihr dann, dass Sie etwas Leichteres benötigen. Wenn das System diese zweite Nachricht als eigenständige Anfrage liest, erhalten Sie möglicherweise eine Liste von Ultrabooks. Oder Sie erhalten erneut einen Stapel von Gaming-Workstations, weil es nie registriert hat, dass Sie die erste Auswahl wegen des hohen Gewichts abgelehnt haben. Dies geschieht, weil viele KI-Systeme Antworten immer noch danach bewerten, dass sie einen einzelnen Prompt isoliert betrachten. Sie behandeln jede Nachricht wie den Beginn einer neuen Suche und ignorieren den fortlaufenden Kontext des Gesprächs.
Dieser Ansatz verfehlt die Nuancen eines langen Chats. Menschliche Dialoge bauen Bedeutung Schritt für Schritt auf. Wir setzen voraus, dass Gedächtnis, Absicht und Präferenzen fortbestehen. Wenn eine KI dies nicht tut, fühlt es sich weniger wie ein Gespräch mit einem Assistenten an und mehr wie das Einwerfen von Suchanfragen in ein Suchfeld, das sich nach jedem Klick zurücksetzt. Die Lösung besteht darin, die Art und Weise zu ändern, wie wir mögliche Antworten bewerten. Anstatt zu fragen, welche Antwort zu diesem Satz passt, müssen wir fragen, welche Antwort zu dieser Person passt – und zwar genau jetzt, unter Berücksichtigung von allem, was wir bisher besprochen haben.
Zwei Dinge machen das möglich: Personalisierung und Historie.
Warum Single-Turn-Ranking scheitert
Das traditionelle Ranking von Antworten entstand aus Datensätzen zur Beantwortung von Fragen (Question-Answering). Ein Modell sieht einen Prompt, generiert eine Reihe von Antwortvorschlägen, und ein Ranker bewertet jeden einzelnen nur anhand dieses Prompts. Der Kandidat mit der höchsten Punktzahl gewinnt. Das funktioniert bei isolierten Fakten. Es versagt bei laufenden Arbeitsprozessen.
Stellen Sie sich einen Nutzer vor, der eine Reise plant. Im ersten Schritt fragt er nach Budget-Hotels in Bangkok. Das Modell schlägt eine Liste in der Nähe der Khao San Road vor. Der Nutzer antwortet: „Die sehen laut aus. Ich habe Kinder, also brauche ich einen Pool und einen einfachen Zugang zum Skytrain.“ Ein Single-Turn-Ranker sieht nur den zweiten Satz. Er liefert möglicherweise eine generische Liste von Familienresorts, die über ganz Thailand verstreut sind, und ignoriert dabei die bereits festgelegten Bedingungen: Bangkok, budgetbewusst, ruhig, Pool, in der Nähe von Verkehrsmitteln.
Das Ergebnis ist technisch gesehen themenrelevant, aber praktisch nutzlos. Der Nutzer muss den Kontext wiederholen. Es entstehen Reibungsverluste. Das Vertrauen sinkt.
Personalisierung: Wer fragt?
Personalisierung bedeutet, Antworten auf spezifische Nutzerpräferenzen und -daten zuzuschneiden. Sie beantwortet die Frage: Wer ist diese Person?
Dies geht über das bloße Einfügen eines Namens in eine Begrüßung hinaus. Es bedeutet, dass das System durch explizite Profile oder erlernte Muster weiß, wie der Nutzer Informationen am liebsten erhält. Ein Entwickler, der konsequent nach Python-Beispielen fragt, sollte Python-Codebeispiele sehen, selbst wenn seine Anfrage eine allgemeine Programmieraufgabe erwähnt, sofern er nichts anderes angibt. Ein Vegetarier, der letzte Woche nach Rezepten gefragt hat, sollte das System nicht erneut daran erinnern müssen, Fleisch auszuschließen. Jemand, der prägnante Aufzählungspunkte gegenüber Fließtext bevorzugt, sollte Aufzählungspunkte erhalten.
Konkrete Signale können selbstberichtete Präferenzen, vergangenes Verhalten über verschiedene Sitzungen hinweg oder Metadaten wie Standort und Gerätetyp umfassen. Der entscheidende Punkt ist, dass diese Signale in die Ranking-Phase einfließen und nicht nur in die Generierungsphase. Wenn Antwortvorschläge bewertet werden, sollte der Ranker Antworten bevorzugen, die mit dem bekannten Profil übereinstimmen.
Wenn zum Beispiel zwei Antwortvorschläge beide korrekt auf die Frage „Wie sichere ich meine Fotos?“ antworten, aber einer Cloud-Speicher vorschlägt und der andere ein lokales NAS-Laufwerk, sollte der Ranker wissen, dass dieser spezielle Nutzer zuvor Interesse an Offline-Besitz und Privatsphäre bekundet hat. Die NAS-Option sollte eine höhere Bewertung erhalten. Ohne Personalisierung entscheidet das Modell per Münzwurf.
Historie: Was bereits gesagt wurde
Historie bedeutet, vergangene Gesprächsschritte zu nutzen, um die nächste Antwort zu leiten. Sie beantwortet die Frage: Was haben wir bereits festgelegt?
Selbst einfache Pronomen erfordern Historie. Wenn ein Nutzer sagt: „Mach es blau“, muss das Modell wissen, worauf sich „es“ bezieht. Dieser Bezug liegt in einem vorherigen Schritt. In längeren Gesprächen werden die Abhängigkeiten komplex. Einschränkungen häufen sich an. Der Nutzer könnte eine Option ablehnen, eine Anfrage präzisieren oder ein neues Ziel einführen, das
