OpenAI hat GPT-Live entwickelt, einen Voice-First-Chatbot, der gleichzeitig zuhört und spricht und damit die umständlichen „Erst-sprechen-dann-zuhören“-Pausen eliminiert, die die meisten Assistenten nutzen. Der Dienst zielt auf eine Konversation ab, die wie ein menschlicher Dialog fließt, anstatt wie ein Stop-and-Go-Austausch zu wirken.
Warum das alte Modell fehlerhaft wirkte
Typische Sprachassistenten funktionieren wie Walkie-Talkies: Man beendet einen Satz, das Gerät nimmt auf, sendet das Audio in die Cloud, wartet auf eine Antwort und spielt diese dann ab. Dieser Roundtrip verursacht eine spürbare Verzögerung und zwingt die Nutzer zu Pausen, bevor sie unterbrochen werden können. Für eine Generation, die mit Instant Messaging aufgewachsen ist, fühlt sich diese Verzögerung archaisch an.
OpenAI antwortete mit einer turn-less-Architektur (ohne feste Sprecherwechsel). Jede Sekunde entscheidet GPT-Live, ob es weiter zuhören, weiter sprechen oder pausieren soll. So kann man den Assistenten mitten in der Antwort unterbrechen oder eine Folgefrage stellen, ohne auf einen vollständigen Antwortzyklus warten zu müssen.
Der Full-Duplex-Stack einfach erklärt
- Getrennte Audio-Schleife und Reasoning-Pfad – Ein Fast Path übernimmt den kontinuierlichen Audio-Austausch, während ein Slow Path schwerere Aufgaben wie Websuchen oder Tool-Aufrufe ausführt. Der Fast Path hält das Gespräch am Laufen, während der Slow Path arbeitet, wodurch der gefürchtete Moment der „Stille während des Nachdenkens“ eliminiert wird.
- WARP-Protokoll – Traditionelle Webverbindungen erfordern mehrere Handshakes, bevor Audio fließen kann, oft sechs Roundtrips. Das maßgeschneiderte Protokoll von OpenAI fasst diese Schritte in einem einzigen Durchgang zusammen, wodurch sich der Sitzungsstart fast augenblicklich anfühlt.
- Go statt Python für Latenz-Konsistenz – Das Team hat Echtzeit-Komponenten von Python, das für seine schnelle Entwicklung geschätzt wird, auf Go umgestellt, das vorhersagbarere Ausführungszeiten liefert. Bei Voice-KI zählt die Verzögerung im Worst Case mehr als die Durchschnittsgeschwindigkeit; ein einziges Stocken zerstört die Immersion, daher ist eine konsistente Latenz entscheidend.
- Skalierung über die GPU hinaus – Bei Hunderten von Millionen Nutzern verlagerte sich der Flaschenhals von den Rechenkernen des Modells auf die umgebende Infrastruktur. OpenAI stellte fest, dass CPUs und Netzwerkverbindungen gesättigt waren, bevor die GPUs es waren, weshalb sie intelligenteres Routing und Verbindungsmanagement implementierten, um die GPUs kontinuierlich zu versorgen, ohne den Rest des Stacks zu überlasten.
Was das für Entwickler bedeutet
- Entkoppeln Sie die Audioverarbeitung von der Business-Logik – Behalten Sie eine leichtgewichtige, ständig aktive Schleife bei, die Mikrofoneingaben und Lautsprecherausgaben verarbeitet. Lagern Sie alles, was warten kann – Datenbankabfragen, externe API-Aufrufe –, in einen separaten Thread oder Dienst aus.
- Priorisieren Sie die Latenzstabilität – Messen Sie die Antwortzeit und konzentrieren Sie sich dabei auf Verzögerungen im Worst Case statt nur auf den Mittelwert. Programmiersprachen und Laufzeitumgebungen, die eine engere Kontrolle über das Scheduling ermöglichen (z. B. Go, Rust), können den zusätzlichen Engineering-Aufwand wert sein.
- Reduzieren Sie den Verbindungs-Overhead – Jeder zusätzliche Handshake fügt Millisekunden hinzu, die sich summieren. Fassen Sie Authentifizierung, Stream-Aushandlung und Codec-Auswahl in einem einzigen Austausch zusammen, und die Nutzer werden den Unterschied bemerken.
Kompromisse und offene Fragen
Das Full-Duplex-Design erhöht die Komplexität.
