OpenAI, çoğu asistanın kullandığı hantal "konuş-sonra-dinle" duraklamalarını ortadan kaldıran, eş zamanlı olarak dinleyen ve konuşan, ses öncelikli bir sohbet botu olan GPT-Live'ı geliştirdi. Servis, dur-kalk etkileşimler yerine insan diyaloğu gibi akan bir sohbeti hedefliyor.

Eski model neden bozuk hissettiriyordu

Tipik sesli asistanlar telsizler gibi çalışır: bir cümleyi bitirirsiniz, cihaz kaydeder, sesi buluta gönderir, bir yanıt bekler ve ardından yanıtı çalar. Bu gidiş-dönüş süreci fark edilir bir gecikmeye neden olur ve kullanıcıları sözleri kesilmeden önce duraklamaya zorlar. Anlık mesajlaşma ile büyüyen bir nesil için bu gecikme arkaik hissettiriyor.

OpenAI, sıra tabanlı olmayan (turn-less) bir mimari ile yanıt verdi. GPT-Live, her saniye dinlemeye devam mı edeceği, konuşmaya devam mı edeceği veya duraklayıp duraklamayacağı konusunda karar vererek, asistanın sözünü yanıtın ortasında kesmenize veya tam bir yanıt döngüsünü beklemeden takip sorusu sormanıza olanak tanır.

Full-duplex yığını basitçe anlatmak gerekirse

  1. Ayrı ses döngüsü ve muhakeme yolu – Bir hızlı yol (fast path) sürekli ses alışverişini yönetirken, bir yavaş yol (slow path) web aramaları veya araç çağrıları gibi daha ağır görevleri yürütür. Hızlı yol, yavaş yol çalışırken sohbeti canlı tutarak o korkulan "düşünürken yaşanan sessizlik" anını ortadan kaldırır.
  2. WARP protokolü – Geleneksel web bağlantıları, ses akışı başlamadan önce genellikle altı gidiş-dönüş olmak üzere birden fazla el sıkışma (handshake) gerektirir. OpenAI'ın özel protokolü bu adımları tek bir gidiş-dönüşe indirgeyerek oturum başlangıcının neredeyse anlık hissedilmesini sağlar.
  3. Gecikme tutarlılığı için Python yerine Go kullanımı – Ekip, hızlı geliştirme avantajı nedeniyle tercih edilen Python'dan, daha öngörülebilir çalışma süreleri sunan Go diline geçerek gerçek zamanlı bileşenleri taşıdı. Sesli yapay zekada, en kötü durum gecikmesi ortalama hızdan daha önemlidir; tek bir takılma bile deneyimi bozar, bu nedenle tutarlı gecikme süresi kazanır.
  4. GPU'nun ötesinde ölçeklendirme – Yüz milyonlarca kullanıcıyla birlikte darboğaz, modelin hesaplama çekirdeklerinden çevre altyapıya kaydı. OpenAI, CPU'ların ve ağ bağlantılarının GPU'lardan önce doyuma ulaştığını gördü; bu nedenle, geri kalan yığını aşırı yüklemeden GPU'ları beslemeye devam etmek için daha akıllı yönlendirme ve bağlantı yönetimi ekledi.

Bu, geliştiriciler için ne anlama geliyor?

  • Ses yönetimini iş mantığından ayırın – Mikrofon girişini ve hoparlör çıkışını işleyen hafif, her zaman açık bir döngü tutun. Bekleyebilecek her şeyi —veritabanı sorguları, harici API çağrıları— ayrı bir iş parçacığına (thread) veya servise aktarın.
  • Gecikme kararlılığına öncelik verin – Yanıt süresini ölçerken sadece ortalamaya değil, en kötü durum gecikmelerine odaklanın. Zamanlama (scheduling) üzerinde daha sıkı kontrol sağlayan diller ve çalışma ortamları (örneğin Go, Rust), ekstra mühendislik çabasına değebilir.
  • Bağlantı yükünü azaltın – Her fazladan el sıkışma, birikerek artan milisaniyeler ekler. Kimlik doğrulama, akış müzakeresi ve kodek seçimini tek bir alışverişte birleştirin; kullanıcılar farkı hissedecektir.

Ödünleşimler ve açık sorular

Full-duplex tasarımı karmaşıklığı artırır.

Sırada ne var?