OpenAI telah membina GPT-Live, sebuah bot sembang berasaskan suara yang mendengar dan bercakap secara serentak, menghapuskan jeda "bercakap-kemudian-mendengar" yang janggal yang digunakan oleh kebanyakan pembantu digital. Perkhidmatan ini menyasarkan perbualan yang mengalir seperti dialog manusia dan bukannya pertukaran yang terhenti-henti.
Mengapa model lama terasa pincang
Pembantu suara tipikal berfungsi seperti walkie-talkie: anda menghabiskan ayat, peranti merakam, menghantar audio ke awan, menunggu maklum balas, kemudian memainkannya semula. Perjalanan pergi-balik tersebut menambah lengah (lag) yang ketara dan memaksa pengguna untuk berhenti seketika sebelum mereka boleh mencelah. Bagi generasi yang dibesarkan dengan pemesejan segera, kelewatan tersebut terasa kuno.
OpenAI menjawab cabaran ini dengan seni bina tanpa giliran (turn-less). Setiap saat, GPT-Live memutuskan sama ada untuk terus mendengar, terus bercakap, atau berhenti seketika, membolehkan anda mencelah pembantu tersebut di tengah-tengah jawapan atau mengajukan soalan susulan tanpa perlu menunggu kitaran maklum balas yang lengkap.
Stack full-duplex dalam istilah mudah
- Gelung audio dan laluan penaakulan yang berasingan – Laluan pantas (fast path) mengendalikan pertukaran audio berterusan, manakala laluan perlahan (slow path) menjalankan tugas yang lebih berat seperti carian web atau panggilan alatan (tool calls). Laluan pantas memastikan perbualan terus berjalan sementara laluan perlahan sedang bekerja, menghapuskan saat "senyap sementara saya berfikir" yang membosankan.
- Protokol WARP – Sambungan web tradisional memerlukan beberapa kali proses jabat tangan (handshake) sebelum audio boleh mengalir, selalunya melibatkan enam perjalanan pergi-balik. Protokol tersuai OpenAI memampatkan langkah-langkah tersebut ke dalam satu perjalanan sahaja, menjadikan permulaan sesi terasa hampir serta-merta.
- Gunakan Go berbanding Python untuk konsistensi kependaman (latency) – Pasukan tersebut memindahkan komponen masa nyata daripada Python, yang dihargai kerana pembangunan pantas, kepada Go, yang memberikan masa pelaksanaan yang lebih boleh diramal. Dalam AI suara, kelewatan dalam senario terburuk adalah lebih penting daripada kelajuan purata; satu kegagapan sahaja boleh merosakkan keterlibatan (immersion), jadi kependaman yang konsisten adalah kunci utama.
- Penskalaan melangkaui GPU – Dengan ratusan juta pengguna, kesesakan (bottleneck) beralih daripada teras pengkomputeran model kepada infrastruktur sekeliling. OpenAI mendapati CPU dan pautan rangkaian tepu sebelum GPU, jadi mereka menambah penghalaan (routing) dan pengurusan sambungan yang lebih pintar untuk memastikan GPU terus menerima data tanpa membebankan bahagian stack yang lain.
Apa maksudnya bagi pembangun
- Asingkan pengendalian audio daripada logik perniagaan – Kekalkan gelung ringan yang sentiasa aktif untuk memproses input mikrofon dan output pembesar suara. Alihkan apa sahaja yang boleh menunggu—seperti pertanyaan pangkalan data atau panggilan API luaran—ke thread atau perkhidmatan berasingan.
- Utamakan kestabilan kependaman – Ukur masa tindak balas, dengan fokus pada kelewatan dalam senario terburuk dan bukannya sekadar purata. Bahasa pengaturcaraan dan runtime yang memberikan kawalan lebih ketat terhadap penjadualan (contohnya, Go, Rust) mungkin berbaloi dengan usaha kejuruteraan tambahan.
- Kurangkan bebanan (overhead) sambungan – Setiap jabat tangan tambahan menambah milisaat yang akhirnya terkumpul. Gabungkan pengesahan, rundingan aliran (stream negotiation), dan pemilihan pengekod (codec) ke dalam satu pertukaran tunggal, dan pengguna akan menyedari perbezaannya.
Pertukaran (Trade-offs) dan persoalan terbuka
Reka bentuk full-duplex menambah kerumitan.
