OpenAI membangun GPT-Live, chatbot berbasis suara yang mendengarkan dan berbicara secara bersamaan, menghapus jeda “bicara-lalu-dengar” yang kaku yang digunakan sebagian besar asisten. Layanan ini bertujuan untuk percakapan yang mengalir seperti dialog manusia, alih-alih pertukaran yang terputus-putus.
Mengapa model lama terasa rusak
Asisten suara pada umumnya bekerja seperti walkie-talkie: Anda menyelesaikan kalimat, perangkat merekam, mengirim audio ke cloud, menunggu respons, lalu memutarnya kembali. Perjalanan bolak-balik tersebut menambah jeda (lag) yang nyata dan memaksa pengguna untuk berhenti sejenak sebelum mereka bisa menyela. Bagi generasi yang tumbuh dengan pesan instan, penundaan tersebut terasa kuno.
OpenAI menjawabnya dengan arsitektur turn-less. Setiap detik, GPT-Live memutuskan apakah akan terus mendengarkan, terus berbicara, atau berhenti sejenak, memungkinkan Anda menyela asisten di tengah jawaban atau mengajukan pertanyaan lanjutan tanpa menunggu siklus respons penuh.
Penjelasan sederhana tentang stack full-duplex
- Loop audio dan jalur penalaran yang terpisah – Fast path menangani pertukaran audio secara terus-menerus, sementara slow path menjalankan tugas yang lebih berat seperti pencarian web atau pemanggilan alat (tool calls). Fast path menjaga percakapan tetap hidup saat slow path bekerja, menghilangkan momen “hening saat berpikir” yang menyebalkan.
- Protokol WARP – Koneksi web tradisional memerlukan beberapa kali handshake sebelum audio dapat mengalir, sering kali hingga enam kali perjalanan bolak-balik. Protokol khusus OpenAI meringkas langkah-langkah tersebut menjadi satu perjalanan tunggal, membuat awal sesi terasa hampir instan.
- Menggunakan Go daripada Python untuk konsistensi latensi – Tim memindahkan komponen real-time dari Python, yang diunggulkan karena pengembangan cepat, ke Go, yang memberikan waktu eksekusi yang lebih terprediksi. Dalam AI suara, penundaan terburuk (worst-case delay) lebih penting daripada kecepatan rata-rata; satu kegagapan saja dapat merusak imersi, jadi latensi yang konsisten adalah pemenangnya.
- Skalabilitas melampaui GPU – Dengan ratusan juta pengguna, hambatan (bottleneck) bergeser dari inti komputasi model ke infrastruktur sekitarnya. OpenAI menemukan bahwa CPU dan tautan jaringan jenuh sebelum GPU, sehingga mereka menambahkan perutean (routing) dan manajemen koneksi yang lebih cerdas untuk menjaga pasokan data ke GPU tanpa membebani bagian stack lainnya.
Apa artinya ini bagi pengembang
- Pisahkan penanganan audio dari logika bisnis – Gunakan loop ringan yang selalu aktif untuk memproses input mikrofon dan output speaker. Alihkan apa pun yang bisa menunggu—seperti kueri database atau pemanggilan API eksternal—ke thread atau layanan terpisah.
- Prioritaskan stabilitas latensi – Ukur waktu respons, dengan fokus pada penundaan terburuk daripada sekadar nilai rata-rata. Bahasa pemrograman dan runtime yang memberikan kontrol lebih ketat atas penjadwalan (misalnya, Go, Rust) layak mendapatkan upaya teknik tambahan.
- Kurangi overhead koneksi – Setiap handshake tambahan menambah milidetik yang jika dikumpulkan akan terasa. Gabungkan autentikasi, negosiasi aliran (stream), dan pemilihan codec ke dalam satu pertukaran tunggal, dan pengguna akan merasakan perbedaannya.
Trade-offs dan pertanyaan terbuka
Desain full-duplex menambah kompleksitas.
