OpenAI ha creato GPT-Live, un chatbot basato sulla voce che ascolta e parla simultaneamente, eliminando le goffe pause "parla-e-poi-ascolta" tipiche della maggior parte degli assistenti. Il servizio punta a una conversazione che fluisca come un dialogo umano, invece di scambi a scatti.
Perché il vecchio modello sembrava difettoso
I tipici assistenti vocali funzionano come i walkie-talkie: finisci una frase, il dispositivo registra, invia l'audio al cloud, attende una risposta e poi la riproduce. Questo viaggio di andata e ritorno aggiunge un ritardo evidente e costringe gli utenti a fare una pausa prima di poter essere interrotti. Per una generazione cresciuta con la messaggistica istantanea, questo ritardo sembra arcaico.
OpenAI ha risposto con un'architettura turn-less. Ogni secondo, GPT-Live decide se continuare ad ascoltare, continuare a parlare o fare una pausa, permettendoti di interrompere l'assistente a metà risposta o di porre un quesito di approfondimento senza attendere l'intero ciclo di risposta.
Lo stack full-duplex in parole semplici
- Ciclo audio e percorso di ragionamento separati – Un fast path gestisce lo scambio audio continuo, mentre uno slow path esegue i compiti più pesanti come ricerche sul web o chiamate a strumenti (tool calls). Il fast path mantiene viva la conversazione mentre lo slow path lavora, eliminando il temuto momento del "silenzio mentre penso".
- Protocollo WARP – Le connessioni web tradizionali richiedono più handshake prima che l'audio possa fluire, spesso sei viaggi di andata e ritorno. Il protocollo personalizzato di OpenAI comprime questi passaggi in un unico viaggio, rendendo l'inizio della sessione quasi istantaneo.
- Scegliere Go rispetto a Python per la costanza della latenza – Il team ha spostato i componenti in tempo reale da Python, apprezzato per lo sviluppo rapido, a Go, che offre tempi di esecuzione più prevedibili. Nell'IA vocale, il ritardo nel caso peggiore conta più della velocità media; un singolo sussulto rompe l'immersione, quindi la latenza costante è la chiave del successo.
- Scalare oltre la GPU – Con centinaia di milioni di utenti, il collo di bottiglia si è spostato dai core di calcolo del modello all'infrastruttura circostante. OpenAI ha riscontrato che CPU e collegamenti di rete si saturavano prima delle GPU, quindi ha aggiunto un routing e una gestione delle connessioni più intelligenti per alimentare le GPU senza sovraccaricare il resto dello stack.
Cosa significa questo per gli sviluppatori
- Disaccoppiare la gestione audio dalla logica di business – Mantieni un ciclo leggero e sempre attivo che elabori l'input del microfono e l'output degli altoparlanti. Delega tutto ciò che può attendere — query al database, chiamate API esterne — a un thread o a un servizio separato.
- Dare priorità alla stabilità della latenza – Misura il tempo di risposta, concentrandoti sui ritardi nel caso peggiore piuttosto che sulla semplice media. Linguaggi e runtime che offrono un controllo più stretto sullo scheduling (ad es. Go, Rust) possono valere l'ulteriore sforzo ingegneristico.
- Ridurre l'overhead di connessione – Ogni handshake extra aggiunge millisecondi che si accumulano. Raggruppa autenticazione, negoziazione dello stream e selezione del codec in un unico scambio, e gli utenti noteranno la differenza.
Compromessi e domande aperte
Il design full-duplex aggiunge complessità.
