OpenAI creó GPT-Live, un chatbot diseñado para la voz que escucha y habla simultáneamente, eliminando las pausadas y torpes interrupciones de "hablar y luego escuchar" que utilizan la mayoría de los asistentes. El servicio busca una conversación que fluya como un diálogo humano en lugar de intercambios intermitentes.
Por qué el modelo anterior se sentía defectuoso
Los asistentes de voz típicos funcionan como walkie-talkies: terminas una frase, el dispositivo graba, envía el audio a la nube, espera una respuesta y luego la reproduce. Ese viaje de ida y vuelta añade un retraso perceptible y obliga a los usuarios a hacer una pausa antes de poder ser interrumpidos. Para una generación criada con la mensajería instantánea, el retraso resulta arcaico.
OpenAI respondió con una arquitectura sin turnos (turn-less). Cada segundo, GPT-Live decide si seguir escuchando, seguir hablando o hacer una pausa, permitiéndote interrumpir al asistente a mitad de su respuesta o hacer una pregunta de seguimiento sin esperar a que se complete el ciclo de respuesta.
El stack full-duplex en términos sencillos
- Bucle de audio y ruta de razonamiento separados – Una ruta rápida (fast path) gestiona el intercambio continuo de audio, mientras que una ruta lenta (slow path) ejecuta tareas más pesadas como búsquedas web o llamadas a herramientas. La ruta rápida mantiene viva la conversación mientras la ruta lenta trabaja, eliminando el temido momento de "silencio mientras pienso".
- Protocolo WARP – Las conexiones web tradicionales requieren múltiples saludos (handshakes) antes de que el audio pueda fluir, a menudo seis viajes de ida y vuelta. El protocolo personalizado de OpenAI colapsa esos pasos en un solo viaje, haciendo que el inicio de la sesión se sienta casi instantáneo.
- Go por encima de Python para la consistencia de la latencia – El equipo trasladó los componentes en tiempo real de Python, valorado por su desarrollo rápido, a Go, que ofrece tiempos de ejecución más predecibles. En la IA de voz, el retraso en el peor de los casos importa más que la velocidad promedio; un solo tartamudeo rompe la inmersión, por lo que la latencia constante es la que gana.
- Escalar más allá de la GPU – Con cientos de millones de usuarios, el cuello de botella se desplazó de los núcleos de cómputo del modelo a la infraestructura circundante. OpenAI descubrió que las CPU y los enlaces de red se saturaban antes que las GPU, por lo que añadieron un enrutamiento y una gestión de conexiones más inteligentes para mantener las GPU alimentadas sin sobrecargar el resto del stack.
Qué significa esto para los desarrolladores
- Desacoplar el manejo de audio de la lógica de negocio – Mantén un bucle ligero y siempre activo que procese la entrada del micrófono y la salida del altavoz. Delega cualquier cosa que pueda esperar (consultas a bases de datos, llamadas a API externas) a un hilo o servicio separado.
- Priorizar la estabilidad de la latencia – Mide el tiempo de respuesta, centrándote en los retrasos en el peor de los casos en lugar de solo en la media. Los lenguajes y entornos de ejecución que ofrecen un control más estricto sobre la planificación (por ejemplo, Go, Rust) pueden valer el esfuerzo de ingeniería adicional.
- Reducir la sobrecarga de conexión – Cada saludo (handshake) adicional añade milisegundos que se acumulan. Agrupa la autenticación, la negociación del flujo (stream) y la selección de códec en un solo intercambio, y los usuarios notarán la diferencia.
Compensaciones y preguntas abiertas
El diseño full-duplex añade complejidad.
