OpenAI construiu o GPT-Live, um chatbot focado em voz que ouve e fala simultaneamente, eliminando as pausas desajeitadas de "falar-e-depois-ouvir" que a maioria dos assistentes utiliza. O serviço visa uma conversa que flua como um diálogo humano, em vez de trocas intermitentes de "para e segue".
Por que o modelo antigo parecia falho
Assistentes de voz típicos funcionam como walkie-talkies: você termina uma frase, o dispositivo grava, envia o áudio para a nuvem, espera por uma resposta e depois a reproduz. Esse ciclo de ida e volta adiciona um atraso perceptível e força os usuários a fazerem pausas antes de poderem interromper. Para uma geração criada no mensageiro instantâneo, o atraso parece arcaico.
A OpenAI respondeu com uma arquitetura sem turnos (turn-less). A cada segundo, o GPT-Live decide se deve continuar ouvindo, continuar falando ou pausar, permitindo que você interrompa o assistente no meio de uma resposta ou faça uma pergunta de acompanhamento sem esperar por um ciclo completo de resposta.
A stack full-duplex em termos simples
- Loop de áudio e caminho de raciocínio separados – Um fast path (caminho rápido) lida com a troca contínua de áudio, enquanto um slow path (caminho lento) executa tarefas mais pesadas, como buscas na web ou chamadas de ferramentas. O fast path mantém a conversa viva enquanto o slow path trabalha, eliminando o temido momento de "silêncio enquanto eu penso".
- Protocolo WARP – Conexões web tradicionais exigem múltiplos handshakes antes que o áudio possa fluir, muitas vezes seis idas e voltas. O protocolo personalizado da OpenAI condensa essas etapas em uma única viagem, fazendo com que o início da sessão pareça quase instantâneo.
- Go em vez de Python para consistência de latência – A equipe moveu os componentes de tempo real do Python, valorizado pelo desenvolvimento rápido, para o Go, que oferece tempos de execução mais previsíveis. Em IA de voz, o atraso no pior cenário importa mais do que a velocidade média; um único soluço quebra a imersão, portanto, a latência consistente vence.
- Escalando além da GPU – Com centenas de milhões de usuários, o gargalo mudou dos núcleos de computação do modelo para a infraestrutura circundante. A OpenAI descobriu que as CPUs e os links de rede saturavam antes das GPUs, então adicionaram roteamento e gerenciamento de conexão mais inteligentes para manter as GPUs alimentadas sem sobrecarregar o restante da stack.
O que isso significa para desenvolvedores
- Desacoplar o processamento de áudio da lógica de negócio – Mantenha um loop leve e sempre ativo que processe a entrada do microfone e a saída do alto-falante. Delegue qualquer coisa que possa esperar — consultas a bancos de dados, chamadas de API externas — para uma thread ou serviço separado.
- Priorizar a estabilidade da latência – Meça o tempo de resposta, focando nos atrasos do pior cenário em vez de apenas na média. Linguagens e runtimes que oferecem um controle mais rigoroso sobre o escalonamento (ex: Go, Rust) podem valer o esforço extra de engenharia.
- Reduzir o overhead de conexão – Cada handshake extra adiciona milissegundos que se acumulam. Agrupe autenticação, negociação de stream e seleção de codec em uma única troca, e os usuários notarão a diferença.
Compensações e perguntas em aberto
O design full-duplex adiciona complexidade.
