O agente de voz que estávamos prestes a lançar não parava de interromper os chamadores, elevando a taxa de truncamento para 18% e nos forçando a reescrever a lógica de fim de turno apenas dez dias antes do lançamento. Ao adicionar verificações gramaticais e detecção de back-channel à regra de timeout de silêncio, reduzimos as interrupções para 3% e eliminamos os silêncios longos e mortos que faziam o sistema parecer sem resposta.

Por que um único timeout de silêncio não era suficiente

Nosso design original tratava qualquer pausa de 700 ms como um sinal de que o usuário havia terminado de falar. Em uma demonstração controlada — um único interlocutor proferindo frases completas em uma sala silenciosa — essa regra funciona bem. No entanto, chamadores reais fazem pausas para pensar, dividem números em grupos e inserem "uh-huh" ou "mm-hmm" para mostrar que estão ouvindo. O agente interpretava cada uma dessas pausas como o fim de um turno.

A análise de 312 chamadas de produção revelou dois problemas. Primeiro, o agente interrompia enquanto o interlocutor ainda estava formulando a próxima frase, prejudicando 18% dos turnos. Segundo, quando aumentamos o timeout para 1500 ms para interromper as interrupções, o sistema tornou-se lento e começou a travar em linhas com ruído. O ruído de fundo continuava resetando o contador de silêncio, de modo que o agente nunca decidia que o usuário havia terminado.

Três sinais substituem um único número

Abandonamos o timeout fixo e construímos uma pequena máquina de estados que monitora três sinais:

  • Duração do silêncio – quanto tempo o usuário está em silêncio.
  • Gramática – o transcrito termina com uma unidade sintática completa ou com uma palavra solta como "o" ou "e"?
  • Detecção de back-channel – o último som foi um turno genuíno (ex: uma resposta falada) ou um breve reconhecimento como "sim"?

Com esses sinais, definimos dois orçamentos de silêncio:

  1. Transcrito completo – quando o texto analisado parece finalizado, aplicamos um timeout curto de 550 ms. O agente permanece ágil e responde prontamente.
  2. Transcrito incompleto – quando o último token sugere que o usuário está no meio de uma frase, estendemos o timeout para 1300 ms, dando espaço para o interlocutor continuar.

Dois mecanismos de proteção extras evitam interrupções falsas:

  • Duração mínima da fala – um breve "mm-hmm" não conta como um turno completo, então o agente espera por uma fala mais longa antes de decidir.
  • Limite máximo (hard cap) – independentemente do ruído de fundo, um limite máximo de silêncio força o agente a responder após um período razoável, evitando travamentos infinitos.

Resultados e o que isso significa para a IA de voz

Após implementarmos o sistema de três sinais, a taxa de truncamento caiu de 18% para 3%. Os chamadores não ouviam mais o agente falando por cima deles, e o problema anterior de "silêncio morto" desapareceu. O agente parece ágil e educado, assemelhando-se à forma como os humanos gerenciam os turnos de conversação.

Para desenvolvedores que constroem assistentes de voz, a lição é clara: uma única constante em um arquivo de configuração não consegue capturar as nuances da interação falada. Uma máquina de estados leve que avalia a duração do silêncio, a completude gramatical e os sinais de back-channel pode melhorar drasticamente a precisão da alternância de turnos sem adicionar uma carga computacional pesada.

Possíveis desvantagens e questões em aberto

Adicionar o processamento gramatical e a classificação de back-channel adiciona etapas de processamento. As equipes devem verificar se a latência extra não anula os ganhos na fluidez da conversa. A abordagem também depende de um transcrito razoavelmente preciso; em ambientes ruidosos ou com fala sotaqueada, as pistas gramaticais podem falhar, forçando o sistema a recorrer a timeouts mais longos.

Trabalhos futuros poderiam explorar limiares de timeout adaptativos que aprendem com os hábitos individuais de cada chamador, ou integrar características prosódicas (tom, energia) para fortalecer o detector de back-channel. Monitorar como esses refinamentos afetam métricas principais — satisfação do cliente, tempo de conclusão da chamada e taxas de erro — será essencial antes de escalar a técnica para implementações maiores em contact centers.

Conclusão: Tratar a conclusão de um turno como uma decisão baseada em múltiplos sinais, e não em um único temporizador de silêncio, reduz os erros de interrupção em uma ordem de magnitude e restaura o fluxo natural que os usuários esperam de agentes de voz.