Los asistentes de voz han sufrido durante mucho tiempo de un techo frustrante. Podías preguntarles el tiempo, poner un temporizador o preparar una lista de reproducción. En el momento en que la conversación derivaba hacia algo complejo —depurar código, estructurar un acuerdo comercial, realizar pruebas de estrés a una estrategia de producto—, la interacción se desmoronaba. Es posible que el asistente te escuchara correctamente, pero carecía de la profundidad de razonamiento para analizar el problema contigo.

Anthropic está intentando solucionar eso. La empresa ha expandido el modo de voz en Claude, pasando de su modelo de nivel básico, Haiku, a sus sistemas más capaces, Opus y Sonnet. Este movimiento señala algo más interesante que un simple lanzamiento de funciones. Anthropic apuesta a que el trabajo serio puede realizarse mediante la conversación hablada, no solo a través del teclado.

Por qué la voz necesita capacidad de razonamiento

Anteriormente, el modo de voz de Claude funcionaba exclusivamente con Haiku. Ese modelo prioriza la velocidad y la baja latencia. Para preguntas rápidas —"¿Cuál es la capital de Estonia?" o "¿Resume este correo electrónico?"—, esa compensación tenía sentido. Haiku responde con rapidez. Pero Anthropic notó que los usuarios seguían exigiendo más de la función de lo que Haiku fue diseñado para manejar. La gente intentaba usar la voz para trabajos sustanciales, y el modelo a menudo se quedaba corto en el tipo de razonamiento extendido que esas tareas demandan.

Incorporar a Opus y Sonnet cambia la dinámica de la conversación. Estos modelos son los motores principales de Anthropic para tareas cognitivas difíciles. Opus, el modelo insignia, gestiona análisis elaborados, cadenas de razonamiento extendidas y síntesis creativa. Sonnet se sitúa en el medio, ofreciendo un razonamiento sólido a una mayor velocidad que Opus. Con la voz superpuesta, ahora puedes hablar sobre una arquitectura técnica compleja o un modelo financiero matizado y esperar que la IA siga la lógica, detecte inconsistencias y te cuestione con preguntas relevantes.

Pensar en voz alta

La diferencia es cualitativa. Con la voz de Haiku, la interacción se sentía transaccional. Tú preguntabas; él respondía. Con Opus y Sonnet, la interacción se vuelve colaborativa.

Imagina que eres un gerente de producto conduciendo a casa. Dictas una idea a medio formar sobre un nuevo flujo de incorporación. En lugar de recibir una respuesta genérica de "Eso es interesante", Claude Sonnet empieza a indagar. Pregunta si has considerado los casos límite para usuarios empresariales. Traza paralelismos con patrones de incorporación que ha visto en otros contextos. Para cuando llegas a la entrada de tu casa, has puesto a prueba la idea desde tres ángulos que no habías considerado.

O imagina a una ingeniera solucionando un fallo en un sistema distribuido mientras consulta los registros en una segunda pantalla. Al hablar con Claude Opus, puede describir los síntomas en lenguaje sencillo, leer los mensajes de error en voz alta y plantear hipótesis sin tener que detenerse a escribir. El modelo sigue el hilo a través de múltiples turnos, recuerda qué vías ya han sido descartadas y sugiere cambios de configuración basados en el diagnóstico en evolución. Esto no es una transcripción con un motor de búsqueda adjunto. Es razonamiento realizado en tiempo real a través de la voz.

De hablar a actuar

Quizás el cambio más significativo es que estos modelos avanzados pueden actuar, no solo chatear. Anthropic está presentando el modo de voz actualizado como una interfaz agéntica. Debido a que Opus y Sonnet poseen la capacidad de razonamiento para interpretar la intención con precisión, pueden convertir una conversación hablada en resultados concretos.

El ejemplo que ofrece Anthropic es sencillo pero revelador. Un usuario discute una idea de negocio por voz y luego le pide a Claude que convierta esa conversación divagante en una propuesta (pitch) estructurada de una página. El modelo analiza el diálogo no estructurado, identifica la propuesta de valor central, la audiencia y los supuestos financieros, y produce un documento con formato. Sin tener que volver a escribir. Sin copiar los registros del chat en una plantilla aparte.

Esta capa agéntica se extiende a las herramientas de productividad. Anthropic está conectando la experiencia de voz con Gmail, Slack y Canva. Eso significa que podrías dictar un resumen de proyecto a Claude, pedirle que genere la presentación en Canva, dejar un resumen en el canal de Slack de tu equipo y redactar el correo electrónico de seguimiento en Gmail, todo desde la misma sesión de voz. El modelo se convierte en un coordinador, traduciendo la intención hablada en acciones a través de aplicaciones distintas.

Cambiar de marcha sin perder el hilo

Anthropic también ha diseñado la experiencia para eliminar las barreras entre los diferentes modos de interacción. Ahora los usuarios pueden alternar entre texto y voz dentro de la misma conversación sin perder el contexto. Es posible que comiences a escribir una consulta técnica en tu escritorio, cambies a voz mientras caminas hacia una reunión y luego vuelvas al texto para pegar un fragmento de código.

El sistema también permite cambiar entre los niveles de modelo a mitad de camino. Si comienzas una sesión de lluvia de ideas informal con Haiku —aprovechando sus respuestas rápidas— puedes escalar la conversación a Opus cuando la discusión pase a una ejecución técnica rigurosa. El contexto se transfiere. La IA recuerda lo que dijiste hace tres turnos, independientemente de si lo escribiste o lo hablaste, o de si estabas hablando con el modelo rápido o con el profundo.

Esta fluidez es importante porque el trabajo real rara vez es lineal. Algunos problemas requieren velocidad; otros, profundidad. Crear una interfaz única donde los usuarios puedan moverse entre esos engranajes ahorra carga cognitiva. Evita la fricción de abrir nuevas pestañas, copiar prompts o volver a explicar el contexto.

Hablando los idiomas del mundo

La expansión no se limita a los angloparlantes. Anthropic ha finalizado la beta exclusiva en inglés, añadiendo soporte oficial para nueve idiomas adicionales:

  • Idiomas europeos: francés, alemán, italiano, español y portugués.
  • Idiomas asiáticos: hindi, indonesio, japonés y coreano.

Esto no es simplemente una casilla de verificación de localización. La asistencia de voz de alto razonamiento en coreano o hindi cambia quién puede utilizar estas herramientas para el trabajo profesional. El fundador de una startup en Yakarta puede redactar mediante voz una actualización para inversores en indonesio. Un analista de fabricación en Turín puede interrogar datos de la cadena de suministro en italiano. El poder cognitivo de Opus se vuelve accesible para cualquier persona que piense de forma más natural en su lengua materna que en inglés.

En el mercado más amplio de los asistentes de IA, este despliegue multilingüe —combinado con las capacidades de razonamiento de los modelos de nivel superior— agudiza la ventaja competitiva de Claude. Históricamente, la mayoría de los asistentes de voz han tratado a los mercados no angloparlantes como algo secundario, añadiendo capas de traducción sobre un razonamiento superficial. Anthropic parece apostar por que los usuarios globales quieren la misma profundidad de pensamiento en sus propios idiomas que los angloparlantes ya esperan.

La perspectiva real