Xiaomi ha lanzado MiMo V2.5, un modelo multimodal de pesos abiertos que trata el audio, las imágenes y el vídeo como tokens nativos y ofrece una ventana de contexto de 1,05 millones de tokens. La lista de precios indica 0,14 $ por cada millón de tokens de entrada y 0,28 $ por cada millón de tokens de salida, una estructura de costes que hace que sea viable ejecutar reuniones de larga duración o transmisiones de vídeo en un solo prompt.
Por qué es importante que sea de "pesos abiertos"
La mayoría de las IA multimodales combinan distintos componentes front-end: un motor de voz a texto, un modelo de descripción de imágenes y, después, introducen el texto resultante en un modelo de lenguaje extenso (LLM). El LLM nunca ve la forma de onda bruta o los datos de píxeles, por lo que se pueden perder matices como el tono, las pausas o los gestos. Xiaomi afirma que MiMo V2.5 ingiere audio y vídeo directamente, preservando la sincronización, la entonación y las señales visuales. En teoría, esto permite que el modelo detecte un suspiro en una llamada telefónica, siga un boceto en una pizarra o distinga a interlocutores que se solapan sin necesidad de un paso de transcripción intermedio.
Debido a que los pesos del modelo se han publicado abiertamente, las organizaciones pueden descargarlo y ejecutarlo en sus propias instalaciones (on-premise). Esto evita la práctica común de enviar archivos multimedia brutos a APIs en la nube, un paso que muchos sectores regulados —como la sanidad y las finanzas— se muestran reacios o tienen prohibido realizar.
Cifras técnicas principales
- Ventana de contexto: 1,05 millones de tokens, suficiente para incluir una reunión de varias horas o un documental completo en una sola solicitud.
- Precios: 0,14 $ por cada millón de tokens de entrada, 0,28 $ por cada millón de tokens de salida.
- Modalidades: Audio, imagen, vídeo, además del procesamiento de texto estándar.
La gran ventana de contexto es la gran protagonista. Los LLM tradicionales se limitan a unos pocos miles de tokens, lo que obliga a los desarrolladores a fragmentar grabaciones largas o dividir el vídeo en clips cortos. Con MiMo V2.5, un solo prompt puede contener una reunión de varias horas sin necesidad de cortarla en trozos.
Un vistazo de primera mano al motor de texto
Aunque los flujos de trabajo de audio y vídeo no han sido evaluados mediante pruebas de rendimiento independientes, el núcleo de texto superó una rápida prueba de coherencia:
- Programación: El modelo resolvió un problema clásico de "unión de intervalos" (merge intervals) y produjo un algoritmo con una complejidad de
O(n log n), lo que demuestra que puede comprender restricciones algorítmicas. - Razonamiento: Respondió a un problema matemático de varios pasos mediante cuatro cálculos limpios, demostrando capacidad de cadena de pensamiento (chain-of-thought).
- Salida estructurada: Dada la descripción de la imagen de una factura, generó un objeto JSON correctamente formateado con conceptos, totales y fechas.
Contar con una base de texto sólida es fundamental porque la misma arquitectura transformer sustenta las vías multimodales. Si la parte lingüística falla, la capacidad del modelo para fusionar señales de audio o vídeo será limitada.
Casos de uso centrados en la privacidad
Las empresas que deben mantener los archivos multimedia brutos de forma interna ahora pueden imaginar una pila de software autoalojada para:
- Inteligencia de reuniones: Resúmenes, extracción de tareas pendientes, atribución de interlocutores y análisis de sentimiento sin enviar grabaciones a un servicio de terceros.
- Analítica de llamadas: Detección de estrés, frustración o palabras clave relacionadas con el cumplimiento normativo en tiempo real.
- Interfaces de voz: Creación de chatbots que comprendan el tono y puedan responder con la inflexión vocal adecuada.
- Análisis de vídeo: Reconocimiento de gestos, cambios de diapositiva o dibujos en pantalla durante seminarios web.
Sustituir tres soluciones de proveedores distintos por un solo modelo reduce la carga de integración y los puntos de fuga de datos.
Advertencias y qué verificar
Las capacidades de audio y vídeo siguen siendo afirmaciones del fabricante; no se han publicado mediciones independientes. Los posibles adoptantes deberían realizar sus propias pruebas de rendimiento con conjuntos de datos representativos antes de comprometerse con cargas de trabajo de producción.
El precio, aunque es transparente, es por token.
Qué esperar a continuación
- Publicación de comparativas (benchmarks): Evaluaciones de terceros sobre la calidad de la tokenización de audio/vídeo, la latencia y la huella de memoria.
- Ecosistema de herramientas: Adaptadores de código abierto para códecs de audio y contenedores de vídeo populares que se conecten directamente con MiMo V2.5.
- Respuesta regulatoria: Si los reguladores de privacidad de datos consideran que los modelos de pesos abiertos autoalojados son una salvaguarda suficiente en comparación con las APIs en la nube.
- Contribuciones de la comunidad: Dado que los pesos son públicos, la comunidad podría realizar un ajuste fino (fine-tune) del modelo para dominios específicos (por ejemplo, dictado médico o declaraciones legales).
MiMo V2.5 eleva la conversación de un «pegamento multimodal» a un «cerebro multimodal» capaz de ejecutarse tras un cortafuegos corporativo. Su naturaleza de pesos abiertos reduce las barreras para las organizaciones sensibles a la privacidad, pero la prometida fidelidad de audio y vídeo aún debe demostrarse. Hasta que pruebas independientes confirmen las afirmaciones, el mayor atractivo del modelo sigue siendo su masiva ventana de contexto y la posibilidad de consolidar varios servicios de IA en un único stack autoalojado.
