Xiaomi a lancé MiMo V2.5, un modèle multimodal à poids ouverts qui traite l'audio, les images et la vidéo comme des jetons (tokens) natifs et offre une fenêtre de contexte de 1,05 million de jetons. La grille tarifaire indique 0,14 $ par million de jetons d'entrée et 0,28 $ par million de jetons de sortie, une structure de coûts qui rend possible l'exécution de réunions de longue durée ou de flux vidéo en une seule requête.
Pourquoi le concept de « poids ouverts » est important
La plupart des IA multimodales assemblent des interfaces distinctes : un moteur de reconnaissance vocale (speech-to-text), un modèle de légendage d'images, puis injectent le texte résultant dans un grand modèle de langage (LLM). Le LLM ne voit jamais la forme d'onde brute ou les données de pixels, de sorte que des nuances telles que le ton, les pauses ou les gestes peuvent être perdues. Xiaomi affirme que MiMo V2.5 ingère l'audio et la vidéo directement, préservant ainsi le rythme, l'intonation et les indices visuels. En théorie, cela permet au modèle de détecter un soupir lors d'un appel téléphonique, de suivre un croquis sur un tableau blanc ou de distinguer des interlocuteurs qui se chevauchent sans étape de transcription intermédiaire.
Comme les poids du modèle sont publiés en accès libre, les organisations peuvent le télécharger et l'exécuter sur site. Cela permet d'éviter la pratique courante consistant à envoyer des médias bruts à des API cloud, une étape que de nombreux secteurs réglementés — comme la santé et la finance — sont réticents ou interdits d'entreprendre.
Chiffres techniques clés
- Fenêtre de contexte : 1,05 million de jetons, assez pour inclure une réunion de plusieurs heures ou un documentaire complet en une seule requête.
- Tarification : 0,14 $ par million de jetons d'entrée, 0,28 $ par million de jetons de sortie.
- Modalités : Audio, image, vidéo, en plus de la gestion standard du texte.
La grande fenêtre de contexte vole la vedette. Les LLM traditionnels sont limités à quelques milliers de jetons, forçant les développeurs à découper les longs enregistrements ou à diviser la vidéo en clips courts. Avec MiMo V2.5, une seule requête peut contenir une réunion de plusieurs heures sans avoir à la fractionner.
Premier aperçu du moteur de texte
Bien que les pipelines audio et vidéo n'aient pas été évalués de manière indépendante, le cœur textuel a passé un test de cohérence rapide :
- Codage : Le modèle a résolu un problème classique de « fusion d'intervalles » (merge intervals) et a produit un algorithme avec une complexité
O(n log n), prouvant qu'il peut comprendre les contraintes algorithmiques. - Raisonnement : Il a répondu à un problème mathématique à étapes multiples en quatre calculs clairs, démontrant une capacité de raisonnement par étapes (chain-of-thought).
- Sortie structurée : À partir de la description d'une image de facture, il a généré un objet JSON correctement formaté avec les articles, les totaux et les dates.
Une base textuelle solide est essentielle car la même architecture transformer sous-tend les voies multimodales. Si le volet linguistique défaille, la capacité du modèle à fusionner les indices audio ou vidéo sera limitée.
Cas d'utilisation axés sur la confidentialité
Les entreprises qui doivent conserver les médias bruts en interne peuvent désormais envisager une pile logicielle auto-hébergée unique pour :
- Intelligence des réunions : Résumés, extraction des points d'action, attribution des locuteurs et analyse de sentiment sans envoyer les enregistrements à un service tiers.
- Analyse d'appels : Détection du stress, de la frustration ou de mots-clés liés à la conformité en temps réel.
- Interfaces vocales : Création de chatbots capables de comprendre le ton et de répondre avec une inflexion vocale appropriée.
- Analyse vidéo : Reconnaissance des gestes, des changements de diapositives ou des dessins à l'écran lors de webinaires.
Remplacer trois solutions de fournisseurs différents par un seul modèle réduit les frais d'intégration et les points de fuite de données.
Mises en garde et points à vérifier
Les capacités audio et vidéo restent des affirmations du fabricant ; aucune mesure indépendante n'a été publiée. Les adoptants potentiels devraient effectuer leurs propres benchmarks sur des jeux de données représentatifs avant de s'engager dans des charges de travail en production.
La tarification, bien que transparente, s'effectue au jeton.
À surveiller prochainement
- Publications de benchmarks : Évaluations tierces de la qualité de la tokenisation audio/vidéo, de la latence et de l'empreinte mémoire.
- Écosystème d'outils : Adaptateurs open-source pour les codecs audio et les conteneurs vidéo populaires qui alimentent directement MiMo V2.5.
- Retours réglementaires : Savoir si les régulateurs de la confidentialité des données considèrent les modèles à poids ouverts auto-hébergés comme une protection suffisante par rapport aux API cloud.
- Contributions de la communauté : Puisque les poids sont publics, la communauté pourrait affiner le modèle pour des domaines de niche (ex: dictée médicale, dépositions juridiques).
MiMo V2.5 fait évoluer le débat, passant de la « colle multimodale » au « cerveau multimodal » capable de s'exécuter derrière un pare-feu d'entreprise. Sa nature à poids ouverts abaisse la barrière pour les organisations soucieuses de la confidentialité, mais la fidélité audio/vidéo promise reste à prouver. Tant que des tests indépendants n'auront pas confirmé ces affirmations, le principal atout du modèle reste sa fenêtre de contexte massive et la possibilité de consolider plusieurs services d'IA au sein d'une pile unique auto-hébergée.
