Xiaomi hat MiMo V2.5 veröffentlicht, ein Open-Weight-multimodales Modell, das Audio, Bilder und Video als native Token behandelt und ein Kontextfenster von 1,05 Millionen Token bietet. Die Preisliste führt 0,14 $ pro Million Input-Token und 0,28 $ pro Million Output-Token auf – eine Kostenstruktur, die es ermöglicht, längere Besprechungen oder Videostreams in einem einzigen Prompt zu verarbeiten.

Warum „Open-Weight“ wichtig ist

Die meisten multimodalen KIs verknüpfen separate Frontends: eine Speech-to-Text-Engine, ein Image-Captioning-Modell und speisen den resultierenden Text dann in ein Large Language Model (LLM) ein. Das LLM sieht dabei nie die rohen Wellenform- oder Pixeldaten, wodurch Nuancen wie Tonfall, Pausen oder Gestik verloren gehen können. Xiaomi gibt an, dass MiMo V2.5 Audio und Video direkt verarbeitet, wodurch Timing, Intonation und visuelle Hinweise erhalten bleiben. Theoretisch ermöglicht dies dem Modell, ein Seufzen in einem Telefonat zu erkennen, einer Skizze auf einem Whiteboard zu folgen oder sich überlappende Sprecher zu unterscheiden, ohne einen zwischengeschalteten Transkriptionsschritt zu benötigen.

Da die Gewichte des Modells offen veröffentlicht werden, können Unternehmen es herunterladen und on-premise betreiben. Dies umgeht die gängige Praxis, Rohmedien an Cloud-APIs zu senden – ein Schritt, den viele regulierte Sektoren, wie das Gesundheitswesen und das Finanzwesen, nur ungern oder gar nicht unternehmen dürfen.

Technische Eckdaten

  • Kontextfenster: 1,05 Millionen Token, ausreichend für eine mehrstündige Besprechung oder eine komplette Dokumentation in einer einzigen Anfrage.
  • Preisgestaltung: 0,14 $ pro Million Input-Token, 0,28 $ pro Million Output-Token.
  • Modalitäten: Audio, Bild, Video sowie standardmäßige Textverarbeitung.

Das große Kontextfenster stiehlt allen anderen die Show. Traditionelle LLMs sind auf wenige tausend Token begrenzt, was Entwickler dazu zwingt, lange Aufnahmen in Stücke zu unterteilen (Chunking) oder Videos in kurze Clips zu splitten. Mit MiMo V2.5 kann ein einziger Prompt eine mehrstündige Besprechung enthalten, ohne sie in Einzelteile zerlegen zu müssen.

Erster Blick auf die Text-Engine

Während die Audio- und Videopipelines noch nicht unabhängig getestet wurden, bestand der Textkern einen schnellen Sanity-Check:

  • Programmierung: Das Modell löste ein klassisches „Merge Intervals“-Problem und erzeugte einen Algorithmus mit einer Komplexität von O(n log n), was zeigt, dass es algorithmische Einschränkungen verstehen kann.
  • Logik: Es beantwortete ein mehrstufiges mathematisches Textproblem in vier sauberen Rechenschritten und demonstrierte damit Chain-of-Thought-Fähigkeiten.
  • Strukturierte Ausgabe: Basierend auf der Beschreibung eines Rechnungsbildes gab es ein korrekt formatiertes JSON-Objekt mit Posten, Summen und Daten aus.

Eine solide Textbasis ist wichtig, da dieselbe Transformer-Architektur auch den multimodalen Pfaden zugrunde liegt. Wenn die Sprachseite schwächelt, wird die Fähigkeit des Modells, Audio- oder Videohinweise zu fusionieren, eingeschränkt sein.

Anwendungsfälle mit Fokus auf Datenschutz

Unternehmen, die Rohmedien intern behalten müssen, können sich nun einen einzigen, selbst gehosteten Stack für folgende Bereiche vorstellen:

  • Meeting-Intelligence: Zusammenfassungen, Extraktion von Aktionspunkten, Sprecherzuordnung und Sentiment-Analyse, ohne Aufnahmen an einen Drittanbieter zu senden.
  • Anruf-Analytik: Echtzeit-Erkennung von Stress, Frustration oder Compliance-relevanten Schlüsselwörtern.
  • Sprachschnittstellen: Entwicklung von Chatbots, die den Tonfall verstehen und mit angemessener vokaler Modulation antworten können.
  • Videoanalyse: Erkennung von Gesten, Folienwechseln oder Zeichnungen auf dem Bildschirm während Webinaren.

Der Ersatz von drei separaten Anbieterlösungen durch ein einziges Modell senkt den Integrationsaufwand und reduziert potenzielle Datenleck-Schwachstellen.

Einschränkungen und zu prüfende Punkte

Die Audio- und Videofähigkeiten basieren weiterhin auf Herstellerangaben; es wurden noch keine unabhängigen Messungen veröffentlicht. Potenzielle Anwender sollten eigene Benchmarks mit repräsentativen Datensätzen durchführen, bevor sie das Modell für produktive Workloads einsetzen.

Die Preisgestaltung ist zwar transparent, erfolgt jedoch pro Token.

Worauf man als Nächstes achten sollte

  • Veröffentlichung von Benchmarks: Unabhängige Bewertungen der Qualität der Audio-/Video-Tokenisierung, der Latenz und des Speicherbedarfs.
  • Tooling-Ökosystem: Open-Source-Adapter für gängige Audio-Codecs und Video-Container, die direkt in MiMo V2.5 einspeisen.
  • Regulatorisches Feedback: Ob Datenschutzbehörden selbst gehostete Open-Weight-Modelle als ausreichende Absicherung im Vergleich zu Cloud-APIs betrachten.
  • Community-Beiträge: Da die Gewichte öffentlich sind, könnte die Community das Modell für Nischenbereiche feintunen (z. B. medizinische Diktate, juristische Zeugenaussagen).

MiMo V2.5 verschiebt die Diskussion von einem „multimodalen Klebstoff“ hin zu einem „multimodalen Gehirn“, das hinter einer Unternehmens-Firewall betrieben werden kann. Die Open-Weight-Natur senkt die Hürden für datenschutzsensible Organisationen, doch die versprochene Audio-/Video-Fidelity muss erst noch bewiesen werden. Bis unabhängige Tests die Behauptungen bestätigen, bleibt das größte Verkaufsargument des Modells sein riesiges Kontextfenster und die Möglichkeit, mehrere KI-Dienste in einem einzigen, selbst gehosteten Stack zusammenzuführen.