Xiaomi udostępniło MiMo V2.5, multimodalny model typu open-weight, który traktuje dźwięk, obrazy i wideo jako natywne tokeny i oferuje okno kontekstowe o wielkości 1,05 miliona tokenów. Cennik przewiduje 0,14 USD za milion tokenów wejściowych i 0,28 USD za milion tokenów wyjściowych – taka struktura kosztów sprawia, że możliwe jest przetwarzanie długich spotkań lub strumieni wideo w ramach pojedynczego zapytania (promptu).
Dlaczego „open-weight” ma znaczenie
Większość multimodalnych systemów AI łączy ze sobą oddzielne interfejsy: silnik speech-to-text, model opisujący obrazy (image-captioning), a następnie przesyła wynikowy tekst do dużego modelu językowego (LLM). LLM nigdy nie widzi surowej formy fali dźwiękowej ani danych pikselowych, przez co niuanse takie jak ton, pauzy czy gesty mogą zostać utracone. Xiaomi twierdzi, że MiMo V2.5 przetwarza dźwięk i wideo bezpośrednio, zachowując rytm, intonację i wskazówki wizualne. W teorii pozwala to modelowi wykryć westchnienie podczas rozmowy telefonicznej, śledzić szkic na tablicy lub rozróżniać nakładających się mówców bez konieczności pośredniej transkrypcji.
Ponieważ wagi modelu są udostępnione publicznie, organizacje mogą je pobrać i uruchomić lokalnie (on-premise). Pozwala to uniknąć powszechnej praktyki przesyłania surowych mediów do API w chmurze – kroku, na który wiele regulowanych sektorów, takich jak ochrona zdrowia czy finanse, nie chce lub nie może sobie pozwolić.
Kluczowe dane techniczne
- Okno kontekstowe: 1,05 miliona tokenów – wystarczająco dużo, aby zmieścić wielogodzinne spotkanie lub pełnometrażowy dokument w jednym zapytaniu.
- Cennik: 0,14 USD za milion tokenów wejściowych, 0,28 USD za milion tokenów wyjściowych.
- Modalności: Dźwięk, obraz, wideo oraz standardowa obsługa tekstu.
Duże okno kontekstowe jest tu główną atrakcją. Tradycyjne modele LLM mają ograniczenia rzędu kilku tysięcy tokenów, co zmusza programistów do dzielenia długich nagrań na fragmenty lub rozcinania wideo na krótkie klipy. Dzięki MiMo V2.5 pojedynczy prompt może zawierać wielogodzinne spotkanie bez konieczności dzielenia go na części.
Pierwsze spojrzenie na silnik tekstowy
Choć potoki (pipelines) audio i wideo nie zostały jeszcze poddane niezależnym testom wydajnościowym, rdzeń tekstowy przeszedł szybki test poprawności (sanity check):
- Programowanie: Model rozwiązał klasyczny problem „merge intervals” (łączenie przedziałów) i wygenerował algorytm o złożoności
O(n log n), co pokazuje, że potrafi rozumieć ograniczenia algorytmiczne. - Rozumowanie: Rozwiązał wieloetapowe zadanie matematyczne w czterech przejrzystych obliczeniach, demonstrując zdolność do rozumowania krok po kroku (chain-of-thought).
- Ustrukturyzowany wynik: Na podstawie opisu obrazu faktury wygenerował poprawnie sformatowany obiekt JSON z pozycjami, kwotami całkowitymi i datami.
Solidny fundament tekstowy jest istotny, ponieważ ta sama architektura transformer wspiera ścieżki multimodalne. Jeśli strona językowa zawiedzie, zdolność modelu do łączenia wskazówek audio lub wideo będzie ograniczona.
Zastosowania stawiające prywatność na pierwszym miejscu
Przedsiębiorstwa, które muszą przechowywać surowe media u siebie, mogą teraz wyobrazić sobie pojedynczy, hostowany samodzielnie stos technologiczny do:
- Analizy spotkań (Meeting intelligence): Podsumowania, wyodrębnianie zadań do wykonania, przypisywanie wypowiedzi do mówców oraz analiza nastrojów bez przesyłania nagrań do zewnętrznych usług.
- Analityki połączeń: Wykrywanie stresu, frustracji lub słów kluczowych związanych ze zgodnością (compliance) w czasie rzeczywistym.
- Interfejsów głosowych: Budowanie chatbotów, które rozumieją ton głosu i potrafią odpowiadać z odpowiednią modulacją.
- Analizy wideo: Rozpoznawanie gestów, zmian slajdów czy rysunków na ekranie podczas webinarów.
Zastąpienie trzech oddzielnych rozwiązań od różnych dostawców jednym modelem zmniejsza koszty integracji i ogranicza punkty ryzyka wycieku danych.
Uwagi i co należy zweryfikować
Możliwości audio i wideo pozostają na razie jedynie deklaracjami producenta; nie opublikowano żadnych niezależnych pomiarów. Potencjalni użytkownicy powinni przeprowadzić własne testy wydajnościowe na reprezentatywnych zestawach danych przed wdrożeniem modelu do zadań produkcyjnych.
Cennik, choć przejrzysty, opiera się na liczbie tokenów.
Na co warto zwrócić uwagę w przyszłości
- Publikacje benchmarków: Niezależne oceny jakości tokenizacji audio/wideo, opóźnień (latency) oraz zużycia pamięci.
- Ekosystem narzędzi: Otwarte adaptery dla popularnych kodeków audio i kontenerów wideo, które będą bezpośrednio współpracować z MiMo V2.5.
- Reakcje regulatorów: Czy organy regulujące ochronę danych uznają modele typu open-weight hostowane samodzielnie za wystarczające zabezpieczenie w porównaniu z API w chmurze.
- Wkład społeczności: Ponieważ wagi są publiczne, społeczność może dotrenowywać (fine-tune) model pod kątem niszowych dziedzin (np. dyktowanie medyczne, zeznania prawne).
MiMo V2.5 przesuwa dyskusję z poziomu „multimodalnego kleju” na poziom „multimodalnego mózgu”, który może działać za korporacyjnym firewallem. Jego otwarta natura (open-weight) obniża barierę wejścia dla organizacji dbających o prywatność, jednak obiecana wierność dźwięku i obrazu wciąż wymaga potwierdzenia. Dopóki niezależne testy nie zweryfikują tych zapewnień, największym atutem modelu pozostaje jego ogromne okno kontekstowe oraz możliwość konsolidacji wielu usług AI w ramach jednego, hostowanego samodzielnie stosu technologicznego.
