Xiaomi wprowadziło MiMo-V2.5, multimodalny model typu open-weight, który traktuje dźwięk, obraz i wideo jako natywne tokeny. Oferuje on okno kontekstowe o wielkości 1 050 000 tokenów oraz model płatności pay-as-you-go w wysokości 0,14 USD za milion tokenów wejściowych i 0,28 USD za milion tokenów wyjściowych, celując w organizacje potrzebujące rozwiązań AI typu on-premise, intensywnie wykorzystujących multimedia.
Dlaczego nowe podejście multimodalne ma znaczenie
Większość istniejących systemów multimodalnych „oszukuje”. Najpierw uruchamiają silnik speech-to-text, następnie model wizyjny, który zamienia obrazy na opisy, a na końcu przekazują powstały tekst do dużego modelu językowego (LLM). LLM nigdy nie widzi oryginalnej fali dźwiękowej ani danych pikselowych, przez co niuanse, takie jak westchnienie, pauza, drgnięcie twarzy czy gest dłonią, znikają. MiMo-V2.5 omija tę drogę na skróty: przyjmuje dźwięk i wideo bezpośrednio jako „tokeny”, zachowując wyczucie czasu, ton oraz wskazówki wizualne, których transkrypcja nie jest w stanie uchwycić.
Specyfikacja techniczna
- Okno tokenów: 1 050 000 tokenów – wystarczająco dużo, aby przetworzyć wielogodzinne nagrania ze spotkań bez konieczności dzielenia ich na fragmenty.
- Self-hosting: Wdrażanie modelu na własnych serwerach firmy, dzięki czemu surowe multimedia nigdy nie opuszczają siedziby organizacji.
- Cennik: 0,14 USD za milion tokenów wejściowych, 0,28 USD za milion tokenów wyjściowych – przejrzysty koszt skalujący się wraz z użyciem.
Podczas szybkiego testu sprawdzającego (sanity check) samego rdzenia tekstowego, model rozwiązał klasyczny problem programistyczny merge-interval przy użyciu oczekiwanego algorytmu O(n log n), krok po kroku obliczył zadanie matematyczne dotyczące tempa napełniania zbiornika oraz bezbłędnie wyodrębnił ładunek JSON z faktury. W tym teście nie wykorzystano potoków (pipelines) audio i wideo.
Kto może na tym skorzystać
Branże o wysokich wymaganiach dotyczących prywatności, takie jak ochrona zdrowia i finanse, nie mogą przesyłać surowego dźwięku ani wideo do zewnętrznych API. Dzięki przechowywaniu danych za firewallem, MiMo-V2.5 pozwala tym organizacjom przestrzegać zasad ochrony danych, jednocześnie czerpiąc korzyści z analiz opartych na AI. Potencjalne zastosowania obejmują:
- Meeting intelligence: Analiza całych nagrań wideo w celu wykrywania decyzji, zadań do wykonania oraz nastroju mówcy, bez konieczności osobnego etapu transkrypcji.
- Analityka call center: Wykrywanie frustracji, wahania lub pewności siebie w głosie dzwoniącego w czasie rzeczywistym.
- Asystenci urządzeń (on-device): Budowanie interfejsów głosowych, które rozumieją ton i reagują na sygnały niewerbalne bez przesyłania dźwięku do chmury.
Praktyczne przeszkody
Obietnica MiMo-V2.5 zależy od wydajności jego enkoderów audio i wideo – komponentów, których autor nie poddał jeszcze testom porównawczym (benchmarking). Przed wdrożeniem produkcyjnym przedsiębiorstwa muszą zweryfikować opóźnienia, dokładność oraz zużycie sprzętu na własnych zbiorach danych. Zespoły, które potrzebują wyłącznie tekstu, prawdopodobnie uznają mniejszy, tekstowy model za bardziej wydajny pod względem mocy obliczeniowej i kosztów. Charakter open-weight modelu MiMo-V2.5 oznacza, że kod i wagi są publicznie dostępne; umożliwia to głęboką personalizację, ale wymaga również posiadania wewnętrznych kompetencji w celu utrzymania i zabezpieczenia stosu technologicznego.
Podsumowanie
MiMo-V2.5 oferuje natywną tokenizację multimediów, ogromne okno kontekstowe oraz możliwość self-hostingu przy jasnym koszcie za token. Dla organizacji wrażliwych na punkcie prywatności, które muszą przechowywać surowy dźwięk i wideo lokalnie, stanowi to realną ścieżkę pilotażową. Rzeczywista wartość będzie zależeć od tego, jak jego enkodery audio i wideo poradzą sobie przy obciążeniach korporacyjnych oraz czy operacyjne koszty utrzymania własnej infrastruktury mieszczą się w kompetencjach obecnych zespołów AI.
