Xiaomi випустила MiMo V2.5 — мультимодальну модель із відкритими вагами, яка сприймає аудіо, зображення та відео як нативні токени та пропонує контекстне вікно обсягом 1,05 мільйона токенів. Згідно з прайс-листом, вартість становить $0,14 за мільйон вхідних токенів і $0,28 за мільйон вихідних токенів; така структура витрат робить можливим проведення тривалих зустрічей або відеострімів в межах одного запиту.
Чому «відкриті ваги» мають значення
Більшість мультимодальних ШІ поєднують окремі фронтенди: механізм перетворення мовлення в текст, модель опису зображень, а потім подають отриманий текст у велику мовну модель (LLM). LLM ніколи не бачить сирих даних хвиль або пікселів, тому такі нюанси, як тон, паузи чи жести, можуть бути втрачені. Xiaomi стверджує, що MiMo V2.5 безпосередньо обробляє аудіо та відео, зберігаючи таймінг, інтонацію та візуальні підказки. Теоретично це дозволяє моделі розпізнати зітхання під час телефонної розмови, стежити за ескізом на маркерній дошці або розрізняти спікерів, що перебивають один одного, без проміжного етапу транскрибації.
Оскільки ваги моделі є відкритими, організації можуть завантажити та запускати її локально (on-premise). Це дозволяє уникнути загальноприйнятої практики надсилання сирих медіафайлів у хмарні API — кроку, на який багато регульованих секторів, таких як охорона здоров'я та фінанси, не хочуть або не мають права йти.
Основні технічні показники
- Контекстне вікно: 1,05 мільйона токенів, чого достатньо, щоб вмістити багатогодинну зустріч або повноформатний документальний фільм в одному запиті.
- Ціноутворення: $0,14 за мільйон вхідних токенів, $0,28 за мільйон вихідних токенів.
- Модальності: Аудіо, зображення, відео, а також стандартна обробка тексту.
Велике контекстне вікно стає головною особливістю. Традиційні LLM обмежені кількома тисячами токенів, що змушує розробників розбивати довгі записи на частини або ділити відео на короткі кліпи. З MiMo V2.5 один запит може містити багатогодинну зустріч без необхідності її фрагментації.
Перше знайомство з текстовим рушієм
Хоча конвеєри обробки аудіо та відео ще не пройшли незалежне тестування, текстове ядро пройшло швидку перевірку на адекватність:
- Програмування: Модель розв'язала класичну задачу «об'єднання інтервалів» (merge intervals) і створила алгоритм зі складністю
O(n log n), що демонструє її здатність розуміти алгоритмічні обмеження. - Логічне мислення: Вона відповіла на багатоступеневу математичну текстову задачу за чотири чіткі обчислення, продемонструвавши здатність до ланцюжка міркувань (chain-of-thought).
- Структурований вивід: На основі опису зображення рахунку-фактури вона видала правильно відформатований об'єкт JSON із позиціями, підсумковими сумами та датами.
Надійна текстова основа є важливою, оскільки та сама архітектура transformer лежить в основі мультимодальних шляхів. Якщо мовна складова дасть збій, здатність моделі поєднувати аудіо- або відеопідказки буде обмеженою.
Варіанти використання з акцентом на приватність
Підприємства, які повинні зберігати сирі медіафайли всередині компанії, тепер можуть уявити єдиний самостійно розміщений стек для:
- Аналітики зустрічей: Резюме, вилучення пунктів до виконання, ідентифікація спікерів та аналіз тональності без надсилання записів стороннім сервісам.
- Аналітики дзвінків: Виявлення стресу, розчарування або ключових слів, пов'язаних із дотриманням нормативних вимог, у режимі реального часу.
- Голосових інтерфейсів: Створення чат-ботів, які розуміють тон і можуть відповідати з відповідною вокальною інтонацією.
- Відеоаналізу: Розпізнавання жестів, зміни слайдів або малюнків на екрані під час вебінарів.
Заміна трьох окремих рішень від різних постачальників однією моделлю зменшує витрати на інтеграцію та кількість точок можливого витоку даних.
Застереження та що варто перевірити
Можливості обробки аудіо та відео залишаються лише твердженнями виробника; жодних незалежних вимірювань опубліковано не було. Потенційним користувачам варто провести власні бенчмарки на репрезентативних наборах даних, перш ніж переходити до робочих навантажень у реальних умовах.
Ціноутворення, хоча й є прозорим, розраховується за кожен токен.
На що звернути увагу далі
- Публікація результатів бенчмарків: Незалежні оцінки якості токенізації аудіо/відео, затримки та споживання пам'яті.
- Екосистема інструментів: Адаптери з відкритим вихідним кодом для популярних аудіокодеків та відеоконтейнерів, які подають дані безпосередньо в MiMo V2.5.
- Регуляторна реакція: Чи вважатимуть регулятори у сфері конфіденційності даних самостійно розміщені моделі з відкритими вагами достатнім заходом захисту порівняно з хмарними API.
- Внесок спільноти: Оскільки ваги є публічними, спільнота може донавчати (fine-tune) модель для нішевих галузей (наприклад, медичне диктування, юридичні свідчення).
MiMo V2.5 переводить дискусію з поняття «мультимодальний клей» у площину «мультимодального мозку», здатного працювати за корпоративним фаєрволом. Завдяки відкритим вагам модель стає доступнішою для організацій, чутливих до питань конфіденційності, проте обіцяна точність відтворення аудіо та відео все ще потребує підтвердження. Доки незалежні тести не підтвердять ці заяви, головною перевагою моделі залишається її величезне контекстне вікно та можливість об'єднання кількох сервісів ШІ в єдиний self-hosted стек.
