Xiaomi выпустила MiMo V2.5 — мультимодальную модель с открытыми весами, которая обрабатывает аудио, изображения и видео как нативные токены и обладает контекстным окном в 1,05 миллиона токенов. Согласно прайс-листу, стоимость составляет $0,14 за миллион входных токенов и $0,28 за миллион выходных токенов. Такая структура затрат делает возможным обработку длительных совещаний или видеопотоков в рамках одного промпта.
Почему важны «открытые веса»
Большинство мультимодальных ИИ объединяют разрозненные компоненты: движок преобразования речи в текст, модель описания изображений, а затем передают полученный текст в большую языковую модель (LLM). LLM никогда не видит необработанную волновую форму или пиксельные данные, поэтому такие нюансы, как тон, паузы или жесты, могут быть утеряны. Xiaomi утверждает, что MiMo V2.5 напрямую воспринимает аудио и видео, сохраняя тайминг, интонацию и визуальные подсказки. Теоретически это позволяет модели распознать вздох во время телефонного разговора, следить за наброском на доске или различать говорящих, которые перебивают друг друга, без промежуточного этапа транскрибации.
Поскольку веса модели находятся в открытом доступе, организации могут скачивать и запускать её на собственных мощностях (on-premise). Это позволяет избежать распространенной практики отправки необработанных медиафайлов в облачные API — шаг, на который многие регулируемые секторы, такие как здравоохранение и финансы, не решаются или которым им запрещено идти.
Основные технические показатели
- Контекстное окно: 1,05 миллиона токенов, чего достаточно, чтобы уместить многочасовое совещание или полнометражный документальный фильм в одном запросе.
- Стоимость: $0,14 за миллион входных токенов, $0,28 за миллион выходных токенов.
- Модальности: аудио, изображения, видео, а также стандартная обработка текста.
Огромное контекстное окно становится главным преимуществом. Традиционные LLM ограничены несколькими тысячами токенов, что вынуждает разработчиков разбивать длинные записи на части или делить видео на короткие клипы. С MiMo V2.5 один промпт может содержать многочасовое совещание без необходимости его фрагментации.
Первичный обзор текстового ядра
Хотя конвейеры обработки аудио и видео еще не прошли независимое тестирование, текстовое ядро успешно прошло базовую проверку:
- Программирование: Модель решила классическую задачу «объединения интервалов» (merge intervals) и выдала алгоритм со сложностью
O(n log n), продемонстрировав понимание алгоритмических ограничений. - Логическое мышление: Она решила многошаговую математическую текстовую задачу в четыре чистых вычисления, продемонстрировав способность к цепочке рассуждений (chain-of-thought).
- Структурированный вывод: Получив описание изображения счета, модель выдала правильно отформатированный JSON-объект со строками товаров, итоговыми суммами и датами.
Надежный текстовый фундамент имеет значение, так как та же архитектура трансформера лежит в основе мультимодальных путей. Если языковая составляющая будет давать сбои, способность модели объединять аудио- или видеосигналы будет ограничена.
Сценарии использования с приоритетом конфиденциальности
Предприятия, которые обязаны хранить необработанные медиаданные внутри компании, теперь могут представить единый самохостинговый стек для:
- Интеллектуального анализа совещаний: создание резюме, извлечение задач к исполнению, идентификация говорящих и анализ тональности без отправки записей сторонним сервисам.
- Аналитики звонков: обнаружение стресса, разочарования или ключевых слов, связанных с соблюдением нормативных требований (комплаенсом), в режиме реального времени.
- Голосовых интерфейсов: создание чат-ботов, которые понимают тон и могут отвечать с соответствующей вокальной интонацией.
- Видеоаналитики: распознавание жестов, смены слайдов или рисунков на экране во время вебинаров.
Замена трех отдельных решений от разных вендоров одной моделью снижает накладные расходы на интеграцию и уменьшает количество точек утечки данных.
Предостережения и что следует проверить
Возможности работы с аудио и видео на данный момент являются лишь заявлениями производителя; независимых измерений опубликовано не было. Потенциальным пользователям следует провести собственные бенчмарки на репрезентативных наборах данных, прежде чем внедрять модель в рабочие процессы.
Цена, хотя и прозрачна, рассчитывается за каждый токен.
За чем следить дальше
- Публикация бенчмарков: независимые оценки качества токенизации аудио/видео, задержки (latency) и объема занимаемой памяти.
- Экосистема инструментов: появление open-source адаптеров для популярных аудиокодеков и видеоконтейнеров, которые будут напрямую подавать данные в MiMo V2.5.
- Реакция регуляторов: будут ли регуляторы в сфере защиты данных рассматривать самохостинговые модели с открытыми весами как достаточную меру защиты по сравнению с облачными API.
- Вклад сообщества: поскольку веса публичны, сообщество может дообучать (fine-tune) модель для узких областей (например, медицинское диктование или юридические показания).
MiMo V2.5 переводит дискуссию из плоскости «мультимодального клея» в плоскость «мультимодального мозга», способного работать за корпоративным файрволом. Открытость весов модели снижает барьеры для организаций, чувствительных к вопросам конфиденциальности, однако заявленное качество аудио и видео всё еще требует подтверждения. Пока независимые тесты не подтвердят эти заявления, главным преимуществом модели остается её огромное контекстное окно и возможность объединения нескольких ИИ-сервисов в единый self-hosted стек.
