Xiaomi представила MiMo-V2.5 — мультимодальную модель с открытыми весами, которая обрабатывает аудио, изображения и видео как нативные токены. Она предлагает контекстное окно объемом 1 050 000 токенов и модель оплаты по мере использования (pay-as-you-go): $0,14 за миллион входных токенов и $0,28 за миллион выходных токенов. Модель ориентирована на организации, которым требуется локальное (on-premise) решение для работы с тяжелым медиаконтентом.
Почему важен новый мультимодальный подход
Большинство существующих мультимодальных систем «хитрят». Сначала они запускают движок преобразования речи в текст (speech-to-text), затем модель компьютерного зрения, которая превращает изображения в описания, и, наконец, передают полученный текст в большую языковую модель (LLM). LLM никогда не видит исходную звуковую волну или пиксельные данные, поэтому такие нюансы, как вздох, пауза, мимика или жест рукой, теряются. MiMo-V2.5 избегает этих обходных путей: она воспринимает аудио и видео напрямую как «токены», сохраняя тайминг, тон и визуальные подсказки, которые невозможно передать через текстовую расшифровку.
Технические характеристики
- Контекстное окно: 1 050 000 токенов — этого достаточно, чтобы обрабатывать многочасовые записи встреч, не разбивая их на фрагменты.
- Self-hosting (локальное размещение): Развертывание модели на собственных серверах компании, благодаря чему необработанные медиафайлы никогда не покидают периметр организации.
- Ценообразование: $0,14 за миллион входных токенов, $0,28 за миллион выходных токенов — прозрачная стоимость, масштабируемая в зависимости от использования.
В ходе быстрой проверки текстового ядра модель решила классическую задачу программирования на объединение интервалов (merge-interval) с ожидаемым алгоритмом сложности O(n log n), пошагово вычислила математическую задачу на скорость заполнения бака и без ошибок извлекла JSON-данные из счета-фактуры. В этом тесте аудио- и видеоканалы не задействовались.
Кому это будет полезно
Отрасли с повышенными требованиями к конфиденциальности, такие как здравоохранение и финансы, не могут отправлять необработанное аудио или видео в сторонние API. Сохраняя данные внутри защищенного контура (firewall), MiMo-V2.5 позволяет таким организациям соблюдать правила защиты данных, получая при этом аналитические выводы с помощью ИИ. Потенциальные области применения включают:
- Аналитика встреч: Анализ видеозаписей целиком для выявления принятых решений, задач к исполнению и настроения спикеров без необходимости отдельного этапа транскрибации.
- Аналитика колл-центров: Определение фрустрации, нерешительности или уверенности в голосе звонящего в режиме реального времени.
- Локальные ассистенты: Создание голосовых интерфейсов, которые понимают тон и реагируют на невербальные сигналы, не отправляя аудио в облако.
Практические сложности
Потенциал MiMo-V2.5 напрямую зависит от производительности ее аудио- и видеокодеров — компонентов, которые автор еще не тестировал с помощью бенчмарков. Прежде чем внедрять модель в промышленную эксплуатацию, предприятиям необходимо проверить задержку (latency), точность и потребление ресурсов на собственных наборах данных. Командам, которым нужен только текст, скорее всего, будет эффективнее использовать более компактные текстовые модели как с точки зрения вычислений, так и по стоимости. Открытость весов MiMo-V2.5 означает, что код и веса доступны публично; это позволяет проводить глубокую кастомизацию, но также требует наличия внутренних экспертов для обслуживания и обеспечения безопасности стека.
Итог
MiMo-V2.5 предлагает нативную токенизацию медиаданных, огромное контекстное окно и возможность локального размещения с понятной стоимостью за токен. Для организаций, чувствительных к вопросам конфиденциальности и обязанных хранить аудио- и видеофайлы внутри компании, это отличный вариант для пилотного проекта. Реальная ценность будет зависеть от того, как аудио- и видеокодеры справятся с корпоративными нагрузками и впишутся ли операционные расходы на self-hosting в компетенции существующих ИИ-команд.
