Xiaomi가 오디오, 이미지, 비디오를 네이티브 토큰으로 처리하는 오픈 웨이트(open-weight) 멀티모달 모델인 MiMo-V2.5를 출시했습니다. 이 모델은 1,050,000 토큰의 컨텍스트 창을 제공하며, 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28의 종량제 가격을 책정하여 온프레미스 기반의 미디어 중심 AI가 필요한 조직을 타겟으로 합니다.
새로운 멀티모달 접근 방식이 중요한 이유
대부분의 기존 멀티모달 시스템은 편법을 사용합니다. 먼저 음성-텍스트 변환(STT) 엔진을 실행한 다음, 이미지를 캡션으로 변환하는 비전 모델을 돌리고, 마지막으로 결과 텍스트를 대규모 언어 모델(LLM)에 입력합니다. LLM은 원래의 음파나 픽셀 데이터를 전혀 볼 수 없기 때문에, 한숨, 일시 정지, 얼굴의 경련 또는 손짓과 같은 미세한 뉘앙스가 사라집니다. MiMo-V2.5는 이러한 우회 과정을 건너뜁니다. 오디오와 비디오를 직접 "토큰"으로 입력받아, 텍스트 변환으로는 포착할 수 없는 타이밍, 어조 및 시각적 단서를 보존합니다.
기술적 사양
- 토큰 창: 1,050,000 토큰 – 몇 시간 분량의 회의 녹음 파일을 조각내지 않고도 한 번에 입력할 수 있는 충분한 용량입니다.
- 셀프 호스팅: 모델을 기업 자체 서버에 배포할 수 있어 원본 미디어가 외부로 유출되지 않습니다.
- 가격 책정: 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28 – 사용량에 따라 확장되는 투명한 비용 구조입니다.
텍스트 전용 코어에 대한 간단한 검증(sanity check) 결과, 이 모델은 예상되는 O(n log n) 알고리즘을 사용하여 전형적인 병합 구간(merge-interval) 코딩 문제를 해결했으며, 탱크 채우기 속도 수학 문제를 단계별로 계산하고, 송장에서 오류 없이 JSON 페이로드를 추출했습니다. 해당 테스트에서는 오디오 및 비디오 파이프라인은 사용되지 않았습니다.
수혜 대상
의료 및 금융과 같이 개인정보 보호가 중요한 산업은 원본 오디오나 비디오를 제3자 API로 전송할 수 없습니다. 데이터를 방화벽 내에 유지함으로써, MiMo-V2.5는 이러한 조직이 데이터 보호 규정을 준수하면서도 AI 기반의 통찰력을 얻을 수 있도록 합니다. 잠재적인 활용 분야는 다음과 같습니다:
- 회의 인텔리전스: 별도의 전사(transcription) 단계 없이 전체 비디오 녹화물을 분석하여 결정 사항, 실행 항목 및 화자의 감정을 파악합니다.
- 콜센터 분석: 통화자의 목소리에서 좌절감, 망설임 또는 자신감을 실시간으로 감지합니다.
- 온디바이스 어시스턴트: 오디오를 클라우드로 전송하지 않고도 어조를 이해하고 비언어적 신호에 반응하는 음성 인터페이스를 구축합니다.
실질적인 과제
MiMo-V2.5의 잠재력은 오디오 및 비디오 인코더의 성능에 달려 있습니다. 이 구성 요소들은 아직 저자에 의해 벤치마크되지 않았습니다. 기업은 실제 운영에 도입하기 전에 자체 데이터셋을 사용하여 지연 시간, 정확도 및 하드웨어 소비량을 검증해야 합니다. 텍스트만 필요한 팀은 컴퓨팅 및 비용 측면에서 더 작은 텍스트 전용 모델이 더 효율적이라고 느낄 것입니다. MiMo-V2.5의 오픈 웨이트 특성상 코드와 가중치는 공개되어 있습니다. 이는 심도 있는 커스텀을 가능하게 하지만, 스택을 유지 관리하고 보안을 유지하기 위한 내부 전문 지식을 요구합니다.
시사점
MiMo-V2.5는 네이티브 미디어 토큰화, 거대한 컨텍스트 창, 그리고 명확한 토큰당 비용을 통한 셀프 호스팅을 제공합니다. 원본 오디오와 비디오를 내부적으로 유지해야 하는 개인정보 민감 조직에게는 실행 가능한 파일럿 경로를 제공합니다. 실제 가치는 오디오 및 비디오 인코더가 기업용 워크로드에서 얼마나 잘 작동하는지, 그리고 셀프 호스팅의 운영 오버헤드가 기존 AI 팀의 기술 역량 범위 내에 있는지에 따라 달라질 것입니다.
