Xiaomi가 오디오, 이미지, 비디오를 네이티브 토큰으로 처리하고 105만 토큰의 컨텍스트 창을 제공하는 오픈 웨이트(open-weight) 멀티모달 모델인 MiMo V2.5를 출시했습니다. 가격표에 따르면 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러로, 단일 프롬프트로 긴 회의나 비디오 스트림을 실행하는 것이 경제적으로 가능합니다.
“오픈 웨이트”가 중요한 이유
대부분의 멀티모달 AI는 별도의 프론트엔드, 즉 음성-텍스트 변환(speech-to-text) 엔진과 이미지 캡셔닝 모델을 결합한 뒤 그 결과물인 텍스트를 대규모 언어 모델(LLM)에 입력하는 방식을 사용합니다. 이 경우 LLM은 원본 파형이나 픽셀 데이터를 직접 볼 수 없으므로 어조, 일시 정지, 제스처와 같은 미묘한 차이가 손실될 수 있습니다. Xiaomi는 MiMo V2.5가 오디오와 비디오를 직접 입력받아 타이밍, 억양, 시각적 단서를 보존한다고 주장합니다. 이론적으로 이는 모델이 전화 통화 중의 한숨을 감지하거나, 화이트보드의 스케치를 따라가거나, 중간 전사(transcription) 단계 없이 겹치는 화자를 구별할 수 있게 해줍니다.
모델의 가중치(weights)가 공개되어 있으므로 조직은 이를 다운로드하여 온프레미스(on-premise)에서 실행할 수 있습니다. 이는 의료 및 금융과 같이 규제가 엄격한 분야에서 기피하거나 금지하는 방식인 원본 미디어를 클라우드 API로 전송하는 관행을 피할 수 있게 해줍니다.
주요 기술 지표
- 컨텍스트 창: 105만 토큰, 수 시간 분량의 회의나 전체 다큐멘터리를 한 번의 요청에 담기에 충분함.
- 가격: 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러.
- 모달리티: 오디오, 이미지, 비디오 및 표준 텍스트 처리.
거대한 컨텍스트 창이 핵심입니다. 기존 LLM은 수천 토큰 수준에서 제한되어 있어 개발자가 긴 녹음 파일을 조각내거나 비디오를 짧은 클립으로 나누어야 했습니다. MiMo V2.5를 사용하면 단일 프롬프트에 수 시간 분량의 회의 내용을 자르지 않고 그대로 포함할 수 있습니다.
텍스트 엔진 직접 살펴보기
오디오 및 비디오 파이프라인은 아직 독립적인 벤치마크를 거치지 않았지만, 텍스트 코어는 간단한 검증(sanity check)을 통과했습니다.
- 코딩: 모델이 고전적인 “구간 병합(merge intervals)” 문제를 해결하고
O(n log n)복잡도의 알고리즘을 생성하여, 알고리즘적 제약 조건을 이해할 수 있음을 보여주었습니다. - 추론: 다단계 수학 문장제를 네 단계의 깔끔한 계산으로 풀어내며 사고의 사슬(chain-of-thought) 능력을 입증했습니다.
- 구조화된 출력: 송장 이미지 설명을 입력받아 품목, 합계, 날짜가 포함된 올바른 형식의 JSON 객체를 생성했습니다.
동일한 트랜스포머(transformer) 아키텍처가 멀티모달 경로의 기반이 되기 때문에 탄탄한 텍스트 기반이 중요합니다. 언어 측면이 흔들리면 오디오나 비디오 단서를 융합하는 모델의 능력도 제한될 것입니다.
프라이버시 우선 유스케이스
원본 미디어를 내부적으로 유지해야 하는 기업은 이제 다음과 같은 단일 자체 호스팅 스택을 구상할 수 있습니다.
- 회의 인텔리전스: 녹음 파일을 제3자 서비스로 보내지 않고도 요약, 실행 항목 추출, 화자 식별 및 감성 분석 가능.
- 콜 분석: 스트레스, 좌절감 또는 규정 준수 관련 키워드를 실시간으로 감지.
- 음성 인터페이스: 어조를 이해하고 적절한 음성 억양으로 응답할 수 있는 챗봇 구축.
- 비디오 분석: 웨비나 중 제스처, 슬라이드 변경 또는 화면상의 그림 인식.
세 개의 별도 벤더 솔루션을 하나의 모델로 대체하면 통합 오버헤드가 줄어들고 데이터 유출 지점이 감소합니다.
주의 사항 및 확인 사항
오디오 및 비디오 기능은 제조사의 주장일 뿐이며, 아직 독립적인 측정 결과는 발표되지 않았습니다. 도입을 고려하는 사용자는 실제 워크로드에 적용하기 전에 대표 데이터셋을 사용하여 자체 벤치마크를 실행해야 합니다.
가격은 투명하지만 토큰 단위로 부과됩니다.
향후 주목할 점
- 벤치마크 발표: 오디오/비디오 토큰화 품질, 지연 시간(latency), 메모리 점유율에 대한 제3자 평가.
- 툴링 생태계: MiMo V2.5로 직접 데이터를 공급하는 인기 오디오 코덱 및 비디오 컨테이너용 오픈 소스 어댑터.
- 규제 피드백: 데이터 프라이버시 규제 기관이 클라우드 API와 비교했을 때 자체 호스팅되는 오픈 웨이트 모델을 충분한 보호책으로 간주할지 여부.
- 커뮤니티 기여: 가중치가 공개되어 있으므로 커뮤니티에서 특정 도메인(예: 의료 받아쓰기, 법률 증언)에 맞춰 모델을 미세 조정(fine-tune)할 수 있습니다.
MiMo V2.5는 논의의 흐름을 단순한 “멀티모달 접착제”에서 기업 방화벽 내부에서 구동 가능한 “멀티모달 두뇌”로 전환시킵니다. 오픈 웨이트(open-weight) 특성은 개인정보 보호에 민감한 조직의 진입 장벽을 낮춰주지만, 약속된 오디오/비디오 충실도(fidelity)는 여전히 검증이 필요합니다. 독립적인 테스트를 통해 해당 주장이 입증되기 전까지, 이 모델의 가장 큰 강점은 거대한 컨텍스트 윈도우와 여러 AI 서비스를 단일 셀프 호스팅 스택으로 통합할 수 있는 가능성입니다.
