Xiaomi의 새로운 MiMo-V2-Flash 모델은 3,090억 개의 파라미터를 가진 전문가 혼합(MoE) 시스템으로, 유사한 모델 대비 1/50 미만의 연산량을 사용하면서도 SWE-Bench 오픈 소스 리더보드에서 73.4%의 정확도로 1위를 차지했습니다. 이 결과는 대규모 언어 모델 연구의 표준이 되어버린 막대한 에너지 비용 없이도 최상위 성능을 구현할 수 있음을 보여줍니다.
Xiaomi가 MoE를 선택한 이유
MoE 아키텍처는 공유 백본에 많은 "전문가(expert)" 서브 네트워크를 연결함으로써 비용 문제를 우회합니다. 이 모델은 전체 3,090억 개의 파라미터를 저장하지만, 각 토큰에 대해서는 약 150억 개만 활성화합니다. 이러한 선택적 활성화는 추론 메모리와 연산량을 대폭 절감하여, FP16 모드에서 618GB의 VRAM을 갖춘 약 10대의 H100 GPU만으로도 모델을 실행할 수 있게 합니다.
실용성을 높여주는 엔지니어링 기법
- 하이브리드 어텐션 패턴(Hybrid attention pattern) – 대부분의 레이어는 슬라이딩 윈도우 어텐션(sliding-window attention)을 사용하여 어텐션 행렬을 각 토큰 주변의 좁은 범위로 제한합니다. 6번째 레이어마다 글로벌 어텐션(global attention)으로 전환하여, 메모리 사용량을 폭증시키지 않으면서도 장기 의존성(long-range dependencies)을 포착합니다. 이 패턴은 메모리 사용량을 6분의 1로 줄여줍니다.
- 고속 디코딩 모듈(Fast decoding module) – 내장된 예측기가 단 한 번의 포워드 패스(forward pass)에서 여러 토큰을 생성하여, 표준 자기회귀(autoregressive) 디코딩보다 최대 2.6배 빠른 생성 속도를 제공합니다.
- 256K 컨텍스트 윈도우(context window) – 이 아키텍처는 25만 개의 토큰 입력을 처리할 수 있어 코드베이스, 연구 논문 또는 기타 긴 문서를 다루는 데 유용합니다.
이러한 구성 요소들 덕분에 3,090억 규모의 시스템으로는 감당하기 어려웠던 하드웨어에서도 모델을 사용할 수 있습니다.
다중 교사 온-폴리시 증류 (Multi-Teacher On-Policy Distillation, MOPD)
MOPD는 수학용, 프로그래밍용 등 다양한 전문 분야를 가진 여러 '교사(teacher)' 모델을 사용하여 학생 모델인 MiMo-V2-Flash를 학습시킵니다. 학생 모델이 스스로 응답을 생성하는 동안 모든 교사로부터 동시에 피드백을 받습니다. 학생 모델이 실제로 생성하게 될 분포로부터 학습하기 때문에, 증류(distillation) 과정이 안정적으로 유지되며 지식 전이가 실제 작업에 집중될 수 있습니다.
MOPD는 전통적인 방식에 필요한 연산량의 1/50 미만을 소비합니다.
벤치마크 성능
| 벤치마크 | 점수 |
|---|---|
| SWE-Bench (코딩) | 73.4% |
| GPQA-Diamond (일반 QA) | 83.7% |
| MMLU-Pro (멀티태스크 언어 이해) | 84.9% |
| Arena-Hard (적대적 채팅) | 86.2% |
여전히 남아있는 트레이드오프(trade-offs)
MoE를 통한 절감 효과에도 불구하고, MiMo-V2-Flash를 실행하는 것은 노트북으로 할 수 있는 작업이 아닙니다. 배포를 위해서는 여전히 약 10대의 H100 GPU가 필요하며, 618GB의 VRAM 요구 사양으로 인해 고속 상호 연결(interconnects)을 갖춘 데이터 센터 환경으로 사용이 제한됩니다.
향후 주목할 점
핵심 요약: MiMo-V2-Flash는 영리한 학습 파이프라인과 모듈형 아키텍처를 통해, 지난 수년간 대규모 언어 모델 개발의 특징이었던 통제 불능의 연산 비용 없이도 최상위 성능을 낼 수 있음을 증명했습니다. 다음 과제는 이러한 성능을 자금력이 풍부한 연구소 너머의 누구라도 감당할 수 있을 만큼 저렴하게 만드는 것입니다.
