MiniMax가 Hugging Face에 H3 비디오 생성 모델의 가중치(weights)를 공개했습니다. 이제 적절한 GPU를 보유한 사람이라면 누구나 핵심 시스템을 다운로드할 수 있습니다. 이번 공개는 전체 상용 파이프라인을 모두 포함하지는 않습니다. H3-Base 생성기만 오픈 웨이트(open-weight)로 제공되며, 전처리 및 업스케일링 단계는 API를 통해서만 이용할 수 있습니다.
오픈 웨이트 공개에 실제로 포함된 내용
MiniMax의 H3 아키텍처는 세 개의 논리적 블록으로 나뉩니다. 그중 API로만 제공되는 두 가지는 다음과 같습니다:
- Context-IR layer – 입력 텍스트, 이미지 또는 비디오 스니펫을 전처리합니다.
- Regenerate-2K layer – 출력을 고해상도(2K) 비디오로 업스케일링합니다.
개발자는 멀티모달 프롬프트를 네이티브 오디오가 포함된 짧은 쪽 가장자리 768픽셀의 비디오 클립으로 변환하는 엔진인 H3-Base core generator를 다운로드할 수 있습니다.
하드웨어 및 런타임 현실
이 모델은 330억 개의 파라미터를 포함하며 두 가지 버전으로 제공됩니다:
- fl2va – 텍스트 및 이미지 프롬프트를 지원합니다.
- ref2va – 프롬프트의 일부로 참조 비디오를 지원합니다.
가장 작은 양자화된 체크포인트는 약 21GB이며, 전체 정밀도(full-precision) 체크포인트는 123.6GB입니다. MiniMax는 원활한 작동을 위해 최소 42.5GB의 VRAM 또는 저장 공간을 권장합니다.
12GB GPU 환경에서 개발자는 CPU 오프로딩을 통해 모델을 실행할 수 있지만, 추론 속도가 눈에
