MiniMaxがH3ビデオ生成モデルのウェイトをHugging Faceに公開しました。これにより、適切なGPUがあれば誰でもコアシステムをダウンロードできます。今回のリリースは完全な商用パイプラインではなく、オープンウェイトとなっているのはH3-Base generatorのみです。前処理とアップスケーリングのステージはAPI経由での提供に留まっています。
オープンウェイト版の実際の構成
MiniMaxのH3アーキテクチャは3つの論理ブロックに分かれています。API限定となっているのは以下の2つです:
- Context-IR layer – 入力テキスト、画像、またはビデオスニペットを前処理します。
- Regenerate-2K layer – 出力を高解像度(2K)ビデオに引き上げます。
開発者は、マルチモーダルなプロンプトを、ネイティブオーディオ付きの短辺768ピクセルのビデオクリップに変換するエンジンである H3-Base core generator をダウンロードできます。
ハードウェアと実行環境の実態
このモデルは330億のパラメータを持ち、2つのバリエーションで提供されます:
- fl2va – テキストと画像プロンプトを受け付けます。
- ref2va – プロンプトの一部としてリファレンスビデオを受け付けます。
最小の量子化チェックポイントは約 21 GB、フル精度のチェックポイントは 123.6 GB です。MiniMaxは、快適な動作のために少なくとも 42.5 GB のVRAMまたはストレージを推奨しています。
12 GBのGPU では、CPUオフローディングを使用してモデルを実行できますが、推論速度は著しく低下します。ローカルでの生成は短辺768 pxが上限であり、専用のRegenerate-2K layerが提供する2K解像度には遠く及びません。
なぜこのリリースが重要なのか
Artificial Analysisの最新のランキングでは、H3は「ビデオ編集」カテゴリで1位、さらに「text-to-video」と「image-to-video」の両方でトップ3に入っています。これらのスコアにより、H3は現在利用可能なオープンウェイトのビデオモデルの中で最も有能なものとなっています。
このモデルはマルチモーダルです。テキスト、画像、ビデオ、オーディオを理解し、同期されたサウンドを伴うビデオを合成できます。これは、公開されているウェイトセットとしては、非常に稀な広範な能力です。
限界と別の側面
H3がどこでも勝てるわけではありません。特定のタスクではGemini Omni Flashの方が優れています。高解像度のアップスケーリングはAPI経由であるため、開発者はMiniMaxのサービスに料金を支払わなければ、完全な商用出力を得ることはできません。
ライセンスも別の障壁となります。利用規約では、欧州連合(EU)、英国、韓国、および米国 での使用が明示的に禁止されています。これらの地域の組織は、別途商用契約を交渉するか、他の手段を探す必要があります。
要点: MiniMaxのオープンウェイトH3は、開発者にローカルで実行可能な強力なマルチモーダルビデオジェネレーターを提供しますが、API限定の前処理とアップスケーリング、膨大なハードウェア要件、そして地域的なライセンス禁止により、多くのユーザーにとって完全な商用体験は手の届かないものとなっています。
