Flux 3は、Black Forest Labsの最新の動画生成モデルであり、音声内蔵の20秒間のクリップを作成できます。同ラボ独自のベンチマークによれば、競合する主要なあらゆるモデルを打ち負かしています。内部テストにおいて、Flux 3はLuma Ray 3.2に対して93%の支持を得て、同モデルが上回るよう設計されたSeedance 2.0に対しても52%の優位性を示しました。

なぜこの数字が重要なのか

BFL Testsと呼ばれるBFLのベンチマークは、一連のプロンプトを用いてモデルを並べて比較し、どの出力がより優れているかを人間の評価者に判断させるものです。Flux 3は、あらゆる項目でリストのトップに立ちました。

  • Luma Ray 3.2を93%上回る
  • Runway Gen-4.5を77%上回る
  • Grok Imagine Videoを69%上回る
  • Kling v3 Proを60%上回る
  • Seedance 2.0およびGemini Omni Flashを52%上回る

もしこの結果が裏付けられれば、開発者やコンテンツクリエイターは、text-to-video、image-to-video、video-to-videoを一つのパッケージで処理できる単一のモデルに集約していく可能性があり、複数のツールを組み合わせる必要性が減少することになります。

その主張を支える技術

Flux 3は、画像、ビデオフレーム、オーディオトラックを同時に取り込むトレーニング手法「Self-Flow」を導入しています。また、言語が混在する複雑なプロンプトにも対応しており、単一のクリップ内で多言語による対話を可能にすると主張しています。Clip chaining機能により、ユーザーは複数の20秒間のセグメントを連結してより長い物語を作成でき、これは従来の生成モデルに共通していた制限を解消するものだとBFLは述べています。

メディア制作の枠を超えて

BFLの取り組みは、純粋なコンテンツ生成に留まりません。Mimic Roboticsとの提携により、物理的なロボットの動作を提案できるモデルのバージョン「Flux-mimic」が誕生しました。Audiはこのビデオ・アクション変種を生産ラインのタスク向けにテストしており、生成AIが単なるエンターテインメントだけでなく、現実世界のオペレーションに活用される未来を予感させています。

不足している要素

これらすべての熱狂は、BFLの内部テストに基づいています。第三者によるベンチマークは公開されておらず、好感度スコアの背後にある手法も公開されていません。外部の研究所がこれらの結果を再現できるまでは、Flux 3が明確なリーダーであるという主張は暫定的なものに留まります。

今後の注目点

  • 独立した評価 – 研究機関や学術グループが独自の比較を行う可能性が高く、BFLの数値との乖離があれば市場の認識を左右することになります。
  • アーリーアクセス版の展開 – BFLは数週間以内にFlux 3の画像生成バージョンをリリースし、エコシステムを拡大する計画です。
  • Audiの生産現場での結果 – Flux-mimicの試行による具体的な成果は、生成ビデオがロボットの動作を確実にガイドできるかどうかを示す指標となるでしょう。