新しいGoogle Vidsインターフェースを通じてアクセスできるGoogleのGemini Omniは、3回連続のビデオ編集後でも、単一の被写体(配達員)を安定して維持できるかどうかを確認するため、実地ラボテストが行われました。
このテストが重要である理由
生成ビデオツールは、テキストコマンド一つで背景を入れ替えたり、照明を追加したり、エフェクトを散りばめたりできることを約束しています。クリエイターにとって、その約束はシンプルです。生のクリップから始めて、「夜に雨を降らせて」と入力するだけで、洗練されたショート動画が手に入ります。しかし、ほとんどのユーザーは「ドリフト(drift)」という隠れたコストに気づいていません。これは、AIが新しい指示を解釈するたびに、元の被写体の外見、ポーズ、動きが徐々に失われていく現象です。もし2回目の編集後に配達員の顔が微妙に変わってしまうと、最終的な作品はプロフェッショナルとは言えず、コストのかかる手作業による修正が必要になる可能性があります。
実験内容
ベースライン・クリップ – ネイビーのウィンドブレーカーを着用し、左手に小さな段ボール箱を持ち、カメラに向かって2歩歩く人物を、固定カメラでスタジオ撮影したもの。照明は均一で、背景は無地、動きは単純なものです。
編集シーケンス – 以下の3つの編集を順番に適用しました:
- 背景の入れ替え – スタジオを、夜の雨が降る街路に置き換える。
- 照明の微調整 – 配達員の周囲に青いリムライトを追加し、ショップの窓から温かい光を当てる。
- 雰囲気のレイヤー – 軽い雨粒と薄い湯気を散りばめる。
「ダイレクトコントロール」ランでは、これら3つの指示を単一のプロンプトにまとめ、AIに一度のプロセスで最終的なクリップを生成させました。
一貫性のスコアリング方法
スコアカードは12の基準で構成され、4つのテーマに分類されています:
- キャラクターの安定性 – 顔、髪、服装が同一のまま維持されている。
- シーンの安定性 – カメラアングルと被写体の位置が固定されている。
- 編集の精度 – AIが他の要素を変更することなく、指示に従っている。
- 時間的な品質 – 動きの最中にフリッカー(ちらつき)、歪み、ジッター(小刻みな震え)が発生していない。
各クリップは、最初のフレーム、2歩の歩行の中間地点、および最後のフレームで評価されました。スコアリングの結果、明確なパターンが明らかになりました。
数値が示すこと
編集を重ねて行った場合、AIはスコアカードを用いて評価されました。単一プロンプトによるコントロール群も、同様の評価を受けました。
勝者と敗者
単一の包括的なプロンプトを使いこなせるスタジオは、よりスムーズなワークフローを手にします。一方で、生成ビデオシステムの開発者は、明確なエンジニアリング上の課題に直面しています。それは、連続的な変換プロセスにおいて、被写体の安定した潜在表現(latent representation)を維持する必要性です。
反論
ユーザーの中には、段階的な編集の方がより高いクリエイティブなコントロールが可能であると主張する人もいます。一度に一つの要素を調整することで、次のステップに進む前に各レイヤーを微調整できるからです。しかし、このテストは、その柔軟性が視覚的な忠実度(fidelity)を損なうことを示しています。もしクリエイターが、きめ細かなコントロールのために被写体のわずかな変化を受け入れるのであれば、現在のGemini Omniのワークフローは依然として有効かもしれません。
今後の注目点
- プロンプト間で被写体の潜在コード(latent code)を固定するモデルの改良。
- クリエイターがドリフトを報告し、被写体の「再固定(re-anchor)」を要求できるようにするユーザーフィードバック・ループ。
まとめ
Gemini Omniは、一連の指示を一度に与えれば、洗練されたマルチ要素のビデオを生成できますが、編集を重ねると被写体の忠実度が低下します。
