新しいGoogle Vidsインターフェースを通じてアクセスできるGoogleのGemini Omniは、3回連続のビデオ編集後でも、単一の被写体(配達員)を安定して維持できるかどうかを確認するため、実地ラボテストが行われました。

このテストが重要である理由

生成ビデオツールは、テキストコマンド一つで背景を入れ替えたり、照明を追加したり、エフェクトを散りばめたりできることを約束しています。クリエイターにとって、その約束はシンプルです。生のクリップから始めて、「夜に雨を降らせて」と入力するだけで、洗練されたショート動画が手に入ります。しかし、ほとんどのユーザーは「ドリフト(drift)」という隠れたコストに気づいていません。これは、AIが新しい指示を解釈するたびに、元の被写体の外見、ポーズ、動きが徐々に失われていく現象です。もし2回目の編集後に配達員の顔が微妙に変わってしまうと、最終的な作品はプロフェッショナルとは言えず、コストのかかる手作業による修正が必要になる可能性があります。

実験内容

ベースライン・クリップ – ネイビーのウィンドブレーカーを着用し、左手に小さな段ボール箱を持ち、カメラに向かって2歩歩く人物を、固定カメラでスタジオ撮影したもの。照明は均一で、背景は無地、動きは単純なものです。

編集シーケンス – 以下の3つの編集を順番に適用しました:

  1. 背景の入れ替え – スタジオを、夜の雨が降る街路に置き換える。
  2. 照明の微調整 – 配達員の周囲に青いリムライトを追加し、ショップの窓から温かい光を当てる。
  3. 雰囲気のレイヤー – 軽い雨粒と薄い湯気を散りばめる。

「ダイレクトコントロール」ランでは、これら3つの指示を単一のプロンプトにまとめ、AIに一度のプロセスで最終的なクリップを生成させました。

一貫性のスコアリング方法

スコアカードは12の基準で構成され、4つのテーマに分類されています:

  • キャラクターの安定性 – 顔、髪、服装が同一のまま維持されている。
  • シーンの安定性 – カメラアングルと被写体の位置が固定されている。
  • 編集の精度 – AIが他の要素を変更することなく、指示に従っている。
  • 時間的な品質 – 動きの最中にフリッカー(ちらつき)、歪み、ジッター(小刻みな震え)が発生していない。

各クリップは、最初のフレーム、2歩の歩行の中間地点、および最後のフレームで評価されました。スコアリングの結果、明確なパターンが明らかになりました。

数値が示すこと

編集を重ねて行った場合、AIはスコアカードを用いて評価されました。単一プロンプトによるコントロール群も、同様の評価を受けました。

勝者と敗者

単一の包括的なプロンプトを使いこなせるスタジオは、よりスムーズなワークフローを手にします。一方で、生成ビデオシステムの開発者は、明確なエンジニアリング上の課題に直面しています。それは、連続的な変換プロセスにおいて、被写体の安定した潜在表現(latent representation)を維持する必要性です。

反論

ユーザーの中には、段階的な編集の方がより高いクリエイティブなコントロールが可能であると主張する人もいます。一度に一つの要素を調整することで、次のステップに進む前に各レイヤーを微調整できるからです。しかし、このテストは、その柔軟性が視覚的な忠実度(fidelity)を損なうことを示しています。もしクリエイターが、きめ細かなコントロールのために被写体のわずかな変化を受け入れるのであれば、現在のGemini Omniのワークフローは依然として有効かもしれません。

今後の注目点

  • プロンプト間で被写体の潜在コード(latent code)を固定するモデルの改良
  • クリエイターがドリフトを報告し、被写体の「再固定(re-anchor)」を要求できるようにするユーザーフィードバック・ループ

まとめ

Gemini Omniは、一連の指示を一度に与えれば、洗練されたマルチ要素のビデオを生成できますが、編集を重ねると被写体の忠実度が低下します。