多くのクリエイティブ・ソフトウェアは、依然としてアイデアと完成したファイルの間には人間が必要であると考えています。AIにビデオ編集の内容を説明することはできても、クリップのトリミング、レイヤーの調整、フレームのエクスポートといった実際の作業は、通常、人間に委ねられます。そのギャップが存在するのは、メディア編集が単一のプロンプトとレスポンスだけで完結するタスクではないからです。それは、ステップ2が実際にタイムラインを変更して初めてステップ3が意味を成すような、依存関係のある意思決定の長い連鎖なのです。最近共有されたあるプロジェクトは、Claude CodeをGemini Interactions APIによるステートフルなビデオ編集パイプラインに組み込むことで、まさにこの摩擦に対処しています。その結果、AIエージェントに単にワークフローを提案させるのではなく、真にクリエイティブなワークフローを指揮させる方法の実用的なデモンストレーションが実現しました。

ディレクターとエディター

アーキテクチャは意図的に分割されています。Claude Codeはディレクターとして機能し、ハイレベルなプランニング、曖昧なクリエイティブ・ブリーフの解釈、そして次に何を行うべきかの決定を担当します。それは「無音部分をカットしてタイトルカードを追加して」といったリクエストを個別のタスクに分解し、次のステップに進む前に各タスクが成功したかどうかを監視します。

Gemini Interactions APIは、専門的な編集ロジックを担当します。汎用モデルにビデオエディターのシミュレーションを強いるのではなく、この構成ではGoogleのAPIを、カットを実行し、タイムラインの状態を評価し、具体的な結果を報告する実務担当者(オペレーター)として使用しています。システムはこれら両方の役割を単一のモデルに集約させません。推論レイヤーとツール使用レイヤーを分離して維持することで、各パーツがそれぞれの得意分野に集中できるようにしています。

この分割は、実際のポストプロダクション・チームの機能方法を反映しています。ディレクターはストーリーを把握し、決断を下します。エディターはソフトウェアを熟知し、ピクセルを操作します。エージェントが単一のコンテキストウィンドウ内で両方を行おうとすると、構文でつまずいたり、どのクリップがどのトラックにあるかを忘れたりすることがよくあります。負荷を分散することで、この問題が解決されます。

なぜ「メモリ」がすべてを変えるのか

ビデオ編集は本質的にステートフル(状態保持型)です。クリップを4秒短縮した場合、その後のすべてのトランジション、オーディオキュー、字幕の配置がそれに合わせて移動しなければなりません。ほとんどのAIエージェントは、各ステップを独立したクエリとして扱うため、ここで苦戦します。あるレスポンスでカットを推奨した後に、次のレスポンスで異なるタイムラインをハルシネーション(捏造)したり、もはや存在しないセグメントに対してエフェクトを提案したりすることがあります。

Gemini Interactions APIは、これらの操作にわたって状態を維持するように構築されています。エージェントが作業を進める中で、プロジェクトの実際の状態を追跡します。つまり、システムはエクスポートが失敗したか、クリップがすでに処理されたか、あるいはカラーグレーディングが適用されたかを知っているということです。Claudeが次の指示を出すとき、それは推測ではなく、タイムラインの実際の現在の状態に基づいて動作します。

AIが、前の4つのステップを完全に無視した「簡単な」5ステップの修正策を自信満々に提案するのを見たことがある人にとって、永続的な状態(persistent state)の価値は明らかです。メモリ(記憶)がなければ、クリエイティブなタスクはすぐに質が低下します。ステートフルなバックエンドは、チャットボットを、実際に仕事を完遂できる「参加者」へと変貌させます。

ワークフローのイメージ

実用的なシーケンスを想像してみてください。システムにいくつかの生素材(raw clips)を入力し、完成したソーシャルメディア向けのカットを依頼します。Claude Codeはまずリクエストを評価します。映像のスタビライズ、次にボイスオーバーの抽出、次に字幕、そして垂直方向のクロップが必要だと判断するかもしれません。これらをプランとして構造化し、Gemini Interactions APIを呼び出して各項目を順番に実行し始めます。

Geminiはメディア操作を実行し、構造化されたフィードバックを返します。例えば、スタビライズには成功したものの、オーディオ分離の結果、対話が重なっていて字幕の信頼性が低いことが判明したとします。Claudeはその更新を受け取り、プランを修正し、テキストオーバーレイを生成する前に話者のセグメントを特定するなど、Geminiに別の方法を試すよう求めます。APIが状態を保持しているため、字幕トラックが元の揺れる映像ではなく、新しくスタビライズされたビデオと一致していることを確認できます。

このループは、チェックリストが完了するまで続きます。システムは、単発のスクリプト生成ではなく、複雑なビデオタスクのための真のワークフローを構築します。コーデック設定の不一致でレンダリングが失敗した場合、そのエラーはClaudeにフィードバックされ、Claudeはパラメータを調整して再試行できます。エージェントは、最初の障害にぶつかったからといってプロジェクトを放棄することはありません。

強みを活かすための異なるモデルの活用

このプロジェクトは、AIエンジニアリングにおけるより広範なデザインパターンを示しています。それは、「一つのモデルにすべてをやらせようとするのをやめる」ということです。Claude Codeは、曖昧な指示の推論、分岐ロジックの管理、そして長いセッションにわたる会話コンテキストの維持に長けています。一方、Gemini Interactions APIは、特にリッチメディアとのやり取りやツール利用において、深いマルチモーダル機能とステートフルな実行能力をもたらします。これらを組み合わせることで、それぞれの限界を回避することができるのです。

非線形エディタに触れたことのない推論モデルであっても、コーデック、キーフレーム、トラックの階層構造を理解する実行レイヤーにアクセスできれば、素晴らしいカットを指示することができます。逆に、メディアに精通したAPIは、プランナーモデルが抽象的なクリエイティブ・ノートを具体的なステップに翻訳済みであれば、それらを解析する必要はありません。一方の強みが、もう一方の弱みを補うのです。

これは理論上の話ではありません。このセットアップは、単一モデルのエージェントでは完遂できないことが多い「クリエイティブなビデオ編集」というカテゴリーの作業を、異なるAIモデルがどのように連携して処理するかを明確に示しています。エージェント型システムを構築する開発者にとって、この教訓は無視できないものです。オーケストレーション層にスペシャリストであることを求めず、スペシャリストに戦略家であることを求めてはいけません。

ビルダーが学ぶべきこと

このパターンを役立てるために、ビデオスタジオを運営する必要はありません。変化する環境下での多段階の作業を必要とするあらゆるドメイン(CADワークフロー、オーディオエンジニアリング、データ視覚化、科学計算など)において、同じ構造を応用できます。一つのモデルが永続的なプロジェクトマネージャーとして機能し、専門的なAPIやツールがドメイン固有のソフトウェア内でのステートフルな操作を処理します。

開発者の役割は、「モデルがすべてを覚えていることを祈るような巨大なプロンプトを書くこと」から、「推論と実行の間のクリーンな受け渡し(handoff)を設計すること」へとシフトします。ステート管理が極めて重要な要素となります。もしエージェントが、自身の直前の動作によって何が変わったのかを把握できなければ、再び確実に動作することはできません。

統合がどのように機能するかについての詳細な内訳(具体的なAPIのやり取りやプロジェクト構造を含む)は、dev.to の詳細な記事で読むことができます。

真の教訓

AIで複雑なクリエイティブ作業を解決するために、計画、記憶、実行のすべてを一度に行える単一の完璧なモデルを待つ必要はありません。必要なのは、ステップ間で維持されるメモリ(記憶)と、実際に委任できるスペシャリストをエージェントに与えることです。考えるものには考えさせ、編集するものには編集させるのです。