Timeline Studioは、Reactで構築されたオープンソースのビデオエディターであり、すべてのAI機能を完全にブラウザ内で実行できるようになりました。開発者のコードにより、ユーザーはファイルをリモートサーバーに送信することなく、ボイスオーバーの生成、音声の文字起こし、被写体の検出、トーキングポートレート(話す肖像画)の作成、そして完成したクリップのエクスポートを行うことができます。

なぜローカルファーストのエディターが重要なのか

一般的なAI搭載ビデオツールは、生の映像をクラウドサービスにストリーミングし、サーバーが音声文字起こしモデル、画像解析パイプライン、またはディープフェイク生成器を実行するのを待ちます。この往復通信は数秒から数分の遅延を生じさせ、ユーザーは潜在的に機密性の高いメディアを第三者に預けることを余儀なくされます。Timeline Studioは、すべての計算をクライアントデバイス上で行うことで、これらのプライバシーに関する懸念を解消し、クラウドベースの推論に伴う継続的なコストを回避します。

ブラウザがいかにして計算エンジンとなったか

ウェブページ上で重量級のニューラルネットワークを実行することは、単にモデルファイルをロードすれば済むという問題ではありません。ブラウザはメモリ、CPU使用率、およびスレッドスケジューリングに対して厳しい制限を課しています。開発者は、実装を成功させるためには、ブラウザを本格的なオペレーティングシステムとして扱う必要があることを見出しました。つまり、メモリを慎重に割り当て、データをインテリジェントにキャッシュし、作業をバックグラウンドスレッドにオフロードする必要があるのです。

主要なエンジニアリング手法

  • タスク固有のモデルパス – AIのタスクごとに、最も適したランタイムを使用します。音声文字起こしにはWebAssembly (WASM) にコンパイルされたWhisperを使用し、ニューラルポートレート生成器にはブラウザの新しいグラフィックス・コンピューティングAPIであるWebGPUを使用します。
  • 重い処理のためのWeb Workers – モデルの推論、オーディオのデコード、その他のCPU負荷の高いステップは、専用のワーカーで実行されます。UIスレッドの応答性が維持されるため、タイムラインのスクラブ操作によって画面がフリーズすることはありません。
  • モデルの遅延読み込み(Lazy-loading) – ユーザーが対応する機能を使用するときにのみ、エディターはモデルをダウンロードします。そのため、新規インストール時でも数百メガバイトのデータを待つことなく、数秒でロードが完了します。
  • 時間的な事前解析 – 単一のフレームを検査するのではなく、コードが一定の間隔でビデオをサンプリングし、人物の動きに合わせて更新される被写体マップを構築します。これにより、クリップ全体を通して検出の精度を維持します。
  • WebGPU向けのカスタム数学 – 元のポートレート・パイプラインは、WebGPUがサポートしていない5次元のサンプリング操作に依存していました。開発者はそれらのカーネルを4次元の同等物に書き換え、厳格な数値誤差のしきい値に対して検証を行いました。
  • Service-workerによるキャッシュ – モデルが一度取得されると、サービスワーカーがブラウザのキャッシュに保存します。次回のセッションからは即座にロードされるため、巨大なバイナリブロブの繰り返しダウンロードを回避できます。

ローカルに留まることの代償

ローカルファーストのAIは、負荷をクラウドプロバイダーからユーザーのデバイスへと転換させます。モデルはディスク容量を占有し、実行中はRAMを消費するため、低スペックの端末では問題になる可能性があります。サービスワーカーのキャッシュは、繰り返されるネットワークトラフィックを軽減します。

今後の注目点

このプロトタイプは、最新のブラウザが高度なメディア・インテリジェンス・パイプラインをホストできることを示していますが、このアプローチは依然としてWebGPUのような新しい標準規格に依存しています。

要点: ブラウザをフルスタックの計算プラットフォームとして扱い、ワーカー間で作業を分割し、モデルをキャッシュし、各AIタスクを最も効率的なランタイムに合わせて最適化することで、Timeline Studioは、完全ローカルのAIビデオエディターが単に実現可能であるだけでなく、スピードとプライバシーを重視する日常的なクリエイターにとって実用的なものであることを証明しています。