タイトル: Latent Identity Tuningにより、精密な顔の編集が可能に
研究者たちは、被写体のアイデンティティを維持したまま、text-to-imageジェネレーターの顔の特徴を編集できる技術「Latent-Identity Tuning」を発表しました。この手法は、追加のトレーニングを行うことなく動作します。
ほとんどの拡散ベース(diffusion-based)のtext-to-imageモデルは、眉の形を変える、鼻の位置をずらす、目の色を変えるといった細かな詳細の変更を求められると、その人の容姿をぼかしたり変えてしまったりします。この問題は、これらのモデルが顔を密な潜在変数(latent variables)の集合としてエンコードしていることに起因します。そのうちのどれか一つを動かそうとすると、画像全体に影響が波及し、アイデンティティが崩れてしまう傾向があるのです。
LITは、既存モデルの凍結された(frozen)エンコーダーを借用し、その潜在空間を探索して、個別の顔の属性に対応する方向を見つけ出すことで、この問題を回避します。ネットワーク全体を再学習したり新しいデータを投入したりする代わりに、この手法は顔の特定の部位をそれぞれ制御する個々の潜在トークン(latent tokens)を分離します。あるトークンは眉の形を制御し、別のトークンは鼻の構造を制御するといった具合です。単一のトークンの値を調整することで、開発者は周囲のトークンによって肖像画の他の部分を変化させずに、その特徴だけを微調整できます。
このアプローチには、4つの実用的な利点があります。
- 精度 – 変更は対象となる特徴のみに限定され、全体の見た目が維持されます。
- 低計算コスト – エンコーダーが凍結されているため、新しい学習ループが不要であり、計算負荷を最小限に抑えられます。
- アイデンティティの一貫性 – 複数の画像やプロンプトにわたる編集においても、同一人物の容姿が維持されます。
- 市場投入までのスピード – 学習をスキップできるため、即時的な顔の操作を必要とするアプリケーションの開発サイクルを短縮できます。
すぐに恩恵を受けるユースケースとしては、モデルが新しいアイデンティティを勝手に作り出すことなく、買い物客が自分の顔にメガネやメイクを試せる「バーチャル試着」や、ユーザーが表情、年齢、目の色をリアルタイムで微調整できる「アバター作成ツール」などが挙げられます。
