标题:Latent-Identity Tuning 实现精准面部编辑
研究人员推出了 Latent-Identity Tuning(潜空间身份微调),这是一种允许开发者在文生图生成器中编辑面部特征,同时保持主体身份不变的技术,且无需任何额外训练。
大多数基于扩散模型的文生图模型在被要求修改微小细节(如更换眉形、移动鼻子或改变眼睛颜色)时,往往会模糊或改变人物的容貌。问题的根源在于这些模型将面部编码为一组密集的潜变量;调整其中任何一个变量往往会波及整个图像,从而破坏身份的一致性。
LIT 通过借用现有模型的冻结编码器,并探测其潜空间中与离散面部属性相对应的方向,从而避开了这一问题。该方法无需重新训练整个网络或输入新数据,而是分离出控制面部特定部分的单个潜标记(latent tokens)。一个标记可能控制眉形,另一个可能控制鼻子结构。通过调整单个标记的值,开发者可以微调该特征,而周围的标记则保持肖像的其他部分不变。
该方法具有四个实际优势:
- 精准度 – 更改仅限于目标特征,保留整体外观。
- 低计算量 – 冻结的编码器意味着无需新的训练循环,因此计算负载保持在极低水平。
- 身份一致性 – 同一人物的容貌在多张图像或提示词的编辑过程中得以保持。
- 快速落地 – 跳过训练过程缩短了需要即时面部操作的应用的开发周期。
能够立即受益的使用场景包括:虚拟试戴(消费者可以在自己的脸上看到眼镜或妆容,而不会让模型创造出一个全新的身份),以及允许用户实时微调表情、年龄或眼睛颜色的虚拟形象创建工具。
