通过全新的 Google Vids 界面访问的 Google Gemini Omni 接受了一项实操实验室测试,旨在观察该 AI 在连续进行三次视频编辑后,能否保持单一主体(快递员)的稳定性。
为什么这项测试至关重要
生成式视频工具承诺,任何人只需通过一条文本指令,即可更换背景、添加光效或撒下特效。对于创作者而言,这一承诺非常简单:从一段原始素材开始,输入“让夜晚下起雨来”,然后就能得到一段精美的短片。大多数用户并未察觉到“漂移”(drift)这一隐藏成本——即随着 AI 对每一条新指令的解读,原始主体的外观、姿态或动作会逐渐发生改变。如果快递员的面部在第二次编辑后发生了细微变化,最终的作品就会显得不够专业,并且可能需要昂贵的人工后期修复。
实验过程
基准片段 – 一段使用固定摄像机的影棚拍摄镜头,画面中一个人穿着海军蓝风衣,左手拿着一个小纸箱,向摄像机走了两步。光线均匀,背景简洁,动作简单。
编辑序列 – 依次进行了三次编辑:
- 背景更换 – 将影棚替换为夜晚下雨的城市街道。
- 光效微调 – 在快递员周围添加蓝色轮廓光,并增加来自商店橱窗的暖光。
- 氛围层 – 撒下细小的雨滴和一层薄薄的水汽。
“直接控制”运行方式则将这三条指令组合在单个提示词中,让 AI 一次性生成最终片段。
如何进行一致性评分
评分卡由十二项标准组成,分为四个主题:
- 角色稳定性 – 面部、头发和衣着保持一致。
- 场景稳定性 – 摄像机角度和主体位置保持固定。
- 编辑精准度 – AI 遵循指令,且不改变其他任何内容。
- 时间质量 – 动作过程中没有闪烁、扭曲或抖动。
每个片段分别在第一帧、两步走的中点以及最后一帧进行评估。评分结果显示出了明显的规律。
数据说明了什么
当编辑被叠加执行时,使用评分卡对 AI 进行评估。单提示词对照组也接受了同样的评估。
谁是赢家,谁是输家
能够使用单一、全面提示词的工作室将获得更流畅的工作流。生成式视频系统的开发者则面临着一个明确的工程障碍——即如何在连续的变换过程中保持主体稳定的潜在表示(latent representation)。
反方观点
一些用户认为,增量编辑(incremental editing)能提供更多的创意控制权。通过一次调整一个元素,他们可以在继续下一步之前对每一层进行微调。测试表明,这种灵活性是以牺牲视觉保真度为代价的。如果创作者为了实现细粒度控制而接受主体发生的轻微变化,那么目前的 Gemini Omni 工作流可能仍然可行。
后续关注点
- 模型改进:在不同提示词之间锁定主体的潜在编码(latent code)。
- 用户反馈闭环:允许创作者标记“漂移”并请求对主体进行“重新锚定”(re-anchor)。
核心结论
当一次性输入完整的指令集时,Gemini Omni 可以生成一段精美的、包含多种元素的视频;但当编辑被叠加执行时,其主体保真度就会下降。
