通过全新的 Google Vids 界面访问的 Google Gemini Omni 接受了一项实操实验室测试,旨在观察该 AI 在连续进行三次视频编辑后,能否保持单一主体(快递员)的稳定性。

为什么这项测试至关重要

生成式视频工具承诺,任何人只需通过一条文本指令,即可更换背景、添加光效或撒下特效。对于创作者而言,这一承诺非常简单:从一段原始素材开始,输入“让夜晚下起雨来”,然后就能得到一段精美的短片。大多数用户并未察觉到“漂移”(drift)这一隐藏成本——即随着 AI 对每一条新指令的解读,原始主体的外观、姿态或动作会逐渐发生改变。如果快递员的面部在第二次编辑后发生了细微变化,最终的作品就会显得不够专业,并且可能需要昂贵的人工后期修复。

实验过程

基准片段 – 一段使用固定摄像机的影棚拍摄镜头,画面中一个人穿着海军蓝风衣,左手拿着一个小纸箱,向摄像机走了两步。光线均匀,背景简洁,动作简单。

编辑序列 – 依次进行了三次编辑:

  1. 背景更换 – 将影棚替换为夜晚下雨的城市街道。
  2. 光效微调 – 在快递员周围添加蓝色轮廓光,并增加来自商店橱窗的暖光。
  3. 氛围层 – 撒下细小的雨滴和一层薄薄的水汽。

“直接控制”运行方式则将这三条指令组合在单个提示词中,让 AI 一次性生成最终片段。

如何进行一致性评分

评分卡由十二项标准组成,分为四个主题:

  • 角色稳定性 – 面部、头发和衣着保持一致。
  • 场景稳定性 – 摄像机角度和主体位置保持固定。
  • 编辑精准度 – AI 遵循指令,且不改变其他任何内容。
  • 时间质量 – 动作过程中没有闪烁、扭曲或抖动。

每个片段分别在第一帧、两步走的中点以及最后一帧进行评估。评分结果显示出了明显的规律。

数据说明了什么

当编辑被叠加执行时,使用评分卡对 AI 进行评估。单提示词对照组也接受了同样的评估。

谁是赢家,谁是输家

能够使用单一、全面提示词的工作室将获得更流畅的工作流。生成式视频系统的开发者则面临着一个明确的工程障碍——即如何在连续的变换过程中保持主体稳定的潜在表示(latent representation)。

反方观点

一些用户认为,增量编辑(incremental editing)能提供更多的创意控制权。通过一次调整一个元素,他们可以在继续下一步之前对每一层进行微调。测试表明,这种灵活性是以牺牲视觉保真度为代价的。如果创作者为了实现细粒度控制而接受主体发生的轻微变化,那么目前的 Gemini Omni 工作流可能仍然可行。

后续关注点

  • 模型改进:在不同提示词之间锁定主体的潜在编码(latent code)。
  • 用户反馈闭环:允许创作者标记“漂移”并请求对主体进行“重新锚定”(re-anchor)。

核心结论

当一次性输入完整的指令集时,Gemini Omni 可以生成一段精美的、包含多种元素的视频;但当编辑被叠加执行时,其主体保真度就会下降。