Google Vids 发布自定义 AI 数字人与 Gemini Omni 集成功能
Google 正在将其 AI 辅助办公工具转型为个性化视频制作的强大引擎。随着 Google Vids 的最新更新,用户现在可以创建模仿其外貌和声音的自定义数字人(avatars),这标志着企业视频沟通方式的一次重大转变。
个性化数字人进入办公领域
为了直接瞄准专业视频创作市场,Google Vids 现在允许用户在自己的内容中“出演”。通过上传一张自拍和一段录音,用户可以生成一个外貌和声音都与本人极其相似的自定义数字人。该功能旨在简化公司动态更新、培训视频和内部沟通的制作流程,而无需频繁进行实地拍摄。
为了应对围绕深度伪造(deepfakes)的伦理担忧,Google 正在实施严格的保护措施。这些个性化数字人专门与用户的 Google 账号绑定,并使用 SynthID 技术进行不可见的数字水印处理。目前,这些数字人功能仅限特定地区的 18 岁及以上用户使用,以确保这种高保真合成媒体的受控推广。
Gemini Omni 赋能创意
Google Vids 的进化得益于 Gemini Omni 的集成,这是 Google 先进的多模态 AI 模型。这种集成实现了一种复杂的“提示词转视频”(prompt-to-video)工作流,用户可以将书面文本提示词与上传的参考图像相结合。Gemini Omni 会综合这些不同的输入,生成连贯的视频序列。
除了单纯的生成功能外,Gemini Omni 还充当了智能后期制作套件的角色。该模型可以执行复杂的视觉任务,例如更换背景、修复手机拍摄的照明问题以及添加电影级特效。至关重要的是,此次更新引入了对逐步编辑(step-by-step edits)的支持。这允许创作者在制作过程中对项目进行细粒度的迭代修改,从而避免了在仅需调整单个细节时就不得不从头开始重新渲染的挫败感。
竞争格局的转变
这些更新代表了 Google 的战略转型。虽然 Vids 最初被定位为 Google Workspace 的 AI 辅助演示工具,但它正在迅速演变成一个全能的视频创作平台。通过将这些功能直接嵌入 Workspace 生态系统,Google 正在超越简单的幻灯片演示,迈向高端视频制作领域。
这一演进使 Google 与 HeyGen、Synthesia、Captions 和 D-ID 等专业的 AI 视频初创公司展开直接竞争。虽然这些平台侧重于合成数字人演示,但 Google 的优势在于其与现有企业工作流的无缝集成。对于创始人及开发者而言,这预示着一种趋势:像 Gemini Omni 这样的多模态模型正从研究实验转向成为专业生产力工具栈中必不可少的交互式组件。
核心要点
- 自定义数字孪生: 用户仅需一张自拍和一段录音即可生成 AI 数字人,从而简化专业视频信息的传递。
- 多模态编辑: Gemini Omni 的集成实现了基于提示词的复杂视频创作,以及迭代式的逐步视觉编辑。
- 企业级安全性: 所有个性化数字人均受 SynthID 不可见水印保护,并与经过验证的 Google 账号绑定,以防止滥用。
