大多数创意软件仍然需要人类在创意构思与最终文件之间充当媒介。你可能会向 AI 描述一段视频剪辑,但修剪片段、调整图层和导出帧等实际工作通常还是得由你来完成。这种差距之所以存在,是因为媒体编辑并非单一的“提示-响应”任务。它是一个由一系列依赖性决策组成的漫长链条,只有当第二步确实改变了时间轴时,第三步才有意义。最近分享的一个项目通过将 Claude Code 接入由 Gemini Interactions API 提供支持的有状态视频编辑流水线,解决了这一摩擦点。其结果是一个可运行的演示,展示了如何让 AI Agent 真正主导创意工作流,而不仅仅是提供建议。
导演与剪辑师
架构设计是有意拆分的。Claude Code 充当导演,负责高层规划、解读模糊的创意简报,并决定下一步该做什么。它将诸如“剪掉空白部分并添加标题卡”之类的请求分解为离散的任务,然后在继续下一步之前监控每个任务是否成功。
Gemini Interactions API 处理专业的剪辑逻辑。这种设置并没有强迫通用模型去模拟视频剪辑师,而是将 Google 的 API 作为实际的操作员,负责执行剪辑、评估时间轴状态并反馈具体结果。系统并没有将这两个工作合并到一个模型中,而是将推理层与工具使用层分开,这意味着每个部分都可以专注于其最擅长的领域。
这种分工反映了实际后期制作团队的工作方式。导演了解故事并做出决策;剪辑师精通软件并操作像素。当一个 Agent 试图在同一个上下文窗口中同时完成这两项工作时,它往往会因为语法问题而卡壳,或者忘记哪个片段在哪个轨道上。拆分负载解决了这个问题。
为什么记忆力改变了一切
视频编辑本质上是有状态的。如果你将一个片段缩短四秒,随后的每一个转场、音频提示和字幕位置都必须随之移动以保持匹配。大多数 AI Agent 在这里会遇到困难,因为它们将每一步都视为孤立的查询。它们可能在一次响应中建议进行剪辑,然后在下一次响应中幻觉出一个不同的时间轴,或者为一段已经不存在的片段建议特效。
Gemini Interactions API 的设计初衷就是在这些操作中保持状态。它在 Agent 工作时跟踪项目的实际状态。这意味着系统知道导出是否失败、片段是否已经过处理,或者是否已应用调色。当 Claude 发布下一条指令时,它是在基于时间轴真实的当前状态进行操作,而不是凭空猜测。
对于任何见过 AI 自信地建议一个“简单”的五步修复方案,却完全忽略了前四步的人来说,持久状态的价值是不言而喻的。没有记忆,创意任务的质量会迅速下降。有状态的后端将聊天机器人变成了一个能够真正完成工作的参与者。
工作流是什么样的
想象一个实际的操作序列。你向系统输入几个原始片段,并要求生成一段完成的社交媒体剪辑。Claude Code 首先评估请求。它可能会决定素材需要防抖处理,然后是提取旁白,接着是字幕,最后是垂直裁剪。它将这些内容构建成一个计划,并开始按顺序调用 Gemini Interactions API 来执行每一项。
Gemini 执行媒体操作并返回结构化反馈。也许防抖成功了,但音频分离发现对话重叠,导致字幕变得不可靠。Claude 收到该更新后,会修改计划,并要求 Gemini 尝试不同的方法,例如在生成文本叠加层之前先识别说话人片段。由于 API 持有状态,它可以确认字幕轨道与新防抖后的视频对齐,而不是与原始抖动的素材对齐。
这个循环会一直持续到清单完成。该系统为复杂的视频任务创建了真实的工作流,而不是一次性的脚本生成。如果由于编解码器设置不兼容导致渲染失败,错误会反馈给 Claude,它可以调整参数并重试。Agent 不会在遇到第一个障碍后就放弃项目。
利用不同模型的不同优势
该项目还展示了 AI 工程中一种更广泛的设计模式:不要试图让一个模型完成所有工作。Claude Code 擅长通过模糊指令进行推理、管理分支逻辑,并在长会话中维持对话上下文。Gemini Interactions API,特别是在其与富媒体的交互和工具使用方面,带来了深度的多模态能力和有状态的执行能力。通过将它们连接在一起,你可以绕过各自的局限性。
一个从未接触过非线性编辑器的推理模型,如果能够访问理解编解码器、关键帧和轨道层级的执行层,仍然可以指导完成一次精彩的剪辑。相反,如果一个规划模型已经将抽象的创意笔记转化为具体的步骤,那么一个精通媒体的 API 就不需要去解析这些笔记。一个的优势可以弥补另一个的劣势。
这并非理论。该设置明确展示了不同的 AI 模型如何协同工作,以处理单模型智能体(agent)通常无法完成的一类工作——创意视频编辑。对于构建智能体系统的开发者来说,这个教训是不容忽视的。不要再要求你的编排层成为你的专家,也不要再要求你的专家成为你的战略家。
构建者应该从中获得什么
你不需要经营一家视频工作室才能发现这种模式的用处。任何需要在变化环境中进行多步工作的领域,如 CAD 工作流、音频工程、数据可视化或科学计算,都可以借鉴这种结构。一个模型充当持久的项目经理,而专门的 API 或工具则处理特定领域软件内部的有状态操作。
开发者的工作重心从编写“祈祷模型能记住一切”的巨型提示词,转向设计推理与执行之间清晰的交接。状态管理成为了关键环节。如果你的智能体无法看到其上一次操作后的变化,它就无法再次可靠地执行操作。
你可以在 dev.to 上的详细文章中阅读关于集成工作原理的完整分解,包括具体的 API 交互和项目结构。
真正的启示
利用 AI 解决复杂的创意工作,并不需要等待一个能够同时进行规划、记忆和执行一切的单一完美模型。它需要给智能体一个能够在步骤之间延续的记忆,以及一个它真正可以委派任务的专家。让思考者去思考,让剪辑师去剪辑。
