前 OpenAI 高管 Barret Zoph 已加入 Google 担任研究副总裁,旨在加速 Gemini 系列大语言模型的发展。Google 希望 Zoph 在强化学习和后训练技术方面的专业知识能够加强 Gemini 的对齐、推理和安全性——而这些领域目前仍由 OpenAI 的 GPT 系列领先。

AI 精英的旋风之旅

Zoph 的简历读起来就像是该行业近期动荡的缩影。在 OpenAI 工作两年后,他于 2024 年 10 月离开,与前 OpenAI CTO Mira Murati 共同创立了初创公司 Thinking Machines。该创业项目在几个月后便解散了;到 2025 年 1 月,Zoph 与另一位联合创始人 Luke Metz 重返 OpenAI,负责领导 AI 企业销售业务。在担任该职位五个月后,Zoph 于 2025 年 6 月再次离职,为他转投 Google 扫清了障碍。

每一个停靠点都反映了一个更广泛的模式:顶尖研究人员在成熟实验室、新兴初创公司和资金雄厚的科技巨头之间来回跳动。Zoph 的最新跃迁让他进入了一家已在 AI 领域投入数十亿美元,但在发布具有轰动效应的模型方面一直难以企及 OpenAI 的公司。

为什么强化学习和“后训练”成为了新的战场

大语言模型在海量文本语料库的预训练过程中获得原始能力。接下来的阶段——通常被称为“后训练”——则是为了实际应用而对这些模型进行微调。最显眼的后训练方法是基于人类反馈的强化学习 (RLHF),即由人类评估者判断模型输出,并由强化学习算法调整模型以满足这些判断。

Google 的 Gemini 系列展现了扎实的原始性能,但批评者指出,其安全性和指令遵循能力落后于 OpenAI 最新的 GPT。通过任命一位其发表的研究成果不断推动 RL 和 RLHF 边界的研究员,Google 释放了缩小这一差距的信号。Zoph 将协助构建更高效地收集人类反馈的流水线,设计能够捕捉细微意图的奖励模型,并尝试能够提高推理能力且不牺牲稳定性的新型 RL 算法。

Google 与 OpenAI 的利害关系

对于 Google 而言,此举是其多年努力中的具体一步,旨在将 Gemini 打造成为涵盖云服务、搜索和消费级产品的商业基石。更好的对齐模型可以降低责任风险并提升客户信任——随着企业要求能够大规模安全部署的 AI,这些因素变得至关重要。

与此同时,OpenAI 正面临着超出 Zoph 个人的人才流失问题。在过去的八个月里,该公司不仅经历了首席运营官和高级数据中心负责人的离职,还经历了高管层的频繁变动。这些离职发生之际,OpenAI 正准备进行潜在的 IPO,而投资者通常会审视领导层的稳定性。人员流动可以注入新鲜视角,但也存在破坏长期研究项目连续性的风险。

反方观点:单凭一人无法在一夜之间重塑 Gemini

Google 在 RL、安全性和模型对齐方面已经拥有深厚的研究人才储备。一些观察人士警告称,即便拥有 Zoph 这样资历的研究员,单凭一位副总裁也无法独自彻底改革像 Gemini 这样庞大的产品线。真正的效果将取决于 Zoph 将其想法融入现有团队、获取资源以及影响更广泛的产品路线图的速度。

人才流动既关乎战略优势,也关乎个人契合度和职业轨迹。Zoph 在企业销售领域的短暂经历表明,他渴望从事结合研究与市场影响力的角色——相比纯研究型实验室,Google 可能更有能力提供这种结合。

后续关注点

  • Gemini 发布 – 即将到来的模型更新将揭示以 RL 为核心的改进是否能提高安全性评分和推理基准。
  • 研究论文发表 – Google 研究部门中带有 Zoph 姓名或共同署名的论文将预示内部实验的方向。
  • OpenAI 领导层变动 – 在任何公开上市之前,进一步的高层离职或新聘人员可能会重塑公司的研究议程。
  • 市场反应 – 云服务客户和企业买家将在承诺使用 Google 的 AI 技术栈之前,观察 Gemini 在对齐方面是否有具体的改进。

总结

Barrett Zoph 从 OpenAI 转投 Google,凸显了当前的 AI 军备竞赛在人才领域的角逐已与算力领域的竞争同样激烈。通过在 Gemini 研究团队的核心位置安置一名强化学习专家,Google 押注更加专注于后训练(post-training)将缩小其与 OpenAI GPT 模型在性能和安全性方面的差距——这一结果可能会重塑整个行业的竞争格局。