Google 在过去几周里不断丰富其 Gemini 产品线,传递了一个明确的信息:速度和专业化与单纯追求规模同样重要。该公司推出了三种全新的 Flash 变体,每种都针对开发者市场的不同细分领域进行了优化。然而,尽管势头强劲,席位中仍有一个空缺。旗舰级的 Gemini 3.5 Pro 尚未公开发布,而竞争对手们可不会坐以待毙。

Gemini 3.6 Flash:以暴力性能换取经济性

这次发布的核心是 Gemini 3.6 Flash。Google 设计该模型的初衷是进行一种许多开发者都会欣然接受的权衡:牺牲巅峰的原始性能,以换取速度和成本的显著提升。对于运行自主智能体 (autonomous agents)、高吞吐量 API 或大规模内容流水线的团队来说,这种权衡往往决定了一个产品是盈利的还是仅停留在实验阶段。

效率的提升是实实在在的。根据 Artificial Analysis Index 的数据,预计 3.6 Flash 的输出 token 使用量将比其前身 3.5 Flash 减少约 17%。在 DeepSWE 等针对性基准测试中,Google 声称 token 的节省比例最高可达 65%。当你按 token 付费并每天处理数百万次请求时,这些百分比会直接转化为预算的节省。

定价反映了这种对易用性的关注。输入 token 的价格为每百万个 1.50 美元,而输出 token 的价格为每百万个 7.50 美元。一个每小时处理数千次交互的客户支持智能体或代码审查助手,在使用此层级模型时,其消耗的资金将远低于旗舰模型。规模较小的初创公司和独立开发者现在有了真正的机会去构建智能体工作流,而不会在一周内就耗尽他们的云积分。

该模型不仅更便宜,而且在智能体任务方面的表现也明显更加聪明。在 MLE Bench 上,得分从 49.7% 上升到 63.9%。OSWorld-Verified 的得分从 78.4% 跳升至 83%。这些并非微小的进步。它们表明 3.6 Flash 在规划、调试和执行多步任务方面的可靠性明显高于其前身。如果你正在构建一个自主研究助手或部署智能体,这种额外的能力比理论上的顶尖性能更为重要。

专业化模型:Flash-Lite 与 Flash Cyber

如果说 3.6 Flash 是新的全能选手,那么另外两个发布版本则是针对特定的痛点进行了精准打击。

Gemini 3.5 Flash-Lite 是为极致速度而生的。它每秒可生成 350 个输出 token,且每百万个输入 token 的成本仅为 0.30 美元。这个价格令人难以忽视。你可以运行实时聊天界面、分类流水线或高容量数据提取任务,而无需担心推理费用会超过你的收入。

Flash-Lite 特别引人注目之处在于,它偶尔能“以小博大”。Google 指出,在某些智能体软件工程和计算机使用任务中,它的表现优于规模更大的 Gemini 3 Flash。业界多年来一直认为“大即是好”,而 Flash-Lite 通过证明更小、经过优化的模型可以在特定任务上超越更大的通用模型,挑战了这一观念。对于正在为狭窄的生产任务挑选模型的工程师来说,这种优化策略非常有吸引力。

接着是 Gemini 3.5 Flash Cyber。这并不是一个通用的聊天机器人。它是一个安全专家,直接集成在 Google 的 CodeMender 智能体中,并专门针对网络安全工作流进行了微调。在 CyberGym 基准测试中,它获得了 83.2% 的得分。这使其已接近