2026 年 6 月中旬的数据已经出炉,呈现出一幅清晰且不容置疑的图景。中国 AI 模型在 Token 吞吐量方面已连续十周占据全球首位。这并非源于单一基准测试的昙花一现,也不是某个爆款模型发布带来的暂时激增。这是一种持续数周的模式,揭示了人工智能的实际工作正在何处开展。
在全球每周总计 46.7 万亿 Token 的吞吐量中,中国模型处理了 18.81 万亿,美国模型处理了 5.76 万亿。这相当于中国占 46%,美国占 13%。Token 吞吐量是我们衡量 AI 在实际应用中普及程度最具体的指标。每一个 Token 都代表一个真实的计算劳动单位——一段被审查的代码、一个被回答的客户查询、一份被总结的文档、一张被描述的图像,或是一条被执行的推理链。当全球近一半的 AI 劳动通过中国构建的模型运行时,我们正在见证全球 AI 经济的一次根本性重新分配。
企业迁移发生得异常迅速
美国企业内部的转变非常剧烈。美国企业对中国模型的 Token 消耗量从 2025 年的 4.5% 攀升至 2026 年的 46%。自 2026 年 2 月以来,这一比例一直保持在 30% 以上。这两个数据点共同讲述了一个清晰的故事。这不再是少数好奇的工程师进行的早期实验,而是一场广泛的结构性迁移,它在今年年初跨越了临界点,且再未回头。
美国企业最初将中国模型视为备选方案或出于好奇尝试。随后,团队开始进行内部成本对比。他们发现,切换模型并不需要牺牲常规任务的准确性。一旦这一点变得明确,采购决策便迅速推进。46% 的企业份额意味着,美国公司内部近一半的 AI 计算预算现在正流向太平洋对岸开发的架构。对于一个多年来一直将旧金山和湾区视为引力中心的行业来说,这是一次非凡的重新对齐。
真实的企业,真实的成本节约
名牌企业的具体决策展示了这一趋势的深度。加密货币交易所 Coinbase 为其工程师选择了 GLM-5.2 和 Kimi K2.7。这不是埋没在研究实验室里的试点项目。这些模型正在驱动实际的开发工作流——代码补全、技术文档编写、调试辅助以及内部工具开发。Coinbase 对系统可用性和安全性有着严格的要求。其工程团队采用外国模型并非为了微小的收益,而是因为这些模型在满足企业级可靠性标准的同时,提供了更优的经济效益。
此外还有 Lindy,这家美国初创公司从 Anthropic Claude 转向了 DeepSeek-V4。结果是成本降低了 95%,节省了数百万美元。初创公司的资金链非常紧张。推理支出减少 95%,可能意味着在 18 个月内耗尽资金与能够从容地扩张数年之间的本质区别。但 Lindy 的举动也释放了一个更广泛的信号:DeepSeek-V4 的表现足以在生产环境中取代 Claude。这并非降级为廉价方案,而是在保持实用性的同时彻底消灭了成本。
这两个例子处于企业光谱的两端。Coinbase 是一家拥有合规团队和传统基础设施的上市科技巨头;而 Lindy 是一家将生存押注在精明 AI 经济学上的早期初创公司。两者最终都走向了同一个结果。这足以说明问题。
效率在实践中的真实含义
效率是驱动这些选择的核心,但我们需要明确其具体含义。这不仅仅是仪表盘上更便宜的 API 定价问题。中国的实验室研发出了能够从每个计算周期中挤压出更多性能的推理架构。更优的量化技术、优化的注意力机制、蒸馏模型变体以及硬件感知型服务栈,共同推动了单个 Token 成本的下降。
为什么这很重要?因为 Token 量不是静态的。当一家公司构建出成功的 AI 功能时,使用量往往会呈复合增长。如果你的应用因为深受客户喜爱而在下个季度产生了十倍的 Token 量,你的基础设施账单也会随之增长。一个仅仅是“更便宜”的模型会有所帮助,但一个便宜了 95% 的模型会彻底改变你的单位经济效益。它决定了你的 AI 产品线是盈利还是亏损中心。它让初创公司能够与既有巨头竞争,也让巨头在推出更多 AI 功能的同时保护其利润率。
美国公司正意识到这一数学逻辑。他们发现许多生产任务——如工单路由、邮件起草、日志解析、测试用例生成、会议摘要——并不需要市场上最昂贵的前沿模型。它们需要的是一个性能足够好、且成本结构能支撑商业模式的模型。中国供应商正积极填补这一空白。
解读连续十周的领先态势
在全球 Token 量榜首连续占据十周,这在 AI 领域是一段很长的时间。一周可能是异常现象,但连续十周则是一个具有动能的趋势。这表明中国模型已经走出了全球企业的“评估”阶段,进入了“默认”阶段。工程师们不仅是在测试它们,还在基于它们进行开发。产品经理正在为其分配预算。基础设施正被集成到持续部署流水线和面向客户的系统中。
事后看来,2026 年 2 月的转折点是有迹可循的。像 DeepSeek-V4、GLM-5.2 和 Kimi K2.7 这样的模型已经推出了一段时间,但 2026 年初似乎是美国团队积累了足够的生产经验,从而能够大规模信任这些模型的时期。一旦信任度跨越了关键阈值,企业级份额便跃升至 30% 以上并持续攀升。到 6 月中旬,中国模型在全球处理的 Token 量已接近美国模型的四倍。
给开发者的启示
如果你正在构建产品或管理工程团队,实际的教训非常直接:不要将模型质量与地理位置挂钩。针对你的特定工作负载的最佳架构可能并不来自湾区供应商。在真实数据上运行你自己的单任务成本基准测试。同时衡量延迟、准确性和价格。考虑当使用量扩大 10 倍或 100 倍时,你的预算会发生什么变化。
全球 AI 基础设施层正在快速全球化。成本效率现在是重塑企业级采用的主要引擎,而中国的实验室在过去一年中一直在针对这一压力进行优化。结果是,全球 46% 的 AI Token 正在通过中国模型流动,而美国公司本身现在占据了其中近一半的企业级使用量。AI 重型工作的地理分布已经发生了转移。数据不会撒谎。
Source: China Dominates Global Token Volume
Optional learning community: GyaanSetu AI on Telegram
