Moonshot AI 的全新 Kimi K3 在 AA-Briefcase 基准测试中超越了 GPT-5.6,得分 1,527,而后者为 1,495。这一胜利伴随着一种定价模式,使得这款拥有 2.8 万亿参数的开源权重模型成为长篇编码任务中一个出人意料的廉价选择。
为什么该基准测试至关重要
AA-Briefcase 衡量的是持续的、真实世界的负载性能,而非孤立的琐碎问题。更高的分数意味着模型可以在数千个 token 的过程中保持上下文、提前规划并专注于任务——这正是开发者在构建助手、代码生成器或研究助手时面临的状况。Kimi K3 相对于 GPT-5.6 的优势表明,开源模型现在可以在传统上由闭源对手统治的领域展开竞争。
技术概况
- 规模 – 2.8 万亿参数,是迄今为止发布的最大的开源权重模型。
- 架构 – Stable LatentMoE(混合专家模型,Mixture-of-Experts),拥有 896 个专家,其中任何时刻都有 16 个处于激活状态。
- 上下文窗口 – 超过 100 万 token,足以容纳整本书籍或长代码库。
- 注意力机制 – Kimi Delta Attention,一种据称能提高扩展效率的自定义优化。
这些选择赋予了模型处理“长程(long-horizon)”任务的能力,但同时也推高了计算需求,这体现在速度和成本数据上。
引人注目的定价
Moonshot 将 token 定价分为三个档次:
| 使用类型 | 每 100 万 token 成本 |
|---|---|
| 输入 – 缓存未命中 | $3.00 |
| 输入 – 缓存命中 | $0.30 |
| 输出 | $15.00 |
该公司表示,编码工作负载的缓存命中率高达 90%。如果属实,对于编码智能体(coding agents)来说,这是一个非常廉价的选择。
你会感受到的权衡
- 速度 – 该模型的处理速度约为每秒 62 个 token,低于行业中位数。长提示词(prompt)可能会持续数分钟,这对于交互式使用非常关键。
- 推理成本 – Kimi K3 默认以“最大推理强度(max reasoning effort)”运行,且没有提供调低强度的选项。因此,简单的查询会消耗与复杂查询相同的 token 预算,从而增加了常规任务的成本。
- 隐藏的 token 使用量 – 一些用户反映模型会自动注入相当大的系统提示词,这些 token 虽然在用户请求中不可见,但仍会被计费。
这些因素意味着,在实际应用中,极低的标称价格可能会被较慢的响应速度和更高的 token 消耗所抵消。
可用性与未来之路
API 今日已上线,允许开发者立即进行实验。模型权重本身将于 7 月 27 日发布,届时将支持自托管。在此之前,用户必须依赖 Moonshot 的托管服务,并接受相关的延迟和定价结构。
来自闭源模型阵营的反驳观点
正在显现的启示
主要的启示是闭源模型与开源模型之间的差距正在缩小。Kimi K3 证明了开源权重模型可以处理复杂的长程任务。
