Kimi K3 的 API 表面上看起来很便宜,但隐藏费用和缺失的技术细节可能使其成本远高于宣传数字。
炒作中被忽略的事实
Moonshot AI 的发布材料吹嘘其拥有一个 2.8 万亿参数的模型,且具有“廉价”和“开放”的特性。新闻稿还承诺很快会提供可下载的权重。但这两项说法都站不住脚。
- 权重尚未公开 – Moonshot 将公开检查点(checkpoint)的截止日期定在了 2026 年 7 月 27 日。在此之前,用户必须调用托管 API,因此“开源”的承诺无法提供任何实际可用的东西。
- 2.8 万亿参数并非全部处于激活状态 – 该数字描述的是架构的总容量。K3 的混合专家(Mixture-of-Experts)设计通过 896 个专家子网络中的 16 个来路由每个 token。Moonshot 尚未说明每次请求会运行多少参数,这使得内存和计算量的估算变得不可能。
看起来很划算的定价——直到你开始计算字数
已公布的价格:
- 缓存命中输入:每 100 万 token $0.30
- 非缓存输入:每 100 万 token $3.00
- 输出:每 100 万 token $15.00
这些费率看起来很低,但它们忽略了 token 的消耗量。
最近的一项测试显示,K3 的输出量达到了 1.3 亿 token,是其他领先模型在执行相同任务时产生的 6300 万 token 的两倍多。该模型的冗长性会直接推高输出账单——字数翻倍意味着成本翻倍。对于代码生成、论文写作或聊天代理而言,每百万 token 15 美元的费率可能会占据主要的支出。
这对不同用户意味着什么
开发者与研究人员
如果你测试 K3 用于编程辅助或数据驱动的研究,请务必对 token 输出设置硬性上限。通过将 K3 与具有相同输出限制的基准模型进行 A/B 测试,可以判断较高的 token 使用量是源于模型本身,还是源于提示词(prompt)设计。
预算敏感型团队
缓存命中折扣仅在输入内容重复时适用。可以设计稳定的提示词前缀,以生成完全相同的输入字符串,从而将更多请求推入 $0.30 的档位;但这仅适用于高度重复的工作负载(例如模板化查询)。大多数多样的输入都将回退到 $3.00 的非缓存费率。
考虑自托管的企业
等待检查点(checkpoint)发布是明智之举。自托管模型虽然可以免除按 token 计费的费用,但会增加未公开的许可和基础设施成本。在权重公开之前,托管 API 仍然是唯一现实的选择。
生产环境
不要仅仅因为宣传价格看起来比竞争对手低就进行切换。应进行试点测试,衡量完成单项任务的成本(包括长响应带来的隐藏开销),而不是衡量每个 token 的成本。只有这样,你才能决定 K3 是否真的省钱。
后续关注重点
- 2026 年 7 月 27 日检查点发布 – 权重预计将于该日期发布。
- 激活参数披露 – 了解每 token 运行多少个 2.8 万亿参数,将使用户能够准确评估硬件规模。
总结
K3 宣传的每百万 token 15 美元的输出价格只说了一半的事实。它生成 token 的数量往往是同行的两倍,这可能会抵消任何宣传上的节省,尤其是在长回答任务中。在权重发布且激活参数数量明确之前,请将 K3 视为一种高端且可能较为冗长的服务,而非廉价的替代方案。请进行 token 预算测试,强制执行输出限制,并在衡量完完成单项任务的真实成本后再决定是否切换。
