一项最新的成本分析显示,只有当企业每月处理约 500 万到 1000 万个输入 token 时,自托管大语言模型才会比商业 API 更具优势。对于任何正在规划 AI 服务预算的人来说,盈亏平衡点决定了“免费”开源权重的诱惑是否能转化为真正的成本节约。

API 模式

API 提供商按 token 计费,并负责所有的硬件、电力和冷却工作。目前的公开价格如下:

  • Claude Sonnet 5 – 每百万输入 token 2 美元
  • GPT-5.6 – 每百万输入 token 约 1 美元
  • Meta Muse Spark – 输入每百万 token 1.25 美元,输出每百万 token 4.25 美元

该模式采用按需付费的方式。当流量降至零时,账单也会降至零。用户还可以免于处理 GPU 故障、固件更新和容量规划等烦恼。

自托管模式

在自有硬件上运行开源权重模型意味着无论利用率如何,你都需承担计算成本。单台 NVIDIA H100(LLM 推理的常用选择)的成本为:

  • 通用 GPU 云服务:每小时 2 – 3 美元
  • 主要云平台 (AWS, Azure):每小时 7 – 12 美元

这意味着单台 H100 持续运行一个月的费用约为 1,800 – 2,000 美元。硬件价格仅仅是账单中显而易见的一部分。

数据交汇点

分析发现,一旦每月输入 token 量达到 500 万至 1000 万的范围,自托管就会比优质 API 更便宜。低于该阈值时,按 token 计费的 API 模式更具优势。当每月处理量达到 1 亿个 token 或更多时,仅硬件成本的曲线会降至 API 曲线之下,使自托管在账面上看起来非常有吸引力。

隐藏的运营开支

GPU 租赁仅占模型在生产环境中运行真实成本的约 30%。其余部分来自于:

  • 网络与存储 – 高吞吐量链路和快速磁盘可保持低延迟。
  • 冗余与监控 – 多个实例、健康检查和告警流水线增加了软件和硬件支出。
  • 工程人才 – 保持模型可靠在线通常需要 1.5 – 2 名全职工程师。按市场价格计算,这将使年度支出增加 270,000 – 550,000 美元。

当加上这些层面的成本后,仅靠硬件带来的表面节省会迅速蒸发。

谁应该考虑自托管

只有在特定条件下,自托管才有意义:

  • 持续的海量业务量 – 组织必须定期超过 500 万 token 的阈值,否则按 token 计费的 API 价格仍然更低。
  • 监管或数据隐私限制 – 某些行业禁止将专有数据或个人数据发送到第三方端点。
  • 专门的定制化或延迟保证 – 当模型必须基于内部数据进行微调,或需要提供亚秒级响应时,拥有整套技术栈是合理的。

如果不存在这些压力,隐藏的人力及基础设施成本往往会超过硬件节省的费用。

混合策略方案

大多数达到自托管可行规模的团队仍会采用混合模式:

  1. 从 API 开始 – 它们价格低廉、集成快速,非常适合实验或低业务量的工作负载。
  2. 迁移高业务量流 – 一旦 token 数量持续超过盈亏平衡点,就将这些流水线转移到内部集群。
  3. 保留安全网 – 将偶尔或突发性的请求保留在 API 上,以避免过度配置本地资源。

定期进行 token 成本计算,然后叠加原始硬件价格所忽略的运营开销。基于这种全局视角的决策不太可能被误区所误导。

总结

如果你的 AI 产品每月处理的 token 少于几百万个,最简单、最便宜的途径仍然是调用 API。只有当出现持续的高业务量需求、严格的合规性要求或自定义延迟需求时,自托管在财务上才变得可行——即便如此,在宣布战胜云服务之前,也必须将人力和基础设施的隐藏成本考虑在内。