企业正在激进地扩展 AI 基础设施,但资本支出与运营监管之间正出现日益扩大的“算力差距”。随着各机构竞相获取硬件,他们发现自己衡量单位经济效益和 GPU 利用率的能力已无法跟上投资速度。
算力差距:快速投资 vs. 低可见度
VentureBeat Pulse Research 对 107 家企业进行的调查显示,AI 生命周期中存在明显的脱节。公司向基础设施投入大量资金,但缺乏进行管理的遥测数据。支出意向正在飙升,但生产成熟度却保持在较低水平;仅有 21% 的受访企业在大规模运行生产级 AI。
最关键的症状是效率低下。83% 的企业报告 GPU 利用率在 50% 或以下。更糟糕的是,只有不到一半(44%)的企业能够严格追踪其 AI 计算的实际成本。因此,大规模、快速推进的投资在缺乏引导长期经济效益所需的可见性的情况下展开。
供应商动态的变化与高更迭率
传统的超大规模云服务商和模型 API 主导着技术栈。Google Cloud 以 48% 的使用率领先,其次是 Microsoft Azure (29%)、AWS (22%) 和 Oracle Cloud (22%)。模型消耗集中在 Gemini (41%) 和 OpenAI (40%)。CoreWeave、Lambda 和 Together 等专业 AI 云的市场份额不足 2%。
波动性很高。64% 的企业计划在 12 个月内更换或增加基础设施供应商,38% 的企业计划在下一季度内进行。其中 41% 的决策是由与现有技术栈的集成驱动的,而总拥有成本(TCO)占 35%。只有 8% 的企业提到标称的 Token 价格。
下一个前沿:专业化云与内存带宽
正在从实验阶段转向实际应用的各企业正将目光投向 AI 专业化云。45% 的企业计划在未来一年评估此类供应商——这是目前计划中最大的评估领域。
一个新的技术约束正在出现:限制大规模推理的将是内存带宽,而非原始 GPU 计算能力。只有约 20% 的企业意识到这一瓶颈或正在采取措施解决它。对于开发者和 CTO 而言,掌握带宽管理将是实现可扩展推理与避免成本失控的分水岭。
核心要点
- 效率低下已成常态: 83% 的企业 GPU 利用率 ≤ 50%;不到一半的企业能准确追踪计算支出。
- 供应商更迭率高: 64% 的企业计划在一年内更换或增加供应商,优先考虑集成性 (41%) 和 TCO (35%)。
- 向专业化转型: 45% 的企业将评估利基 AI 云以弥补算力差距。
- 内存带宽隐忧: 约 20% 的企业意识到了这一新兴瓶颈或正在应对。
文章
VentureBeat Pulse Research 对 107 家公司的调查显示,83% 的公司 GPU 利用率仅为一半或更低,而只有 44% 的公司能确定每个计算小时的确切成本。这种不匹配促使 64% 的受访者计划在未来一年内更换或增加基础设施供应商。
为什么“算力差距”现在至关重要
核心数据描绘了一幅严峻的图景:AI 支出在攀升,但生产成熟度却滞后。仅有 21% 的公司表示他们在生产环境中大规模运行 AI,这意味着大部分投资仍停留在实验室、概念验证(PoC)或闲置硬件中。低 GPU 利用率直接转化为资本浪费——半满的服务器仍在消耗电力、需要冷却并占用机架空间。当不到一半的组织能够追踪单 GPU 成本时,预算编制就变成了猜测,CFO 面临的是一个可能在一年内耗尽技术预算的“黑盒”。
我们是如何走到这一步的
这一热潮始于超大规模云厂商推出 AI 特定实例和模型即服务(MaaS)API。Google Cloud 目前承载了 48% 的受访工作负载,其次是 Microsoft Azure (29%)、AWS (22%) 和 Oracle Cloud (22%)。模型消耗也呈现类似的分布,Gemini 和 OpenAI 各占约 40% 的使用量。其吸引力显而易见:值得信赖的云服务、即插即用的 GPU 以及承诺成本透明的按需付费模式。
研究揭示了一个隐藏成本。集成难题主导了迁移决策:41% 的企业提到难以将供应商的技术栈织入现有流水线,而 35% 的企业指向了总拥有成本。只有 8% 的企业表示标称的 Token 价格令其望而却步,这表明生态适配性比单纯的价格标签更重要。
供应商与买家的博弈
对于三大云厂商而言,占据主导的市场份额赋予了其话语权,但供应商更迭的意向预示着这种控制力正在被削弱。
买家面临两种风险。首先,持续的低利用率会推高单次推理或训练任务的成本,从而削弱 AI 的商业合理性。其次,缺乏成本可见性会阻碍战略规划;如果没有清晰的单位经济效益,就很难证明进一步投资的合理性,也难以为 AI 增强型产品制定定价。
专业化 AI 云的崛起
专业化 AI 云——CoreWeave、Lambda 和 Together——目前占据的市场份额不足 2%。45% 的企业表示他们将在未来一年评估这些利基供应商,这使其成为计划中最大的供应商评估领域。它们的价值主张在于与 AI 工具链更紧密的集成、更细粒度的计费以及针对 AI 工作负载优化的硬件,这可以将 GPU 利用率提升到远高于目前困扰大多数企业的 50% 上限。
技术盲点:内存带宽
硬件讨论的重心正在转移。随着推理工作负载的规模扩大,内存带宽(即数据进出 GPU 的速度)正成为瓶颈,其重要性已超过了原始算力。然而,在受访企业中,只有约 20% 的公司意识到这一限制或正在采取措施解决它。忽视带宽可能意味着即使 GPU 已被充分利用,也无法提供所需的吞吐量,从而导致实例数量增加并推高成本。
反方观点:超大规模云厂商仍占据主导地位
现在宣布超大规模云厂商的时代已经结束还为时过早。它们的规模、全球布局以及现有的企业合同仍使其成为许多人的默认选择。调查显示,大多数工作负载仍留在这些平台上;对于拥有根深蒂固的多云策略的组织来说,惯性可能会超过高利用率带来的吸引力。此外,专业化云厂商有限的市场份额表明,虽然兴趣很高,但迁移过程将是渐进的。
后续关注点
- 内存带宽限制: 随着推理工作负载的增长,带宽可能成为关键瓶颈,从而影响硬件选择和架构决策。
核心结论
- 低效已成常态: 83% 的企业 GPU 利用率 ≤ 50%;仅 44% 的企业能够准确追踪算力支出。
- 供应商更迭频繁: 64% 的企业计划在一年内更换或增加基础设施供应商,主要驱动因素是集成需求 (41%) 和总拥有成本 (TCO) (35%)。
- 专业化云厂商正在崛起: 45% 的企业将在未来 12 个月内评估利基 AI 云,以期缩小算力差距。
- 内存带宽是迫在眉睫的限制: 大约 20% 的公司已经意识到或正在应对这一新兴瓶颈。
AI 支出与经济可见性之间的差距不再仅仅是一个注脚;它正在重塑采购策略,并促使企业向那些能够证明每一美元都能发挥更大价值的供应商迁移。
