Meta 将于今年 9 月开始生产定制 AI 芯片

Meta 正在加速实现其“硅片独立”的进程,计划于今年 9 月开始生产其最新的 AI 专用芯片。通过开发自主硬件,这家社交媒体巨头旨在大幅减少对 Nvidia 和 AMD 高成本 GPU 的依赖,同时为其下一代 AI 工作负载优化其庞大的基础设施。

扩展 Meta 训练与推理加速器 (MTIA)

即将开始的生产标志着 Meta 的 Meta Training and Inference Accelerator (MTIA) 项目的一个重要里程碑。与传统的单体芯片设计不同,Meta 正在采用模块化的“芯粒”(chiplet)方案。这一策略使公司能够更快速地迭代,将最新的 AI 工作负载洞察和硬件技术融入更短的开发周期中。在 AI 模型需求几乎每月都在演变的背景下,这种模块化设计至关重要。

根据内部报告,其中至少一款新芯片在短短六周内就成功通过了测试阶段。Meta 正与 Broadcom 合作进行设计架构,同时利用台积电 (TSMC) 进行高端制造。这些芯片的供应链已经非常稳健,涉及三星 (Samsung) 的内存、Sandisk 的存储以及住友电工 (Sumitomo Electric) 的光纤设备。

减少对 Nvidia 和 AMD 的依赖

随着 AI 模型复杂度的爆炸式增长,专用硬件的成本已成为沉重的资本负担。Meta 已发出激进的支出路线图信号,预计今年的资本支出将在 1250 亿至 1450 亿美元之间。这笔预算中的很大一部分将用于确保训练和部署 Muse Spark 系列 AI 模型所需的计算能力。

虽然 Meta 将继续购买价值数十亿美元的 AMD Instinct GPU 及其他第三方硬件,但 MTIA 芯片旨在处理特定的、高容量的任务。这些任务包括训练排名和推荐算法(Instagram 和 Facebook 的核心支柱),以及其各种消费级应用的通用 AI 推理。

更广泛的“硅片主权”竞赛

Meta 的举措是行业向“硅片主权”转移的大趋势的一部分。单一主导芯片供应商的时代正受到超大规模云计算厂商(hyperscalers)和 AI 实验室的共同挑战。Google 和 Amazon 已经建立了成功的定制硅片项目,据报道,OpenAI 和 Anthropic 目前也正在与 Broadcom 和 Samsung 等合作伙伴探索类似的路径。

为了支持这些硬件,Meta 也在以前所未有的速度扩展其物理基础设施。该公司计划今年部署 7 吉瓦 (GW) 的计算能力,并计划明年将这一数字翻倍。在定制硅片和数据中心电力方面的这种巨额投资,凸显了一个现实:AI 的未来将取决于底层硬件的效率。

核心要点

  • 模块化硬件策略: Meta 在其 MTIA 项目中使用基于 chiplet 的设计,以实现更快的迭代并适应不断演变的 AI 工作负载。
  • 战略供应链: 生产部署涉及强大的合作伙伴生态系统,包括负责设计的 Broadcom、负责制造的 TSMC 以及负责内存的三星 (Samsung)。
  • 大规模基础设施投资: Meta 正通过预计高达 1450 亿美元的资本支出 (CAPEX) 并计划将计算部署翻倍至 14 吉瓦,来为长期的 AI 霸权地位奠定基础。