据报道,Apple 正与由 Khosla Ventures 支持的初创公司 PrismML 进行初步讨论,旨在将其先进的模型压缩技术整合到其生态系统中。此举旨在将复杂的人工智能直接引入 iPhone,从而弥合移动硬件限制与现代大语言模型 (LLMs) 巨大计算需求之间的鸿沟。

解决端侧 AI 的限制

随着 Apple 推出 iOS 18 和重新设计的 Siri,该公司面临着一个重大的技术障碍:高性能 AI 模型通常需要海量的内存和处理能力,这超出了标准智能手机的能力范围。通过整合 PrismML 的技术,Apple 寻求将处理过程从云端转移到设备本身。

这种转变对 Apple 的战略定位至关重要。端侧 AI 可以降低延迟,减少昂贵的云计算成本,并通过确保敏感的用户数据保留在手机上,强化 Apple 的核心隐私承诺。此外,它还允许关键的 AI 功能在没有网络连接的情况下也能正常运行。

PrismML 如何缩小庞大的 AI 模型

PrismML 源自加州理工学院 (California Institute of Technology) 的研究,它采用了一种复杂的方法来简化模型内部数值的存储方式。传统方法可能会将数值从 16 位降低到 4 位,而 PrismML 则更进一步,将每个数值减少到仅有的一个或三个可能的值。

效率提升非常显著。PrismML 最近通过将阿里巴巴开源的 Qwen 模型从庞大的 54 GB 压缩到不足 4 GB,展示了这一点。这种压缩使得该模型的所有 270 亿参数都能在 iPhone 15 或更新的机型上运行。据 CEO Babak Hassibi 称,这些压缩模型具有多项性能优势:

  • 内存效率: 内存占用减少高达 15 倍。
  • 速度: 运行速度提高六到八倍。
  • 功耗: 能耗降低高达六倍。

虽然 Hassibi 指出性能会有轻微下降——特别是在事实召回方面——但模型在推理和编程能力方面仍保持着很高的水平。

对半导体和硬件市场的影响

像 Apple 这样的巨头如果采用此类压缩技术,可能会改变硬件制造商的市场格局。目前,摩根士丹利 (Morgan Stanley) 等分析师预测,为了支持 AI,Apple 的内存成本可能会在 2027 财年大幅上升,这可能会导致 iPhone 售价提高。

然而,如果 PrismML 的技术成为标准,即使对高速、高效本地处理的需求增加,智能手机对海量内存模块的需求也可能会得到缓解。随着 PrismML 转向压缩 Google 的 Gemma 等其他主流模型,其目标依然明确:让高水平的智能在消费级硬件上实现本地化、快速化和普及化。

核心要点

  • 大规模压缩: PrismML 可以将 54 GB 的 AI 模型缩小到 4 GB 以下,使其在 iPhone 15 等高端智能手机上运行成为可能。
  • 效率提升: 该技术有望减少高达 15 倍的内存占用和 6 倍的能耗,这对于在执行 AI 任务时维持电池续航至关重要。
  • 隐私与速度: 将 AI 从云端转移到设备端将降低延迟并增强用户隐私,这是 Apple 产品理念的基石。

风险与悬而未决的问题

PrismML 的结果虽然令人期待,但仍处于早期阶段。

后续关注点

  • 官方确认: Apple 尚未宣布合作伙伴关系,因此任何关于端侧 LLM 的新闻稿或 iOS 18 测试版说明都将是一个关键信号。

核心结论: PrismML 的压缩技术可以让 iPhone 在不大幅增加内存负担或耗尽电池的情况下,运行真正的大语言模型,从而提供更快、更私密的 AI 体验。