Prism ML 推出了 Bonsai 27B,这是 Qwen 3.6 大语言模型的一个版本,可以运行在手机上。通过使用 1 比特量化技术将原始的 54 GB 压缩到 4 GB 以下,该公司实现了 14 倍的体积缩减,并允许用户在本地运行模型,无需调用云端 API。

为什么压缩如此重要

大语言模型(LLM)通常需要桌面级 GPU 或付费 API,因为它们的权重占用数十 GB 的空间。量化——即每个权重使用更少的比特数——可以缩小模型体积,但也可能剥离知识。Bonsai 提供了两种极端方案:一种是三值变体(具有三种可能的权重值,约 7.2 GB),另一种是激进的 1 比特变体(约 3.9 GB)。体积与能力之间的权衡是本次测试的核心。

模型在事实召回方面的表现

在测试人员的测试套件中,原始的 Qwen 3.6 正确回答了每一个历史日期问题。三值版本的 Bonsai 在六个问题中错失了五个,而 1 比特版本则未能通过任何一个日期查询。正如预期的那样,激进的压缩会首先丢弃稀有的特定事实,仅保留驱动语言流畅性的广泛语言模式。

代码性能则呈现出不同的结果

当提示词切换到编程任务时,结果发生了反转。所有三个模型都毫无差错地解决了经典的并发 bug。在一次具有挑战性的 React 动画任务中,1 比特版本的 Bonsai 仅用了两次尝试就完成了,而原始模型则需要四次,因为它花费了额外的时间来解析代码。三值版本则需要十次尝试,并最终导致测试服务器崩溃。

实际障碍

Bonsai 无法在流行的 Ollama 运行时上运行。1 比特模型需要由 Prism ML 提供的自定义执行层,因此用户必须安装非标准软件才能使其工作。这种依赖性限制了该模型的吸引力,仅适用于那些乐于调整环境的用户。

谁应该考虑 Bonsai,谁应该远离

  • 通用聊天 – 事实细节的剧烈丢失使得 Bonsai 不适合作为知识库助手。对于历史、科学或时事问题的准确回答,请坚持使用原始模型或云端 API。
  • 本地编程助手 – 对于想要一个可以提供代码建议、捕捉 bug,并能在手机或低端笔记本电脑上运行的离线工具的开发者来说,1 比特版本提供了极高的速度和极低的存储成本。它不是一个自主智能体,但它能高效地处理逻辑和语法。

总结

Bonsai 27B 表明,你可以将一个 54 GB 的大语言模型压缩到手机友好的 3.9 GB,并且仍然能获得惊人快速且胜任的代码建议。代价是特定事实召回能力的近乎完全丧失,因此该模型更适合那些看重离线速度而非百科全书式知识的开发者的工具箱。