Prism MLは、モバイル端末に収まるサイズのQwen 3.6大規模言語モデルのバージョンであるBonsai 27Bをリリースしました。1ビット量子化によって、オリジナルの54GBを4GB未満まで圧縮することで、同社は14倍のサイズ削減を実現し、クラウドAPIを介さずにモデルをローカルで実行することを可能にしました。

なぜ圧縮が重要なのか

LLMは通常、重みが数十ギガバイトに及ぶため、デスクトップクラスのGPUや有料APIを必要とします。量子化(重みあたりのビット数を減らすこと)はモデルを小型化しますが、知識を削ぎ落としてしまう可能性もあります。Bonsaiには2つの極端な選択肢があります。1つはternaryバリアント(3つの重み値が可能、約7.2GB)、もう1つはアグレッシブな1ビット・バリアント(約3.9GB)です。サイズと性能のトレードオフが、今回のテストの焦点となっています。

事実の想起におけるモデルの性能

テスターのスイートにおいて、オリジナルのQwen 3.6は歴史的な日付に関するすべての質問に正解しました。一方、ternary Bonsaiは6問中5問に失敗し、1ビット版は日付に関するクエリすべてに失敗しました。予想通り、強力な圧縮はまず稀で具体的な事実を破棄し、流暢さを支える広範な言語パターンのみを保持します。

コーディング性能は異なる結果を示している

プロンプトをコーディングタスクに切り替えると、結果は一変しました。3つのモデルすべてが、古典的な並行性のバグをエラーなしで解決しました。負荷の高いReactアニメーションの課題では、1ビット版のBonsaiは2回の試行で完了しましたが、オリジナルはコードの解析に余計な時間がかかったため4回を要しました。ternary版は10回の試行を必要とし、最終的にテストサーバーをクラッシュさせました。

実用上のハードル

Bonsaiは、普及しているOllamaランタイムでは動作しません。1ビットモデルにはPrism MLが提供するカスタム実行レイヤーが必要なため、動作させるには非標準のソフトウェアをインストールする必要があります。この依存関係により、環境の微調整に慣れている層以外には、モデルの魅力が限定されてしまいます。

Bonsaiを検討すべき人と、避けるべき人

  • 汎用チャット – 事実の詳細が劇的に失われるため、Bonsaiは知識ベースのアシスタントとしては不向きです。歴史、科学、時事問題に対して正確な回答を求める場合は、オリジナルモデルまたはクラウドAPIを使用してください。
  • ローカル・コーディング・エイド – コードの提案、バグの検出ができ、スマートフォンや低スペックのノートPCで動作するオフラインツールを求める開発者にとって、1ビット版はスピードと低ストレージコストを提供します。自律的なエージェントではありませんが、ロジックと構文を効率的に処理します。

結論

Bonsai 27Bは、54GBのLLMをスマートフォンに適した3.9GBまで圧縮しても、驚くほど高速で有能なコード提案が得られることを示しています。その代償は、具体的な事実の想起能力がほぼ完全に失われることですが、このモデルは百科事典的な知識よりもオフラインでのスピードを重視する開発者のツールボックスに適しています。