Prism ML مدل Bonsai 27B را عرضه کرد؛ نسخه‌ای از مدل زبانی بزرگ Qwen 3.6 که روی یک گوشی موبایل جای می‌گیرد. این شرکت با فشرده‌سازی نسخه اصلی ۵۴ گیگابایتی به کمتر از ۴ گیگابایت از طریق کوانتیزاسیون ۱-بیتی (1-bit quantization)، کاهش اندازه ۱۴ برابری را محقق کرده و به کاربران اجازه می‌دهد مدل را به‌صورت محلی و بدون نیاز به فراخوانی APIهای ابری اجرا کنند.

چرا فشرده‌سازی اهمیت دارد

مدل‌های زبانی بزرگ (LLMs) معمولاً به یک پردازنده گرافیکی (GPU) در سطح دسکتاپ یا یک API پولی نیاز دارند، زیرا وزن‌های آن‌ها ده‌ها گیگابایت فضا اشغال می‌کنند. کوانتیزاسیون (Quantization) — یعنی استفاده از بیت‌های کمتر برای هر وزن — مدل را کوچک می‌کند، اما می‌تواند دانش مدل را نیز از بین ببرد. Bonsai دو حالت متمایز را ارائه می‌دهد: یک نسخه سه‌گانه (ternary) با سه مقدار وزن احتمالی (حدود ۷.۲ گیگابایت) و یک نسخه تهاجمی ۱-بیتی (حدود ۳.۹ گیگابایت). موازنه میان اندازه و توانمندی، محرک اصلی این آزمایش است.

عملکرد مدل‌ها در بازیابی حقایق

مدل اصلی Qwen 3.6 در مجموعه آزمون‌های ارزیاب، به تمام سوالات مربوط به تاریخ‌های تاریخی به‌درستی پاسخ داد. نسخه سه‌گانه Bonsai پنج مورد از شش سوال را از دست داد و نسخه ۱-بیتی در تک‌تک پرس‌وجوهای مربوط به تاریخ شکست خورد. همان‌طور که انتظار می‌رفت، فشرده‌سازی تهاجمی ابتدا حقایق نادر و خاص را حذف می‌کند و تنها الگوهای زبانی گسترده‌ای را که باعث روانی متن می‌شوند، حفظ می‌کند.

عملکرد کدنویسی داستان متفاوتی را روایت می‌کند

هنگامی که دستورها (prompts) به وظایف کدنویسی تغییر یافتند، نتایج کاملاً متفاوت شد. هر سه مدل، باگ‌های کلاسیک همزمانی (concurrency) را بدون خطا حل کردند. در یک چالش دشوار انیمیشن React، مدل ۱-بیتی Bonsai در دو تلاش کار را تمام کرد، در حالی که نسخه اصلی به چهار تلاش نیاز داشت، زیرا زمان اضافی را صرف تجزیه (parsing) کد می‌کرد. نسخه سه‌گانه به ده تلاش نیاز داشت و در نهایت باعث از کار افتادن (crash) سرور آزمایش شد.

موانع عملی

Bonsai روی محیط اجرای محبوب Ollama اجرا نمی‌شود. مدل ۱-بیتی به یک لایه اجرایی سفارشی نیاز دارد که توسط Prism ML ارائه شده است، بنابراین کاربران برای راه‌اندازی آن باید نرم‌افزارهای غیر استاندارد را نصب کنند. این وابستگی، جذابیت مدل را تنها به کسانی محدود می‌کند که با تغییر دادن تنظیمات محیط خود راحت هستند.

چه کسانی باید Bonsai را در نظر بگیرند و چه کسانی باید از آن دوری کنند

  • چت عمومی – از دست رفتن شدید جزئیات واقعی، Bonsai را برای استفاده به عنوان دستیار پایگاه دانش نامناسب می‌کند. برای پاسخ‌های دقیق به سوالات تاریخ، علوم یا رویدادهای جاری، از مدل اصلی یا یک API ابری استفاده کنید.
  • کمک‌دست محلی برای کدنویسی – توسعه‌دهندگانی که به دنبال ابزاری آفلاین هستند که بتواند کد پیشنهاد دهد، باگ‌ها را پیدا کند و روی گوشی یا لپ‌تاپ‌های ضعیف اجرا شود، خواهند دید که نسخه ۱-بیتی سرعت بالا و هزینه ذخیره‌سازی کمی را ارائه می‌دهد. این مدل یک عامل خودگردان (autonomous agent) نیست، اما منطق و نحو (syntax) را به‌طور کارآمد مدیریت می‌کند.

خلاصه کلام

Bonsai 27B نشان می‌دهد که می‌توان یک LLM ۵۴ گیگابایتی را به ۳.۹ گیگابایتِ مناسب برای گوشی فشرده کرد و همچنان پیشنهادهای کدنویسی به‌طور شگفت‌آوری سریع و توانمند دریافت کرد. بهای این کار، از بین رفتن تقریباً کامل بازیابی حقایق خاص است؛ بنابراین این مدل متعلق به جعبه‌ابزار توسعه‌دهندگانی است که سرعت آفلاین را بر دانش دانشنامه‌ای ترجیح می‌دهند.