Prism ML مدل Bonsai 27B را عرضه کرد؛ نسخهای از مدل زبانی بزرگ Qwen 3.6 که روی یک گوشی موبایل جای میگیرد. این شرکت با فشردهسازی نسخه اصلی ۵۴ گیگابایتی به کمتر از ۴ گیگابایت از طریق کوانتیزاسیون ۱-بیتی (1-bit quantization)، کاهش اندازه ۱۴ برابری را محقق کرده و به کاربران اجازه میدهد مدل را بهصورت محلی و بدون نیاز به فراخوانی APIهای ابری اجرا کنند.
چرا فشردهسازی اهمیت دارد
مدلهای زبانی بزرگ (LLMs) معمولاً به یک پردازنده گرافیکی (GPU) در سطح دسکتاپ یا یک API پولی نیاز دارند، زیرا وزنهای آنها دهها گیگابایت فضا اشغال میکنند. کوانتیزاسیون (Quantization) — یعنی استفاده از بیتهای کمتر برای هر وزن — مدل را کوچک میکند، اما میتواند دانش مدل را نیز از بین ببرد. Bonsai دو حالت متمایز را ارائه میدهد: یک نسخه سهگانه (ternary) با سه مقدار وزن احتمالی (حدود ۷.۲ گیگابایت) و یک نسخه تهاجمی ۱-بیتی (حدود ۳.۹ گیگابایت). موازنه میان اندازه و توانمندی، محرک اصلی این آزمایش است.
عملکرد مدلها در بازیابی حقایق
مدل اصلی Qwen 3.6 در مجموعه آزمونهای ارزیاب، به تمام سوالات مربوط به تاریخهای تاریخی بهدرستی پاسخ داد. نسخه سهگانه Bonsai پنج مورد از شش سوال را از دست داد و نسخه ۱-بیتی در تکتک پرسوجوهای مربوط به تاریخ شکست خورد. همانطور که انتظار میرفت، فشردهسازی تهاجمی ابتدا حقایق نادر و خاص را حذف میکند و تنها الگوهای زبانی گستردهای را که باعث روانی متن میشوند، حفظ میکند.
عملکرد کدنویسی داستان متفاوتی را روایت میکند
هنگامی که دستورها (prompts) به وظایف کدنویسی تغییر یافتند، نتایج کاملاً متفاوت شد. هر سه مدل، باگهای کلاسیک همزمانی (concurrency) را بدون خطا حل کردند. در یک چالش دشوار انیمیشن React، مدل ۱-بیتی Bonsai در دو تلاش کار را تمام کرد، در حالی که نسخه اصلی به چهار تلاش نیاز داشت، زیرا زمان اضافی را صرف تجزیه (parsing) کد میکرد. نسخه سهگانه به ده تلاش نیاز داشت و در نهایت باعث از کار افتادن (crash) سرور آزمایش شد.
موانع عملی
Bonsai روی محیط اجرای محبوب Ollama اجرا نمیشود. مدل ۱-بیتی به یک لایه اجرایی سفارشی نیاز دارد که توسط Prism ML ارائه شده است، بنابراین کاربران برای راهاندازی آن باید نرمافزارهای غیر استاندارد را نصب کنند. این وابستگی، جذابیت مدل را تنها به کسانی محدود میکند که با تغییر دادن تنظیمات محیط خود راحت هستند.
چه کسانی باید Bonsai را در نظر بگیرند و چه کسانی باید از آن دوری کنند
- چت عمومی – از دست رفتن شدید جزئیات واقعی، Bonsai را برای استفاده به عنوان دستیار پایگاه دانش نامناسب میکند. برای پاسخهای دقیق به سوالات تاریخ، علوم یا رویدادهای جاری، از مدل اصلی یا یک API ابری استفاده کنید.
- کمکدست محلی برای کدنویسی – توسعهدهندگانی که به دنبال ابزاری آفلاین هستند که بتواند کد پیشنهاد دهد، باگها را پیدا کند و روی گوشی یا لپتاپهای ضعیف اجرا شود، خواهند دید که نسخه ۱-بیتی سرعت بالا و هزینه ذخیرهسازی کمی را ارائه میدهد. این مدل یک عامل خودگردان (autonomous agent) نیست، اما منطق و نحو (syntax) را بهطور کارآمد مدیریت میکند.
خلاصه کلام
Bonsai 27B نشان میدهد که میتوان یک LLM ۵۴ گیگابایتی را به ۳.۹ گیگابایتِ مناسب برای گوشی فشرده کرد و همچنان پیشنهادهای کدنویسی بهطور شگفتآوری سریع و توانمند دریافت کرد. بهای این کار، از بین رفتن تقریباً کامل بازیابی حقایق خاص است؛ بنابراین این مدل متعلق به جعبهابزار توسعهدهندگانی است که سرعت آفلاین را بر دانش دانشنامهای ترجیح میدهند.
