Prism ML نے Bonsai 27B متعارف کرایا ہے، جو Qwen 3.6 large-language model کا ایک ایسا ورژن ہے جو موبائل فون پر چل سکتا ہے۔ 1-bit quantization کے ذریعے اصل 54 GB کے ماڈل کو 4 GB سے بھی کم تک سکیڑ کر، کمپنی نے سائز میں 14 گنا کمی حاصل کی ہے اور صارفین کو کلاؤڈ API کالز کے بغیر مقامی طور پر (locally) ماڈل چلانے کی سہولت فراہم کی ہے۔

کمپریشن کیوں اہم ہے

LLMs کو عام طور پر ڈیسک ٹاپ کلاس GPU یا پیڈ API کی ضرورت ہوتی ہے کیونکہ ان کے weights درجنوں گیگا بائٹس جگہ گھیرتے ہیں۔ Quantization—یعنی ہر weight کے لیے کم bits کا استعمال—ماڈل کے سائز کو چھوٹا کر دیتا ہے لیکن اس سے معلومات (knowledge) میں بھی کمی آ سکتی ہے۔ Bonsai دو انتہاؤں کی پیشکش کرتا ہے: ایک ternary variant (تین ممکنہ weight values، تقریباً 7.2 GB) اور ایک جارحانہ 1-bit variant (تقریباً 3.9 GB)۔ سائز اور صلاحیت کے درمیان توازن ہی اس ٹیسٹ کا بنیادی مقصد ہے۔

حقائق یاد رکھنے (factual recall) میں ماڈلز کی کارکردگی کیسی ہے

ٹیسٹر کے سوٹ میں اصل Qwen 3.6 نے تاریخ سے متعلق ہر سوال کا درست جواب دیا۔ Ternary Bonsai چھ میں سے پانچ سوالات کا جواب دینے میں ناکام رہا، جبکہ 1-bit ورژن تاریخ سے متعلق ہر سوال میں ناکام ہو گیا۔ جیسا کہ توقع تھی، جارحانہ کمپریشن سب سے پہلے نایاب اور مخصوص حقائق کو ختم کر دیتی ہے، اور صرف زبان کے وسیع تر پیٹرنز کو محفوظ رکھتی ہے جو روانی (fluency) فراہم کرتے ہیں۔

کوڈنگ کی کارکردگی ایک مختلف کہانی سناتی ہے

جب پرامپٹس (prompts) کو کوڈنگ کے کاموں میں بدلا گیا، تو نتائج بالکل مختلف رہے۔ تینوں ماڈلز نے کلاسک concurrency bugs کو بغیر کسی غلطی کے حل کر لیا۔ React اینیمیشن کے ایک مشکل چیلنج پر، 1-bit Bonsai نے دو کوششوں میں کام مکمل کر لیا، جبکہ اصل ماڈل کو چار کوششیں کرنی پڑیں کیونکہ اس نے کوڈ کو سمجھنے (parsing) میں اضافی وقت صرف کیا۔ Ternary ورژن کو دس کوششیں کرنی پڑیں اور آخر کار اس نے ٹیسٹ سرور کو کریش کر دیا۔

عملی رکاوٹیں

Bonsai مشہور Ollama runtime پر نہیں چلتا۔ 1-bit ماڈل کو Prism ML کی فراہم کردہ ایک کسٹم execution layer کی ضرورت ہوتی ہے، اس لیے صارفین کو اسے چلانے کے لیے غیر معیاری (non-standard) سافٹ ویئر انسٹال کرنا پڑتا ہے۔ یہ انحصار ماڈل کی مقبولیت کو صرف ان لوگوں تک محدود کر دیتا ہے جو اپنے ماحول (environment) میں تبدیلی کرنے کے عادی ہیں۔

کسے Bonsai پر غور کرنا چاہیے، اور کنہیں اس سے دور رہنا چاہیے

  • عام مقصد کے لیے چیٹ (General-purpose chat) – حقائق کی تفصیلات میں شدید کمی Bonsai کو نالج بیس اسسٹنٹ کے طور پر غیر موزوں بناتی ہے۔ تاریخ، سائنس، یا موجودہ واقعات کے درست جوابات کے لیے، اصل ماڈل یا کلاؤڈ API کا استعمال کریں۔
  • مقامی کوڈنگ مددگار (Local coding aide) – وہ ڈویلپرز جو ایک ایسا آف لائن ٹول چاہتے ہیں جو کوڈ تجویز کر سکے، بگ پکڑ سکے، اور فون یا کم قیمت لیپ ٹاپ پر چل سکے، وہ دیکھیں گے کہ 1-bit ورژن تیز رفتاری اور کم اسٹوریج لاگت فراہم کرتا ہے۔ یہ ایک خود مختار ایجنٹ (autonomous agent) نہیں ہے، لیکن یہ منطق (logic) اور سنٹیکس (syntax) کو مؤثر طریقے سے سنبھالتا ہے۔

خلاصہ

Bonsai 27B ظاہر کرتا ہے کہ آپ ایک 54 GB کے LLM کو فون کے لیے موزوں 3.9 GB تک سکیڑ سکتے ہیں اور پھر بھی حیران کن طور پر تیز اور قابل بھروسہ کوڈ تجاویز حاصل کر سکتے ہیں۔ اس کی قیمت مخصوص حقائق کو یاد رکھنے کی صلاحیت کا تقریباً مکمل خاتمہ ہے، اس لیے یہ ماڈل ان ڈویلپرز کے ٹول باکس کے لیے ہے جو انسائیکلوپیڈک علم کے مقابلے میں آف لائن رفتار کو اہمیت دیتے ہیں۔