PrismML کا نیا Bonsai 27B 1-bit ماڈل 3.9 GB کی فائل میں سما جاتا ہے اور iPhone 17 Pro Max پر تقریباً 11 ٹوکن فی سیکنڈ کی رفتار سے چلتا ہے، جو اس بات کا ثبوت ہے کہ 27 بلین پیرامیٹر والا لینگویج ماڈل ایک عام اسمارٹ فون پر چل سکتا ہے۔ یہ دعویٰ اس لیے اہم ہے کیونکہ یہ آن-ڈیوائس (on-device) AI کی حدود کو آگے بڑھاتا ہے، اور ڈیٹا کو کلاؤڈ پر بھیجے بغیر بہتر آف لائن اسسٹنٹس کا وعدہ کرتا ہے۔
اس کمی کی اہمیت کیوں ہے
فل پریسیژن (full-precision) Bonsai 27B کا وزن 54.7 GB ہے۔ ماڈل کو سنگل-بٹ ریپریزنٹیشن (single-bit representation) میں کوانٹائز (quantising) کر کے، PrismML نے اسے 3.9 GB تک سکیڑ دیا ہے—جو کہ سائز میں 14 گنا کمی ہے۔ یہ کمپریشن ماڈل کو تکنیکی طور پر ہائی اینڈ آئی فونز پر اسٹور کرنے کے قابل بناتی ہے، ایک ایسی حد جو پہلے چند سو میگا بائٹس سے زیادہ کے لیے ناممکن تھی۔
ایپل ہارڈ ویئر پر ماڈل کی کارکردگی کیسی ہے
PrismML نے یہ ماڈل ایپل کے MLX stack کے لیے بنایا ہے، جو کہ APIs کا وہ مجموعہ ہے جو ڈویلپرز کو نیورل نیٹ ورکس (neural nets) کو براہ راست نیورل انجن پر چلانے کی اجازت دیتا ہے۔ اپنے خود کے ٹیسٹنگ میں، ماڈل نے iPhone 17 Pro Max پر ہر سیکنڈ میں تقریباً 11 ٹوکنز پیدا کیے۔ 15 معیاری لینگویج ماڈل بینچ مارکس پر، 1-bit ورژن نے اصل ماڈل کے کوالٹی اسکورز کا 89.5% برقرار رکھا، جس سے پتہ چلتا ہے کہ کمپریشن نے اس کی افادیت کو متاثر نہیں کیا ہے۔
عملی حدود جن کا آپ کو سامنا کرنا پڑے گا
- میموری کا دباؤ (Memory pressure) – 3.9 GB کی فائل تو سما جاتی ہے، لیکن ماڈل کو حالیہ سیاق و سباق (context) کو محفوظ کرنے کے لیے کی-ویلیو (KV) کیش (cache) کی بھی ضرورت ہوتی ہے۔ یہ کیش گفتگو کے طول کے ساتھ بڑھتا جاتا ہے اور فون کے RAM کے استعمال کو بڑھا سکتا ہے، جس سے رفتار کم ہو سکتی ہے۔
- حرارت اور بیٹری – 27 بلین پیرامیٹر والے نیٹ ورک کو چلانا نیورل انجن پر بوجھ ڈالتا ہے۔ مسلسل لوڈ کے تحت فون گرم ہونے لگتے ہیں، اور ایپل کا تھرمل مینجمنٹ ہارڈ ویئر کے تحفظ کے لیے کارکردگی کو کم (throttle) کر دے گا۔ PrismML نے بیٹری کے اخراج کے ٹھوس اعداد و شمار جاری نہیں کیے ہیں، اس لیے روزانہ کے استعمال کے پیٹرن پر اس کے اصل اثر کا علم نہیں ہے۔
- ڈیوائس کی مخصوص نوعیت – کارکردگی کا یہ دعویٰ تازہ ترین iPhone 17 Pro Max پر لاگو ہوتا ہے۔ پرانے آئی فونز، کم درجے کے iOS ڈیوائسز، یا اینڈرائیڈ فونز میں اسی طرح کی نیورل انجن کی صلاحیتیں نہیں ہوتیں، جس کی وجہ سے ان میں انفرنس (inference) سست ہوگی یا شاید ماڈل ان پر چل ہی نہ سکے۔
کس کو فائدہ ہوگا، اور کون پیچھے رہ سکتا ہے
پرائیویسی کو ترجیح دینے والی ایپس کے ڈویلپرز اب آن-ڈیوائس ایک بڑا لینگویج ماڈل ہوسٹ کر سکتے ہیں، جس سے صارف کا ڈیٹا فون پر ہی محفوظ رہے گا۔ اس کا مطلب زیادہ بہتر آواز والے اسسٹنٹس، آف لائن ترجمہ، یا کلاؤڈ سبسکرپشن کے بغیر سیاق و سباق کے مطابق ٹیکسٹ جنریشن ہو سکتا ہے۔
اینڈرائیڈ مینوفیکچررز اور درمیانے درجے کے فون استعمال کرنے والے صارفین اس سے محروم رہیں گے۔ یہ ماڈل ایپل کے پراپرائٹری اسٹیک (proprietary stack) پر انحصار کرتا ہے، اس لیے یہی کمپریشن خود بخود دوسرے ایکو سسٹم پر کام نہیں کرے گی۔
کیا چیزیں ابھی ٹیسٹ ہونا باقی ہیں
PrismML کے اعداد و شمار اندرونی بینچ مارکس سے لیے گئے ہیں۔ آزاد ٹیسٹرز کو طویل سیشنز کے دوران ٹوکن فی سیکنڈ کی شرح کی تصدیق کرنے، بیٹری کے اصل استعمال کی پیمائش کرنے، اور KV کیش کے بڑھنے کے ساتھ کارکردگی میں کتنی تیزی سے کمی آتی ہے، اس کا جائزہ لینے کی ضرورت ہے۔ حقیقی دنیا کا استعمال—جیسے ایک گھنٹے تک چیٹ کرنا، مواد اسٹریمنگ کرنا، یا ماڈل کو دیگر ایپس کے ساتھ چلانا—یہ ظاہر کرے گا کہ آیا 11 ٹوکن فی سیکنڈ کا یہ ہندسہ کنٹرول شدہ لیب سے باہر برقرار رہتا ہے یا نہیں۔
خلاصہ
Bonsai 27B ظاہر کرتا ہے کہ 27 بلین پیرامیٹر والے لینگویج ماڈلز کو اتنا کمپریس کیا جا سکتا ہے کہ وہ ایک فلیگ شپ آئی فون پر چل سکیں، اور مناسب رفتار پر تقریباً مکمل کوالٹی فراہم کر سکیں۔ یہ پیش رفت ایپل کے MLX stack پر منحصر ہے اور اب بھی عملی رکاوٹوں کا سامنا ہے: میموری کا اضافی بوجھ، تھرمل تھروٹلنگ (thermal throttling)، اور بیٹری پر نامعلوم اثرات۔ اگر بعد کے ٹیسٹ ان دعووں کی تصدیق کر دیتے ہیں، تو آن-ڈیوائس AI مخصوص ڈیمو سے نکل کر روزمرہ کی ایپس کا حصہ بن سکتا ہے—بشرطیکہ iOS فلیگ شپ اور باقی مارکیٹ کے درمیان ہارڈ ویئر کا فرق کم ہو جائے۔
