PrismML का नया Bonsai 27B 1-bit मॉडल 3.9 GB की फ़ाइल में समा जाता है और iPhone 17 Pro Max पर लगभग 11 tokens प्रति सेकंड की गति से चलता है, जो इस बात का प्रमाण है कि एक 27-बिलियन-पैरामीटर वाला लैंग्वेज मॉडल एक कंज्यूमर स्मार्टफोन पर चल सकता है। यह दावा महत्वपूर्ण है क्योंकि यह ऑन-डिवाइस AI की सीमाओं को आगे बढ़ाता है, जिससे डेटा को क्लाउड पर भेजे बिना बेहतर ऑफलाइन असिस्टेंट मिलने की संभावना बढ़ जाती है।
यह कमी क्यों महत्वपूर्ण है
फुल-प्रिसिजन Bonsai 27B का आकार 54.7 GB है। मॉडल को सिंगल-बिट रिप्रेजेंटेशन में क्वांटाइज़ (quantising) करके, PrismML ने इसे घटाकर 3.9 GB कर दिया है—जो कि आकार में 14 गुना की कमी है। यह कंप्रेशन मॉडल को तकनीकी रूप से हाई-एंड iPhones पर स्टोर करने योग्य बनाता है, एक ऐसा स्तर जिसे पहले कुछ सौ मेगाबाइट से अधिक के लिए असंभव माना जाता था।
Apple हार्डवेयर पर मॉडल का प्रदर्शन कैसा है
PrismML ने इस मॉडल को Apple के MLX stack के लिए बनाया है, जो APIs का एक ऐसा सेट है जो डेवलपर्स को न्यूरल इंजन पर सीधे न्यूरल नेटवर्क चलाने की अनुमति देता है। अपने स्वयं के परीक्षण में, मॉडल ने iPhone 17 Pro Max पर प्रति सेकंड लगभग 11 tokens जेनरेट किए। 15 मानक लैंग्वेज-मॉडल बेंचमार्क में, 1-bit वर्जन ने मूल मॉडल के क्वालिटी स्कोर का 89.5% बनाए रखा, जिससे पता चलता है कि कंप्रेशन ने इसकी उपयोगिता को कम नहीं किया है।
व्यावहारिक सीमाएं जिनका आपको सामना करना पड़ सकता है
- मेमोरी प्रेशर (Memory pressure) – 3.9 GB की फ़ाइल तो फिट हो जाती है, लेकिन मॉडल को हालिया कॉन्टेक्स्ट (context) स्टोर करने के लिए एक की-वैल्यू (KV) कैश की भी आवश्यकता होती है। यह कैश बातचीत की लंबाई के साथ बढ़ता जाता है और फोन के RAM उपयोग को बढ़ा सकता है, जिससे संभावित रूप से गति धीमी हो सकती है।
- गर्मी और बैटरी – 27-बिलियन-पैरामीटर वाले नेटवर्क को चलाने से न्यूरल इंजन पर भारी दबाव पड़ता है। लगातार लोड के तहत फोन गर्म होने लगते हैं, और Apple का थर्मल मैनेजमेंट हार्डवेयर की सुरक्षा के लिए परफॉरमेंस को कम (throttle) कर देगा। PrismML ने बैटरी ड्रेन के ठोस आंकड़े जारी नहीं किए हैं, इसलिए दिन भर के उपयोग पैटर्न पर इसके वास्तविक प्रभाव का अभी पता नहीं है।
- डिवाइस की विशिष्टता – परफॉरमेंस का यह दावा नवीनतम iPhone 17 Pro Max पर लागू होता है। पुराने iPhones, लोअर-टियर iOS डिवाइस, या Android फोन में समान न्यूरल-इंजन क्षमताएं नहीं होती हैं, जिससे इन्फरेंस (inference) धीमा हो सकता है या मॉडल बिल्कुल भी फिट नहीं हो सकता है।
किसे लाभ होगा, और कौन पीछे छूट सकता है
प्राइवेसी-फर्स्ट ऐप्स के डेवलपर्स अब ऑन-डिवाइस एक लार्ज लैंग्वेज मॉडल होस्ट कर सकते हैं, जिससे यूजर डेटा फोन पर ही सुरक्षित रहेगा। इसका मतलब अधिक रिस्पॉन्सिव वॉइस असिस्टेंट, ऑफलाइन ट्रांसलेशन, या क्लाउड सब्सक्रिप्शन के बिना कॉन्टेक्स्टुअल टेक्स्ट जनरेशन हो सकता है।
Android निर्माता और मिड-रेंज फोन के उपयोगकर्ता इससे वंचित रह सकते हैं। यह मॉडल Apple के प्रोप्रायटरी स्टैक (proprietary stack) पर निर्भर है, इसलिए यही कंप्रेशन अन्य इकोसिस्टम पर स्वचालित रूप से काम नहीं करेगा।
क्या परीक्षण किया जाना बाकी है
PrismML के आंकड़े आंतरिक बेंचमार्क से आए हैं। स्वतंत्र परीक्षकों को लंबे सत्रों (sessions) के दौरान टोकन-प्रति-सेकंड की दर को सत्यापित करने, वास्तविक बैटरी खपत को मापने और KV कैश बढ़ने पर परफॉरमेंस कितनी जल्दी गिरती है, इसका आकलन करने की आवश्यकता है। वास्तविक दुनिया का उपयोग—जैसे एक घंटे तक चैट करना, कंटेंट स्ट्रीम करना, या अन्य ऐप्स के साथ मॉडल चलाना—यह बताएगा कि क्या 11-टोकन-प्रति-सेकंड का आंकड़ा नियंत्रित लैब के बाहर भी कायम रहता है।
निष्कर्ष
Bonsai 27B यह दिखाता है कि 27-बिलियन-पैरामीटर वाले लैंग्वेज मॉडल को इतना कंप्रेस किया जा सकता है कि वे एक फ्लैगशिप iPhone पर चल सकें, जो मध्यम गति पर लगभग पूर्ण गुणवत्ता प्रदान करते हैं। यह सफलता Apple के MLX stack पर टिकी है और अभी भी व्यावहारिक बाधाओं का सामना कर रही है: मेमोरी ओवरहेड, थर्मल थ्रॉटलिंग और अज्ञात बैटरी प्रभाव। यदि आगामी परीक्षण दावों की पुष्टि करते हैं, तो ऑन-डिवाइस AI विशिष्ट डेमो से निकलकर रोजमर्रा के ऐप्स तक पहुँच सकता है—बशर्ते iOS फ्लैगशिप और बाकी बाजार के बीच हार्डवेयर का अंतर कम हो जाए।
