PrismML चे नवीन Bonsai 27B 1-bit मॉडेल 3.9 GB च्या फाईलमध्ये बसते आणि iPhone 17 Pro Max वर सुमारे 11 tokens प्रति सेकंद वेगाने चालते, जे हे सिद्ध करते की 27-billion-parameter भाषा मॉडेल ग्राहकांच्या स्मार्टफोनवर चालू शकते. हा दावा महत्त्वाचा आहे कारण तो on-device AI च्या मर्यादा विस्तारतो, ज्यामुळे डेटा क्लाउडवर न पाठवता अधिक प्रगत ऑफलाइन असिस्टंट मिळण्याचे आश्वासन मिळते.
ही घट का महत्त्वाची आहे
पूर्ण-प्रिसिजन (full-precision) असलेले Bonsai 27B मॉडेल 54.7 GB चे आहे. मॉडेलला single-bit representation मध्ये quantise करून, PrismML ने त्याचा आकार 3.9 GB पर्यंत कमी केला आहे—म्हणजेच आकारात 14 पटीने घट झाली आहे. या कॉम्प्रेशनमुळे तांत्रिकदृष्ट्या हे मॉडेल हाय-एंड iPhones वर साठवणे शक्य झाले आहे, जे पूर्वी केवळ काही शेकडो मेगाबाइट्सपेक्षा जास्त आकाराच्या मॉडेल्ससाठी अशक्य होते.
Apple हार्डवेअरवर मॉडेलची कामगिरी कशी आहे
PrismML ने हे मॉडेल Apple च्या MLX stack साठी तयार केले आहे, जे अशा APIs चा संच आहे ज्यामुळे डेव्हलपर्स neural nets थेट neural engine वर चालवू शकतात. त्यांच्या स्वतःच्या चाचणीत, iPhone 17 Pro Max वर मॉडेलने प्रति सेकंद सुमारे 11 tokens जनरेट केले. 15 मानक language-model benchmarks मध्ये, 1-bit व्हर्जनने मूळ मॉडेलच्या गुणवत्ता गुणांपैकी (quality scores) 89.5% गुण टिकवून ठेवले आहेत, ज्यावरून असे दिसून येते की कॉम्प्रेशनमुळे त्याच्या उपयुक्ततेवर परिणाम झालेला नाही.
तुम्हाला येणाऱ्या व्यावहारिक मर्यादा
- Memory pressure – 3.9 GB ची फाईल बसते, परंतु अलीकडील संदर्भ (context) साठवण्यासाठी मॉडेलला key-value (KV) cache ची देखील आवश्यकता असते. संभाषणाची लांबी वाढल्यास हा cache वाढतो आणि फोनच्या RAM चा वापर वाढवू शकतो, ज्यामुळे संभाव्यतः वेग मंदावू शकतो.
- Heat and battery – 27-billion-parameter नेटवर्क चालवल्यामुळे neural engine वर ताण येतो. सततच्या लोडमुळे फोन गरम होण्याची शक्यता असते आणि हार्डवेअरच्या संरक्षणासाठी Apple चे thermal management कामगिरी कमी (throttle) करेल. PrismML ने बॅटरी संपण्याचे (battery-drain) ठोस आकडेवारी जाहीर केलेली नाही, त्यामुळे दैनंदिन वापराच्या स्वरूपावर याचा नेमका काय परिणाम होईल हे अद्याप माहीत नाही.
- Device specificity – कामगिरीचा हा दावा नवीनतम iPhone 17 Pro Max साठी आहे. जुने iPhones, कमी श्रेणीतील iOS डिव्हाइसेस किंवा Android फोन्समध्ये तशा प्रकारच्या neural-engine क्षमता नसतात, त्यामुळे तिथे inference चा वेग कमी असेल किंवा मॉडेल कदाचित अजिबात बसणार नाही.
कोणाला फायदा होईल आणि कोण मागे पडू शकते
Privacy-first ॲप्स बनवणाऱ्या डेव्हलपर्स आता मोठ्या language model ला on-device होस्ट करू शकतात, ज्यामुळे वापरकर्त्याचा डेटा फोनवरच सुरक्षित राहील. याचा अर्थ अधिक प्रतिसाद देणारे voice assistants, ऑफलाइन भाषांतर किंवा क्लाउड सबस्क्रिप्शनशिवाय contextual text generation मिळू शकते.
Android उत्पादक आणि मध्यम श्रेणीतील (mid-range) फोन वापरकर्ते यापासून वंचित राहतील. हे मॉडेल Apple च्या proprietary stack वर अवलंबून आहे, त्यामुळे तेच कॉम्प्रेशन इतर ecosystems वर आपोआप काम करणार नाही.
काय तपासणे बाकी आहे
PrismML चे आकडे अंतर्गत benchmarks वरून आलेले आहेत. स्वतंत्र परीक्षकांनी दीर्घकाळ चालवल्यानंतर token-per-second दर तपासणे, प्रत्यक्ष बॅटरीचा वापर मोजणे आणि KV cache वाढल्यामुळे कामगिरी किती वेगाने कमी होते याचे मूल्यांकन करणे आवश्यक आहे. प्रत्यक्ष वापर—जसे की एक तास चॅटिंग करणे, कंटेंट स्ट्रीमिंग करणे किंवा इतर ॲप्ससोबत मॉडेल चालवणे—यावरून हे स्पष्ट होईल की नियंत्रित प्रयोगशाळेबाहेर 11-token-per-second चा आकडा टिकून राहतो की नाही.
निष्कर्ष
Bonsai 27B हे दर्शवते की 27-billion-parameter भाषा मॉडेल्सना फ्लॅगशिप iPhone वर चालवण्यासाठी पुरेसे कॉम्प्रेशन केले जाऊ शकते, ज्यामुळे मध्यम वेगाने जवळपास पूर्ण गुणवत्ता मिळते. हा breakthrough Apple च्या MLX stack वर अवलंबून आहे आणि त्याला अजूनही व्यावहारिक अडथळ्यांचा सामना करावा लागत आहे: memory overhead, thermal throttling आणि बॅटरीवरील अज्ञात परिणाम. जर पुढील चाचण्यांनी या दाव्यांची पुष्टी केली, तर on-device AI केवळ डेमोंपुरते मर्यादित न राहता दैनंदिन ॲप्सचा भाग बनू शकते—जर iOS फ्लॅगशिप्स आणि इतर मार्केटमधील हार्डवेअरमधील अंतर कमी झाले तर.
