Prism ML ने Bonsai 27B लाँच केले आहे, जे Qwen 3.6 लार्ज-लँग्वेज मॉडेलचे असे व्हर्जन आहे जे मोबाईल फोनवर सहज चालू शकते. 1-bit quantization वापरून मूळ 54 GB मॉडेलचा आकार 4 GB पेक्षा कमी करून, कंपनीने आकारात 14 पट घट केली आहे आणि वापरकर्त्यांना क्लाउड API कॉल्सशिवाय स्थानिक पातळीवर (locally) मॉडेल चालवण्याची सुविधा दिली आहे.
कॉम्प्रेशन (compression) का महत्त्वाचे आहे
LLMs साठी सहसा डेस्कटॉप-क्लास GPU किंवा सशुल्क (paid) API ची आवश्यकता असते, कारण त्यांचे weights डझन्स ऑफ गिगाबाइट्स जागा व्यापतात. Quantization—प्रत्येक weight साठी कमी बिट्स वापरणे—मॉडेलचा आकार कमी करते, परंतु यामुळे माहिती किंवा ज्ञान (knowledge) देखील कमी होऊ शकते. Bonsai दोन टोकांचे पर्याय देते: एक ternary variant (तीन संभाव्य weight व्हॅल्यूज, 7.2 GB) आणि एक आक्रमक (aggressive) 1-bit variant (3.9 GB). आकार आणि क्षमता यांच्यातील हा समतोल (trade-off) या चाचणीचा मुख्य आधार आहे.
तथ्यात्मक स्मृती (factual recall) बाबतीत मॉडेल्सची कामगिरी कशी आहे
मूळ Qwen 3.6 ने टेस्टरच्या सुईटमधील इतिहासातील प्रत्येक तारखेच्या प्रश्नाचे अचूक उत्तर दिले. Ternary Bonsai ने सहा पैकी पाच प्रश्नांची उत्तरे चुकवली, तर 1-bit व्हर्जन कोणत्याही तारखेच्या प्रश्नाचे उत्तर देऊ शकले नाही. अपेक्षेप्रमाणे, आक्रमक कॉम्प्रेशनमुळे दुर्मिळ आणि विशिष्ट तथ्ये (facts) आधी नष्ट होतात आणि केवळ भाषेचे व्यापक नमुने (broad language patterns) शिल्लक राहतात, ज्यामुळे भाषेचा ओघ (fluency) टिकून राहतो.
कोडिंग कामगिरी वेगळी कथा सांगते
जेव्हा प्रॉम्प्ट्स कोडिंग कामांकडे वळले, तेव्हा निकाल पूर्णपणे बदलले. तिन्ही मॉडेल्सनी क्लासिक concurrency bugs कोणत्याही त्रुटीशिवाय सोडवले. एका कठीण React animation आव्हानामध्ये, 1-bit Bonsai ने दोन प्रयत्नांत काम पूर्ण केले, तर मूळ मॉडेलला चार प्रयत्न लागले कारण त्याचा कोड पार्स (parsing) करण्यात जास्त वेळ गेला. Ternary व्हर्जनला दहा प्रयत्न लागले आणि शेवटी त्याचा टेस्ट सर्व्हर क्रॅश झाला.
व्यावहारिक अडथळे
Bonsai लोकप्रिय Ollama runtime वर चालत नाही. 1-bit मॉडेलसाठी Prism ML द्वारे पुरवल्या जाणाऱ्या कस्टम एक्झिक्यूशन लेयरची (execution layer) आवश्यकता असते, त्यामुळे ते वापरण्यासाठी वापरकर्त्यांना नॉन-स्टँडर्ड सॉफ्टवेअर इन्स्टॉल करावे लागते. या अवलंबित्वामुळे (dependency) हे मॉडेल केवळ अशा लोकांसाठी मर्यादित राहते जे स्वतःच्या वातावरणात (environment) बदल करण्यास सक्षम आहेत.
कोणाला Bonsai चा विचार करावा आणि कोणापासून दूर राहावे
- सामान्य वापरासाठी चॅट (General-purpose chat) – तथ्यात्मक तपशीलांच्या मोठ्या नुकसानीमुळे Bonsai ज्ञान-आधारित सहाय्यक (knowledge-base assistant) म्हणून अयोग्य ठरते. इतिहास, विज्ञान किंवा चालू घडामोडींच्या अचूक उत्तरांसाठी मूळ मॉडेल किंवा क्लाउड API चा वापर करणेच योग्य ठरेल.
- स्थानिक कोडिंग सहाय्यक (Local coding aide) – ज्या डेव्हलपर्सना कोड सुचवणारे, बग्स शोधणारे आणि फोन किंवा कमी क्षमतेच्या लॅपटॉपवर चालणारे ऑफलाइन टूल हवे आहे, त्यांच्यासाठी 1-bit व्हर्जन वेगवान आणि कमी स्टोरेज खर्च देणारे ठरेल. हे एखादे स्वायत्त एजंट (autonomous agent) नाही, परंतु ते लॉजिक आणि सिंटॅक्स कार्यक्षमतेने हाताळते.
निष्कर्ष
Bonsai 27B हे दर्शवते की तुम्ही 54 GB चा LLM फोनसाठी सोयीस्कर अशा 3.9 GB पर्यंत कॉम्प्रेस करू शकता आणि तरीही आश्चर्यकारकपणे वेगवान आणि सक्षम कोड सूचना मिळवू शकता. याची किंमत म्हणजे विशिष्ट तथ्यात्मक स्मृतीचा (factual recall) जवळजवळ पूर्णपणे होणारा ऱ्हास आहे, त्यामुळे हे मॉडेल अशा डेव्हलपर्सच्या टूलबॉक्ससाठी आहे जे विश्वकोशासारख्या ज्ञानापेक्षा ऑफलाइन वेगाला अधिक महत्त्व देतात.
