१५० अब्ज पॅरामीटर असलेला Mixture-of-Experts (MoE) मॉडेल एका सामान्य डेव्हलपर लॅपटॉपवर मजकूर तयार करू शकतो. या प्रयोगातून असे दिसून येते की, SSD च्या वेगापेक्षा RAM हा कामगिरीवर मर्यादा आणणारा खरा घटक आहे. हे महत्त्वाचे आहे कारण यातून सिद्ध होते की, क्लाउड कॉम्प्युटवर खर्च न करताही अत्याधुनिक (frontier-scale) मॉडेल्स स्थानिक पातळीवर (locally) तपासणे शक्य आहे.

चाचणी

आम्ही DeepSeek V4 Flash मॉडेल—जे एक REAP-pruned 150 B-पॅरामीटर MoE आहे—ओपन-सोर्स Colibrì इन्फरन्स इंजिनद्वारे चालवले. यासाठी आम्ही ६१ GB RAM आणि १ TB NVMe SSD असलेला AMD Ryzen AI 9 365 लॅपटॉप वापरला. आम्ही तीन मिनिटांच्या जनरेशन रनचा वेळ मोजला आणि प्रत्येक डिस्क ॲक्सेसची नोंद केली.

आकडेवारी काय दर्शवते

  • डिस्कची हालचाल अत्यल्प होती. तीन मिनिटांच्या जनरेशन दरम्यान SSD ने ११ सेकंदांपेक्षा कमी वेळ डेटा वाचण्याचे (reads) काम केले. जर ड्राइव्हने डेटा त्वरित वाचला असता, तरीही एकूण थ्रूपुटमध्ये (throughput) केवळ ६ टक्क्यांनी सुधारणा झाली असती.
  • RAM च्या आकारामुळे वेगावर थेट परिणाम झाला. RAM कॅशे (cache) अर्धी केल्यामुळे थ्रूपुटमध्ये अंदाजे १५ टक्क्यांनी घट झाली. डिस्कची प्रतीक्षा करण्याइतकाच वेळ CPU ने कॅशे मिस (cache misses) हाताळण्यात—म्हणजेच डी-क्वांटायझिंग (de-quantising), कॉपी करणे आणि डेटा व्यवस्थापित करणे—वापरला.

लॅपटॉपवर मोठ्या मॉडेल्सच्या इन्फरन्ससाठी (inference) स्टोरेज बँडविड्थ हा मुख्य अडथळा आहे, या सामान्य समजुतीला हे आकडे छेद देतात.

RAM, SSD पेक्षा सरस का आहे

जेव्हा मॉडेल पॅरामीटर आधीच RAM मध्ये उपलब्ध नसतो, तेव्हा सिस्टमला खालील गोष्टी कराव्या लागतात:

  1. SSD मधून डेटा खेचणे.
  2. तो डिकोड करणे आणि गणनेसाठी (computation) CPU रजिस्टर्समध्ये हलवणे.

या दोन्ही पायऱ्यांमध्ये वेळ (cycles) खर्च होतो. पहिली पायरी SSD च्या बँडविड्थने मर्यादित असते; दुसरी पायरी साधारणपणे तितकाच विलंब निर्माण करते कारण डेटा कितीही वेगाने आला तरी CPU ला तो डी-क्वांटाइज करावाच लागतो. त्यामुळे, वेगवान SSD मुळे मिळणारा फायदा मर्यादित असतो, तर अधिक RAM मुळे मॉडेलचा मोठा भाग RAM मध्येच राहू शकतो आणि डेटाची वारंवार ये-जा करण्याची गरज उरत नाही.

डेव्हलपर्ससाठी याचे महत्त्व

  • स्टोरेजमध्ये नाही, तर मेमरीमध्ये गुंतवणूक करा.
  • स्थानिक चाचणी (Local testing) व्यवहार्य होते. डेव्हलपर्स क्लाउड क्रेडिट्ससाठी पैसे खर्च न करता, त्यांच्या सध्याच्या मशीनवर ओपन-वेट MoE मॉडेल्स चालवू शकतात आणि त्यांची शैली (style), टूल-कॉलिंग वर्तन (tool-calling behavior) आणि आउटपुटची गुणवत्ता तपासू शकतात.
  • बॅच इव्हॅल्युएशन (Batch evaluation) वास्तववादी बनते. रिअल-टाइम चॅट कदाचित अजूनही संथ वाटू शकते, परंतु रांगेत लावलेली कामे (queued jobs)—जसे की संशोधनासाठी डझनभर प्रॉम्प्ट्स तयार करणे—लॅपटॉपवर सहजपणे चालू शकतात.

संभाव्य प्रतिवाद

काही लोक असा युक्तिवाद करू शकतात की, ज्या वर्कलोड्समध्ये वारंवार नवीन 'एक्स्पर्ट वेट्स' (expert weights) लोड करावे लागतात, तिथे SSD लेटन्सी (latency) अजूनही महत्त्वाची ठरते.

पुढे काय पाहावे

  • मेमरी-कार्यक्षम (Memory-efficient) मॉडेल व्हेरिएंट्स.
  • मोठ्या ऑन-चिप कॅशे (on-chip caches) असलेले हार्डवेअर.
  • सॉफ्टवेअर-स्तरीय कॅशिंग स्ट्रॅटेजीज (caching strategies).

सारांश स्पष्ट आहे: ज्या डेव्हलपर्सना लॅपटॉपवर मोठ्या MoE मॉडेल्ससोबत प्रयोग करायचे आहेत, त्यांनी अधिक RAM खरेदी करावी. SSD अपग्रेड केल्याने केवळ काही टक्क्यांचीच बचत होते, तर अतिरिक्त मेमरीमुळे इन्फरन्स वेळेत दुहेरी अंकी (double-digit) टक्केवारीने कपात होऊ शकते. यामुळे AI प्रोटोटायपिंगसाठी खर्चाचे गणित बदलते आणि अशा मॉडेल्सच्या स्थानिक, विनामूल्य चाचणीसाठी मार्ग मोकळा होतो, ज्यांच्यासाठी पूर्वी समर्पित क्लाउड क्लस्टर्सची आवश्यकता असल्याचे मानले जात होते.