एक 150-बिलियन-पैरामीटर वाला Mixture-of-Experts मॉडल एक स्टैंडर्ड डेवलपर लैपटॉप पर टेक्स्ट जेनरेट कर सकता है। यह प्रयोग दिखाता है कि SSD की गति नहीं, बल्कि RAM वास्तविक प्रदर्शन को सीमित करने वाला कारक है। यह महत्वपूर्ण है क्योंकि यह साबित करता है कि क्लाउड कंप्यूट पर खर्च किए बिना फ्रंटियर-स्केल मॉडल्स का स्थानीय रूप से परीक्षण किया जा सकता है।

परीक्षण

हमने ओपन-सोर्स Colibrì इन्फरेंस इंजन के माध्यम से DeepSeek V4 Flash मॉडल—जो कि एक REAP-प्रून किया हुआ 150 B-पैरामीटर MoE है—को चलाया। हार्डवेयर एक AMD Ryzen AI 9 365 लैपटॉप था जिसमें 61 GB RAM और 1 TB NVMe SSD थी। हमने तीन मिनट के जनरेशन रन का समय मापा और हर डिस्क एक्सेस को लॉग किया।

आंकड़े क्या बताते हैं

  • डिस्क गतिविधि न्यूनतम थी। तीन मिनट के जनरेशन के दौरान SSD ने 11 सेकंड से भी कम समय के लिए रीड (read) किया। यदि ड्राइव डेटा को तुरंत पढ़ भी पाती, तो भी कुल थ्रूपुट (throughput) में केवल लगभग 6 प्रतिशत का सुधार होता।
  • RAM के आकार का गति पर सीधा प्रभाव पड़ा। RAM कैश को आधा करने से थ्रूपुट में लगभग 15 प्रतिशत की कमी आई। CPU ने कैश मिस (cache misses) को संभालने—जैसे डी-क्वांटाइजिंग (de-quantising), कॉपी करने और डेटा मैनेज करने—में लगभग उतना ही समय बिताया जितना कि डिस्क का इंतज़ार करने में।

ये आंकड़े इस आम धारणा को गलत साबित करते हैं कि लैपटॉप पर बड़े-मॉडल इन्फरेंस के लिए स्टोरेज बैंडविड्थ मुख्य बाधा (choke point) है।

RAM, SSD से बेहतर क्यों है

जब कोई मॉडल पैरामीटर पहले से ही RAM में मौजूद नहीं होता है, तो सिस्टम को यह करना पड़ता है:

  1. SSD से डेटा निकालना।
  2. इसे डिकोड करना और गणना के लिए CPU रजिस्टर्स में ले जाना।

दोनों चरणों में साइकिल (cycles) खर्च होते हैं। पहला चरण SSD के बैंडविड्थ द्वारा सीमित होता है; दूसरा चरण लगभग उतना ही विलंब (delay) जोड़ता है क्योंकि डेटा कितनी भी तेज़ी से आए, CPU को उसे डी-क्वांटाइज करना ही पड़ता है। इसलिए, एक तेज़ SSD से मिलने वाला लाभ कम होता जाता है, जबकि अधिक RAM मॉडल के अधिक हिस्से को RAM में ही रहने देती है और इस खर्चीले राउंड-ट्रिप को खत्म कर देती है।

डेवलपर्स के लिए निहितार्थ

  • स्टोरेज में नहीं, मेमोरी में निवेश करें।
  • स्थानीय परीक्षण व्यवहार्य हो जाता है। डेवलपर्स मौजूदा मशीनों पर ओपन-वेट MoE मॉडल्स चला सकते हैं, और क्लाउड क्रेडिट के लिए भुगतान किए बिना स्टाइल, टूल-कॉलिंग व्यवहार और आउटपुट क्वालिटी की जांच कर सकते हैं।
  • बैच मूल्यांकन वास्तविक है। रियल-टाइम चैट अभी भी सुस्त लग सकती है, लेकिन क्यू (queued) किए गए काम—जैसे शोध के लिए दर्जनों प्रॉम्प्ट जेनरेट करना—लैपटॉप पर आसानी से चल सकते हैं।

संभावित प्रति-तर्क

कुछ लोग तर्क दे सकते हैं कि उन वर्कलोड के लिए SSD लेटेंसी (latency) अभी भी मायने रखती है जो बार-बार नए एक्सपर्ट वेट्स (expert weights) लोड करते हैं।

आगे क्या देखें

  • मेमोरी-कुशल मॉडल वेरिएंट।
  • बड़े ऑन-चिप कैश वाले हार्डवेयर।
  • सॉफ्टवेयर-स्तर की कैशिंग रणनीतियाँ।

निष्कर्ष स्पष्ट है: जो डेवलपर्स लैपटॉप पर विशाल MoE मॉडल्स के साथ प्रयोग करना चाहते हैं, उन्हें अधिक RAM खरीदनी चाहिए। SSD अपग्रेड से केवल कुछ प्रतिशत की ही बचत होती है, जबकि अतिरिक्त मेमोरी इन्फरेंस समय को दो अंकों (double-digit) के प्रतिशत तक कम कर सकती है। यह AI प्रोटोटाइपिंग के लिए लागत गणना (cost calculus) को बदल देता है और उन मॉडल्स के स्थानीय, लागत-मुक्त परीक्षण का मार्ग प्रशस्त करता है जिनके लिए पहले समर्पित क्लाउड क्लस्टर की आवश्यकता मानी जाती थी।