150 ارب پیرامیٹر والا Mixture-of-Experts ماڈل ایک عام ڈویلپر لیپ ٹاپ پر متن تیار کر سکتا ہے۔ تجربہ ظاہر کرتا ہے کہ کارکردگی کی اصل رکاوٹ SSD کی رفتار نہیں بلکہ RAM ہے۔ یہ اس لیے اہم ہے کیونکہ یہ ثابت کرتا ہے کہ فرنٹیر اسکیل (frontier-scale) ماڈلز کو کلاؤڈ کمپیوٹنگ پر خرچ کیے بغیر مقامی طور پر ٹیسٹ کیا جا سکتا ہے۔

ٹیسٹ

ہم نے DeepSeek V4 Flash ماڈل—جو کہ ایک REAP-pruned 150 B-parameter MoE ہے—کو اوپن سورس Colibrì inference engine کے ذریعے چلایا۔ ہارڈ ویئر ایک AMD Ryzen AI 9 365 لیپ ٹاپ تھا جس میں 61 GB RAM اور 1 TB NVMe SSD تھی۔ ہم نے تین منٹ کے جنریشن رن کا وقت نوٹ کیا اور ڈسک کے ہر ایکسیس (access) کا ریکارڈ رکھا۔

اعداد و شمار کیا ظاہر کرتے ہیں

  • ڈسک کی سرگرمی نہ ہونے کے برابر تھی۔ تین منٹ کے جنریشن کے دوران SSD نے 11 سیکنڈ سے بھی کم وقت ریڈ (read) کرنے میں صرف کیا۔ اگر ڈرائیو ڈیٹا کو فوری طور پر پڑھ بھی سکتی، تب بھی کل تھرو پٹ (throughput) میں صرف تقریباً 6 فیصد بہتری آتی۔
  • RAM کے سائز نے براہ راست رفتار پر اثر ڈالا۔ RAM کیش (cache) کو آدھا کرنے سے تھرو پٹ میں تقریباً 15 فیصد کمی آئی۔ CPU نے کیش مسز (cache misses) کو سنبھالنے—یعنی ڈی کوانٹائزنگ (de-quantising)، کاپی کرنے اور ڈیٹا کو مینیج کرنے—میں تقریباً اتنا ہی وقت صرف کیا جتنا اس نے ڈسک کا انتظار کرنے میں لگایا۔

یہ اعداد و شمار اس عام تصور کو غلط ثابت کرتے ہیں کہ لیپ ٹاپ پر بڑے ماڈلز کے انفرنس (inference) کے لیے اسٹوریج بینڈوتھ (bandwidth) سب سے بڑی رکاوٹ ہے۔

RAM، SSD سے بہتر کیوں ہے

جب ماڈل کا کوئی پیرامیٹر پہلے سے RAM میں موجود نہ ہو، تو سسٹم کو یہ کرنا پڑتا ہے:

  1. SSD سے ڈیٹا نکالنا۔
  2. اسے ڈی کوڈ کرنا اور کمپیوٹیشن کے لیے CPU رجسٹرز میں منتقل کرنا۔

یہ دونوں مراحل سائیکل (cycles) استعمال کرتے ہیں۔ پہلا مرحلہ SSD کی بینڈوتھ سے محدود ہے؛ دوسرا مرحلہ تقریباً اتنا ہی تاخیر پیدا کرتا ہے کیونکہ ڈیٹا کتنی ہی تیزی سے پہنچے، CPU کو اسے ڈی کوانٹائز کرنا ہی پڑتا ہے۔ اس لیے ایک تیز رفتار SSD سے حاصل ہونے والا فائدہ محدود ہے، جبکہ زیادہ RAM ماڈل کے زیادہ حصے کو مستقل طور پر موجود رکھنے میں مدد دیتی ہے اور مہنگے 'راؤنڈ ٹرپ' کو ختم کر دیتی ہے۔

ڈویلپرز کے لیے اثرات

  • اسٹوریج کے بجائے میموری میں سرمایہ کاری کریں۔
  • مقامی ٹیسٹنگ ممکن ہو جاتی ہے۔ ڈویلپرز کلاؤڈ کریڈٹس کے لیے ادائیگی کیے بغیر موجودہ مشینوں پر اوپن ویٹ (open-weight) MoE ماڈلز چلا سکتے ہیں، اور اسٹائل، ٹول کالنگ (tool-calling) رویے اور آؤٹ پٹ کے معیار کو چیک کر سکتے ہیں۔
  • بیچ ایویلیوایشن (Batch evaluation) حقیقت پسندانہ ہے۔ ریئل ٹائم چیٹ اب بھی سست محسوس ہو سکتی ہے، لیکن کیوڈ شدہ کام—جیسے تحقیق کے لیے درجنوں پرامپٹس تیار کرنا—لیپ ٹاپ پر آسانی سے چل سکتے ہیں۔

ممکنہ جوابی دلیل

کچھ لوگ یہ دلیل دے سکتے ہیں کہ ان ورک لوڈز کے لیے SSD لیٹنسی (latency) اب بھی اہمیت رکھتی ہے جو بار بار نئے ایکسپرٹ ویٹس (expert weights) لوڈ کرتے ہیں۔

آگے کیا دیکھنا ہے

  • میموری کے لحاظ سے موثر ماڈل ورائینٹس (variants)۔
  • بڑے آن-چپ کیش (on-chip caches) والے ہارڈ ویئر۔
  • سافٹ ویئر لیول کی کیشنگ حکمت عملیتیں۔

خلاصہ یہ ہے کہ: جو ڈویلپرز لیپ ٹاپ پر بڑے پیمانے کے MoE ماڈلز کے ساتھ تجربہ کرنا چاہتے ہیں، انہیں زیادہ RAM خریدنی چاہیے۔ SSD اپ گریڈ کرنے سے صرف چند فیصد کا فرق پڑتا ہے، جبکہ اضافی میموری انفرنس کے وقت کو دو ہندسوں (double-digit) تک کم کر سکتی ہے۔ یہ AI پروٹو ٹائپنگ کے لیے لاگت کے حساب کتاب کو بدل دیتا ہے اور ان ماڈلز کی مقامی اور مفت ٹیسٹنگ کا راستہ کھولتا ہے جن کے بارے میں پہلے سمجھا جاتا تھا کہ ان کے لیے مخصوص کلاؤڈ کلسٹرز کی ضرورت ہے۔