یک مدل Mixture-of-Experts با ۱۵۰ میلیارد پارامتر میتواند روی یک لپتاپ معمولی برنامهنویس متن تولید کند. این آزمایش نشان میدهد که محدودکننده واقعی عملکرد، RAM است و نه سرعت SSD. این موضوع از این جهت اهمیت دارد که ثابت میکند مدلهای در مقیاس پیشرو (frontier-scale) را میتوان بدون هزینه کردن برای پردازش ابری، بهصورت محلی تست کرد.
آزمایش
ما مدل DeepSeek V4 Flash را — یک مدل MoE با ۱۵۰ میلیارد پارامتر که با روش REAP هرس (pruned) شده است — از طریق موتور استنتاج متنباز Colibrì اجرا کردیم. سختافزار مورد استفاده یک لپتاپ AMD Ryzen AI 9 365 با ۶۱ گیگابایت RAM و یک SSD از نوع NVMe با ظرفیت ۱ ترابایت بود. ما یک دوره تولید متن سه دقیقهای را زمانبندی کردیم و تمام دسترسیهای دیسک را ثبت نمودیم.
آنچه اعداد فاش میکنند
- فعالیت دیسک بسیار ناچیز بود. در طول آن سه دقیقه تولید متن، SSD کمتر از ۱۱ ثانیه عملیات خواندن انجام داد. حتی اگر درایو میتوانست دادهها را بهصورت آنی بخواند، نرخ انتقال داده (throughput) کل تنها حدود ۶ درصد بهبود مییافت.
- حجم RAM مستقیماً بر سرعت تأثیر گذاشت. نصف کردن حافظه کش RAM، نرخ انتقال داده را تقریباً ۱۵ درصد کاهش داد. پردازنده (CPU) تقریباً به همان اندازهای که منتظر دیسک میماند، وقت خود را صرف مدیریت خطاهای کش (cache misses) — شامل بازگشایی کوانتیزاسیون (de-quantising)، کپی کردن و مدیریت دادهها — میکرد.
این ارقام این باور رایج را که پهنای باند ذخیرهسازی گلوگاه اصلی برای استنتاج مدلهای بزرگ روی لپتاپ است، دگرگون میکند.
چرا RAM بر SSD برتری دارد
وقتی یک پارامتر مدل از قبل در RAM موجود نباشد، سیستم باید:
- داده را از SSD فراخوانی کند.
- آن را رمزگشایی کرده و برای محاسبات به ریجیسترهای CPU منتقل کند.
هر دو مرحله باعث مصرف چرخههای پردازشی میشوند. مرحله اول توسط پهنای باند SSD محدود میشود؛ مرحله دوم تقریباً همان میزان تأخیر را اضافه میکند، زیرا CPU باید دادهها را بدون توجه به سرعت رسیدن آنها، بازگشایی کوانتیزاسیون (de-quantise) کند. بنابراین، یک SSD سریعتر بازدهی نزولی دارد، در حالی که RAM بیشتر اجازه میدهد بخش بیشتری از مدل در حافظه باقی بماند و از رفتوبرگشتهای پرهزینه جلوگیری میکند.
پیامدها برای توسعهدهندگان
- روی حافظه (RAM) سرمایهگذاری کنید، نه فضای ذخیرهسازی.
- تست محلی امکانپذیر میشود. توسعهدهندگان میتوانند مدلهای MoE با وزنهای باز (open-weight) را روی سیستمهای موجود اجرا کنند و بدون پرداخت هزینه برای اعتبارهای ابری (cloud credits)، سبک، رفتار فراخوانی ابزار (tool-calling) و کیفیت خروجی را بررسی کنند.
- ارزیابی دستهای (Batch evaluation) واقعبینانه است. چت در لحظه (real-time) ممکن است همچنان کند به نظر برسد، اما کارهای صفبندی شده — مانند تولید دهها پرامپت برای تحقیق — بهراحتی روی یک لپتاپ اجرا میشوند.
استدلال احتمالی مخالف
برخی ممکن است استدلال کنند که تأخیر (latency) SSD همچنان برای حجم کاریهایی که بهطور مکرر وزنهای جدید متخصص (expert weights) را بارگذاری میکنند، اهمیت دارد.
آنچه باید در آینده زیر نظر داشت
- مدلهای متنوع با بهرهوری حافظه بالا.
- سختافزارهایی با کشهای روی تراشه (on-chip caches) بزرگتر.
- استراتژیهای کشینگ در سطح نرمافزار.
نکته نهایی روشن است: توسعهدهندگانی که میخواهند مدلهای عظیم MoE را روی یک لپتاپ آزمایش کنند، باید RAM بیشتری بخرند. ارتقای SSD تنها چند درصد را کاهش میدهد، در حالی که حافظه اضافی میتواند زمان استنتاج را با درصدهای دو رقمی کاهش دهد. این موضوع محاسبات هزینه برای نمونهسازی (prototyping) هوش مصنوعی را تغییر میدهد و راه را برای تست محلی و بدون هزینه مدلهایی که قبلاً تصور میشد به خوشههای ابری اختصاصی نیاز دارند، باز میکند.
