یک مدل Mixture-of-Experts با ۱۵۰ میلیارد پارامتر می‌تواند روی یک لپ‌تاپ معمولی برنامه‌نویس متن تولید کند. این آزمایش نشان می‌دهد که محدودکننده واقعی عملکرد، RAM است و نه سرعت SSD. این موضوع از این جهت اهمیت دارد که ثابت می‌کند مدل‌های در مقیاس پیشرو (frontier-scale) را می‌توان بدون هزینه کردن برای پردازش ابری، به‌صورت محلی تست کرد.

آزمایش

ما مدل DeepSeek V4 Flash را — یک مدل MoE با ۱۵۰ میلیارد پارامتر که با روش REAP هرس (pruned) شده است — از طریق موتور استنتاج متن‌باز Colibrì اجرا کردیم. سخت‌افزار مورد استفاده یک لپ‌تاپ AMD Ryzen AI 9 365 با ۶۱ گیگابایت RAM و یک SSD از نوع NVMe با ظرفیت ۱ ترابایت بود. ما یک دوره تولید متن سه دقیقه‌ای را زمان‌بندی کردیم و تمام دسترسی‌های دیسک را ثبت نمودیم.

آنچه اعداد فاش می‌کنند

  • فعالیت دیسک بسیار ناچیز بود. در طول آن سه دقیقه تولید متن، SSD کمتر از ۱۱ ثانیه عملیات خواندن انجام داد. حتی اگر درایو می‌توانست داده‌ها را به‌صورت آنی بخواند، نرخ انتقال داده (throughput) کل تنها حدود ۶ درصد بهبود می‌یافت.
  • حجم RAM مستقیماً بر سرعت تأثیر گذاشت. نصف کردن حافظه کش RAM، نرخ انتقال داده را تقریباً ۱۵ درصد کاهش داد. پردازنده (CPU) تقریباً به همان اندازه‌ای که منتظر دیسک می‌ماند، وقت خود را صرف مدیریت خطاهای کش (cache misses) — شامل بازگشایی کوانتیزاسیون (de-quantising)، کپی کردن و مدیریت داده‌ها — می‌کرد.

این ارقام این باور رایج را که پهنای باند ذخیره‌سازی گلوگاه اصلی برای استنتاج مدل‌های بزرگ روی لپ‌تاپ است، دگرگون می‌کند.

چرا RAM بر SSD برتری دارد

وقتی یک پارامتر مدل از قبل در RAM موجود نباشد، سیستم باید:

  1. داده را از SSD فراخوانی کند.
  2. آن را رمزگشایی کرده و برای محاسبات به ریجیسترهای CPU منتقل کند.

هر دو مرحله باعث مصرف چرخه‌های پردازشی می‌شوند. مرحله اول توسط پهنای باند SSD محدود می‌شود؛ مرحله دوم تقریباً همان میزان تأخیر را اضافه می‌کند، زیرا CPU باید داده‌ها را بدون توجه به سرعت رسیدن آن‌ها، بازگشایی کوانتیزاسیون (de-quantise) کند. بنابراین، یک SSD سریع‌تر بازدهی نزولی دارد، در حالی که RAM بیشتر اجازه می‌دهد بخش بیشتری از مدل در حافظه باقی بماند و از رفت‌وبرگشت‌های پرهزینه جلوگیری می‌کند.

پیامدها برای توسعه‌دهندگان

  • روی حافظه (RAM) سرمایه‌گذاری کنید، نه فضای ذخیره‌سازی.
  • تست محلی امکان‌پذیر می‌شود. توسعه‌دهندگان می‌توانند مدل‌های MoE با وزن‌های باز (open-weight) را روی سیستم‌های موجود اجرا کنند و بدون پرداخت هزینه برای اعتبارهای ابری (cloud credits)، سبک، رفتار فراخوانی ابزار (tool-calling) و کیفیت خروجی را بررسی کنند.
  • ارزیابی دسته‌ای (Batch evaluation) واقع‌بینانه است. چت در لحظه (real-time) ممکن است همچنان کند به نظر برسد، اما کارهای صف‌بندی شده — مانند تولید ده‌ها پرامپت برای تحقیق — به‌راحتی روی یک لپ‌تاپ اجرا می‌شوند.

استدلال احتمالی مخالف

برخی ممکن است استدلال کنند که تأخیر (latency) SSD همچنان برای حجم کاری‌هایی که به‌طور مکرر وزن‌های جدید متخصص (expert weights) را بارگذاری می‌کنند، اهمیت دارد.

آنچه باید در آینده زیر نظر داشت

  • مدل‌های متنوع با بهره‌وری حافظه بالا.
  • سخت‌افزارهایی با کش‌های روی تراشه (on-chip caches) بزرگ‌تر.
  • استراتژی‌های کشینگ در سطح نرم‌افزار.

نکته نهایی روشن است: توسعه‌دهندگانی که می‌خواهند مدل‌های عظیم MoE را روی یک لپ‌تاپ آزمایش کنند، باید RAM بیشتری بخرند. ارتقای SSD تنها چند درصد را کاهش می‌دهد، در حالی که حافظه اضافی می‌تواند زمان استنتاج را با درصدهای دو رقمی کاهش دهد. این موضوع محاسبات هزینه برای نمونه‌سازی (prototyping) هوش مصنوعی را تغییر می‌دهد و راه را برای تست محلی و بدون هزینه مدل‌هایی که قبلاً تصور می‌شد به خوشه‌های ابری اختصاصی نیاز دارند، باز می‌کند.