يمكن لنموذج "خليط الخبراء" (Mixture-of-Experts) الذي يحتوي على 150 مليار معلمة (parameter) توليد النصوص على كمبيوتر محمول قياسي للمطورين. تُظهر التجربة أن ذاكرة الوصول العشوائي (RAM)، وليس سرعة قرص SSD، هي العائق الحقيقي للأداء. وهذا أمر بالغ الأهمية لأنه يثبت إمكانية اختبار النماذج ذات النطاق الرائد محلياً دون إنفاق مبالغ على الحوسبة السحابية.

الاختبار

قمنا بتشغيل نموذج DeepSeek V4 Flash — وهو نموذج MoE مكون من 150 مليار معلمة ومقلم بتقنية REAP — عبر محرك الاستدلال مفتوح المصدر Colibrì. كانت الأجهزة عبارة عن كمبيوتر محمول AMD Ryzen AI 9 365 بذاكرة وصول عشوائي (RAM) سعة 61 جيجابايت وقرص NVMe SSD سعة 1 تيرابايت. قمنا بتوقيت عملية توليد استمرت ثلاث دقائق وسجلنا كل عملية وصول إلى القرص.

ما تكشفه الأرقام

  • كان نشاط القرص ضئيلاً. قام قرص SSD بأقل من 11 ثانية من عمليات القراءة خلال عملية التوليد التي استمرت ثلاث دقائق. وحتى لو تمكن القرص من قراءة البيانات فوراً، فإن إجمالي معدل النقل (throughput) لن يتحسن إلا بنسبة 6 بالمائة تقريباً.
  • أثر حجم ذاكرة الوصول العشوائي (RAM) مباشرة على السرعة. أدى تقليص ذاكرة التخزين المؤقت (cache) للـ RAM إلى النصف إلى خفض معدل النقل بنسبة 15 بالمائة تقريباً. وقد قضى المعالج (CPU) وقتاً في معالجة حالات عدم وجود البيانات في ذاكرة التخزين المؤقت (cache misses) — مثل إلغاء التكميم (de-quantising)، والنسخ، وإدارة البيانات — يقارب الوقت الذي قضاه في انتظار القرص.

تقلب هذه الأرقام الاعتقاد الشائع بأن عرض نطاق التخزين (storage bandwidth) هو نقطة الاختناق الأساسية لاستدلال النماذج الكبيرة على الكمبيوتر المحمول.

لماذا تتفوق ذاكرة RAM على قرص SSD

عندما لا تكون معلمة النموذج موجودة بالفعل في ذاكرة RAM، يجب على النظام القيام بما يلي:

  1. سحب البيانات من قرص SSD.
  2. فك تشفيرها ونقلها إلى سجلات المعالج (CPU registers) لإجراء الحسابات.

تستهلك كلتا الخطوتين دورات المعالجة. الخطوة الأولى محدودة بعرض نطاق الـ SSD؛ أما الثانية فتضيف تأخيراً مماثلاً تقريباً لأن المعالج يجب أن يقوم بإلغاء التكميم (de-quantise) للبيانات بغض النظر عن سرعة وصولها. لذلك، فإن استخدام قرص SSD أسرع يعطي عوائد متناقصة، بينما تتيح زيادة ذاكرة RAM بقاء جزء أكبر من النموذج في الذاكرة وتلغي عملية "الرحلة الذهاب والإياب" المكلفة.

التداعيات على المطورين

  • استثمر في الذاكرة، وليس في مساحة التخزين.
  • يصبح الاختبار المحلي ممكناً. يمكن للمطورين تشغيل نماذج MoE ذات الأوزان المفتوحة (open-weight) على الأجهزة الحالية، والتحقق من الأسلوب، وسلوك استدعاء الأدوات (tool-calling)، وجودة المخرجات دون دفع تكاليف رصيد الحوسبة السحابية.
  • التقييم بالدفعات (Batch evaluation) أصبح واقعياً. قد لا تزال الدردشة في الوقت الفعلي تبدو بطيئة، ولكن المهام المجدولة — مثل توليد عشرات المطالبات (prompts) لأغراض البحث — تعمل بسلاسة على الكمبيوتر المحمول.

حجة مضادة محتملة

قد يجادل البعض بأن زمن انتقال (latency) قرص SSD لا يزال مهماً لأعباء العمل التي تقوم بتحميل أوزان خبراء (expert weights) جديدة بشكل متكرر.

ما يجب مراقبته لاحقاً

  • متغيرات النماذج الموفرة للذاكرة.
  • أجهزة ذات ذاكرة تخزين مؤقت (caches) أكبر مدمجة في الرقاقة.
  • استراتيجيات التخزين المؤقت على مستوى البرمجيات.

الخلاصة واضحة: المطورون الذين يرغبون في تجربة نماذج MoE الضخمة على كمبيوتر محمول يجب أن يشتروا ذاكرة RAM إضافية. ترقيات SSD لا توفر سوى بضع بالمائة فقط، بينما يمكن للذاكرة الإضافية أن تقلل وقت الاستدلال بنسب تتكون من رقمين (double-digit). وهذا يغير حسابات التكلفة للنماذج الأولية للذكاء الاصطناعي ويفتح الباب للاختبار المحلي المجاني للنماذج التي كان يُعتقد سابقاً أنها تتطلب مجموعات حوسبة سحابية مخصصة.