كان Nemotron 3 Nano 30B A3B، وهو الإصدار السابق، يُعتبر بالفعل بديلاً مدمجاً للنماذج التأسيسية الأكبر حجماً. ومن خلال الانتقال إلى بنية هجينة تجمع بين Mamba وTransformer وتنشيط 3.6 مليار معلمة فقط في أي لحظة، يدفع Lightning حدود الكفاءة مع الاستمرار في تقديم قدرات استنتاجية تضاهي النماذج الأكبر بكثير.

لماذا تكتسب السرعة أهمية الآن

تنتقل وكلاء الذكاء الاصطناعي (AI agents) من الاستدلال بنمط الدفعات إلى التفاعل المستمر. فبرنامج الدردشة الآلي الذي يتوقف لعدة ثوانٍ يبدو بطيئاً؛ وأداة إكمال الكود التي تتأخر عن كتابة المطور تعطل سير العمل. في مثل هذه البيئات، تترجم إنتاجية الرموز في الثانية (token-per-second throughput) مباشرة إلى سرعة استجابة ملموسة. إن رقم 670 رمزاً في الثانية يمثل ضعف رقم 386 رمزاً في الثانية المسجل لنموذج Google Gemini 3.5 Flash-Lite تقريباً، كما أنه يقلص الوقت اللازم لإنجاز مهمة قياسية في Intelligence Index إلى حوالي نصف دقيقة. وفي المقابل، يحتاج Qwen 3.6 35B A3B إلى 3.5 دقيقة، بينما يحتاج Gemma 4 31B إلى 5.8 دقيقة لإنجاز المهمة نفسها.

هذه الفجوة مهمة لأي خدمة يجب أن تتعامل مع العديد من الطلبات المتزامنة. فالخادم الذي يعالج ضعف عدد الرموز على نفس الأجهزة يمكنه إما خفض التكاليف أو مضاعفة السعة، وهو ما يمثل ميزة واضحة لمزودي الخدمات السحابية والمؤسسات.

كيف يحقق النموذج هذه الأرقام

تدمج البنية الهجينة لـ Nemotron 3.5 Lightning بين نقاط القوة في التعرف على الأنماط بعيدة المدى لـ Transformers وكفاءة فضاء الحالة (state-space efficiency) لكتل Mamba. يحافظ التصميم على إجمالي عدد كبير من المعلمات — 31.6 مليار — للحفاظ على قدرة النمذجة، ولكن يتم تنشيط 3.6 مليار فقط لكل رمز (token) معين. يقلل التنشيط المتفرق (Sparse activation) من الحوسبة لكل رمز، مما يرفع الإنتاجية دون فقدان متناسب في الجودة.

سجلت Artificial Analysis درجة 24 في Intelligence Index لنموذج Lightning، وهي قفزة بمقدار تسع نقاط عن الدرجة 15 التي سجلها نموذج Nano السابق. وهذا يضعه على قدم المساواة مع gpt-oss-120b من OpenAI، على الرغم من أن Lightning يستخدم حوالي ربع عدد المعلمات. لا يزال النموذج يتخلف عن النماذج الرائدة — Muse Glimmer من Meta (35) و Qwen 3.6 35B A3B (32) — ولكن نسبة الذكاء إلى المعلمات لديه تصنف ضمن الأفضل.

معايير الأداء الوكيلية تروي قصة مماثلة

تتجلى براعة Lightning في أعباء العمل الوكيلية (Agentic workloads) — مثل التخطيط، واستخدام الأدوات، والاستنتاج متعدد الخطوات. في معيار GDPval-AA v2، حصل النموذج على تصنيف Elo قدره 824، متفوقاً على gpt-oss-120b الذي يحتوي على 120 مليار معلمة (800) وعلى نموذج Nvidia الأكبر Nemotron 3 Super (698). وفي اختبار Terminal-Bench v2.1، ارتفع معدل نجاح Lightning من 7% إلى 24.3%، ليقترب من نسبة 26.2% التي سجلها gpt-oss-120b.

عزَت Nvidia الفضل في ضبط النموذج على المهام المتخصصة في مجالات معينة إلى التعاون في مرحلة ما بعد التدريب مع شركاء مثل CodeRabbit وHarvey. تحافظ هذه التحسينات على سرعة النموذج مع بقائه منافساً في أعباء العمل المتخصصة.

التوفر والاعتبارات العملية

يتم توفير النموذج بموجب ترخيص OpenMDW-1.1 المرن، مع أوزان بتنسيقات BF16 وNVFP4. يوفر إصدار NVFP4 ضغطاً أكبر للنموذج مع حد أدنى من فقدان الجودة، وهو خيار مفيد للنشر على الأجهزة الطرفية (edge deployments) أو مثيلات السحابة التي تراعي التكلفة. تتيح نافذة سياق تبلغ مليون رمز (token) للنموذج التعامل مع مطالبات (prompts) طويلة جداً دون بتر، وهو أمر قيم لتحليل المستندات أو قواعد الأكواد البرمجية الواسعة.

يعمل الاستدلال بدون خادم (Serverless inference) بالفعل لدى مزودين مثل DeepInfra وFireworks وFriendliAI وCoreWeave وGMI Cloud وNebius وCrusoe. يمكن للمطورين البدء في التجربة دون الحاجة إلى بناء بنية تحتية مخصصة، وإن كانت الجدوى الاقتصادية الحقيقية ستعتمد على تسعير كل منصة.

الخلاصة: يثبت Nemotron 3.5 Lightning أن النموذج يمكنه مضاهاة مستوى الاستنتاج في الأنظمة التي تحتوي على 120 مليار معلمة، مع تقديم ضعف إنتاجية الرموز تقريباً مقارنة بالمنافسين الرائدين، مما يجعله مرشحاً قوياً لوكلاء الذكاء الاصطناعي الحساسين لزمن الاستجابة (latency-sensitive).