Nemotron 3 Nano 30B A3B که پیش‌درآمد این مدل بود، پیش از این نیز به عنوان یک جایگزین فشرده برای مدل‌های پایه بزرگ‌تر شناخته می‌شد. Lightning با تغییر به معماری ترکیبی Mamba-Transformer و فعال‌سازی تنها ۳.۶ میلیارد پارامتر در هر لحظه، مرزهای کارایی را جابه‌جا می‌کند و در عین حال قدرت استدلال قابل مقایسه‌ای با مدل‌های بسیار بزرگ‌تر ارائه می‌دهد.

چرا سرعت اکنون اهمیت دارد

عامل‌های هوش مصنوعی (AI agents) در حال گذار از استنتاج به سبک دسته‌ای (batch-style) به تعامل مداوم هستند. یک چت‌بات که چند ثانیه مکث می‌کند، کند به نظر می‌رسد؛ یک ابزار تکمیل‌کننده کد که از سرعت تایپ برنامه‌نویس عقب می‌ماند، جریان کار را مختل می‌کند. در این شرایط، نرخ پردازش توکن در ثانیه مستقیماً با پاسخگویی ادراک‌شده رابطه دارد. رقم ۶۷۰ توکن در ثانیه تقریباً دو برابر ۳۸۶ توکن در ثانیه است که برای Google’s Gemini 3.5 Flash-Lite گزارش شده است، و زمان لازم برای انجام یک وظیفه استاندارد در Intelligence Index را به حدود نیم دقیقه کاهش می‌دهد. در مقابل، Qwen 3.6 35B A3B برای همان وظیفه به ۳.۵ دقیقه و Gemma 4 31B به ۵.۸ دقیقه زمان نیاز دارد.

این شکاف برای هر سرویسی که باید درخواست‌های همزمان زیادی را مدیریت کند، اهمیت دارد. سروری که می‌تواند روی همان سخت‌افزار، دو برابر توکن پردازش کند، می‌تواند یا هزینه‌ها را کاهش دهد یا ظرفیت را دو برابر کند که این یک مزیت آشکار برای ارائه‌دهندگان ابری و شرکت‌هاست.

مدل چگونه به این اعداد دست می‌یابد

معماری ترکیبی Nemotron 3.5 Lightning، نقاط قوت تشخیص الگو در برد بلندِ Transformerها را با کارایی فضای حالت (state-space) بلوک‌های Mamba ترکیب می‌کند. این طراحی تعداد کل پارامترها را بالا نگه می‌دارد (۳۱.۶ میلیارد) تا ظرفیت مدل‌سازی حفظ شود، اما برای هر توکن داده شده، تنها ۳.۶ میلیارد پارامتر فعال هستند. فعال‌سازی پراکنده (Sparse activation)، محاسبات در هر توکن را کاهش داده و نرخ پردازش را بدون کاهش متناسب در کیفیت، افزایش می‌دهد.

Artificial Analysis امتیاز ۲۴ را در شاخص Intelligence Index برای Lightning اندازه‌گیری کرد که جهشی ۹ امتیازی نسبت به امتیاز ۱۵ مدل Nano قبلی است. این امر آن را با gpt-oss-120b از OpenAI هم‌سطح می‌کند، با وجود اینکه Lightning تقریباً از یک‌چهارم پارامترها استفاده می‌کند. این مدل همچنان از مدل‌های برتر یعنی Muse Glimmer از Meta (۳۵) و Qwen 3.6 35B A3B (۳۲) عقب‌تر است، اما نسبت هوش به پارامتر آن در زمره بهترین‌ها قرار دارد.

بنچمارک‌های عامل‌محور داستان مشابهی را روایت می‌کنند

بار کاری عامل‌محور (Agentic workloads) شامل برنامه‌ریزی، استفاده از ابزار و استدلال چندمرحله‌ای، جایی است که Lightning می‌درخشد. در بنچمارک GDPval-AA v2، این مدل امتیاز Elo معادل ۸۲۴ را کسب کرد که از مدل ۱۲۰ میلیارد پارامتری gpt-oss-120b (۸۰۰) و مدل بزرگ‌تر Nemotron 3 Super از Nvidia (۶۹۸) پیشی گرفته است. در تست Terminal-Bench v2.1، نرخ موفقیت Lightning از ۷٪ به ۲۴.۳٪ افزایش یافت و به نرخ ۲۶.۲٪ ثبت شده توسط gpt-oss-120b نزدیک شد.

Nvidia همکاری‌های پس از آموزش با شرکایی مانند CodeRabbit و Harvey را برای تنظیم مدل در وظایف تخصصی هر حوزه (domain-specific) ستود. این اصلاحات باعث می‌شود مدل در عین رقابتی بودن در بار‌های کاری تخصصی، سریع باقی بماند.

در دسترس بودن و ملاحظات کاربردی

این مدل تحت مجوز منعطف OpenMDW-1.1 عرضه می‌شود و وزن‌های آن در قالب‌های BF16 و NVFP4 موجود است. نسخه NVFP4 مدل را با کمترین کاهش کیفیت، فشرده‌تر می‌کند که گزینه‌ای مفید برای استقرار در لبه (edge) یا نمونه‌های ابری با هزینه محدود است. پنجره بافت (context window) یک میلیون توکنی به مدل اجازه می‌دهد تا پرامپت‌های بسیار طولانی را بدون قطع شدن مدیریت کند که برای تحلیل در سطح سند یا مجموعه‌کدهای گسترده بسیار ارزشمند است.

استنتاج بدون سرور (Serverless inference) در حال حاضر در ارائه‌دهندگانی مانند DeepInfra، Fireworks، FriendliAI، CoreWeave، GMI Cloud، Nebius و Crusoe در دسترس است. توسعه‌دهندگان می‌توانند بدون نیاز به ساخت زیرساخت اختصاصی، آزمایش‌های خود را شروع کنند، اگرچه مقرون‌به‌صرفه بودن واقعی به قیمت‌گذاری هر پلتفرم بستگی خواهد داشت.

نکته کلیدی: Nemotron 3.5 Lightning ثابت می‌کند که یک مدل می‌تواند با سطح استدلال سیستم‌های ۱۲۰ میلیارد پارامتری برابری کند و در عین حال تقریباً دو برابرِ رقبای پیشرو، نرخ پردازش توکن ارائه دهد؛ این ویژگی آن را به گزینه‌ای قدرتمند برای عامل‌های هوش مصنوعی حساس به تأخیر (latency-sensitive) تبدیل می‌کند.