Nemotron 3 Nano 30B A3B که پیشدرآمد این مدل بود، پیش از این نیز به عنوان یک جایگزین فشرده برای مدلهای پایه بزرگتر شناخته میشد. Lightning با تغییر به معماری ترکیبی Mamba-Transformer و فعالسازی تنها ۳.۶ میلیارد پارامتر در هر لحظه، مرزهای کارایی را جابهجا میکند و در عین حال قدرت استدلال قابل مقایسهای با مدلهای بسیار بزرگتر ارائه میدهد.
چرا سرعت اکنون اهمیت دارد
عاملهای هوش مصنوعی (AI agents) در حال گذار از استنتاج به سبک دستهای (batch-style) به تعامل مداوم هستند. یک چتبات که چند ثانیه مکث میکند، کند به نظر میرسد؛ یک ابزار تکمیلکننده کد که از سرعت تایپ برنامهنویس عقب میماند، جریان کار را مختل میکند. در این شرایط، نرخ پردازش توکن در ثانیه مستقیماً با پاسخگویی ادراکشده رابطه دارد. رقم ۶۷۰ توکن در ثانیه تقریباً دو برابر ۳۸۶ توکن در ثانیه است که برای Google’s Gemini 3.5 Flash-Lite گزارش شده است، و زمان لازم برای انجام یک وظیفه استاندارد در Intelligence Index را به حدود نیم دقیقه کاهش میدهد. در مقابل، Qwen 3.6 35B A3B برای همان وظیفه به ۳.۵ دقیقه و Gemma 4 31B به ۵.۸ دقیقه زمان نیاز دارد.
این شکاف برای هر سرویسی که باید درخواستهای همزمان زیادی را مدیریت کند، اهمیت دارد. سروری که میتواند روی همان سختافزار، دو برابر توکن پردازش کند، میتواند یا هزینهها را کاهش دهد یا ظرفیت را دو برابر کند که این یک مزیت آشکار برای ارائهدهندگان ابری و شرکتهاست.
مدل چگونه به این اعداد دست مییابد
معماری ترکیبی Nemotron 3.5 Lightning، نقاط قوت تشخیص الگو در برد بلندِ Transformerها را با کارایی فضای حالت (state-space) بلوکهای Mamba ترکیب میکند. این طراحی تعداد کل پارامترها را بالا نگه میدارد (۳۱.۶ میلیارد) تا ظرفیت مدلسازی حفظ شود، اما برای هر توکن داده شده، تنها ۳.۶ میلیارد پارامتر فعال هستند. فعالسازی پراکنده (Sparse activation)، محاسبات در هر توکن را کاهش داده و نرخ پردازش را بدون کاهش متناسب در کیفیت، افزایش میدهد.
Artificial Analysis امتیاز ۲۴ را در شاخص Intelligence Index برای Lightning اندازهگیری کرد که جهشی ۹ امتیازی نسبت به امتیاز ۱۵ مدل Nano قبلی است. این امر آن را با gpt-oss-120b از OpenAI همسطح میکند، با وجود اینکه Lightning تقریباً از یکچهارم پارامترها استفاده میکند. این مدل همچنان از مدلهای برتر یعنی Muse Glimmer از Meta (۳۵) و Qwen 3.6 35B A3B (۳۲) عقبتر است، اما نسبت هوش به پارامتر آن در زمره بهترینها قرار دارد.
بنچمارکهای عاملمحور داستان مشابهی را روایت میکنند
بار کاری عاملمحور (Agentic workloads) شامل برنامهریزی، استفاده از ابزار و استدلال چندمرحلهای، جایی است که Lightning میدرخشد. در بنچمارک GDPval-AA v2، این مدل امتیاز Elo معادل ۸۲۴ را کسب کرد که از مدل ۱۲۰ میلیارد پارامتری gpt-oss-120b (۸۰۰) و مدل بزرگتر Nemotron 3 Super از Nvidia (۶۹۸) پیشی گرفته است. در تست Terminal-Bench v2.1، نرخ موفقیت Lightning از ۷٪ به ۲۴.۳٪ افزایش یافت و به نرخ ۲۶.۲٪ ثبت شده توسط gpt-oss-120b نزدیک شد.
Nvidia همکاریهای پس از آموزش با شرکایی مانند CodeRabbit و Harvey را برای تنظیم مدل در وظایف تخصصی هر حوزه (domain-specific) ستود. این اصلاحات باعث میشود مدل در عین رقابتی بودن در بارهای کاری تخصصی، سریع باقی بماند.
در دسترس بودن و ملاحظات کاربردی
این مدل تحت مجوز منعطف OpenMDW-1.1 عرضه میشود و وزنهای آن در قالبهای BF16 و NVFP4 موجود است. نسخه NVFP4 مدل را با کمترین کاهش کیفیت، فشردهتر میکند که گزینهای مفید برای استقرار در لبه (edge) یا نمونههای ابری با هزینه محدود است. پنجره بافت (context window) یک میلیون توکنی به مدل اجازه میدهد تا پرامپتهای بسیار طولانی را بدون قطع شدن مدیریت کند که برای تحلیل در سطح سند یا مجموعهکدهای گسترده بسیار ارزشمند است.
استنتاج بدون سرور (Serverless inference) در حال حاضر در ارائهدهندگانی مانند DeepInfra، Fireworks، FriendliAI، CoreWeave، GMI Cloud، Nebius و Crusoe در دسترس است. توسعهدهندگان میتوانند بدون نیاز به ساخت زیرساخت اختصاصی، آزمایشهای خود را شروع کنند، اگرچه مقرونبهصرفه بودن واقعی به قیمتگذاری هر پلتفرم بستگی خواهد داشت.
نکته کلیدی: Nemotron 3.5 Lightning ثابت میکند که یک مدل میتواند با سطح استدلال سیستمهای ۱۲۰ میلیارد پارامتری برابری کند و در عین حال تقریباً دو برابرِ رقبای پیشرو، نرخ پردازش توکن ارائه دهد؛ این ویژگی آن را به گزینهای قدرتمند برای عاملهای هوش مصنوعی حساس به تأخیر (latency-sensitive) تبدیل میکند.
