Nemotron 3 Nano 30B A3B، اس کا پیش رو، پہلے ہی بڑے فاؤنڈیشن ماڈلز کے ایک مختصر متبادل کے طور پر موجود تھا۔ ہائبرڈ Mamba-Transformer آرکیٹیکچر پر منتقل ہو کر اور کسی بھی لمحے صرف 3.6 بلین پیرامیٹرز کو فعال کر کے، Lightning کارکردگی کی نئی سرحدیں عبور کر رہا ہے اور ساتھ ہی بہت بڑے ماڈلز کے برابر استدلال (reasoning) کی طاقت بھی فراہم کر رہا ہے۔
اب رفتار کیوں اہم ہے
AI ایجنٹس اب بیچ-اسٹائل (batch-style) انفرنس سے مسلسل بات چیت (continuous interaction) کی طرف بڑھ رہے ہیں۔ ایسا چیٹ بوٹ جو کئی سیکنڈ کے لیے رک جائے وہ سست محسوس ہوتا ہے؛ کوڈ-کمپلیشن ٹول جو ڈویلپر کی ٹائپنگ کے پیچھے رہ جائے وہ کام کے بہاؤ (workflow) میں خلل ڈالتا ہے۔ ان حالات میں، ٹوکن فی سیکنڈ تھرو پٹ (throughput) براہ راست محسوس ہونے والی فوری جوابدہی (responsiveness) میں تبدیل ہو جاتی ہے۔ 670 ٹوکن فی سیکنڈ کا یہ ہندسہ Google کے Gemini 3.5 Flash-Lite کے لیے رپورٹ کردہ 386 ٹوکن فی سیکنڈ سے تقریباً دوگنا ہے، اور یہ ایک معیاری Intelligence Index ٹاسک کو مکمل کرنے کے وقت کو تقریباً آدھے منٹ تک کم کر دیتا ہے۔ اس کے برعکس، اسی ٹاسک کے لیے Qwen 3.6 35B A3B کو 3.5 منٹ اور Gemma 4 31B کو 5.8 منٹ درکار ہوتے ہیں۔
یہ فرق کسی بھی ایسی سروس کے لیے اہم ہے جسے بیک وقت بہت سی درخواستوں (simultaneous requests) کو سنبھالنا ہو۔ ایک ایسا سرور جو اسی ہارڈ ویئر پر دوگنے ٹوکنز پروسیس کر سکتا ہے، وہ یا تو اخراجات کم کر سکتا ہے یا صلاحیت کو دوگنا کر سکتا ہے، جو کہ کلاؤڈ فراہم کرنے والوں اور اداروں کے لیے ایک واضح فائدہ ہے۔
ماڈل یہ اعداد و شمار کیسے حاصل کرتا ہے
Nemotron 3.5 Lightning کا ہائبرڈ آرکیٹیکچر Transformers کی طویل فاصلے تک پیٹرن کی شناخت کرنے کی صلاحیت کو Mamba بلاکس کی اسٹیٹ-اسپیس (state-space) کارکردگی کے ساتھ ملا دیتا ہے۔ یہ ڈیزائن ماڈلنگ کی صلاحیت برقرار رکھنے کے لیے کل پیرامیٹرز کی تعداد زیادہ—31.6 بلین—رکھتا ہے، لیکن کسی بھی مخصوص ٹوکن کے لیے صرف 3.6 بلین ہی فعال ہوتے ہیں۔ اسپارس ایکٹیویشن (Sparse activation) فی ٹوکن کمپیوٹ کو کم کرتی ہے، جس سے معیار میں متناسب کمی کے بغیر تھرو پٹ بڑھ جاتی ہے۔
Artificial Analysis نے Lightning کے لیے Intelligence Index اسکور 24 ناپا، جو کہ پچھلے Nano ماڈل کے 15 اسکور سے نو پوائنٹس کا اضافہ ہے۔ یہ اسے OpenAI کے gpt-oss-120b کے برابر کھڑا کرتا ہے، باوجود اس کے کہ Lightning تقریباً ایک چوتھائی پیرامیٹرز استعمال کرتا ہے۔ یہ اب بھی ٹاپ ماڈلز—Meta کے Muse Glimmer (35) اور Qwen 3.6 35B A3B (32)—سے پیچھے ہے، لیکن اس کا انٹیلیجنس-ٹو-پیرامیٹر تناسب بہترین میں شمار ہوتا ہے۔
ایجنٹک بینچ مارکس بھی ایسی ہی کہانی سناتے ہیں
ایجنٹک ورک لوڈز—منصوبہ بندی، ٹول کا استعمال، کثیر مرحلہ وار استدلال (multi-step reasoning)—وہ جگہیں ہیں جہاں Lightning چمکتا ہے۔ GDPval-AA v2 بینچ مارک پر، ماڈل نے 824 کی Elo ریٹنگ حاصل کی، جو کہ 120 بلین پیرامیٹرز والے gpt-oss-120b (800) اور Nvidia کے اپنے بڑے Nemotron 3 Super (698) سے آگے ہے۔ Terminal-Bench v2.1 ٹیسٹ میں، Lightning کی کامیابی کی شرح 7% سے بڑھ کر 24.3% ہو گئی، جو کہ gpt-oss-120b کے ریکارڈ کردہ 26.2% کے قریب پہنچ گئی۔
Nvidia نے ڈومین-اسپیسیفک (domain-specific) ٹاسکس پر ماڈل کی ٹیوننگ کے لیے CodeRabbit اور Harvey جیسے شراکت داروں کے ساتھ پوسٹ ٹریننگ تعاون کا سہرا اپنے سر باندھا۔ یہ اصلاحات ماڈل کو تیز رکھتی ہیں جبکہ خصوصی ورک لوڈز پر مسابقتی بھی رکھتی ہیں۔
دستیابی اور عملی تحفظات
ماڈل کو پرمیسیو OpenMDW-1.1 لائسنس کے تحت جاری کیا گیا ہے، جس کے ویٹس (weights) BF16 اور NVFP4 فارمیٹس میں دستیاب ہیں۔ NVFP4 ورژن معیار کے معمولی نقصان کے ساتھ ماڈل کو زیادہ ٹائٹ پیک کرتا ہے، جو کہ ایج ڈیپلائمنٹس (edge deployments) یا لاگت کے بارے میں حساس کلاؤڈ انسٹنسز کے لیے ایک مفید آپشن ہے۔ ایک ملین ٹوکن کا کانٹیکسٹ ونڈو (context window) ماڈل کو بغیر کسی کٹوتی کے بہت طویل پرامپٹس کو سنبھالنے کی اجازت دیتا ہے، جو کہ دستاویز کی سطح کے تجزیہ یا وسیع کوڈ بیسز کے لیے قیمتی ہے۔
Serverless انفرنس پہلے ہی DeepInfra، Fireworks، FriendliAI، CoreWeave، GMI Cloud، Nebius اور Crusoe جیسے فراہم کنندگان پر دستیاب ہے۔ ڈویلپرز اپنا کسٹم انفراسٹرکچر بنائے بغیر تجربات شروع کر سکتے ہیں، اگرچہ حقیقی لاگت کا فائدہ ہر پلیٹ فارم کی قیمتوں پر منحصر ہوگا۔
خلاصہ: Nemotron 3.5 Lightning یہ ثابت کرتا ہے کہ ایک ماڈل 120 بلین پیرامیٹر والے سسٹمز کے استدلال کے معیار کا مقابلہ کر سکتا ہے اور ساتھ ہی صف اول کے حریفوں کے مقابلے میں تقریباً دوگنا ٹوکن تھرو پٹ فراہم کر سکتا ہے، جو اسے لیٹنسی کے حساس (latency-sensitive) AI ایجنٹس کے لیے ایک مضبوط امیدوار بناتا ہے۔
