Nvidia نے 11 اگست کو Nemotron 3.5 Lightning جاری کیا۔ یہ 30 بلین پیرامیٹر والا mixture-of-experts ماڈل ہے جو صرف 3 بلین فعال پیرامیٹرز کے ساتھ چلتا ہے، اور اس کی ساتھی NeMo Switchyard routing library نے پہلے ہی inference اخراجات اور cache کی کارکردگی پر بحث چھیڑ دی ہے۔ Switchyard جس طرح ماڈلز کے درمیان درخواستیں منتقل کرتا ہے، وہ prompt caches کو تباہ کر سکتا ہے اور ممکنہ طور پر ایک ہی inference session کے بل کو دوگنا کر سکتا ہے۔

اوپن ویٹ (open-weight) ایجنٹس کے لیے بنایا گیا ایک ماڈل

Nemotron 3.5 Lightning ان AI ایجنٹس کو نشانہ بناتا ہے جو ٹولز کو کال کرتے ہیں، نتائج کی تصدیق کرتے ہیں، اور reasoning trace برقرار رکھتے ہیں۔ تین تکنیکی انتخاب اسے دوسروں سے ممتاز کرتے ہیں:

  • Hybrid architecture – یہ ایک Mamba-2 state-space core کو روایتی Transformer کے ساتھ جوڑتا ہے، جو یہ ثابت کرتا ہے کہ non-Transformer ڈیزائن اس پیمانے پر مقابلہ کر سکتے ہیں۔
  • 4-bit floating-point quantization – کم درستگی (low-precision) میں دستیاب ہونے کی وجہ سے 30 B ماڈل M5 Max MacBook Pro پر تقریباً 100 ٹوکن فی سیکنڈ کی رفتار سے کام کر سکتا ہے، ایک ایسی رفتار جس کا مقابلہ کرنا full-precision ماڈل کے لیے مشکل ہوگا۔
  • Full openness – Nvidia نے weight files اور مکمل training recipe جاری کی ہے، جو کہ اعلیٰ کارکردگی والے inference کے لیے بنائے گئے ماڈل کے لیے ایک نایاب بات ہے۔

ابتدائی صارفین کا کہنا ہے کہ یہ ماڈل "ضرورت سے زیادہ سوچ" (over-think) سکتا ہے، اور طویل reasoning chains فراہم کرتا ہے جو کبھی کبھی غلط ہو سکتی ہیں۔ ڈویلپرز کو ایک طاقتور اور کھلے طور پر دستیاب agent executor ملتا ہے، لیکن غیر ضروری طوالت سے بچنے کے لیے انہیں احتیاط سے prompt دینا ہوگا۔

Routing layer کیوں اہم ہے

NeMo Switchyard امیدواروں کے ایک گروپ میں سے کسی درخواست کو "بہترین" ماڈل تک متحرک طور پر پہنچانے (dynamically routing) کے لیے Nvidia کی لائبریری ہے۔ نظریاتی طور پر، ایک router ہر سوال کے لیے ایک ماہر ماڈل کا انتخاب کر کے جواب کے معیار کو بڑھا سکتا ہے۔ عملی طور پر، routing کا فیصلہ ان prompt-caching میکانزم سے ٹکراتا ہے جن پر بہت سے inference pipelines انحصار کرتے ہیں۔

  • Prompt caches ابتدائی prompt کے token embeddings کو محفوظ کرتے ہیں تاکہ بعد میں آنے والی نسلیں (generations) "prefill" مرحلے کو دوبارہ کیلکولیٹ کیے بغیر انہیں دوبارہ استعمال کر سکیں۔
  • Routing swaps پہلے چند ٹوکنز کے بعد درخواست کو Model A سے Model B پر منتقل کر دیتے ہیں، جس سے سسٹم پر مجبور ہونا پڑتا ہے کہ وہ cached prompt کو چھوڑ دے اور نئے ماڈل کے لیے اسے شروع سے دوبارہ کیلکولیٹ کرے۔

چونکہ AI کا زیادہ تر خرچ نئے ٹوکنز تیار کرنے کے بجائے cached prompt کو پڑھنے پر ہوتا ہے، اس لیے ایک ہی routing hop درخواست کی لاگت کو مؤثر طریقے سے دوگنا کر سکتا ہے۔

لاگت کی کشمکش

مستقبل کے امکانات

یہ بحث اس وقت سامنے آئی ہے جب Nvidia کی open-weight حکمت عملی کا براہ راست مقابلہ ہو رہا ہے۔ 15 اگست کو Qwen 3.8-27B لانچ ہوگا، اور ابتدائی benchmarks سے پتہ چلتا ہے کہ یہ مقامی ترقیاتی منظرناموں (local development scenarios) میں Nemotron 3.5 Lightning کا مقابلہ کر سکتا ہے۔

Nvidia کا طریقہ کار—اوپن ویٹس، اوپن ٹریننگ ریسپی، اور ایک اوپن روٹنگ لیئر—ایسا لگتا ہے کہ اسے اس لیے ڈیزائن کیا گیا ہے تاکہ اس کے GPUs ان تمام لوگوں کے لیے ڈیفالٹ ہارڈ ویئر بن جائیں جو ان ماڈلز کو مقامی طور پر چلا رہے ہیں۔ سافٹ ویئر اسٹیک کو سامنے لا کر، Nvidia امید کرتا ہے کہ وہ ڈویلپرز کو اپنے ecosystem میں مقید کر لے گا، چاہے routing logic چھپے ہوئے اخراجات کا باعث بنے۔

خلاصہ

اگر آپ اپنی مشین پر Nemotron 3.5 Lightning چلانے کا ارادہ رکھتے ہیں، تو نہ صرف یہ پوچھیں کہ "یہ کتنی تیزی سے تیار کر سکتا ہے؟" بلکہ یہ بھی پوچھیں کہ "Switchyard مجھے کتنی بار اپنا prompt cache چھوڑنے پر مجبور کرے گا؟" وہی جواب طے کرے گا کہ ماڈل کا open-weight وعدہ حقیقی دنیا میں بچت ثابت ہوگا یا ایک مہنگا تجربہ۔ جیسے جیسے Qwen جیسے متبادل سامنے آ رہے ہیں، routing کی لچک اور cache پر مبنی لاگت کی کارکردگی کے درمیان توازن یہ فیصلہ کرے گا کہ کون سا ٹول کٹ—اور بالآخر کون سا ہارڈ ویئر پلیٹ فارم—کامیاب ہوگا۔