Nvidia ఆగస్టు 11న Nemotron 3.5 Lightningని విడుదల చేసింది. ఈ 30-బిలియన్-పారామీటర్ల mixture-of-experts మోడల్ కేవలం 3 బిలియన్ల యాక్టివ్ పారామీటర్లతో నడుస్తుంది, మరియు దీనితో పాటు వచ్చిన NeMo Switchyard రూటింగ్ లైబ్రరీ ఇప్పటికే ఇన్ఫరెన్స్ ఖర్చులు (inference costs) మరియు క్యాచీ ఎఫిషియన్సీ (cache efficiency) పై చర్చను రేకెత్తించింది. Switchyard మోడళ్ల మధ్య రిక్వెస్ట్‌లను పంపే విధానం ప్రాంప్ట్ క్యాచీలను (prompt caches) దెబ్బతీసి, ఒకే ఇన్ఫరెన్స్ సెషన్‌కు అయ్యే ఖర్చును రెట్టింపు చేసే అవకాశం ఉంది.

ఓపెన్-వెయిట్ ఏజెంట్ల కోసం రూపొందించబడిన మోడల్

Nemotron 3.5 Lightning టూల్స్‌ను పిలిచే (call tools), ఫలితాలను ధృవీకరించే (validate results) మరియు రీజనింగ్ ట్రేస్‌ను (reasoning trace) ఉంచుకునే AI ఏజెంట్లను లక్ష్యంగా చేసుకుంటుంది. మూడు సాంకేతిక ఎంపికలు దీనిని ప్రత్యేకంగా నిలుపుతాయి:

  • Hybrid architecture – ఇది Mamba-2 state-space కోర్‌ను సాంప్రదాయ Transformerతో మిళితం చేస్తుంది, దీని ద్వారా నాన్-ట్రాన్స్‌ఫార్మర్ డిజైన్‌లు కూడా ఈ స్థాయిలో పోటీ పడగలవని నిరూపిస్తుంది.
  • 4-bit floating-point quantization – తక్కువ ప్రిసిషన్ (low-precision) లో ఉండటం వల్ల, ఈ 30 B మోడల్ M5 Max MacBook Proలో సెకనుకు సుమారు 100 టోకెన్లను ఉత్పత్తి చేయగలదు; ఫుల్-ప్రిసిషన్ మోడల్ ఈ వేగాన్ని అందుకోవడం కష్టమవుతుంది.
  • Full openness – Nvidia వెయిట్ ఫైల్స్ మరియు పూర్తి ట్రైనింగ్ రెసిపీని విడుదల చేసింది, హై-పెర్ఫార్మెన్స్ ఇన్ఫరెన్స్ కోసం ఉద్దేశించిన మోడల్‌కు ఇది చాలా అరుదైన విషయం.

ప్రారంభ వినియోగదారులు ఈ మోడల్ "over-think" చేయవచ్చని, అంటే కొన్నిసార్లు తప్పులు చేసే సుదీర్ఘమైన రీజనింగ్ చైన్లను (reasoning chains) ఇస్తుందని చెబుతున్నారు. డెవలపర్‌లకు శక్తివంతమైన, బహిరంగంగా అందుబాటులో ఉండే ఏజెంట్ ఎగ్జిక్యూటర్ లభిస్తుంది, కానీ అనవసరమైన వర్బోసిటీని (verbosity) నివారించడానికి ప్రాంప్ట్‌లను జాగ్రత్తగా ఇవ్వాలి.

రూటింగ్ లేయర్ ఎందుకు ముఖ్యం

NeMo Switchyard అనేది అందుబాటులో ఉన్న మోడళ్ల నుండి ఒక రిక్వెస్ట్‌ను "ఉత్తమ" మోడల్‌కు డైనమిక్‌గా రూట్ చేయడానికి Nvidia రూపొందించిన లైబ్రరీ. సిద్ధాంతపరంగా, ప్రతి క్వెరీ కోసం ఒక స్పెషలిస్ట్ మోడల్‌ను ఎంచుకోవడం ద్వారా రూటర్ సమాధానం యొక్క నాణ్యతను పెంచగలదు. కానీ ఆచరణలో, ఈ రూటింగ్ నిర్ణయం అనేక ఇన్ఫరెన్స్ పైప్‌లైన్‌లు ఆధారపడే ప్రాంప్ట్-క్యాషింగ్ మెకానిజమ్‌లతో విభేదిస్తుంది.

  • Prompt caches ప్రారంభ ప్రాంప్ట్ యొక్క టోకెన్ ఎంబెడ్డింగ్స్‌ను నిల్వ చేస్తాయి, తద్వారా తదుపరి జనరేషన్లు "prefill" దశను మళ్ళీ లెక్కించకుండా వాటిని తిరిగి ఉపయోగించుకోవచ్చు.
  • Routing swaps మొదటి కొన్ని టోకెన్ల తర్వాత రిక్వెస్ట్‌ను మోడల్ A నుండి మోడల్ Bకి మారుస్తాయి, దీనివల్ల సిస్టమ్ క్యాష్ చేసిన ప్రాంప్ట్‌ను పారేసి, కొత్త మోడల్ కోసం దానిని మొదటి నుండి మళ్ళీ లెక్కించాల్సి వస్తుంది.

కొత్త టోకెన్లను జనరేట్ చేయడం కంటే క్యాష్ చేసిన ప్రాంప్ట్‌ను చదవడానికే ఎక్కువ AI ఖర్చు అవుతుంది కాబట్టి, ఒకే ఒక రూటింగ్ హాప్ (routing hop) రిక్వెస్ట్ ఖర్చును ప్రభావవంతంగా రెట్టింపు చేయగలదు.

ఖర్చుల మధ్య పోరాటం

భవిష్యత్తులో ఏమి ఉండబోతోంది

Nvidia యొక్క ఓపెన్-వెయిట్ వ్యూహం ప్రత్యక్ష పోటీని ఎదుర్కొంటున్న తరుణంలో ఈ చర్చ మొదలైంది. ఆగస్టు 15న Qwen 3.8-27B లాంచ్ కానుంది, మరియు ప్రారంభ బెంచ్‌మార్క్‌ల ప్రకారం లోకల్ డెవలప్‌మెంట్ సందర్భాలలో ఇది Nemotron 3.5 Lightningతో సమానంగా పోటీ పడగలదు.

Nvidia యొక్క విధానం—ఓపెన్ వెయిట్స్, ఓపెన్ ట్రైనింగ్ రెసిపీలు మరియు ఓపెన్ రూటింగ్ లేయర్—ఈ మోడళ్లను లోకల్‌గా రన్ చేసే ఎవరికైనా తన GPUలను డిఫాల్ట్ హార్డ్‌వేర్‌గా మార్చడానికి రూపొందించినట్లు కనిపిస్తుంది. సాఫ్ట్‌వేర్ స్టాక్‌ను బహిర్గతం చేయడం ద్వారా, రూటింగ్ లాజిక్ వల్ల దాగి ఉన్న అదనపు ఖర్చులు ఉన్నప్పటికీ, డెవలపర్‌లను తన ఎకోసిస్టమ్‌లోకి తీసుకురావాలని Nvidia ఆశిస్తోంది.

ముగింపు

మీరు మీ స్వంత మెషీన్‌లో Nemotron 3.5 Lightningని రన్ చేయాలని ప్లాన్ చేస్తే, "ఇది ఎంత వేగంగా జనరేట్ చేయగలదు?" అని మాత్రమే కాకుండా, "Switchyard నా ప్రాంప్ట్ క్యాచీని ఎంత తరచుగా పారేయాలని చేస్తుంది?" అని కూడా అడగండి. ఆ సమాధానమే ఈ మోడల్ యొక్క ఓపెన్-వెయిట్ వాగ్దానం నిజమైన పొదుపుగా మారుతుందా లేదా ఖరీదైన ప్రయోగంగా మిగిలిపోతుందా అనేది నిర్ణయిస్తుంది. Qwen వంటి ప్రత్యామ్నాయాలు వస్తున్న కొద్దీ, రూటింగ్ ఫ్లెక్సిబిలిటీ మరియు క్యాష్ ఆధారిత ఖర్చు సామర్థ్యం (cost efficiency) మధ్య సమతుల్యత ఏ టూల్‌కిట్—మరియు చివరికి ఏ హార్డ్‌వేర్ ప్లాట్‌ఫామ్—గెలుస్తుందో నిర్ణయిస్తుంది.