Nvidia ஆகஸ்ட் 11 அன்று Nemotron 3.5 Lightning-ஐ வெளியிட்டது. 30 பில்லியன் அளவுருக்களைக் கொண்ட இந்த mixture-of-experts மாடல், வெறும் 3 பில்லியன் செயலில் உள்ள (active) அளவுருக்களுடன் இயங்குகிறது, மேலும் அதன் துணை NeMo Switchyard routing library, inference செலவுகள் மற்றும் cache செயல்திறன் குறித்த விவாதத்தை ஏற்கனவே கிளப்பியுள்ளது. Switchyard மாடல்களுக்கு இடையே கோரிக்கைகளை (requests) பரிமாறும் விதம், prompt caches-களை அழித்துவிடக்கூடும் மற்றும் ஒரு एकल inference அமர்விற்கான (session) கட்டணத்தை இரட்டிப்பாக்கக்கூடும்.

open-weight ஏஜெண்டுகளுக்காக உருவாக்கப்பட்ட ஒரு மாடல்

Nemotron 3.5 Lightning கருவிகளைப் பயன்படுத்துதல் (call tools), முடிவுகளைச் சரிபார்த்தல் (validate results) மற்றும் ஒரு தர்க்கரீதியான தடயத்தை (reasoning trace) வைத்திருத்தல் போன்ற பணிகளைச் செய்யும் AI ஏஜெண்டுகளை இலக்காகக் கொண்டுள்ளது. மூன்று தொழில்நுட்பத் தெரிவுகள் இதனைத் தனித்துவமாக்குகின்றன:

  • Hybrid architecture – இது ஒரு Mamba-2 state-space மையத்தையும் வழக்கமான Transformer-ஐயும் இணைக்கிறது, இதன் மூலம் non-Transformer வடிவமைப்புகளும் இவ்வளவு பெரிய அளவில் போட்டியிட முடியும் என்பதை நிரூபிக்கிறது.
  • 4-bit floating-point quantization – குறைந்த துல்லியத்துடன் (low-precision) வழங்குவதால், இந்த 30 B மாடல் ஒரு M5 Max MacBook Pro-வில் வினாடிக்குத் தோராயமாக 100 tokens-களை உருவாக்க முடிகிறது; முழுத் துல்லியத் திறன் (full-precision) கொண்ட மாடலால் இந்த வேகத்தை எட்ட முடியாது.
  • Full openness – Nvidia அதன் weight கோப்புகளையும் முழுமையான training recipe-யையும் வெளியிட்டுள்ளது; உயர் செயல்திறன் கொண்ட inference-ஐ இலக்காகக் கொண்ட ஒரு மாடலுக்கு இது அரிதான ஒன்றாகும்.

ஆரம்பகால பயனர்கள், இந்த மாடல் "அதிகமாகச் சிந்திக்கிறது" (over-think) என்றும், சில நேரங்களில் தவறான நீண்ட தர்க்கச் சங்கிலிகளை (reasoning chains) வெளியிடுகிறது என்றும் கூறுகின்றனர். டெவலப்பர்களுக்கு ஒரு சக்திவாய்ந்த, வெளிப்படையாகக் கிடைக்கக்கூடிய agent executor கிடைக்கிறது, ஆனால் தேவையற்ற விரிவான விளக்கங்களைத் தவிர்க்க கவனமாக prompt கொடுக்க வேண்டும்.

routing layer ஏன் முக்கியமானது

NeMo Switchyard என்பது பல மாடல்களின் தொகுப்பிலிருந்து ஒரு கோரிக்கையை (request) "சிறந்த" மாடலுக்குத் தானாகவே (dynamically) வழிநடத்துவதற்கான Nvidia-வின் library ஆகும். கோட்பாட்டளவில், ஒரு router ஒவ்வொரு வினாவிற்கும் ஒரு நிபுணத்துவ மாடலைத் தேர்ந்தெடுப்பதன் மூலம் பதிலின் தரத்தை அதிகரிக்க முடியும். ஆனால் நடைமுறையில், இந்த routing முடிவு பல inference pipelines நம்பியிருக்கும் prompt-caching வழிமுறைகளுடன் முரண்படுகிறது.

  • Prompt caches ஆரம்பகால prompt-ன் token embeddings-களைச் சேமித்து வைக்கின்றன, இதனால் பிந்தைய உருவாக்கங்களின் போது "prefill" படிநிலையை மீண்டும் கணக்கிடாமல் அவற்றை மறுபயன்பாடு செய்ய முடியும்.
  • Routing swaps முதல் சில tokens-களுக்குப் பிறகு ஒரு கோரிக்கையை Model A-விலிருந்து Model B-க்கு மாற்றுகிறது, இது cache செய்யப்பட்ட prompt-ஐத் தூக்கி எறிந்துவிட்டு, புதிய மாடலுக்காக அதை ஆரம்பத்திலிருந்து மீண்டும் கணக்கிட வேண்டிய கட்டாயத்தை உருவாக்குகிறது.

புதிய tokens-களை உருவாக்குவதை விட, cache செய்யப்பட்ட prompt-ஐப் படிப்பதற்கே பெரும்பாலான AI செலவுகள் செய்யப்படுவதால், ஒரு சிறிய routing மாற்றம் ஒரு கோரிக்கையின் செலவை உண்மையில் இரட்டிப்பாக்கக்கூடும்.

செலவு தொடர்பான இழுபறி

வரவிருக்கும் மாற்றங்கள்

Nvidia-வின் open-weight உத்தி நேரடிப் போட்டியைச் சந்திக்கும் வேளையில் இந்த விவாதம் எழுந்துள்ளது. ஆகஸ்ட் 15 அன்று, Qwen 3.8-27B அறிமுகமாக உள்ளது, மேலும் ஆரம்பகால benchmarks-கள் உள்ளூர் மேம்பாட்டுச் சூழல்களில் (local development scenarios) Nemotron 3.5 Lightning-க்கு இணையாக இது செயல்பட முடியும் என்று தெரிவிக்கின்றன.

Nvidia-வின் முறை—open weights, open training recipes மற்றும் ஒரு open routing layer—இந்த மாடல்களை உள்ளூரில் இயக்கும் எவருக்கும் அதன் GPUs-களைத் தரநிலையான (default) hardware-ஆக மாற்றுவதற்காக வடிவமைக்கப்பட்டதாகத் தெரிகிறது. மென்பொருள் தொகுப்பை (software stack) வெளிப்படுத்துவதன் மூலம், routing logic மறைமுகச் செலவுகளைச் சேர்த்தாலும், டெவலப்பர்களைத் தனது ecosystem-க்குள் தக்கவைக்க Nvidia நம்புகிறது.

சுருக்கம்

நீங்கள் உங்கள் சொந்த இயந்திரத்தில் Nemotron 3.5 Lightning-ஐ இயக்கத் திட்டமிட்டால், "இது எவ்வளவு வேகமாக உருவாக்க முடியும்?" என்று மட்டும் கேட்காமல், "Switchyard எவ்வளவு அடிக்கடி எனது prompt cache-ஐத் தூக்கி எறியச் செய்யும்?" என்றும் கேளுங்கள். அந்தப் பதில்தான், இந்த மாடலின் open-weight வாக்குறுதி நிஜ உலகில் ஒரு சேமிப்பாக மாறுமா அல்லது ஒரு விலையுயர்ந்த பரிசோதனையாக மாறுமா என்பதைத் தீர்மானிக்கும். Qwen போன்ற மாற்றுகள் வரும்போது, routing நெகிழ்வுத்தன்மைக்கும் (flexibility) cache சார்ந்த செலவுத் திறனுக்கும் (cost efficiency) இடையிலான சமநிலையே எந்தத் தொகுப்பு (toolkit)—மற்றும் இறுதியில் எந்த hardware platform—வெல்லும் என்பதைத் தீர்மானிக்கும்.