Nvidia ഓഗസ്റ്റ് 11-ന് Nemotron 3.5 Lightning പുറത്തിറക്കി. 30 ബില്യൺ പാരാമീറ്ററുകളുള്ള mixture-of-experts മോഡൽ വെറും 3 ബില്യൺ ആക്ടീവ് പാരാമീറ്ററുകൾ ഉപയോഗിച്ച് പ്രവർത്തിക്കുന്നു. ഇതിനോടൊപ്പമുള്ള NeMo Switchyard റൂട്ടിംഗ് ലൈബ്രറി, ഇൻഫറൻസ് ചിലവിനെയും (inference costs) കാഷെ കാര്യക്ഷമതയെയും (cache efficiency) കുറിച്ച് ഇതിനകം തന്നെ ഒരു സംവാദത്തിന് വഴിതെളിച്ചിട്ടുണ്ട്. മോഡലുകൾക്കിടയിൽ റിക്വസ്റ്റുകൾ കൈമാറുന്ന Switchyard-ന്റെ രീതി പ്രോംപ്റ്റ് കാഷെകളെ (prompt caches) നശിപ്പിക്കാനും ഒരു ഇൻഫറൻസ് സെഷന്റെ ചിലവ് ഇരട്ടിയാക്കാനും സാധ്യതയുണ്ട്.
ഓപ്പൺ-വെയ്റ്റ് ഏജന്റുകൾക്കായി നിർമ്മിച്ച ഒരു മോഡൽ
ടൂളുകൾ ഉപയോഗിക്കുന്ന, ഫലങ്ങൾ പരിശോധിക്കുന്ന, കൂടാതെ റീസണിംഗ് ട്രാസ് (reasoning trace) സൂക്ഷിക്കുന്ന AI ഏജന്റുകളെയാണ് Nemotron 3.5 Lightning ലക്ഷ്യമിടുന്നത്. മൂന്ന് സാങ്കേതിക തിരഞ്ഞെടുപ്പുകൾ ഇതിനെ വ്യത്യസ്തമാക്കുന്നു:
- ഹൈബ്രിഡ് ആർക്കിടെക്ചർ (Hybrid architecture) – ഇത് ഒരു Mamba-2 സ്റ്റേറ്റ്-സ്പേസ് കോറിനെ പരമ്പരാഗത Transformer-മായി സംയോജിപ്പിക്കുന്നു, ഇത് Transformer അല്ലാത്ത ഡിസൈനുകൾക്കും ഈ അളവിൽ മത്സരിക്കാൻ കഴിയുമെന്ന് തെളിയിക്കുന്നു.
- 4-bit ഫ്ലോട്ടിംഗ്-പോയിന്റ് ക്വാണ്ടൈസേഷൻ (4-bit floating-point quantization) – ലോ-പ്രസിഷനിൽ ലഭ്യമാകുന്നതിലൂടെ, 30 B മോഡലിന് ഒരു M5 Max MacBook Pro-യിൽ സെക്കൻഡിൽ ഏകദേശം 100 ടോക്കണുകൾ പുറപ്പെടുവിക്കാൻ കഴിയും; ഫുൾ-പ്രസിഷൻ മോഡലുകൾക്ക് എത്തിപ്പിടിക്കാൻ പ്രയാസമുള്ള വേഗതയാണിത്.
- പൂർണ്ണമായ തുറന്ന സമീപനം (Full openness) – ഹൈ-പെർഫോമൻസ് ഇൻഫറൻസിനായി ലക്ഷ്യമിടുന്ന ഒരു മോഡലിനെ സംബന്ധിച്ചിടത്തോളം അപൂർവ്വമായ ഒന്നാണ് Nvidia ഇതിന്റെ വെയ്റ്റ് ഫയലുകളും പൂർണ്ണമായ ട്രെയിനിംഗ് റെസിപ്പിയും പുറത്തുവിട്ടത്.
മോഡൽ "അമിതമായി ചിന്തിക്കുന്നു" (over-think) എന്നും, ചിലപ്പോൾ തെറ്റായ നീണ്ട റീസണിംഗ് ചെയിനുകൾ (reasoning chains) നൽകുന്നു എന്നും ആദ്യകാല ഉപയോക്താക്കൾ പറയുന്നു. ഡെവലപ്പർമാർക്ക് ശക്തവും തുറന്നതും ആയ ഒരു ഏജന്റ് എക്സിക്യൂട്ടർ (agent executor) ലഭിക്കുന്നുണ്ടെങ്കിലും, അനാവശ്യമായ വിവരണങ്ങൾ ഒഴിവാക്കാൻ ശ്രദ്ധാപൂർവ്വം പ്രോംപ്റ്റ് നൽകേണ്ടതുണ്ട്.
റൂട്ടിംഗ് ലെയർ എന്തുകൊണ്ട് പ്രധാനമാകുന്നു
ലഭ്യമായ മോഡലുകളിൽ നിന്ന് ഒരു റിക്വസ്റ്റിനെ ഏറ്റവും അനുയോജ്യമായ ("best") മോഡലിലേക്ക് ഡൈനാമിക് ആയി റൂട്ട് ചെയ്യുന്നതിനായുള്ള Nvidia-യുടെ ലൈബ്രറിയാണ് NeMo Switchyard. സിദ്ധാന്തപരമായി, ഓരോ ക്വറിക്കും ഒരു സ്പെഷ്യലിസ്റ്റ് മോഡലിനെ തിരഞ്ഞെടുക്കുന്നതിലൂടെ ഒരു റൂട്ടറിന് ഉത്തരത്തിന്റെ ഗുണനിലവാരം വർദ്ധിപ്പിക്കാൻ കഴിയും. എന്നാൽ പ്രായോഗികമായി, റൂട്ടിംഗ് തീരുമാനം പല ഇൻഫറൻസ് പൈപ്പ്ലൈനുകളും ആശ്രയിക്കുന്ന പ്രോംപ്റ്റ്-കാഷിംഗ് മെക്കാനിസങ്ങളുമായി (prompt-caching mechanisms) ഏറ്റുമുട്ടുന്നു.
- പ്രോംപ്റ്റ് കാഷെകൾ (Prompt caches) പ്രാരംഭ പ്രോംപ്റ്റിന്റെ ടോക്കൺ എംബെഡിംഗുകൾ (token embeddings) സംഭരിക്കുന്നു, അതിനാൽ പിൽക്കാല ജനറേഷനുകൾക്ക് "prefill" ഘട്ടം വീണ്ടും കണക്കാക്കാതെ തന്നെ അവ പുനരുപയോഗിക്കാൻ കഴിയും.
- റൂട്ടിംഗ് സ്വാപ്പുകൾ (Routing swaps) ആദ്യത്തെ ഏതാനും ടോക്കണുകൾക്ക് ശേഷം ഒരു റിക്വസ്റ്റിനെ Model A-യിൽ നിന്ന് Model B-യിലേക്ക് മാറ്റുന്നു, ഇത് സിസ്റ്റത്തെ കാഷെ ചെയ്ത പ്രോംപ്റ്റ് ഉപേക്ഷിക്കാനും പുതിയ മോഡലിനായി അത് ആദ്യം മുതൽ വീണ്ടും കണക്കാക്കാനും നിർബന്ധിക്കുന്നു.
പുതിയ ടോക്കണുകൾ നിർമ്മിക്കുന്നതിനേക്കാൾ കൂടുതൽ AI ചിലവ് കാഷെ ചെയ്ത പ്രോംപ്റ്റ് വായിക്കുന്നതിലാണ് ചെലവാകുന്നത് എന്നതിനാൽ, ഒരു റൂട്ടിംഗ് ഹോപ്പ് (routing hop) ഒരു റിക്വസ്റ്റിന്റെ ചിലവ് ഫലപ്രദമായി ഇരട്ടിയാക്കിയേക്കാം.
ചിലവുകൾ തമ്മിലുള്ള പോരാട്ടം
വരാനിരിക്കുന്നവ
Nvidia-യുടെ ഓപ്പൺ-വെയ്റ്റ് തന്ത്രം നേരിട്ടുള്ള മത്സരത്തെ നേരിടുന്ന സാഹചര്യത്തിലാണ് ഈ സംവാദം വരുന്നത്. ഓഗസ്റ്റ് 15-ന് Qwen 3.8-27B പുറത്തിറങ്ങും, ലോക്കൽ ഡെവലപ്മെന്റ് സാഹചര്യങ്ങളിൽ Nemotron 3.5 Lightning-ന് തുല്യമായി നിൽക്കാൻ ഇതിന് കഴിയുമെന്ന് ആദ്യകാല ബെഞ്ച്മാർക്കുകൾ സൂചിപ്പിക്കുന്നു.
ഓപ്പൺ വെയ്റ്റുകൾ, ഓപ്പൺ ട്രെയിനിംഗ് റെസിപ്പികൾ, ഓപ്പൺ റൂട്ടിംഗ് ലെയർ എന്നിവ ഉൾപ്പെടുന്ന Nvidia-യുടെ രീതി, ഈ മോഡലുകൾ ലോക്കലായി പ്രവർത്തിപ്പിക്കുന്നവർക്ക് അവരുടെ GPU-കൾ ഡിഫോൾട്ട് ഹാർഡ്വെയർ ആക്കി മാറ്റുന്നതിനായി രൂപകൽപ്പന ചെയ്തതായി കാണപ്പെടുന്നു. സോഫ്റ്റ്വെയർ സ്റ്റാക്ക് തുറന്നുകാട്ടുന്നതിലൂടെ, റൂട്ടിംഗ് ലോജിക് മറഞ്ഞിരിക്കുന്ന ചിലവ് വർദ്ധനവ് ഉണ്ടാക്കിയാലും, ഡെവലപ്പർമാരെ അതിന്റെ ഇക്കോസിസ്റ്റത്തിൽ (ecosystem) നിലനിർത്താൻ Nvidia ആഗ്രഹിക്കുന്നു.
ചുരുക്കത്തിൽ
നിങ്ങൾ നിങ്ങളുടെ സ്വന്തം മെഷീനിൽ Nemotron 3.5 Lightning പ്രവർത്തിപ്പിക്കാൻ പദ്ധതിയിടുന്നുണ്ടെങ്കിൽ, "ഇത് എത്ര വേഗത്തിൽ ജനറേറ്റ് ചെയ്യും?" എന്ന് മാത്രമല്ല, "Switchyard എത്ര തവണ എന്റെ പ്രോംപ്റ്റ് കാഷെ ഉപേക്ഷിക്കാൻ എന്നെ നിർബന്ധിക്കും?" എന്നും ചോദിക്കുക. ആ ഉത്തരം മോഡലിന്റെ ഓപ്പൺ-വെയ്റ്റ് വാഗ്ദാനം യഥാർത്ഥ ലാഭമാകുമോ അതോ ചിലവേറിയ പരീക്ഷണമാകുമോ എന്ന് തീരുമാനിക്കും. Qwen പോലുള്ള ബദലുകൾ വരുമ്പോൾ, റൂട്ടിംഗ് ഫ്ലെക്സിബിലിറ്റിയും (routing flexibility) കാഷെ അധിഷ്ഠിത ചിലവ് കാര്യക്ഷമതയും (cache-driven cost efficiency) തമ്മിലുള്ള സന്തുലിതാവസ്ഥ ഏത് ടൂൾകിറ്റും—അവസാനം ഏത് ഹാർഡ്വെയർ പ്ലാറ്റ്ഫോമും—വിജയിക്കുമെന്ന് തീരുമാനിക്കും.
