Nvidia ಆಗಸ್ಟ್ 11 ರಂದು Nemotron 3.5 Lightning ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿತು. 30 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿರುವ mixture-of-experts ಮಾದರಿಯು ಕೇವಲ 3 ಬಿಲಿಯನ್ ಸಕ್ರಿಯ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ, ಮತ್ತು ಅದರ ಸಹವರ್ತಿ NeMo Switchyard routing library ಈಗಾಗಲೇ inference ವೆಚ್ಚಗಳು ಮತ್ತು cache ದಕ್ಷತೆಯ ಬಗ್ಗೆ ಚರ್ಚೆಯನ್ನು ಹುಟ್ಟುಹಾಕಿದೆ. Switchyard ಮಾದರಿಗಳ ನಡುವೆ ವಿನಂತಿಗಳನ್ನು (requests) ವರ್ಗಾಯಿಸುವ ವಿಧಾನವು prompt caches ಅನ್ನು ಹಾಳುಮಾಡಬಹುದು ಮತ್ತು ಒಂದೇ ಒಂದು inference ಸೆಷನ್‌ಗಾಗಿ ಬಿಲ್ ಅನ್ನು ದ್ವಿಗುಣಗೊಳಿಸುವ ಸಾಧ್ಯತೆಯಿದೆ.

open-weight agents ಗಾಗಿ ನಿರ್ಮಿಸಲಾದ ಮಾದರಿ

Nemotron 3.5 Lightning ಉಪಕರಣಗಳನ್ನು (tools) ಬಳಸುವ, ಫಲಿತಾಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸುವ ಮತ್ತು ತಾರ್ಕಿಕ ಹಾದಿಯನ್ನು (reasoning trace) ಕಾಪಾಡಿಕೊಳ್ಳುವ AI agents ಗಳನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ. ಮೂರು ತಾಂತ್ರಿಕ ಆಯ್ಕೆಗಳು ಇದನ್ನು ವಿಭಿನ್ನವಾಗಿಸುತ್ತವೆ:

  • Hybrid architecture – ಇದು Mamba-2 state-space ಕೋರ್ ಅನ್ನು ಸಾಂಪ್ರದಾಯಿಕ Transformer ನೊಂದಿಗೆ ವಿಲೀನಗೊಳಿಸುತ್ತದೆ, ಇದು non-Transformer ವಿನ್ಯಾಸಗಳು ಈ ಮಟ್ಟದಲ್ಲಿ ಸ್ಪರ್ಧಿಸಬಲ್ಲವು ಎಂಬುದನ್ನು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
  • 4-bit floating-point quantization – ಕಡಿಮೆ ನಿಖರತೆಯಲ್ಲಿ (low-precision) ಲಭ್ಯವಿರುವುದರಿಂದ, ಈ 30 B ಮಾದರಿಯು M5 Max MacBook Pro ನಲ್ಲಿ ಸೆಕೆಂಡಿಗೆ ಸುಮಾರು 100 ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ, ಇದು ಪೂರ್ಣ ನಿಖರತೆಯ (full-precision) ಮಾದರಿಯು ತಲುಪಲು ಕಷ್ಟಪಡುವ ವೇಗವಾಗಿದೆ.
  • Full openness – Nvidia ತೂಕದ ಫೈಲ್‌ಗಳನ್ನು (weight files) ಮತ್ತು ಸಂಪೂರ್ಣ ತರಬೇತಿ ವಿಧಾನವನ್ನು (training recipe) ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಹೆಚ್ಚಿನ ಕಾರ್ಯಕ್ಷಮತೆಯ inference ಗಾಗಿ ಉದ್ದೇಶಿಸಲಾದ ಮಾದರಿಗೆ ಅಪರೂಪದ ವಿಷಯವಾಗಿದೆ.

ಆರಂಭಿಕ ಬಳಕೆದಾರರು ಈ ಮಾದರಿಯು "ಅತಿಯಾಗಿ ಯೋಚಿಸಬಹುದು" (over-think) ಎಂದು ಹೇಳುತ್ತಾರೆ, ಇದು ಕೆಲವೊಮ್ಮೆ ತಪ್ಪಾದ ದೀರ್ಘ ತಾರ್ಕಿಕ ಸರಪಳಿಗಳನ್ನು (reasoning chains) ನೀಡುತ್ತದೆ. ಡೆವಲಪರ್‌ಗಳು ಶಕ್ತಿಯುತವಾದ, ಮುಕ್ತವಾಗಿ ಲಭ್ಯವಿರುವ agent executor ಅನ್ನು ಪಡೆಯುತ್ತಾರೆ, ಆದರೆ ಅನಗತ್ಯ ವಿವರಣೆಯನ್ನು ತಪ್ಪಿಸಲು ಎಚ್ಚರಿಕೆಯಿಂದ prompt ನೀಡಬೇಕು.

routing layer ಏಕೆ ಮುಖ್ಯ

NeMo Switchyard ಎಂಬುದು ಲಭ್ಯವಿರುವ ಮಾದರಿಗಳ ಗುಂಪಿನಿಂದ ವಿನಂತಿಯನ್ನು "ಅತ್ಯುತ್ತಮ" ಮಾದರಿಗೆ ಡೈನಾಮಿಕ್ ಆಗಿ ವರ್ಗಾಯಿಸಲು Nvidia ಬಳಸುವ library ಆಗಿದೆ. ಸಿದ್ಧಾಂತದ ಪ್ರಕಾರ, ಪ್ರತಿ ಪ್ರಶ್ನೆಗೂ ತಜ್ಞ ಮಾದರಿಯನ್ನು (specialist model) ಆಯ್ಕೆ ಮಾಡುವ ಮೂಲಕ router ಉತ್ತರದ ಗುಣಮಟ್ಟವನ್ನು ಹೆಚ್ಚಿಸಬಹುದು. ಆದರೆ ಪ್ರಾಯೋಗಿಕವಾಗಿ, routing ನಿರ್ಧಾರವು ಅನೇಕ inference pipelines ಅವಲಂಬಿಸಿರುವ prompt-caching ಕಾರ್ಯವಿಧಾನಗಳೊಂದಿಗೆ ಸಂಘರ್ಷ ಉಂಟುಮಾಡುತ್ತದೆ.

  • Prompt caches ಆರಂಭಿಕ prompt ನ token embeddings ಅನ್ನು ಸಂಗ್ರಹಿಸಿಡುತ್ತವೆ, ಇದರಿಂದ ನಂತರದ ಹಂತಗಳಲ್ಲಿ "prefill" ಹಂತವನ್ನು ಮರು-ಲೆಕ್ಕಾಚಾರ ಮಾಡದೆ ಅವುಗಳನ್ನು ಮರುಬಳಕೆ ಮಾಡಬಹುದು.
  • Routing swaps ಮೊದಲ ಕೆಲವು ಟೋಕನ್‌ಗಳ ನಂತರ ವಿನಂತಿಯನ್ನು Model A ನಿಂದ Model B ಗೆ ವರ್ಗಾಯಿಸುತ್ತದೆ, ಇದು ಸಿಸ್ಟಮ್ ಅನ್ನು cached prompt ಅನ್ನು ಕೈಬಿಡಲು ಮತ್ತು ಹೊಸ ಮಾದರಿಗಾಗಿ ಅದನ್ನು ಮೊದಲಿನಿಂದಲೇ ಮರು-ಲೆಕ್ಕಾಚಾರ ಮಾಡಲು ಒತ್ತಾಯಿಸುತ್ತದೆ.

ಹೆಚ್ಚಿನ AI ವೆಚ್ಚವು ಹೊಸ ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುವುದಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ cached prompt ಅನ್ನು ಓದುವುದಕ್ಕೇ ವ್ಯಯವಾಗುವುದರಿಂದ, ಒಂದು routing hop ವಿನಂತಿಯ ವೆಚ್ಚವನ್ನು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ದ್ವಿಗುಣಗೊಳಿಸಬಹುದು.

ವೆಚ್ಚದ ಸಂಘರ್ಷ

ಮುಂದಿನ ಬೆಳವಣಿಗೆಗಳು

Nvidia ನ open-weight ತಂತ್ರವು ನೇರ ಸ್ಪರ್ಧೆಯನ್ನು ಎದುರಿಸುತ್ತಿರುವಾಗ ಈ ಚರ್ಚೆ ಬಂದಿದೆ. ಆಗಸ್ಟ್ 15 ರಂದು Qwen 3.8-27B ಬಿಡುಗಡೆಯಾಗಲಿದೆ ಮತ್ತು ಆರಂಭಿಕ benchmarks ಪ್ರಕಾರ ಇದು ಸ್ಥಳೀಯ ಅಭಿವೃದ್ಧಿ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ (local development scenarios) Nemotron 3.5 Lightning ಗೆ ಸಮಾನವಾಗಿ ಸ್ಪರ್ಧಿಸಬಲ್ಲದು.

Nvidia ನ ಮಾದರಿ—open weights, open training recipes ಮತ್ತು open routing layer—ಈ ಮಾದರಿಗಳನ್ನು ಸ್ಥಳೀಯವಾಗಿ ಚಲಾಯಿಸುವ ಯಾರಿಗಾದರೂ ತನ್ನ GPU ಗಳನ್ನು ಡಿಫಾಲ್ಟ್ ಹಾರ್ಡ್‌ವೇರ್ ಆಗಿ ಮಾಡಲು ವಿನ್ಯಾಸಗೊಳಿಸಿದಂತೆ ಕಾಣುತ್ತದೆ. ಸಾಫ್ಟ್‌ವೇರ್ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಬಹಿರಂಗಪಡಿಸುವ ಮೂಲಕ, routing ತರ್ಕವು ಗುಪ್ತ ವೆಚ್ಚದ ದಂಡಗಳನ್ನು (hidden cost penalties) ಸೇರಿಸಿದರೂ ಸಹ, ಡೆವಲಪರ್‌ಗಳನ್ನು ತನ್ನ ಪರಿಸರ ವ್ಯವಸ್ಥೆಗೆ (ecosystem) ಕಟ್ಟಿಹಾಕಲು Nvidia ಆಶಿಸುತ್ತದೆ.

ಸಾರಾಂಶ

ನೀವು ನಿಮ್ಮ ಸ್ವಂತ ಯಂತ್ರದಲ್ಲಿ Nemotron 3.5 Lightning ಅನ್ನು ಚಲಾಯಿಸಲು ಯೋಜಿಸಿದರೆ, "ಇದು ಎಷ್ಟು ವೇಗವಾಗಿ ಉತ್ಪಾದಿಸುತ್ತದೆ?" ಎಂದು ಕೇಳುವುದಲ್ಲದೆ, "Switchyard ಎಷ್ಟು ಬಾರಿ ನನ್ನ prompt cache ಅನ್ನು ಕೈಬಿಡಲು ಒತ್ತಾಯಿಸುತ್ತದೆ?" ಎಂದು ಕೂಡ ಕೇಳಿ. ಆ ಉತ್ತರದೇ ಈ ಮಾದರಿಯ open-weight ಭರವಸೆಯು ನೈಜ ಪ್ರಪಂಚದ ಉಳಿತಾಯವಾಗುತ್ತದೆಯೇ ಅಥವಾ ದುಬಾರಿ ಪ್ರಯೋಗವಾಗುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. Qwen ನಂತಹ ಪರ್ಯಾಯಗಳು ಕಾಣಿಸಿಕೊಂಡಂತೆ, routing ನ ನಮ್ಯತೆ (flexibility) ಮತ್ತು cache-driven ವೆಚ್ಚದ ದಕ್ಷತೆಯ ನಡುವಿನ ಸಮತೋಲನವು ಯಾವ toolkit—ಮತ್ತು ಅಂತಿಮವಾಗಿ ಯಾವ hardware platform—ಗೆ ಜಯ ಸಿಗುತ್ತದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.