Nemotron 3 Nano 30B A3B, ಇದರ ಪೂರ್ವಜರಾದ ಇದು, ಈಗಾಗಲೇ ದೊಡ್ಡ ಫೌಂಡೇಶನ್ ಮಾಡೆಲ್‌ಗಳಿಗೆ (foundation models) ಒಂದು compact ಪರ್ಯಾಯವಾಗಿ ಗುರುತಿಸಲ್ಪಟ್ಟಿತ್ತು. hybrid Mamba-Transformer architecture ಗೆ ಬದಲಾಗುವ ಮೂಲಕ ಮತ್ತು ಯಾವುದೇ ಸಮಯದಲ್ಲಿ ಕೇವಲ 3.6 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು (parameters) ಸಕ್ರಿಯಗೊಳಿಸುವ ಮೂಲಕ, Lightning ದಕ್ಷತೆಯ ಗಡಿಯನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ ಮತ್ತು ದೊಡ್ಡ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಸಮಾನವಾದ ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯವನ್ನು (reasoning power) ನೀಡುತ್ತದೆ.

ಈಗ ವೇಗ ಏಕೆ ಮುಖ್ಯ?

AI ಏಜೆಂಟ್‌ಗಳು batch-style inference ನಿಂದ ನಿರಂತರ ಸಂವಹನಕ್ಕೆ (continuous interaction) ಬದಲಾಗುತ್ತಿವೆ. ಕೆಲವು ಸೆಕೆಂಡುಗಳ ಕಾಲ ವಿಳಂಬವಾಗುವ ಚಾಟ್‌ಬಾಟ್ ನಿಧಾನಗತಿಯದ್ದಾಗಿ ಭಾಸವಾಗುತ್ತದೆ; ಡೆವಲಪರ್‌ನ ಟೈಪಿಂಗ್‌ಗಿಂತ ಹಿಂದೆ ಬೀಳುವ ಕೋಡ್-ಕಂಪ್ಲೀಷನ್ ಟೂಲ್ ಕೆಲಸದ ಹರಿವನ್ನು (workflow) ಅಡ್ಡಿಪಡಿಸುತ್ತದೆ. ಅಂತಹ ಸಂದರ್ಭಗಳಲ್ಲಿ, token-per-second throughput ನೇರವಾಗಿ ಪ್ರತಿಕ್ರಿಯೆಯ ವೇಗವನ್ನು (responsiveness) ನಿರ್ಧರಿಸುತ್ತದೆ. 670-token-per-second ಎಂಬ ಅಂಕಿಅಂಶವು Google ನ Gemini 3.5 Flash-Lite ಗೆ ವರದಿಯಾದ 386 tokens per second ಗಿಂತ ಸುಮಾರು ಎರಡರಷ್ಟು ಹೆಚ್ಚಾಗಿದ್ದು, ಇದು ಪ್ರಮಾಣಿತ Intelligence Index ಕಾರ್ಯವನ್ನು ಮುಗಿಸಲು ತಗಲುವ ಸಮಯವನ್ನು ಸುಮಾರು ಅರ್ಧ ನಿಮಿಷಕ್ಕೆ ಇಳಿಸುತ್ತದೆ. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಅದೇ ಕಾರ್ಯಕ್ಕಾಗಿ Qwen 3.6 35B A3B ಗೆ 3.5 ನಿಮಿಷಗಳು ಮತ್ತು Gemma 4 31B ಗೆ 5.8 ನಿಮಿಷಗಳು ಬೇಕಾಗುತ್ತದೆ.

ಏಕಕಾಲದಲ್ಲಿ ಅನೇಕ ವಿನಂತಿಗಳನ್ನು (requests) ನಿರ್ವಹಿಸಬೇಕಾದ ಯಾವುದೇ ಸೇವೆಗೆ ಈ ವ್ಯತ್ಯಾಸವು ಮುಖ್ಯವಾಗುತ್ತದೆ. ಒಂದೇ ಹಾರ್ಡ್‌ವೇರ್‌ನಲ್ಲಿ ಎರಡರಷ್ಟು ಹೆಚ್ಚು ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರೊಸೆಸ್ ಮಾಡುವ ಸರ್ವರ್, ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಅಥವಾ ಸಾಮರ್ಥ್ಯವನ್ನು (capacity) ದ್ವಿಗುಣಗೊಳಿಸಬಹುದು, ಇದು ಕ್ಲೌಡ್ ಪ್ರೊವೈಡರ್‌ಗಳು ಮತ್ತು ಉದ್ಯಮಗಳಿಗೆ ಸ್ಪಷ್ಟವಾದ ಪ್ರಯೋಜನವಾಗಿದೆ.

ಮಾಡೆಲ್ ಈ ಅಂಕಿಅಂಶಗಳನ್ನು ಹೇಗೆ ಸಾಧಿಸುತ್ತದೆ

Nemotron 3.5 Lightning ನ hybrid architecture, Transformers ನ ದೀರ್ಘಾವಧಿಯ pattern-recognition ಸಾಮರ್ಥ್ಯವನ್ನು Mamba blocks ನ state-space ದಕ್ಷತೆಯೊಂದಿಗೆ ಬೆರೆಸುತ್ತದೆ. ಮಾಡೆಲಿಂಗ್ ಸಾಮರ್ಥ್ಯವನ್ನು ಉಳಿಸಿಕೊಳ್ಳಲು ಈ ವಿನ್ಯಾಸವು ಒಟ್ಟು ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆಯನ್ನು 31.6 ಬಿಲಿಯನ್‌ನಷ್ಟು ಹೆಚ್ಚಾಗಿರಿಸುತ್ತದೆ, ಆದರೆ ಯಾವುದೇ ನಿರ್ದಿಷ್ಟ ಟೋಕನ್‌ಗಾಗಿ ಕೇವಲ 3.6 ಬಿಲಿಯನ್ ಮಾತ್ರ ಸಕ್ರಿಯವಾಗಿರುತ್ತದೆ. Sparse activation ಪ್ರತಿ ಟೋಕನ್‌ಗೆ ಬೇಕಾಗುವ ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಗುಣಮಟ್ಟದಲ್ಲಿ ಹೆಚ್ಚಿನ ಕುಸಿತವಿಲ್ಲದೆ throughput ಹೆಚ್ಚಾಗುತ್ತದೆ.

Artificial Analysis, Lightning ಗೆ 24 ರ Intelligence Index ಸ್ಕೋರ್ ಅನ್ನು ಅಳೆಯಿತು, ಇದು ಹಿಂದಿನ Nano ಮಾಡೆಲ್ ಪಡೆದ 15 ಕ್ಕಿಂತ ಒಂಬತ್ತು ಅಂಕಗಳ ಜಿಗಿತವಾಗಿದೆ. Lightning ಸುಮಾರು ಕಾಲು ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಬಳಸುತ್ತಿದ್ದರೂ, ಇದು OpenAI ನ gpt-oss-120b ಗೆ ಸಮಾನವಾಗಿದೆ. ಇದು ಇನ್ನೂ ಉನ್ನತ ಮಾಡೆಲ್‌ಗಳಾದ Meta ನ Muse Glimmer (35) ಮತ್ತು Qwen 3.6 35B A3B (32) ಗಿಂತ ಹಿಂದೆ ಇದ್ದರೂ, ಇದರ intelligence-to-parameter ಅನುಪಾತವು ಅತ್ಯುತ್ತಮವಾದುದರ ಪಟ್ಟಿಯಲ್ಲಿದೆ.

ಏಜೆಂಟಿಕ್ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು ಕೂಡ ಇದೇ ರೀತಿಯ ಕಥೆಯನ್ನು ಹೇಳುತ್ತವೆ

ಏಜೆಂಟಿಕ್ ಕೆಲಸಗಳು—ಯೋಜನೆ (planning), ಟೂಲ್ ಬಳಕೆ (tool use), ಬಹು-ಹಂತದ ತಾರ್ಕಿಕತೆ (multi-step reasoning)—Lightning ಮಿಂಚುವ ಕ್ಷೇತ್ರಗಳಾಗಿವೆ. GDPval-AA v2 ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ, ಈ ಮಾಡೆಲ್ 824 ರ Elo ರೇಟಿಂಗ್ ಅನ್ನು ಗಳಿಸಿತು, ಇದು 120-ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಹೊಂದಿರುವ gpt-oss-120b (800) ಮತ್ತು Nvidia ನ ಸ್ವಂತ ದೊಡ್ಡ Nemotron 3 Super (698) ಅನ್ನು ಹಿಂದಿಕ್ಕಿದೆ. Terminal-Bench v2.1 ಪರೀಕ್ಷೆಯಲ್ಲಿ, Lightning ನ ಯಶಸ್ಸಿನ ದರವು 7 % ರಿಂದ 24.3 % ಕ್ಕೆ ಏರಿದ್ದು, gpt-oss-120b ದಾಖಲಿಸಿದ 26.2 % ಕ್ಕೆ ಹತ್ತಿರದಲ್ಲಿದೆ.

ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯಗಳಿಗಾಗಿ (domain-specific tasks) ಮಾಡೆಲ್ ಅನ್ನು ಟ್ಯೂನ್ ಮಾಡಲು CodeRabbit ಮತ್ತು Harvey ನಂತಹ ಪಾಲುದಾರರೊಂದಿಗೆ ನಡೆಸಿದ post-training ಸಹಯೋಗಗಳಿಗೆ Nvidia ಕೃತಿ ಸಲ್ಲಿಸಿದೆ. ಈ ಸುಧಾರಣೆಗಳು ಮಾಡೆಲ್ ಅನ್ನು ವೇಗವಾಗಿರಿಸುವುದಲ್ಲದೆ, ವಿಶೇಷ ಕೆಲಸಗಳಲ್ಲಿ (specialized workloads) ಸ್ಪರ್ಧಾತ್ಮಕವಾಗಿಯೂ ಇರಿಸುತ್ತವೆ.

ಲಭ್ಯತೆ ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ಪರಿಗಣನೆಗಳು

ಈ ಮಾಡೆಲ್ ಅನ್ನು ಅನುಮತಿಸುವ OpenMDW-1.1 ಲೈಸೆನ್ಸ್ ಅಡಿಯಲ್ಲಿ ಬಿಡುಗಡೆ ಮಾಡಲಾಗಿದ್ದು, BF16 ಮತ್ತು NVFP4 ಫಾರ್ಮ್ಯಾಟ್‌ಗಳಲ್ಲಿ ವೇಟ್‌ಗಳನ್ನು (weights) ನೀಡಲಾಗಿದೆ. NVFP4 ವಿಧವು ಕನಿಷ್ಠ ಗುಣಮಟ್ಟದ ನಷ್ಟದೊಂದಿಗೆ ಮಾಡೆಲ್ ಅನ್ನು ಹೆಚ್ಚು ಸಂಕ್ಷಿಪ್ತವಾಗಿ (tightly) ಪ್ಯಾಕ್ ಮಾಡುತ್ತದೆ, ಇದು edge deployments ಅಥವಾ ವೆಚ್ಚ-ಜಾಗರೂಕ ಕ್ಲೌಡ್ ಇನ್‌ಸ್ಟೆನ್ಸ್‌ಗಳಿಗೆ ಉಪಯುಕ್ತ ಆಯ್ಕೆಯಾಗಿದೆ. ಒಂದು ಮಿಲಿಯನ್-ಟೋಕನ್ context window ಮಾಡೆಲ್ ಅನ್ನು ಯಾವುದೇ ಕಡಿತವಿಲ್ಲದೆ (truncation) ಬಹಳ ಉದ್ದದ ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಅನುಮತಿಸುತ್ತದೆ, ಇದು ಡಾಕ್ಯುಮೆಂಟ್-ಮಟ್ಟದ ವಿಶ್ಲೇಷಣೆ ಅಥವಾ ವ್ಯಾಪಕವಾದ ಕೋಡ್‌ಬೇಸ್‌ಗಳಿಗೆ (codebases) ಅಮೂಲ್ಯವಾಗಿದೆ.

Serverless inference ಈಗಾಗಲೇ DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius ಮತ್ತು Crusoe ನಂತಹ ಪ್ರೊವೈಡರ್‌ಗಳಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿದೆ. ಡೆವಲಪರ್‌ಗಳು ಸ್ವಂತ ಮೂಲಸೌಕರ್ಯವನ್ನು (custom infrastructure) ನಿರ್ಮಿಸದೆ ಪ್ರಯೋಗಗಳನ್ನು ಪ್ರಾರಂಭಿಸಬಹುದು, ಆದರೆ ನಿಜವಾದ ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿತ್ವವು ಪ್ರತಿ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ನ ಬೆಲೆ ನಿರ್ಧಾರದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.

Takeaway: Nemotron 3.5 Lightning ಒಂದು ಮಾಡೆಲ್ 120-ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಸಿಸ್ಟಮ್‌ಗಳ ತಾರ್ಕಿಕ ಮಟ್ಟಕ್ಕೆ ಸಮನಾಗಿರಬಲ್ಲದು ಮತ್ತು ಪ್ರಮುಖ ಸ್ಪರ್ಧಿಗಳಿಗಿಂತ ಸುಮಾರು ಎರಡರಷ್ಟು ಹೆಚ್ಚಿನ token throughput ಅನ್ನು ನೀಡಬಲ್ಲದು ಎಂದು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ, ಇದು latency-sensitive AI ಏಜೆಂಟ್‌ಗಳಿಗೆ ಒಂದು ಬಲವಾದ ಅಭ್ಯರ್ಥಿಯಾಗಿದೆ.