20 ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳ (LLMs) ಹೊಸ ಬೆಂಚ್ಮಾರ್ಕ್, 2026ರಲ್ಲಿ ಯಾವುದೇ ಒಂದು ಮಾದರಿಯು ಎಲ್ಲಾ ಕೆಲಸಗಳ ಮೇಲೆ ಪ್ರಾಬಲ್ಯ ಸಾಧಿಸುವುದಿಲ್ಲ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಕಾರ್ಯವನ್ನು ತಜ್ಞ ಮಾದರಿಗೆ (specialist) ವರ್ಗಾಯಿಸುವುದರಿಂದ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ಕೆಲಸದ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸಬಹುದು. ಈ ಅಧ್ಯಯನವು Anthropic, OpenAI, Google, xAI, Meta ಮತ್ತು ಹಲವಾರು ಚೀನೀ ಪ್ರಯೋಗಾಲಯಗಳನ್ನು ಹೋಲಿಕೆ ಮಾಡಿದೆ ಮತ್ತು ತಪ್ಪು ಮಾದರಿಯನ್ನು ಆರಿಸಿಕೊಳ್ಳುವುದು ಹಣ ಮತ್ತು ಸಮಯವನ್ನು ವ್ಯರ್ಥ ಮಾಡುತ್ತದೆ ಎಂದು ಕಂಡುಕೊಂಡಿದೆ.
ಒಂದು ಏಕೈಕ LLM ಇನ್ನು ಮುಂದೆ ಏಕೆ ಕೆಲಸ ಮಾಡುವುದಿಲ್ಲ
ಒಂದು ವರ್ಷದ ಹಿಂದೆ ಹೆಚ್ಚಿನ ಡೆವಲಪರ್ಗಳು ಕೋಡ್ನಿಂದ ಹಿಡಿದು ಸಂಶೋಧನಾ ಉತ್ತರಗಳವರೆಗೆ ಎಲ್ಲದಕ್ಕೂ ಒಂದೇ ಮಾದರಿಯನ್ನು ಆರಿಸಿಕೊಳ್ಳುತ್ತಿದ್ದರು. ಕೋಡಿಂಗ್, ಟೂಲ್ ಆರ್ಕೆಸ್ಟ್ರೇಶನ್ (tool orchestration), ಆಳವಾದ ತರ್ಕ (deep reasoning) ಮತ್ತು ವೆಚ್ಚದ ದಕ್ಷತೆಗಾಗಿ ನಿರ್ಮಿಸಲಾದ ಮಾದರಿಗಳ ನಡುವಿನ ಅಂತರವು ಎಷ್ಟು ಹೆಚ್ಚಾಗಿದೆ ಎಂದರೆ, 'ಎಲ್ಲದಕ್ಕೂ ಒಂದೇ ಮಾದರಿ' ಎಂಬ ವಿಧಾನವು ಈಗ ಸಹಾಯ ಮಾಡುವ ಬದಲು ಹಾನಿಯನ್ನುಂಟುಮಾಡುತ್ತಿದೆ.
ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸಲಾಯಿತು
ನಾನು ಎಲ್ಲಾ 20 ಮಾದರಿಗಳ ಮೇಲೆ ಒಂದೇ ರೀತಿಯ ಕಾರ್ಯಗಳನ್ನು ನಡೆಸಿದೆ, ಮಾರಾಟಗಾರರ ಜಾಹೀರಾತುಗಳನ್ನು ನಿರ್ಲಕ್ಷಿಸಿದೆ ಮತ್ತು ಸ್ವತಂತ್ರ ಹಾಗೂ ಪುನರಾವರ್ತಿತವಾಗಬಹುದಾದ (reproducible) ಡೇಟಾ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸಿದೆ. ಕಾರ್ಯಗಳು ನಾಲ್ಕು ವರ್ಗಗಳಾಗಿವೆ:
- Coding and autonomy – ಪ್ರೊಡಕ್ಷನ್-ಗ್ರೇಡ್ ಕೋಡ್ ಅನ್ನು ರಚಿಸುವುದು ಮತ್ತು ಏಜೆಂಟಿಕ್ ಲೂಪ್ಗಳನ್ನು (agentic loops) ನಿರ್ವಹಿಸುವುದು.
- Tool use and orchestration – ಬಾಹ್ಯ APIಗಳನ್ನು ಕರೆಯುವುದು, ಫೈಲ್ಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು ಮತ್ತು ಕಂಪ್ಯೂಟರ್ ಅನ್ನು ಚಲಾಯಿಸುವುದು.
- Reasoning and science – ಗಣಿತದ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವುದು ಮತ್ತು ಸಂಶೋಧನಾ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು.
- Value – ಸಾಧ್ಯವಾದಷ್ಟು ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಸ್ವೀಕಾರಾರ್ಹ ಗುಣಮಟ್ಟವನ್ನು ಒದಗಿಸುವುದು.
ಈ ಫಲಿತಾಂಶದ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಇಂಜಿನಿಯರ್ಗಳಿಗೆ ಹೆಚ್ಚು ಪ್ರಚಾರ ಪಡೆದ ಹೆಸರನ್ನು ಆಯ್ಕೆ ಮಾಡುವ ಬದಲು, ಕಾರ್ಯದ ಸ್ವರೂಪಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಮಾದರಿಯ ಸಾಮರ್ಥ್ಯವನ್ನು ಹೊಂದಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಪ್ರತಿ ವರ್ಗದಲ್ಲಿ ಯಾವ ಮಾದರಿಗಳು ಮುಂಚೂಣಿಯಲ್ಲಿವೆ
Coding and autonomy – Claude Opus 5 ಮತ್ತು Fable 5 ಸತತವಾಗಿ ಪಟ್ಟಿಯಲ್ಲಿ ಅಗ್ರಸ್ಥಾನ ಪಡೆದವುವು, ಅತ್ಯಂತ ಕಡಿಮೆ ಪುನರಾವರ್ತನೆಗಳೊಂದಿಗೆ (retries) ಸಂಕೀರ್ಣ ಕೋಡ್ ಜನರೇಷನ್ ಮತ್ತು ಮಲ್ಟಿ-ಸ್ಟೆಪ್ ಲೂಪ್ಗಳನ್ನು ನಿರ್ವಹಿಸಿದವು. GPT-5.6 Sol ಇದರ ಬೆನ್ನಲ್ಲೇ ಇತ್ತು, ಮೊದಲ ಎರಡು ಮಾದರಿಗಳು ಲಭ್ಯವಿಲ್ಲದಿದ್ದಾಗ ಇದು ಉತ್ತಮ ಪರ್ಯಾಯವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.
Tool use and orchestration – ಬಾಹ್ಯ ಪರಿಕರಗಳನ್ನು (external tools) ಬಳಸುವಲ್ಲಿ Meta ನ Muse Spark 1.1 ಅತ್ಯಂತ ವಿಶ್ವಾಸಾರ್ಹವೆಂದು ಸಾಬೀತಾಯಿತು, ಆದರೆ ಸ್ಪ್ರೆಡ್ಶೀಟ್ ನಿರ್ವಹಣೆ ಮತ್ತು UI ಆಟೊಮೇಷನ್ನಂತಹ ಕಂಪ್ಯೂಟರ್ ಬಳಕೆಯ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ Gemini 3.6 Flash ಅತ್ಯುತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡಿತು.
Reasoning and science – ಗಣಿತ ಮತ್ತು ಸಂಶೋಧನೆಗೆ GPT-5.6 Sol ಮತ್ತು Gemini 3.1 Pro ಅತ್ಯುತ್ತಮ ಆಯ್ಕೆಗಳಾಗಿದ್ದವು.
Maximum value – ಓಪನ್-ವೇಟ್ ಚೀನೀ ಮಾದರಿಗಳಾದ GLM-5.2 ಮತ್ತು DeepSeek V4, ಪ್ರಮುಖ ಮಾದರಿಗಳ (flagship offerings) ಪ್ರತಿ ಟೋಕನ್ ಬೆಲೆಗಿಂತ ಬಹಳ ಕಡಿಮೆ ಬೆಲೆಯಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ (frontier-level) ಗುಣಮಟ್ಟವನ್ನು ತಲುಪಿದವು. ಸ್ವಲ್ಪ ಮಟ್ಟಿನ ಗುಣಮಟ್ಟದ ಇಳಿಕೆಯನ್ನು ಸಹಿಸಿಕೊಳ್ಳಬಲ್ಲ ತಂಡಗಳಿಗೆ ಇದು ಅತ್ಯುತ್ತಮ ಮೌಲ್ಯವನ್ನು ನೀಡುತ್ತದೆ.
Open-weight leaders – Kimi K3 ಪ್ರಸ್ತುತ ಅತ್ಯಂತ ಬಲಿಷ್ಠವಾದ ಮುಕ್ತವಾಗಿ ಬಿಡುಗಡೆಯಾದ ಮಾದರಿಯಾಗಿ ನಿಂತಿದೆ. Meta ನ Llama 4 ಹಿಂದೆ ಬಿದ್ದಿದೆ.
ಸಾರಾಂಶ: ಒಂದು ನಿರ್ದಿಷ್ಟ ಕೆಲಸಕ್ಕೆ "ಅತಿ ಬುದ್ಧಿವಂತ" ಮಾದರಿಯು ಯಾವಾಗಲೂ ಅತ್ಯಂತ ಆರ್ಥಿಕ ಅಥವಾ ವೇಗವಾಗಿರುವುದಿಲ್ಲ.
ಪ್ರೊಡಕ್ಷನ್ ಸಿಸ್ಟಮ್ಗಳಿಗಾಗಿ ರೂಟಿಂಗ್ ತಂತ್ರ (Routing strategy)
- Route, don’t standardize – ಮಾದರಿ ಆಯ್ಕೆಯನ್ನು ಸ್ಥಿರವಾದ ಡಿಫಾಲ್ಟ್ ಆಗಿ ಪರಿಗಣಿಸದೆ, ಒಂದು ಡೈನಾಮಿಕ್ ನಿರ್ಧಾರವಾಗಿ ಪರಿಗಣಿಸಿ.
- Default cheap, escalate on failure – ಕಾರ್ಯವನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲ ಅತ್ಯಂತ ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ; ಅದು ವಿಫಲವಾದರೆ, ಹೆಚ್ಚಿನ ಹಂತದ ಮಾದರಿಯನ್ನು ಬಳಸಿ.
- Separate planner from worker – ಸಮಸ್ಯೆಯನ್ನು ಹಂತಗಳಾಗಿ ವಿಂಗಡಿಸಲು ಬಲಿಷ್ಠ ತರ್ಕ ಮಾದರಿಯನ್ನು (ಉದಾಹರಣೆಗೆ, Opus 5) ಬಳಸಿ, ನಂತರ ಪುನರಾವರ್ತಿತ ಉಪ-ಕಾರ್ಯಗಳನ್ನು (sub-tasks) ಕಡಿಮೆ ವೆಚ್ಚದ ಎಕ್ಸಿಕ್ಯೂಟರ್ಗೆ (ಉದಾಹರಣೆಗೆ, Gemini Flash) ನೀಡಿ.
- Measure success, not just token usage – ಮೂರು ಬಾರಿ ಪ್ರಯತ್ನಿಸುವ ಅಗ್ಗದ ಮಾದರಿಯು, ಮೊದಲ ಪ್ರಯತ್ನದಲ್ಲೇ ಸರಿಯಾಗಿ ಮಾಡುವ ದುಬಾರಿ ಮಾದರಿಗಿಂತ ಹೆಚ್ಚು ವೆಚ್ಚವಾಗಬಹುದು.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಡೆವಲಪರ್ಗಳು ರೂಟಿಂಗ್ ಮ್ಯಾಪ್ ಅನ್ನು ಒಂದು ಜೀವಂತ ದಾಖಲೆಯಾಗಿ ಪರಿಗಣಿಸಬೇಕು ಮತ್ತು ಪ್ರತಿಯೊಂದು ಪ್ರಮುಖ ಬಿಡುಗಡೆಯೊಂದಿಗೆ ಮಾದರಿ ಆಯ್ಕೆಗಳನ್ನು ಮರುಪರಿಶೀಲಿಸಬೇಕು.
ಸಾರಾಂಶ
2026ರಲ್ಲಿ, LLMಗಳನ್ನು ಕೇವಲ ಒಂದು ಸ್ವಿಸ್-ಆರ್ಮಿ ನೈಫ್ನಂತೆ ನೋಡದೆ, ಒಂದು ಟೂಲ್ಬಾಕ್ಸ್ನಂತೆ ಪರಿಗಣಿಸುವ ತಂಡಗಳೇ ಸ್ಪರ್ಧಾತ್ಮಕವಾಗಿ ಮುಂಚೂಣಿಯಲ್ಲಿರುತ್ತವೆ. ಕಾರ್ಯಗಳನ್ನು ಅವುಗಳಲ್ಲಿ ಪರಿಣಿತರಾದ ಮಾದರಿಗಳಿಗೆ ಹೊಂದಿಸುವ ಮೂಲಕ, ಸಂಸ್ಥೆಗಳು ಫಲಿತಾಂಶಗಳನ್ನು ವೇಗವಾಗಿ ನೀಡುವ ಜೊತೆಗೆ AI ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು. ನಿಜವಾದ ಗೆಲುವು ಎಂಬುದು ಹೊಸ ಹೆಡ್ಲೈನ್ ಮಾದರಿಯಲ್ಲ; ಬದಲಾಗಿ ಅಗತ್ಯವಿರುವ ಕಡೆ ಸರಿಯಾದ ಬುದ್ಧಿವಂತಿಕೆಯನ್ನು ಬಳಸುವ ಶಿಸ್ತುಬದ್ಧ ರೂಟಿಂಗ್ ತಂತ್ರವಾಗಿದೆ.
