20 बड़े भाषा मॉडलों (LLMs) के एक नए बेंचमार्क से पता चलता है कि 2026 में कोई भी एक मॉडल किसी भी वर्कलोड पर पूरी तरह हावी नहीं है। प्रत्येक कार्य को एक विशेषज्ञ (specialist) को सौंपने से लागत कम हो सकती है और डिलीवरी की गति बढ़ सकती है। इस अध्ययन में Anthropic, OpenAI, Google, xAI, Meta और कई चीनी लैब्स की तुलना की गई, और पाया गया कि गलत मॉडल का चुनाव करने से पैसा और समय दोनों बर्बाद होते हैं।
अब एक अकेला LLM क्यों काम नहीं करता
एक साल पहले, अधिकांश डेवलपर्स कोडिंग से लेकर रिसर्च के उत्तरों तक, हर चीज़ के लिए एक ही मॉडल चुनते थे। कोडिंग, टूल ऑर्केस्ट्रेशन (tool orchestration), गहन तर्क (deep reasoning) और शुद्ध लागत-प्रभावशीलता (cost-effectiveness) के लिए बनाए गए मॉडलों के बीच का अंतर इतना बढ़ गया है कि अब 'एक ही समाधान सबके लिए' (one-size-fits-all) वाला दृष्टिकोण मदद करने के बजाय नुकसान पहुँचा रहा है।
बेंचमार्क कैसे बनाया गया
मैंने सभी 20 मॉडलों पर एक ही कार्य सेट चलाया, वेंडर्स के मार्केटिंग दावों को नज़रअंदाज़ किया और स्वतंत्र, पुनरुत्पादित (reproducible) डेटा पर ध्यान केंद्रित किया। कार्यों को चार श्रेणियों में बांटा गया था:
- कोडिंग और स्वायत्तता (Coding and autonomy) – प्रोडक्शन-ग्रेड कोड जेनरेट करना, एजेंटिक लूप्स (agentic loops) को संभालना।
- टूल का उपयोग और ऑर्केस्ट्रेशन (Tool use and orchestration) – बाहरी APIs को कॉल करना, फाइलों को मैनेज करना, कंप्यूटर चलाना।
- तर्क और विज्ञान (Reasoning and science) – गणित की समस्याओं को हल करना, रिसर्च डेटा की व्याख्या करना।
- वैल्यू (Value) – न्यूनतम संभव लागत पर स्वीकार्य गुणवत्ता प्रदान करना।
परिणामी मैट्रिक्स इंजीनियरों को सबसे चर्चित नाम को चुनने के बजाय, कार्य की प्रकृति को मॉडल की ताकत के साथ मिलाने की सुविधा देता है।
कौन से मॉडल प्रत्येक श्रेणी में आगे हैं
कोडिंग और स्वायत्तता (Coding and autonomy) – Claude Opus 5 और Fable 5 ने लगातार सूची में शीर्ष स्थान बनाए रखा, और सबसे कम प्रयासों (retries) के साथ जटिल कोड जनरेशन और मल्टी-स्टेप लूप्स को संभाला। GPT-5.6 Sol इसके ठीक पीछे रहा, जो शीर्ष दो मॉडलों की अनुपलब्धता में एक ठोस विकल्प (fallback) प्रदान करता है।
टूल का उपयोग और ऑर्केस्ट्रेशन (Tool use and orchestration) – बाहरी टूल्स को सक्रिय करने में Meta का Muse Spark 1.1 सबसे विश्वसनीय साबित हुआ, जबकि Gemini 3.6 Flash स्प्रेडशीट हेरफेर और UI ऑटोमेशन जैसे शुद्ध कंप्यूटर-उपयोग वाले परिदृश्यों में उत्कृष्ट रहा।
तर्क और विज्ञान (Reasoning and science) – गणित और रिसर्च के लिए GPT-5.6 Sol और Gemini 3.1 Pro शीर्ष विकल्प थे।
अधिकतम वैल्यू (Maximum value) – ओपन-वेट चीनी मॉडल—GLM-5.2 और DeepSeek V4—फ्लैगशिप पेशकशों की प्रति-टोकन कीमत के एक छोटे से हिस्से पर फ्रंटियर-स्तर की गुणवत्ता तक पहुँच गए। जो टीमें फिनिशिंग (polish) में मामूली कमी को सहन कर सकती हैं, उन्हें अपने पैसे का सबसे अच्छा मूल्य मिलता है।
ओपन-वेट लीडर्स (Open-weight leaders) – Kimi K3 वर्तमान में सबसे मजबूत ओपनली रिलीज़ किए गए मॉडल के रूप में खड़ा है। Meta का Llama 4 पीछे छूट गया है।
निष्कर्ष: किसी दिए गए कार्य के लिए "सबसे स्मार्ट" मॉडल हमेशा सबसे किफायती या सबसे तेज़ नहीं होता है।
प्रोडक्शन सिस्टम के लिए रूटिंग रणनीति
- रूट करें, मानकीकृत (standardize) न करें – मॉडल चयन को एक गतिशील निर्णय के रूप में मानें, न कि एक स्थिर डिफ़ॉल्ट के रूप में।
- सस्ता डिफ़ॉल्ट रखें, विफलता पर अपग्रेड करें – उस सबसे कम लागत वाले मॉडल से शुरुआत करें जो कार्य को संभाल सके; यदि वह विफल हो जाता है, तो उच्च-स्तरीय मॉडल पर जाएँ।
- प्लानर को वर्कर से अलग रखें – समस्या को चरणों में तोड़ने के लिए एक मजबूत रीजनिंग मॉडल (जैसे, Opus 5) का उपयोग करें, फिर दोहराव वाले उप-कार्यों (sub-tasks) को एक सस्ते निष्पादक (जैसे, Gemini Flash) को सौंप दें।
- सफलता को मापें, केवल टोकन उपयोग को नहीं – एक सस्ता मॉडल जो तीन बार प्रयास (retry) करता है, उसकी लागत एक महंगे मॉडल से अधिक हो सकती है जो पहली बार में ही सही परिणाम देता है।
आगे क्या देखें
डेवलपर्स को रूटिंग मैप को एक जीवित दस्तावेज़ (living document) के रूप में मानना चाहिए और प्रत्येक प्रमुख रिलीज़ के साथ मॉडल विकल्पों पर पुनर्विचार करना चाहिए।
निष्कर्ष
2026 में प्रतिस्पर्धात्मक बढ़त उन टीमों के पास होगी जो LLMs को एक सिंगल स्विस-आर्मी नाइफ के बजाय एक टूलबॉक्स के रूप में देखती हैं। कार्यों को उस मॉडल के साथ मिलाने से जो उनमें उत्कृष्ट है, संगठन AI खर्च में कटौती करते हैं और परिणाम तेज़ी से देते हैं। असली जीत कोई नया हेडलाइन मॉडल नहीं है; यह एक अनुशासित रूटिंग रणनीति है जो सही इंटेलिजेंस को वहीं पहुँचाती है जहाँ उसकी सबसे अधिक आवश्यकता होती है।
