Vercel की जून की टोकन-शेयर रिपोर्ट दिखाती है कि ओपन-वेट मॉडल्स (open-weight models) गेटवे टोकन का 29% हिस्सा संभाल रहे हैं, जो अप्रैल के 11% से अधिक है, जिसमें अकेले DeepSeek का योगदान 22.6% है। यह उछाल एक तेज़ बदलाव का संकेत देता है: डेवलपर्स अब किसी एक "सर्वश्रेष्ठ" मॉडल पर निर्भर रहने के बजाय AI मॉडल्स को एक 'राउटेबल इंफ्रास्ट्रक्चर' (routable infrastructure) की तरह देख रहे हैं।
डेवलपर्स मॉडल्स को इंफ्रास्ट्रक्चर की तरह क्यों मान रहे हैं
सस्ते, ओपन-वेट मॉडल्स—जिनमें से कई चीनी प्रदाताओं के हैं—Anthropic जैसी प्रीमियम पेशकशों की तुलना में बहुत कम कीमत पर उपलब्ध हैं। कोड एक्सट्रैक्शन, टेक्स्ट क्लीनिंग, या साधारण डेटा लुक-अप जैसे नियमित कार्यों के लिए, डॉलर के बजाय कुछ सेंट्स में लगने वाला मॉडल अधिक आकर्षक हो सकता है, भले ही वह कुछ प्रतिशत कम सटीक हो।
इसका परिणाम एक नया डिज़ाइन पैटर्न है। एक एप्लिकेशन पहले काम के "बोरिंग" हिस्से के लिए एक कम लागत वाले मॉडल को अनुरोध भेजता है। यदि आउटपुट एक साधारण गुणवत्ता जांच (quality check) पास कर लेता है, तो पाइपलाइन आगे बढ़ती है; यदि नहीं, तो दूसरे प्रयास या अंतिम निर्णय के लिए एक उच्च-मूल्य वाले मॉडल को बुलाया जाता है। यहाँ रूटिंग लॉजिक (routing logic) महत्वपूर्ण हिस्सा बन जाता है, न कि किसी एक मॉडल का चुनाव।
आंकड़े क्या कहते हैं
Vercel का डेटा, जो कई AI प्रदाताओं के सामने काम करने वाले इसके गेटवे से लिया गया है, दिखाता है कि ओपन-वेट मॉडल्स परिधि (periphery) से निकलकर मुख्यधारा (mainstream) में आ रहे हैं। अप्रैल में, वे सभी टोकन के एक-तिहाई से भी कम हिस्से के लिए जिम्मेदार थे; जून तक, वे लगभग एक-तिहाई के करीब पहुँच गए। DeepSeek, जो एक चीनी मॉडल है, ने अकेले ही टोकन वॉल्यूम में एक-पांचवें हिस्से से अधिक का योगदान दिया।
हाई-एंड मॉडल्स अभी भी खर्च पर हावी हैं। उदाहरण के लिए, Anthropic अभी भी कुल मौद्रिक व्यय का बड़ा हिस्सा हासिल कर रहा है क्योंकि प्रति टोकन इसकी कीमत अधिक है। गणित सीधा है: सस्ते मॉडल हाई-वॉल्यूम, लो-मार्जिन वाले काम जीतते हैं, जबकि महंगे मॉडल हाई-मार्जिन, हाई-इम्पैक्ट कार्यों को बरकरार रखते हैं।
AI एजेंट्स के लिए निहितार्थ
एक AI एजेंट आमतौर पर चरणों का एक क्रम पूरा करता है: प्लानिंग, डेटा रिट्रीवल, टूल इनवोकेशन, और रिजल्ट रिफाइनमेंट। जब प्रत्येक चरण को सबसे लागत प्रभावी मॉडल को सौंपा जा सकता है, तो कुल परिचालन लागत नाटकीय रूप से कम हो जाती है।
- डेटा रिट्रीवल और एक्सट्रैक्शन के लिए अक्सर केवल बुनियादी भाषा समझ की आवश्यकता होती है, एक ऐसा कार्य जिसमें सस्ते मॉडल उत्कृष्ट हैं।
- अंतिम निर्णय (Final judgment)—वह हिस्सा जो तय करता है कि उत्तर स्वीकार्य है या नहीं—प्रीमियम मॉडल्स के दायरे में रहता है जिनकी विश्वसनीयता अधिक होती है।
यह लेयर्ड अप्रोच डेवलपर्स को बजट बिगाड़े बिना बड़े वर्कलोड को ऑटोमेट करने की अनुमति देती है। यह "सबसे अच्छा मॉडल चुनें" से बदलकर "प्रत्येक चरण के अनुसार सफलता को मापें और उसी के अनुसार रूट करें" की ओर एक बदलाव भी लाता है।
जोखिम और सीमाएं
अर्थशास्त्र आकर्षक है, लेकिन यह बदलाव बिना किसी बाधा के नहीं है।
- अनुपालन (Compliance): कुछ अधिकार क्षेत्र डेटा-हैंडलिंग के सख्त नियम लागू करते हैं जो विदेशी-होस्टेड मॉडल्स के उपयोग को सीमित कर सकते हैं।
- होस्टिंग की जटिलता: बड़े प्रीमियम मॉडल्स को इन-हाउस चलाना कठिन है, इसलिए संगठनों को बाहरी APIs पर निर्भर रहना पड़ता है, जिससे लेटेंसी (latency) और वेंडर-लॉक (vendor-lock) की चिंताएं बढ़ सकती हैं।
इन कारकों के कारण, सस्ते मॉडल्स द्वारा प्रीमियम मॉडल्स को पूरी तरह से प्रतिस्थापित करने की संभावना कम है। इसके बजाय, वे नियमित काम के लिए डिफ़ॉल्ट बन जाएंगे, जबकि प्रीमियम मॉडल्स "डिसीजन लेयर" में रहेंगे जहाँ उनकी उच्च लागत उचित ठहराई जा सके।
आगे क्या देखें
- रूटिंग के लिए टूलिंग: जैसे-जैसे रूटिंग लेयर अधिक केंद्रीय होती जाएगी, हम ऐसे SDKs और प्लेटफॉर्म्स की एक लहर की उम्मीद कर सकते हैं जो लेटेंसी, लागत और कॉन्फिडेंस थ्रेशोल्ड के आधार पर मॉडल चयन को ऑटोमेट करेंगे।
डेवलपर्स जो टास्क-लेवल सफलता को मापना, रिट्राइज़ (retries) को ट्रैक करना, और "वॉल्यूम" को "जजमेंट" से स्पष्ट रूप से अलग करना शुरू करेंगे, वे उभरते हुए इंफ्रास्ट्रक्चर माइंडसेट से लाभ उठाने के लिए सबसे अच्छी स्थिति में होंगे।
मुख्य बात (Takeaway): AI स्टैक एक एकल मॉडल विकल्प से बदलकर एक रूटिंग समस्या में बदल रहा है, जहाँ सस्ते ओपन-वेट मॉडल्स काम का अधिकांश हिस्सा संभालते हैं और प्रीमियम मॉडल्स को हाई-इम्पैक्ट निर्णयों के लिए सुरक्षित रखा जाता है। उस रूटिंग में महारत हासिल करना AI बिल्डर्स के लिए अगली प्रतिस्पर्धी बढ़त होगी।
