Microsoft ने GitHub Copilot के लिए अगली पीढ़ी के कोडिंग मॉडल के रूप में MAI Code 1.1 Flash पेश किया है, लेकिन शुरुआती बेंचमार्क और मूल्य निर्धारण तालिकाएं (pricing tables) इसे प्रदर्शन और लागत दोनों के मामले में DeepSeek के open-weight विकल्प से पीछे खड़ा करती हैं।
बेंचमार्क की वास्तविकता बनाम प्रेस विज्ञप्ति
Microsoft के लॉन्च नोट्स इसके MAI मॉडल के जून संस्करण की तुलना में टोकन दक्षता (token efficiency) में 25% की वृद्धि और लागत में 75% की कटौती का वादा करते हैं। कंपनी Copilot के भीतर लाखों reinforcement-learning वातावरणों में मॉडल को प्रशिक्षित करने के बाद "code survival" में 4% की वृद्धि का भी दावा करती है।
स्वतंत्र परीक्षण एक अलग कहानी बताते हैं। SWE-bench Verified सुइट पर, MAI Code 1.1 Flash 72.6% पास रेट दर्ज करता है, जो Claude Haiku 4.5 (69.8%) और GPT-5.4 mini (69.2%) से थोड़ा आगे है। यह बढ़त मामूली है और केवल एक ही मेट्रिक तक सीमित है।
Terminal Bench 2.1 पर यह अंतर और बढ़ जाता है, जो वास्तविक दुनिया के कमांड-लाइन कार्यों को पूरा करने की मॉडल की क्षमता को मापता है। यहाँ MAI Code 1.1 Flash का स्कोर 62.9% है, जबकि DeepSeek-V4-Flash-0731 का परिणाम 82.7% है। यह अंतर उन डेवलपर्स को प्रभावित करने के लिए पर्याप्त बड़ा है जो टर्मिनल-केंद्रित कोड जनरेशन पर निर्भर करते हैं।
मूल्य निर्धारण के दबाव बिंदु
Microsoft नए मॉडल को एक "बजट-अनुकूल" विकल्प के रूप में पेश करता है, लेकिन टोकन की कीमतें कुछ और ही कहती हैं। DeepSeek-V4-Flash प्रति इनपुट टोकन $0.14 और प्रति आउटपुट टोकन $0.28 चार्ज करता है। MAI Code 1.1 Flash इनपुट के लिए $0.20 और आउटपुट के लिए $1.20 सूचीबद्ध करता है। Claude Haiku 4.5 क्रमशः $1.00 और $5.00 पर है, जो इसकी प्रीमियम स्थिति की पुष्टि करता है।
आउटपुट-टोकन लागत में भारी उछाल का मतलब है कि कोड के बड़े ब्लॉक जेनरेट करने वाला कोई भी वर्कफ़्लो Microsoft के मॉडल को अधिक महंगा विकल्प बना देगा, भले ही इसके पिछले संस्करण की तुलना में कटौती का वादा किया गया हो। बड़े पैमाने पर काम करने वाले डेवलपर्स और उद्यमों (enterprises) के लिए, आर्थिक लाभ स्पष्ट रूप से DeepSeek की ओर झुकता है।
MAI Code 1.1 Flash कैसे आया
यह मॉडल Copilot स्टैक में थर्ड-पार्टी सेवाओं को आंतरिक रूप से निर्मित विकल्पों से बदलने के Microsoft के व्यापक प्रयास का हिस्सा है। Copilot के उपयोग से प्राप्त व्यापक reinforcement-learning डेटा पर प्रशिक्षण देकर, Microsoft उपयोगकर्ता व्यवहार और मॉडल सुधार के बीच फीडबैक लूप को मजबूत करने की उम्मीद करता है। यह लॉन्च क्रमिक अपग्रेड (incremental upgrades) के पैटर्न का भी अनुसरण करता है: जून संस्करण को लागत बचाने वाले के रूप में पेश किया गया था, और Flash संस्करण को उसी दिशा में अगला कदम बताया गया है।
विजेता, हारने वाले और व्यापक हित
AI खर्च को नियंत्रित करने की कोशिश कर रहे उद्यमों को DeepSeek की कीमतें अधिक आकर्षक लग सकती हैं, खासकर जब आउटपुट की मात्रा अधिक हो। इस बीच, Microsoft को Copilot इकोसिस्टम पर अधिक नियंत्रण प्राप्त होता है और OpenAI या Anthropic जैसे बाहरी प्रदाताओं से राजस्व को दूर ले जाने की क्षमता मिलती है।
Microsoft का संभावित बचाव
Microsoft का अपना डेटा टोकन-दक्षता लाभ और SWE-bench पर मामूली बढ़त पर जोर देता है।
आगे क्या देखें
- Adoption metrics: Copilot के उपयोग के आंकड़े यह बताएंगे कि क्या डेवलपर्स नए डिफॉल्ट पर स्विच करते हैं या API के माध्यम से वैकल्पिक मॉडल आयात करते हैं।
- Pricing adjustments: यदि Microsoft की आउटपुट-टोकन कीमत ऊंची बनी रहती है, तो बाजार का दबाव संशोधन के लिए मजबूर कर सकता है।
- Benchmark updates: टर्मिनल-केंद्रित परीक्षणों के नए संस्करण प्रदर्शन के संतुलन को बदल सकते हैं, विशेष रूप से जैसे-जैसे Microsoft अपनी reinforcement-learning पाइपलाइन को परिष्कृत करता है।
- Open-weight competition: कोडिंग स्पेस में प्रवेश करने वाले अतिरिक्त open-weight मॉडल मूल्य-प्रदर्शन की दौड़ को तेज कर सकते हैं।
निष्कर्ष
MAI Code 1.1 Flash एक सीमित बेंचमार्क पर मामूली लाभ लाता है, लेकिन टर्मिनल प्रदर्शन और टोकन लागत दोनों पर DeepSeek के open-weight मॉडल से पीछे रह जाता है, जिससे डेवलपर्स को एकीकरण की सुविधा (integration convenience) और वास्तविक दक्षता (raw efficiency) के बीच संतुलन बनाना होगा।
