Microsoft ने GitHub Copilot साठी पुढच्या पिढीचे कोडिंग मॉडेल म्हणून MAI Code 1.1 Flash लाँच केले आहे, परंतु सुरुवातीचे बेंचमार्क आणि किंमत तक्ते कामगिरी आणि खर्च या दोन्ही बाबतीत त्याला DeepSeek च्या ओपन-वेट (open-weight) ऑफरिंगच्या मागे ठेवतात.

बेंचमार्कची वास्तविकता विरुद्ध प्रेस रिलीज

Microsoft च्या लाँच नोट्स त्यांच्या MAI मॉडेलच्या जून आवृत्तीच्या तुलनेत टोकन कार्यक्षमतेमध्ये २५% वाढ आणि खर्चात ७५% कपातीचे आश्वासन देतात. कंपनीने असेही म्हटले आहे की, Copilot मधील लाखो रिइन्फोर्समेंट-लर्निंग (reinforcement-learning) एन्व्हायरनमेंट्समध्ये मॉडेलला प्रशिक्षित केल्यामुळे "कोड सर्व्हायव्हल"मध्ये ४% वाढ झाली आहे.

स्वतंत्र चाचण्या वेगळी गोष्ट सांगतात. SWE-bench Verified सूटवर, MAI Code 1.1 Flash ७२.६% पास रेट नोंदवते, जो Claude Haiku 4.5 (६९.८%) आणि GPT-5.4 mini (६९.२%) पेक्षा थोडा जास्त आहे. हा फायदा अल्प असून एकाच मेट्रिकपुरता मर्यादित आहे.

Terminal Bench 2.1 वर ही दरी अधिक वाढते, जे मॉडेलची रिअल-वर्ल्ड कमांड-लाइन टास्क पूर्ण करण्याची क्षमता मोजते. येथे MAI Code 1.1 Flash ६२.९% स्कोअर करते, तर DeepSeek-V4-Flash-0731 ८२.७% निकाल नोंदवते. हा फरक टर्मिनल-केंद्रित कोड जनरेशनवर अवलंबून असलेल्या डेव्हलपर्सना प्रभावित करण्यासाठी पुरेसा मोठा आहे.

किंमतीचे दबाव घटक

Microsoft या नवीन मॉडेलला "बजेट-फ्रेंडली" पर्याय म्हणून मार्केट करते, परंतु टोकनची किंमत मात्र वेगळेच सांगते. DeepSeek-V4-Flash प्रति इनपुट टोकन $०.१४ आणि प्रति आउटपुट टोकन $०.२८ आकारते. MAI Code 1.1 Flash साठी इनपुटसाठी $०.२० आणि आउटपुटसाठी $१.२० अशी किंमत आहे. Claude Haiku 4.5 अनुक्रमे $१.०० आणि $५.०० वर आहे, जे त्याच्या प्रीमियम स्टेटसची पुष्टी करते.

आउटपुट-टोकनच्या खर्चातील ही मोठी वाढ याचा अर्थ असा आहे की, मोठ्या प्रमाणात कोड जनरेट करणारा कोणताही वर्कफ्लो Microsoft चे मॉडेल अधिक महागडा पर्याय बनवेल, जरी त्याच्या आधीच्या मॉडेलच्या तुलनेत आश्वासित कपात केली असली तरीही. मोठ्या प्रमाणावर काम करणारे डेव्हलपर्स आणि एंटरप्राइजेससाठी, आर्थिक गणित DeepSeek च्या बाजूने झुकते.

MAI Code 1.1 Flash कसे आले

हे मॉडेल Copilot स्टॅक मधील थर्ड-पार्टी सेवांची जागा अंतर्गत तयार केलेल्या पर्यायांनी घेण्याच्या Microsoft च्या व्यापक प्रयत्नांचा एक भाग आहे. Copilot वापरावरून घेतलेल्या व्यापक रिइन्फोर्समेंट-लर्निंग डेटावर प्रशिक्षित करून, Microsoft वापरकर्त्याचे वर्तन आणि मॉडेलमधील सुधारणा यांच्यातील फीडबॅक लूप अधिक घट्ट करण्याची आशा करत आहे. हे लाँच टप्प्याटप्प्याने होणाऱ्या अपग्रेड्सच्या पद्धतीचे अनुसरण करते: जून आवृत्ती ही खर्च वाचवणारी म्हणून मांडली गेली होती आणि आता ही Flash आवृत्ती त्याच प्रवासातील पुढचे पाऊल म्हणून सादर केली आहे.

विजेते, पराभूत आणि व्यापक पैलू

AI खर्च नियंत्रित करू इच्छिणाऱ्या एंटरप्राइजेसना DeepSeek चे दर अधिक आकर्षक वाटू शकतात, विशेषतः जेव्हा आउटपुटचे प्रमाण जास्त असते. दरम्यान, Microsoft ला Copilot इकोसिस्टमवर अधिक नियंत्रण मिळते आणि OpenAI किंवा Anthropic सारख्या बाह्य पुरवठादारांकडून महसूल वळवण्याची क्षमता मिळते.

Microsoft ची संभाव्य बाजू

Microsoft चा स्वतःचा डेटा टोकन-कार्यक्षमतेतील वाढ आणि SWE-bench वरील अल्प आघाडीवर भर देतो.

पुढे काय पाहावे

  • अवलंबनाचा मेट्रिक्स (Adoption metrics): Copilot च्या वापराची आकडेवारीवरून हे स्पष्ट होईल की डेव्हलपर्स नवीन डिफॉल्ट मॉडेलकडे वळतात की API द्वारे पर्यायी मॉडेल्स आयात करतात.
  • किंमतीतील बदल (Pricing adjustments): जर Microsoft ची आउटपुट-टोकन किंमत जास्तच राहिली, तर बाजारपेठेतील दबावामुळे त्यात सुधारणा केली जाऊ शकते.
  • बेंचमार्क अपडेट्स (Benchmark updates): टर्मिनल-केंद्रित चाचण्यांच्या नवीन आवृत्त्या कामगिरीचा समतोल बदलू शकतात, विशेषतः जेव्हा Microsoft आपली रिइन्फोर्समेंट-लर्निंग पाइपलाइन अधिक सुधारत असेल.
  • ओपन-वेट स्पर्धा (Open-weight competition): कोडिंग क्षेत्रात येणारी अतिरिक्त ओपन-वेट मॉडेल्स किंमत-कामगिरीच्या शर्यतीला अधिक तीव्र करू शकतात.

निष्कर्ष

MAI Code 1.1 Flash एका मर्यादित बेंचमार्कवर अल्प फायदा देते, परंतु टर्मिनल परफॉर्मन्स आणि टोकन खर्च या दोन्ही बाबतीत DeepSeek च्या ओपन-वेट मॉडेलच्या तुलनेत मागे पडते, ज्यामुळे डेव्हलपर्सना इंटिग्रेशनची सोय आणि प्रत्यक्ष कार्यक्षमता यामध्ये तुलना करावी लागेल.