Microsoft తన GitHub Copilot కోసం తదుపరి తరం కోడింగ్ మోడల్‌గా MAI Code 1.1 Flashను విడుదల చేసింది, కానీ ప్రారంభ బెంచ్‌మార్క్‌లు మరియు ధరల పట్టికలు పనితీరు మరియు ఖర్చు రెండింటిలోనూ DeepSeek యొక్క ఓపెన్-వెయిట్ ఆఫరింగ్‌ కంటే ఇది వెనుకబడి ఉన్నట్లు చూపుతున్నాయి.

బెంచ్‌మార్క్ వాస్తవికత మరియు ప్రెస్ రిలీజ్ మధ్య తేడా

Microsoft యొక్క లాంచ్ నోట్స్, దాని MAI మోడల్ యొక్క జూన్ వెర్షన్‌తో పోలిస్తే టోకెన్ సామర్థ్యంలో 25% పెరుగుదల మరియు ఖర్చులో 75% తగ్గింపును వాగ్దానం చేస్తున్నాయి. Copilot లోపల లక్షలాది రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ ఎన్విరాన్‌మెంట్లలో మోడల్‌కు శిక్షణ ఇవ్వడం ద్వారా, కంపెనీ "code survival" లో 4% పెరుగుదల ఉందని కూడా పేర్కొంది.

స్వతంత్ర పరీక్షలు వేరే కథను చెబుతున్నాయి. SWE-bench Verified సూట్‌లో, MAI Code 1.1 Flash 72.6% పాస్ రేటును నమోదు చేసింది, ఇది Claude Haiku 4.5 (69.8%) మరియు GPT-5.4 mini (69.2%) కంటే స్వల్పంగా ముందుంది. ఈ ఆధిక్యం చాలా తక్కువ మరియు కేవలం ఒకే ఒక మెట్రిక్‌కు పరిమితమైంది.

రియల్-వరల్డ్ కమాండ్-లైన్ పనులను పూర్తి చేసే మోడల్ సామర్థ్యాన్ని కొలిచే Terminal Bench 2.1 లో ఈ వ్యత్యాసం మరింత పెరుగుతుంది. ఇక్కడ MAI Code 1.1 Flash 62.9% స్కోరు సాధించగా, DeepSeek-V4-Flash-0731 82.7% ఫలితాన్ని నమోదు చేసింది. టెర్మినల్-కేంద్రీకృత కోడ్ జనరేషన్‌పై ఆధారపడే డెవలపర్‌లపై ప్రభావం చూపేంత పెద్ద తేడా ఇది.

ధరల ఒత్తిడి అంశాలు

Microsoft ఈ కొత్త మోడల్‌ను "బడ్జెట్ ఫ్రెండ్లీ" ఆప్షన్‌గా మార్కెట్ చేస్తోంది, కానీ టోకెన్ ధరలు మాత్రం అందుకు భిన్నంగా ఉన్నాయి. DeepSeek-V4-Flash ఇన్‌పుట్ టోకెన్‌కు $0.14 మరియు అవుట్‌పుట్ టోకెన్‌కు $0.28 వసూలు చేస్తుంది. MAI Code 1.1 Flash ఇన్‌పుట్ కోసం $0.20 మరియు అవుట్‌పుట్ కోసం $1.20 గా పేర్కొంది. Claude Haiku 4.5 వరుసగా $1.00 మరియు $5.00 వద్ద ఉంది, ఇది దాని ప్రీమియం స్థితిని ధృవీకరిస్తుంది.

అవుట్‌పుట్-టోకెన్ ఖర్చులో భారీ పెరుగుదల వల్ల, పెద్ద మొత్తంలో కోడ్‌ను జనరేట్ చేసే ఏ వర్క్‌ఫ్లో అయినా, తన పూర్వ వెర్షన్ నుండి వాగ్దానం చేసిన తగ్గింపుల తర్వాత కూడా Microsoft మోడల్‌ను మరింత ఖరీదైన ఎంపికగా మారుస్తుంది. అధిక స్థాయి డెవలపర్‌లు మరియు ఎంటర్‌ప్రైజ్ సంస్థల కోసం, ఆర్థిక లాభాలు స్పష్టంగా DeepSeek వైపు మొగ్గు చూపుతున్నాయి.

MAI Code 1.1 Flash ఎలా వచ్చింది

Copilot స్టాక్‌లోని థర్డ్-పార్టీ సర్వీసుల స్థానంలో అంతర్గతంగా నిర్మించిన ప్రత్యామ్నాయాలను తీసుకురావాలనే Microsoft యొక్క విస్తృత ప్రయత్నంలో ఈ మోడల్ ఒక భాగం. Copilot వినియోగం నుండి సేకరించిన విస్తృతమైన రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ డేటాపై శిక్షణ ఇవ్వడం ద్వారా, యూజర్ ప్రవర్తన మరియు మోడల్ మెరుగుదల మధ్య ఫీడ్‌బ్యాక్ లూప్‌ను పటిష్టం చేయాలని Microsoft ఆశిస్తోంది. ఈ లాంచ్ క్రమబద్ధమైన అప్‌గ్రేడ్‌ల విధానాన్ని అనుసరిస్తుంది: జూన్ వెర్షన్‌ను ఖర్చు తగ్గించేదిగా ఉంచగా, ఫ్లాష్ వెర్షన్‌ను ఆ ప్రయాణంలో తదుపరి దశగా రూపొందించారు.

విజేతలు, ఓటములు మరియు విస్తృతమైన ప్రయోజనాలు

AI ఖర్చులను నియంత్రించాలనుకునే ఎంటర్‌ప్రైజ్ సంస్థలు, ముఖ్యంగా అవుట్‌పుట్ వాల్యూమ్ ఎక్కువగా ఉన్నప్పుడు, DeepSeek ధరలను మరింత ఆకర్షణీయంగా కనుగొనవచ్చు. మరోవైపు, Microsoft Copilot ఎకోసిస్టమ్‌పై మరింత నియంత్రణను మరియు OpenAI లేదా Anthropic వంటి బాహ్య ప్రొవైడర్ల నుండి ఆదాయాన్ని మళ్లించే సామర్థ్యాన్ని పొందుతుంది.

Microsoft యొక్క సాధ్యమయ్యే వాదన

Microsoft యొక్క స్వంత డేటా టోకెన్-ఎఫిషియన్సీ లాభాలను మరియు SWE-bench పై స్వల్ప ఆధిక్యాన్ని నొక్కి చెబుతుంది.

తదుపరి ఏమి గమనించాలి

  • అడాప్షన్ మెట్రిక్స్ (Adoption metrics): డెవలపర్‌లు కొత్త డిఫాల్ట్‌కు మారుతారా లేదా API ద్వారా ప్రత్యామ్నాయ మోడల్‌లను ఇంపోర్ట్ చేస్తారా అనేది Copilot వినియోగ గణాంకాలు తెలియజేస్తాయి.
  • ధరల సర్దుబాటు (Pricing adjustments): Microsoft యొక్క అవుట్‌పుట్-టోకెన్ ధర ఎక్కువగా ఉంటే, మార్కెట్ ఒత్తిడి వల్ల ధరల సవరణ జరగవచ్చు.
  • బెంచ్‌మార్క్ అప్‌డేట్‌లు (Benchmark updates): టెర్మినల్-ఫోకస్డ్ పరీక్షల కొత్త వెర్షన్లు పనితీరు సమతుల్యతను మార్చవచ్చు, ముఖ్యంగా Microsoft తన రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ పైప్‌లైన్‌ను మెరుగుపరిచే కొద్దీ.
  • ఓపెన్-వెయిట్ పోటీ (Open-weight competition): కోడింగ్ రంగంలోకి మరిన్ని ఓపెన్-వెయిట్ మోడల్‌లు రావడం వల్ల ధర-పనితీరు రేసు మరింత తీవ్రతరం కావచ్చు.

ముగింపు

MAI Code 1.1 Flash ఒక పరిమితమైన బెంచ్‌మార్క్‌పై స్వల్ప లాభాలను తెస్తుంది, కానీ టెర్మినల్ పనితీరు మరియు టోకెన్ ఖర్చు రెండింటిలోనూ DeepSeek యొక్క ఓపెన్-వెయిట్ మోడల్‌ కంటే వెనుకబడి ఉంది, దీనివల్ల డెవలపర్‌లు ఇంటిగ్రేషన్ సౌలభ్యం మరియు స్వచ్ఛమైన సామర్థ్యం (raw efficiency) మధ్య ఎంపిక చేసుకోవాల్సి ఉంటుంది.