مایکروسافت مدل MAI Code 1.1 Flash را به عنوان نسل بعدی مدل کدنویسی برای GitHub Copilot عرضه کرد، اما بنچمارکهای اولیه و جداول قیمتگذاری، آن را هم از نظر عملکرد و هم از نظر هزینه، در جایگاهی پایینتر از محصول open-weight شرکت DeepSeek قرار میدهند.
واقعیت بنچمارکها در مقابل بیانیه مطبوعاتی
یادداشتهای عرضه مایکروسافت نویدبخش جهش ۲۵ درصدی در کارایی توکن و کاهش ۷۵ درصدی هزینه در مقایسه با نسخه ژوئن مدل MAI خود است. این شرکت همچنین از افزایش ۴ درصدی در «بقای کد» (code survival) پس از آموزش مدل در صدها هزار محیط یادگیری تقویتی در داخل Copilot خبر میدهد.
تستهای مستقل روایت متفاوتی دارند. در مجموعه SWE-bench Verified، مدل MAI Code 1.1 Flash نرخ موفقیت ۷۲.۶ درصدی را ثبت کرده است که با اختلاف اندکی از Claude Haiku 4.5 (۶۹.۸٪) و GPT-5.4 mini (۶۹.۲٪) پیشی گرفته است. این مزیت ناچیز و محدود به یک معیار واحد است.
این شکاف در Terminal Bench 2.1، که توانایی مدل در انجام وظایف خط فرمان در دنیای واقعی را میسنجد، بیشتر میشود. در اینجا MAI Code 1.1 Flash امتیاز ۶۲.۹٪ را کسب میکند، در حالی که DeepSeek-V4-Flash-0731 نتیجه ۸۲.۷٪ را ثبت کرده است. این اختلاف به اندازهای بزرگ است که بر توسعهدهندگانی که به تولید کد مبتنی بر ترمینال متکی هستند، تأثیر بگذارد.
نقاط فشار قیمتگذاری
مایکروسافت مدل جدید را به عنوان یک گزینه «مقرونبهصرفه» بازاریابی میکند، اما قیمتگذاری توکنها خلاف این را میگوید. DeepSeek-V4-Flash برای هر توکن ورودی ۰.۱۴ دلار و برای هر توکن خروجی ۰.۲۸ دلار دریافت میکند. MAI Code 1.1 Flash قیمت ۰.۲۰ دلار برای ورودی و ۱.۲۰ دلار برای خروجی را لیست کرده است. Claude Haiku 4.5 نیز به ترتیب در قیمتهای ۱.۰۰ دلار و ۵.۰۰ دلار قرار دارد که جایگاه ممتاز (premium) آن را تأیید میکند.
جهش شدید در هزینه توکنهای خروجی به این معناست که هر گردش کاری که بلوکهای بزرگ کد تولید میکند، مدل مایکروسافت را به گزینهای گرانتر تبدیل خواهد کرد، حتی پس از کاهشهای وعدهدادهشده نسبت به نسل قبلی. برای توسعهدهندگان و شرکتهای مقیاسبزرگ، محاسبات اقتصادی به شدت به نفع DeepSeek سنگینی میکند.
چگونه MAI Code 1.1 Flash عرضه شد
این مدل بخشی از تلاش گستردهتر مایکروسافت برای جایگزینی سرویسهای شخص ثالث در پشته (stack) Copilot با جایگزینهای ساختهشده در داخل شرکت است. مایکروسافت امیدوار است با آموزش بر روی دادههای گسترده یادگیری تقویتی که از میزان استفاده از Copilot استخراج شدهاند، حلقه بازخورد بین رفتار کاربر و بهبود مدل را تقویت کند. این عرضه همچنین از الگوی ارتقاهای تدریجی پیروی میکند: نسخه ژوئن به عنوان یک مدل صرفهجو در هزینه معرفی شد و نسخه Flash به عنوان گام بعدی در آن مسیر قالببندی شده است.
برندگان، بازندگان و مخاطرات گستردهتر
شرکتهایی که به دنبال کنترل هزینههای هوش مصنوعی خود هستند، ممکن است قیمتگذاری DeepSeek را بهویژه زمانی که حجم خروجی بالا است، جذابتر بیابند. در همین حال، مایکروسافت کنترل دقیقتری بر اکوسیستم Copilot به دست میآورد و توانایی هدایت درآمد را از تأمینکنندگان خارجی مانند OpenAI یا Anthropic به سمت خود میبرد.
دفاع احتمالی مایکروسافت
دادههای خودِ مایکروسافت بر دستاوردهای کارایی توکن و برتری اندک در SWE-bench تأکید دارد.
آنچه باید در آینده زیر نظر داشت
- معیارهای پذیرش: آمار استفاده از Copilot نشان خواهد داد که آیا توسعهدهندگان به مدل پیشفرض جدید تغییر وضعیت میدهند یا مدلهای جایگزین را از طریق API وارد میکنند.
- تعدیلات قیمتگذاری: اگر قیمت توکن خروجی مایکروسافت بالا بماند، فشار بازار میتواند منجر به بازنگری در آن شود.
- بهروزرسانیهای بنچمارک: نسخههای جدید تستهای متمرکز بر ترمینال ممکن است توازن عملکرد را تغییر دهند، بهویژه زمانی که مایکروسافت خط لوله یادگیری تقویتی خود را اصلاح میکند.
- رقابت مدلهای open-weight: ورود مدلهای open-weight بیشتر به فضای کدنویسی میتواند رقابت قیمت-عملکرد را تشدید کند.
نتیجهگیری
MAI Code 1.1 Flash دستاوردهای ناچیزی در یک بنچمارک محدود به همراه دارد، اما هم در عملکرد ترمینال و هم در هزینه توکن، از مدل open-weight شرکت DeepSeek عقب میماند و توسعهدهندگان را با این چالش روبرو میکند که راحتیِ ادغام را در مقابل کارایی خالص بسنجند.
