مایکروسافت مدل MAI Code 1.1 Flash را به عنوان نسل بعدی مدل کدنویسی برای GitHub Copilot عرضه کرد، اما بنچمارک‌های اولیه و جداول قیمت‌گذاری، آن را هم از نظر عملکرد و هم از نظر هزینه، در جایگاهی پایین‌تر از محصول open-weight شرکت DeepSeek قرار می‌دهند.

واقعیت بنچمارک‌ها در مقابل بیانیه مطبوعاتی

یادداشت‌های عرضه مایکروسافت نویدبخش جهش ۲۵ درصدی در کارایی توکن و کاهش ۷۵ درصدی هزینه در مقایسه با نسخه ژوئن مدل MAI خود است. این شرکت همچنین از افزایش ۴ درصدی در «بقای کد» (code survival) پس از آموزش مدل در صدها هزار محیط یادگیری تقویتی در داخل Copilot خبر می‌دهد.

تست‌های مستقل روایت متفاوتی دارند. در مجموعه SWE-bench Verified، مدل MAI Code 1.1 Flash نرخ موفقیت ۷۲.۶ درصدی را ثبت کرده است که با اختلاف اندکی از Claude Haiku 4.5 (۶۹.۸٪) و GPT-5.4 mini (۶۹.۲٪) پیشی گرفته است. این مزیت ناچیز و محدود به یک معیار واحد است.

این شکاف در Terminal Bench 2.1، که توانایی مدل در انجام وظایف خط فرمان در دنیای واقعی را می‌سنجد، بیشتر می‌شود. در اینجا MAI Code 1.1 Flash امتیاز ۶۲.۹٪ را کسب می‌کند، در حالی که DeepSeek-V4-Flash-0731 نتیجه ۸۲.۷٪ را ثبت کرده است. این اختلاف به اندازه‌ای بزرگ است که بر توسعه‌دهندگانی که به تولید کد مبتنی بر ترمینال متکی هستند، تأثیر بگذارد.

نقاط فشار قیمت‌گذاری

مایکروسافت مدل جدید را به عنوان یک گزینه «مقرون‌به‌صرفه» بازاریابی می‌کند، اما قیمت‌گذاری توکن‌ها خلاف این را می‌گوید. DeepSeek-V4-Flash برای هر توکن ورودی ۰.۱۴ دلار و برای هر توکن خروجی ۰.۲۸ دلار دریافت می‌کند. MAI Code 1.1 Flash قیمت ۰.۲۰ دلار برای ورودی و ۱.۲۰ دلار برای خروجی را لیست کرده است. Claude Haiku 4.5 نیز به ترتیب در قیمت‌های ۱.۰۰ دلار و ۵.۰۰ دلار قرار دارد که جایگاه ممتاز (premium) آن را تأیید می‌کند.

جهش شدید در هزینه توکن‌های خروجی به این معناست که هر گردش کاری که بلوک‌های بزرگ کد تولید می‌کند، مدل مایکروسافت را به گزینه‌ای گران‌تر تبدیل خواهد کرد، حتی پس از کاهش‌های وعده‌داده‌شده نسبت به نسل قبلی. برای توسعه‌دهندگان و شرکت‌های مقیاس‌بزرگ، محاسبات اقتصادی به شدت به نفع DeepSeek سنگینی می‌کند.

چگونه MAI Code 1.1 Flash عرضه شد

این مدل بخشی از تلاش گسترده‌تر مایکروسافت برای جایگزینی سرویس‌های شخص ثالث در پشته (stack) Copilot با جایگزین‌های ساخته‌شده در داخل شرکت است. مایکروسافت امیدوار است با آموزش بر روی داده‌های گسترده یادگیری تقویتی که از میزان استفاده از Copilot استخراج شده‌اند، حلقه بازخورد بین رفتار کاربر و بهبود مدل را تقویت کند. این عرضه همچنین از الگوی ارتقاهای تدریجی پیروی می‌کند: نسخه ژوئن به عنوان یک مدل صرفه‌جو در هزینه معرفی شد و نسخه Flash به عنوان گام بعدی در آن مسیر قالب‌بندی شده است.

برندگان، بازندگان و مخاطرات گسترده‌تر

شرکت‌هایی که به دنبال کنترل هزینه‌های هوش مصنوعی خود هستند، ممکن است قیمت‌گذاری DeepSeek را به‌ویژه زمانی که حجم خروجی بالا است، جذاب‌تر بیابند. در همین حال، مایکروسافت کنترل دقیق‌تری بر اکوسیستم Copilot به دست می‌آورد و توانایی هدایت درآمد را از تأمین‌کنندگان خارجی مانند OpenAI یا Anthropic به سمت خود می‌برد.

دفاع احتمالی مایکروسافت

داده‌های خودِ مایکروسافت بر دستاوردهای کارایی توکن و برتری اندک در SWE-bench تأکید دارد.

آنچه باید در آینده زیر نظر داشت

  • معیارهای پذیرش: آمار استفاده از Copilot نشان خواهد داد که آیا توسعه‌دهندگان به مدل پیش‌فرض جدید تغییر وضعیت می‌دهند یا مدل‌های جایگزین را از طریق API وارد می‌کنند.
  • تعدیلات قیمت‌گذاری: اگر قیمت توکن خروجی مایکروسافت بالا بماند، فشار بازار می‌تواند منجر به بازنگری در آن شود.
  • به‌روزرسانی‌های بنچمارک: نسخه‌های جدید تست‌های متمرکز بر ترمینال ممکن است توازن عملکرد را تغییر دهند، به‌ویژه زمانی که مایکروسافت خط لوله یادگیری تقویتی خود را اصلاح می‌کند.
  • رقابت مدل‌های open-weight: ورود مدل‌های open-weight بیشتر به فضای کدنویسی می‌تواند رقابت قیمت-عملکرد را تشدید کند.

نتیجه‌گیری

MAI Code 1.1 Flash دستاوردهای ناچیزی در یک بنچمارک محدود به همراه دارد، اما هم در عملکرد ترمینال و هم در هزینه توکن، از مدل open-weight شرکت DeepSeek عقب می‌ماند و توسعه‌دهندگان را با این چالش روبرو می‌کند که راحتیِ ادغام را در مقابل کارایی خالص بسنجند.