Microsoft telah melancarkan MAI Code 1.1 Flash sebagai model pengekodan generasi seterusnya untuk GitHub Copilot, namun penanda aras awal dan jadual harga meletakkannya di belakang tawaran pemberat terbuka (open-weight) DeepSeek dari segi prestasi dan kos.

Realiti penanda aras berbanding siaran akhbar

Nota pelancaran Microsoft menjanjikan lonjakan 25% dalam kecekapan token dan pengurangan kos sebanyak 75% berbanding versi bulan Jun bagi model MAI miliknya. Syarikat itu juga mempromosikan kenaikan 4% dalam "kelangsungan kod" (code survival) selepas melatih model tersebut dalam ratusan ribu persekitaran pembelajaran pengukuhan (reinforcement-learning) di dalam Copilot.

Ujian bebas menceritakan kisah yang berbeza. Pada suite SWE-bench Verified, MAI Code 1.1 Flash mencatatkan kadar kelulusan 72.6%, mendahului sedikit Claude Haiku 4.5 (69.8%) dan GPT-5.4 mini (69.2%). Kelebihan tersebut adalah kecil dan terhad kepada satu metrik sahaja.

Jurang tersebut semakin melebar pada Terminal Bench 2.1, yang mengukur keupayaan model untuk menyelesaikan tugas baris arahan (command-line) dunia sebenar. Di sini, MAI Code 1.1 Flash mencatatkan skor 62.9%, manakala DeepSeek-V4-Flash-0731 mencatatkan keputusan 82.7%. Perbezaan itu cukup besar untuk menjejaskan pembangun yang bergantung kepada penjanaan kod berpusatkan terminal.

Titik tekanan harga

Microsoft memasarkan model baharu ini sebagai pilihan "mesra bajet", tetapi harga token menunjukkan sebaliknya. DeepSeek-V4-Flash mengenakan caj $0.14 bagi setiap token input dan $0.28 bagi setiap token output. MAI Code 1.1 Flash menyenaraikan $0.20 untuk input dan $1.20 untuk output. Claude Haiku 4.5 pula berada pada harga masing-masing $1.00 dan $5.00, mengesahkan status premiumnya.

Lonjakan mendadak dalam kos token output bermakna sebarang aliran kerja yang menjana blok kod yang besar akan menjadikan model Microsoft sebagai pilihan yang lebih mahal, walaupun selepas pengurangan yang dijanjikan daripada model sebelumnya. Bagi pembangun skala tinggi dan perusahaan, aspek ekonomi lebih memihak kepada DeepSeek.

Bagaimana MAI Code 1.1 Flash dihasilkan

Model ini adalah sebahagian daripada usaha lebih luas Microsoft untuk menggantikan perkhidmatan pihak ketiga dalam timbunan (stack) Copilot dengan alternatif yang dibina secara dalaman. Dengan melatih model menggunakan data pembelajaran pengukuhan yang luas yang diambil daripada penggunaan Copilot, Microsoft berharap dapat memperkemas gelung maklum balas antara tingkah laku pengguna dan penambahbaikan model. Pelancaran ini juga mengikut corak naik taraf secara berperingkat: versi Jun diposisikan sebagai penjimatan kos, dan iterasi Flash dirangka sebagai langkah seterusnya dalam trajektori tersebut.

Pemenang, pecundang dan pertaruhan yang lebih luas

Perusahaan yang ingin mengawal perbelanjaan AI mungkin mendapati harga DeepSeek lebih menarik, terutamanya apabila volum output adalah tinggi. Sementara itu, Microsoft memperoleh kawalan yang lebih ketat ke atas ekosistem Copilot dan keupayaan untuk mengalihkan hasil pendapatan daripada penyedia luaran seperti OpenAI atau Anthropic.

Kemungkinan pembelaan Microsoft

Data Microsoft sendiri menekankan peningkatan kecekapan token dan kelebihan kecil pada SWE-bench.

Apa yang perlu diperhatikan seterusnya

  • Metrik penggunaan: Statistik penggunaan Copilot akan mendedahkan sama ada pembangun beralih kepada tetapan lalai yang baharu atau mengimport model alternatif melalui API.
  • Pelarasan harga: Jika harga token output Microsoft kekal tinggi, tekanan pasaran boleh memaksa semakan semula.
  • Kemas kini penanda aras: Versi baharu ujian berfokuskan terminal mungkin mengubah keseimbangan prestasi, terutamanya apabila Microsoft memperhalusi saluran paip (pipeline) pembelajaran pengukuhannya.
  • Persaingan pemberat terbuka: Model pemberat terbuka tambahan yang memasuki ruang pengekodan boleh meningkatkan persaingan harga-prestasi.

Kesimpulan

MAI Code 1.1 Flash membawa peningkatan kecil pada penanda aras yang sempit tetapi gagal menandingi model pemberat terbuka DeepSeek dari segi prestasi terminal dan kos token, menyebabkan pembangun perlu menimbang antara kemudahan integrasi dengan kecekapan tulen.