Microsoft meluncurkan MAI Code 1.1 Flash sebagai model pengodean generasi berikutnya untuk GitHub Copilot, namun tolok ukur awal dan tabel harga menempatkannya di belakang penawaran open-weight DeepSeek, baik dalam hal performa maupun biaya.
Realitas benchmark versus siaran pers
Catatan peluncuran Microsoft menjanjikan lonjakan efisiensi token sebesar 25% dan pemotongan biaya sebesar 75% dibandingkan dengan versi bulan Juni dari model MAI miliknya. Perusahaan tersebut juga membanggakan kenaikan 4% dalam "code survival" setelah melatih model tersebut di ratusan ribu lingkungan reinforcement-learning di dalam Copilot.
Pengujian independen menceritakan kisah yang berbeda. Pada rangkaian SWE-bench Verified, MAI Code 1.1 Flash mencatat tingkat kelulusan 72,6%, sedikit unggul di atas Claude Haiku 4.5 (69,8%) dan GPT-5.4 mini (69,2%). Keunggulannya tergolong kecil dan terbatas pada satu metrik saja.
Kesenjangan semakin lebar pada Terminal Bench 2.1, yang mengukur kemampuan model untuk menyelesaikan tugas baris perintah (command-line) di dunia nyata. Di sini, MAI Code 1.1 Flash mencetak skor 62,9%, sementara DeepSeek-V4-Flash-0731 mencatat hasil 82,7%. Perbedaan tersebut cukup besar untuk memengaruhi pengembang yang mengandalkan pembuatan kode berbasis terminal.
Titik tekan harga
Microsoft memasarkan model baru ini sebagai opsi yang "ramah anggaran", tetapi harga token menunjukkan hal yang berbeda. DeepSeek-V4-Flash mengenakan biaya $0,14 per token input dan $0,28 per token output. MAI Code 1.1 Flash mencantumkan harga $0,20 untuk input dan $1,20 untuk output. Claude Haiku 4.5 masing-masing berada di angka $1,00 dan $5,00, yang mengonfirmasi status premiumnya.
Lonjakan tajam dalam biaya token output berarti alur kerja apa pun yang menghasilkan blok kode besar akan membuat model Microsoft menjadi pilihan yang lebih mahal, bahkan setelah pengurangan yang dijanjikan dari pendahulunya. Bagi pengembang skala besar dan perusahaan, aspek ekonominya sangat condong ke arah DeepSeek.
Bagaimana MAI Code 1.1 Flash hadir
Model ini adalah bagian dari upaya Microsoft yang lebih luas untuk mengganti layanan pihak ketiga dalam stack Copilot dengan alternatif yang dibangun secara internal. Dengan melatih model menggunakan data reinforcement-learning yang luas yang diambil dari penggunaan Copilot, Microsoft berharap dapat mempererat loop umpan balik antara perilaku pengguna dan peningkatan model. Peluncuran ini juga mengikuti pola peningkatan bertahap: versi Juni diposisikan sebagai penghemat biaya, dan iterasi Flash dibingkai sebagai langkah selanjutnya dalam lintasan tersebut.
Pemenang, pecundang, dan pertaruhan yang lebih luas
Perusahaan yang ingin mengendalikan pengeluaran AI mungkin merasa harga DeepSeek lebih menarik, terutama ketika volume output tinggi. Sementara itu, Microsoft memperoleh kendali yang lebih ketat atas ekosistem Copilot dan kemampuan untuk mengalihkan pendapatan dari penyedia eksternal seperti OpenAI atau Anthropic.
Kemungkinan pembelaan Microsoft
Data Microsoft sendiri menekankan keuntungan efisiensi token dan keunggulan tipis pada SWE-bench.
Apa yang perlu diperhatikan selanjutnya
- Metrik adopsi: Statistik penggunaan Copilot akan mengungkapkan apakah pengembang beralih ke default baru atau mengimpor model alternatif melalui API.
- Penyesuaian harga: Jika harga token output Microsoft tetap tinggi, tekanan pasar dapat memaksa adanya revisi.
- Pembaruan benchmark: Versi baru dari pengujian yang berfokus pada terminal dapat menggeser keseimbangan performa, terutama saat Microsoft menyempurnakan pipeline reinforcement-learning miliknya.
- Persaingan open-weight: Model open-weight tambahan yang memasuki ruang pengodean dapat memperhebat persaingan harga-performa.
Kesimpulan
MAI Code 1.1 Flash memberikan peningkatan kecil pada benchmark yang sempit, tetapi masih kalah dari model open-weight DeepSeek baik dalam performa terminal maupun biaya token, sehingga pengembang harus menimbang kenyamanan integrasi dengan efisiensi murni.
