Model MAI-Cyber-1-Flash baharu Microsoft mencatatkan skor 96% pada penanda aras CyberGym, mengatasi model keselamatan setanding daripada Anthropic, Google dan OpenAI. Microsoft menyatakan bahawa pendekatan ini dapat mengurangkan kos enjin keselamatan perusahaan sebanyak kira-kira separuh sambil masih dapat mengesan kebanyakan kelemahan pada peringkat kod.
Cara model ini berfungsi
MAI-Cyber-1-Flash ialah model kompak dengan daya pemprosesan tinggi yang mengendalikan kira-kira 90% tugas keselamatan rutin secara bersendirian. Microsoft menghalakan kes-kes yang lebih sukar dan selebihnya kepada model yang lebih besar dan lebih mahal—GPT-5.4 daripada OpenAI—melalui sistem "smart routing" atau penjujukan model (model-cascading). Model murah melakukan sebahagian besar kerja; model mahal hanya digunakan untuk cabaran kes ekstrem (edge-case). Microsoft mendakwa pembahagian ini mengurangkan perbelanjaan keseluruhan sebanyak 50%.
Mengapa skor CyberGym itu penting
CyberGym mengukur keupayaan model untuk mengesan kerentanan keselamatan dalam kod sumber. Kadar kelulusan 96% bermakna model tersebut mengenal pasti hampir semua kelemahan yang disuntik dalam set ujian dengan betul. Microsoft memposisikan ketepatan tersebut, digabungkan dengan penghalaan penjimatan kos, sebagai piawaian baharu untuk saluran keselamatan kod berskala besar.
Kepentingan bagi perusahaan
Microsoft memproses kira-kira 100 trilion isyarat keselamatan setiap hari. Dengan menyelaraskan campuran model khusus, syarikat tersebut bertujuan untuk bertindak sebagai "security orchestrator" pusat bagi pelanggan Azure, menawarkan satu perkhidmatan tunggal yang boleh diskalakan tanpa menyebabkan bajet melonjak. Jika dakwaan pengurangan kos ini terbukti benar, organisasi boleh mengalihkan sebahagian besar perbelanjaan keselamatan mereka kepada pemburuan ancaman (threat-hunting) atau pelaporan pematuhan.
Perkara yang perlu dipertimbangkan
Pengkritik memberi amaran bahawa keputusan penanda aras tidak selalunya dapat diterjemahkan ke persekitaran dunia nyata, di mana pangkalan kod, bahasa, dan vektor ancaman sangat berbeza. Bergantung kepada model luaran (GPT-5.4) untuk kes yang paling sukar juga menimbulkan kebimbangan mengenai residensi data, kependaman (latency), dan kuncian vendor (vendor-lock-in). Selain itu, angka penjimatan 50% tersebut mengandaikan pengagihan beban kerja yang sepadan dengan trafik dalaman Microsoft; sesetengah firma mungkin melihat impak yang lebih kecil.
Apa yang perlu diperhatikan seterusnya
Microsoft sedang melancarkan model tersebut melalui perkhidmatan keselamatan Azure, jadi kadar penggunaan dalam kalangan pelanggan perusahaan akan menjadi ujian konkrit yang pertama. Pemerhati juga akan memerhatikan peluasan pendekatan penjujukan ini ke dalam sektor terkawal seperti penjagaan kesihatan dan kewangan, di mana peraturan privasi data boleh merumitkan penggunaan model pihak ketiga.
Rumusan: MAI-Cyber-1-Flash menunjukkan bahawa strategi model hibrid boleh memberikan pengesanan tahap tertinggi sambil menjanjikan pengurangan kos yang ketara—dengan syarat prestasi kekal konsisten di luar makmal dan kos tambahan penghalaan (routing overhead) kekal rendah.
