Alibaba telah melancarkan Qwen3.8-Max, sebuah model Mixture-of-Experts (MoE) dengan 2.4 trilion parameter yang mencatatkan kadar kejayaan 86.1% pada penanda aras OSWorld-Verified—Alibaba menyatakan skor tersebut mengatasi GPT-5.6, Sol Max dan Fable 5. Penanda aras ini mengukur keupayaan AI untuk berinteraksi dengan sistem operasi, memasang perisian dan menyahpepijat kod, satu set kemahiran yang menjadi asas kepada ejen kejuruteraan perisian autonomi.

Perlumbaan ke arah ejen autonomi

Model bahasa besar telah beralih daripada pembantu gaya sembang kepada alatan yang boleh menulis, menguji dan juga melancarkan kod. Syarikat yang dapat menyerahkan kerja kejuruteraan rutin kepada AI secara boleh dipercayai berpeluang mengurangkan kos kakitangan dan mempercepatkan kitaran produk. Penanda aras OSWorld-Verified telah menjadi kayu ukur de-facto bagi keupayaan "ejenik" kerana ia memerlukan lebih daripada sekadar penjanaan teks statik; ia menuntut interaksi dunia nyata dengan sesuatu sistem.

Apa yang dibawa oleh Qwen3.8-Max

  • Seni bina MoE dengan 2.4 T parameter – sehingga 64 sub-rangkaian pakar boleh dirujuk untuk setiap token, satu reka bentuk yang didakwa oleh Alibaba dapat mengurangkan kos pengkomputeran sebanyak kira-kira 40%.
  • Pengendalian prom multimodal – model ini menerima teks, imej dan data berstruktur secara bersama, membolehkan satu permintaan untuk menerangkan UI, menunjukkan tangkapan skrin dan membekalkan fail konfigurasi.
  • Tingkap konteks 64 k token – ruang yang mencukupi untuk keseluruhan pangkalan kod, fail log atau laporan teknikal yang panjang tanpa perlu memotongnya kepada bahagian-bahagian kecil.

Ciri-ciri ini menyasarkan aliran kerja "hujung-ke-hujung" yang memakan masa berjam-jam bagi pasukan perisian: menarik kebergantungan (dependencies), mengimbas log, menampal pepijat dan menjana dokumentasi.

Angka di bawah mikroskop

Tugasan Metrik yang dilaporkan
OSWorld-Verified (interaksi OS ejenik) 86.1% kejayaan
Penjanaan kod (HumanEval-Plus) 78.4% lulus
Penaakulan multimodal (MM-Bench) 84.3%
Ringkasan konteks panjang (ujian 50 k-token) 90.2%

Semua angka adalah daripada ujian dalaman Alibaba. Jika ia terbukti benar, model ini akan memberikan perusahaan satu API tunggal yang boleh mengendalikan kod, imej dan dokumen besar sambil mengekalkan kos inferens yang lebih rendah daripada kebanyakan pesaing model padat (dense-model).

Risiko dan keperluan untuk pengesahan bebas

Ketiadaan pengesahan pihak ketiga adalah amaran yang paling nyata. Penanda aras boleh dilaraskan, prom dioptimumkan atau set ujian ditapis untuk memihak kepada seni bina tertentu. Tanpa replikasi luaran, dakwaan bahawa Qwen3.8-Max "mengatasi" GPT-5.6 kekal bersifat sementara. Selain itu, model MoE boleh menunjukkan prestasi yang tidak sekata: sesetengah token mungkin dihala ke pakar yang kurang terlatih, membawa kepada halusinasi sekali-sekala atau output yang tidak konsisten—isu yang penting apabila AI dijangka untuk mengubah suai sistem pengeluaran (production systems).

Apa yang perlu diperhatikan seterusnya

  • Replikasi bebas – penyelidik dan pelanggan awan berkemungkinan akan menjalankan suite OSWorld-Verified yang sama dan ujian HumanEval-Plus pada perkakasan yang tersedia secara awam.
  • Harga dan kependaman (latency) – harga API Alibaba Cloud akan mendedahkan sama ada penjimatan pengkomputeran 40% diterjemahkan kepada kelebihan kos yang nyata bagi pembangun.
  • Alatan untuk keselamatan – memandangkan ejen autonomi mendapat lebih banyak kawalan ke atas infrastruktur, ekosistem tersebut akan memerlukan mekanisme pemantauan, pengunduran (rollback) dan audit yang masih di peringkat awal.

Jika Qwen3.8-Max memenuhi angka-angka utamanya, jurang antara pembantu perbualan dan bot kejuruteraan yang berdikari akan mengecil secara drastik. Beberapa bulan akan datang sepatutnya menunjukkan sama ada prestasi model tersebut dapat bertahan daripada penelitian dan sama ada perusahaan akan menggunakannya sebagai tulang belakang saluran pembangunan automatik mereka.