Alibaba melancarkan Qwen3.8-Max pada 3 Ogos. Ia merupakan model mixture-of-experts yang berskala sehingga 2.4 trilion parameter tetapi hanya mengaktifkan 95 bilion semasa masa inferens. Model ini menerima imej dan teks melalui gerbang QwenCloud, dan Alibaba menyatakan bahawa pemberat (weights) akan tersedia secara terbuka pada minggu hadapan.
Tajuk berita yang gah itu menyembunyikan persoalan yang lebih sukar: bolehkah ejen model tersebut menulis kod secara boleh dipercayai apabila alatan yang bergantung padanya mengalami kegagalan? Demo vendor menunjukkan pecutan pengekodan autonomi sepenuhnya selama sepuluh hari yang membina projek dari awal, tetapi sesi tersebut dijalankan pada infrastruktur Alibaba sendiri dan di bawah keizinan yang ideal. Pembangun dunia nyata perlu tahu bagaimana sistem bertindak apabila had token dicapai, panggilan alatan gagal, atau akses menulis dihadkan.
Mengapa keterujaan ini penting
Reka bentuk mixture-of-experts membolehkan kumpulan parameter yang besar kekal tidak aktif melainkan "pakar" tertentu dipanggil, sekali gus mengekalkan kos inferens yang lebih rendah berbanding model padat (dense model) dengan saiz yang sama. Input multimodal memperluas kes penggunaan melangkaui penjanaan kod biasa, membolehkan pembangun memasukkan rajah atau tangkapan skrin ke dalam prom yang sama.
Namun, janji tersebut bergantung kepada lapisan ejen yang menyelaraskan penyunting fail, pengkompil (compilers), pelaksana ujian (test runners), dan arahan kawalan versi. Jika lapisan tersebut tidak dapat pulih daripada kegagalan panggilan alatan, keseluruhan sesi pengekodan akan runtuh.
Bahagian yang hilang: tombol usaha penaakulan (reasoning effort)
Qwen3.8-Max hadir dengan tiga pratetap "usaha penaakulan" (reasoning effort)—rendah, sederhana, dan sangat tinggi (xhigh). Tetapan ini mempertukarkan kelajuan dengan kualiti jawapan dan, yang paling penting, dengan jumlah token yang akan dikeluarkan oleh model tersebut.
Pelan ujian yang boleh diulang semula
Untuk menembusi tuntutan pemasaran, cuba protokol praktikal berikut dengan bajet token yang tetap:
- Cipta repositori baharu dengan rangka kerja "hello world" yang ringkas dalam mana-mana bahasa.
- Berikan prom kepada ejen untuk menambah ciri baharu (contohnya, titik akhir REST) dan rekodkan setiap pelan yang dihasilkannya, setiap panggilan alatan yang dibuat, dan setiap fail yang disentuhnya.
- Ganggu pada kegagalan pertama—sebagai contoh, apabila ralat pengkompilan muncul—simpan keadaan dalaman model, kemudian sambung semula dari titik semak tersebut.
- Ulangi larian di bawah setiap tetapan usaha penaakulan, dengan mencatatkan jumlah token, masa sebenar (wall-clock time), dan sebarang ralat pada peringkat alatan.
- Hadkan keizinan dalam satu sesi (akses baca sahaja) dan berikan akses menulis penuh dalam sesi lain, untuk melihat bagaimana ejen menyesuaikan diri.
- Log cubaan semula: berapa kerapkah model memanggil semula alatan yang gagal berbanding membatalkan tugasan?
Mengumpul metrik ini membolehkan anda membandingkan output pengekodan mentah dengan kos tersembunyi pengendalian ralat. Jika ejen berulang kali mencuba semula linter yang tidak stabil, bil token akan melambung tinggi walaupun kod akhir kelihatan baik.
Apa yang disembunyikan oleh angka tersebut
Angka 95 bilion parameter aktif tidak diterjemahkan secara langsung kepada jumlah wang. Panggilan alatan yang mengembalikan ralat memaksa model menjana prom pembetulan, yang meningkatkan penggunaan token. Tanpa keadaan yang tahan lama—titik semak berkala yang membolehkan anda menyambung semula selepas kegagalan—kos satu kegagalan boleh berangkai.
Peringatan tentang pemberat terbuka (open-weights)
Janji Alibaba untuk mengeluarkan pemberat pada minggu hadapan mengundang penggunaan di premis (on-prem), tetapi dua halangan praktikal masih wujud. Pertama, lesen mungkin mengehadkan penggunaan komersial atau memerlukan atribusi; pembangun mesti membacanya sebelum menyepadukan model ke dalam produk. Kedua, menjalankan sistem mixture-of-experts dengan 2.4 trilion parameter masih memerlukan GPU kelas atasan atau pemecut (accelerators) khusus. Pengguna awal harus menganggap tuntutan "penempatan tempatan" sebagai sementara sehingga keperluan perkakasan dan angka prestasi sebenar disahkan.
Hujah balas: perspektif vendor
Ujian dalaman Alibaba menunjukkan model tersebut berjaya menyelesaikan maraton pengekodan autonomi selama sepuluh hari, mengendalikan triaj isu, penjanaan kod, dan pelaksanaan ujian tanpa input manusia. Keputusan tersebut menunjukkan apa yang ingin dilihat oleh pasukan mereka, tetapi ia tidak membuktikan kebolehpercayaan dalam ujian dunia nyata.
Apa yang perlu diperhatikan seterusnya
- Pemuktamadan lesen: Terma tepat pelepasan pemberat terbuka akan menentukan sama ada syarikat pemula boleh melancarkan produk yang dikuasakan oleh Qwen3.8-Max atau mesti kekal menggunakan API hos.
- Ketersediaan perkakasan: Jika penyedia awan mula menawarkan instans yang telah dikonfigurasi awal untuk model mixture-of-experts, halangan untuk ujian di premis akan berkurangan secara drastik.
Kesimpulan
Saiz Qwen3.8-Max yang menjadi bualan utama dan kehebatan multimodal hanyalah separuh daripada ceritanya; metrik sebenar bagi pembangun adalah bagaimana kerangka ejennya menguruskan kegagalan alatan, bajet token, dan had kebenaran. Ujian yang berdisiplin dan boleh diulang—dengan mempelbagaikan usaha penaakulan dan hak akses—akan mendedahkan sama ada model tersebut memenuhi janji pemasarannya atau sekadar menambah satu lagi lapisan yang mahal kepada saluran kerja pengekodan.
