Alibaba Meluncurkan Qwen3.8-Max: Raksasa 2,4 Triliun Parameter untuk AI Agent
Tim Qwen dari Alibaba telah mengumumkan Qwen3.8-Max, sebuah model unggulan masif dengan 2,4 triliun parameter yang dirancang untuk melampaui sekadar perintah obrolan (chat prompts) sederhana menuju penalaran otonom jangka panjang (long-horizon autonomous reasoning). Dengan berfokus pada alur kerja multi-hari dan eksekusi tugas yang kompleks, model ini menandai pergeseran signifikan dari LLM reaktif menjadi AI agent yang proaktif.
Menskalakan Parameter untuk Kecerdasan Otonom
Qwen3.8-Max adalah kekuatan teknis yang luar biasa, menggunakan total 2,4 triliun parameter dengan 95 miliar parameter aktif per kueri. Dibangun di atas arsitektur Qwen3.5, model ini dioptimalkan secara khusus untuk tugas "long-horizon"—tujuan kompleks yang mengharuskan AI beroperasi secara mandiri selama berhari-hari atau bahkan berminggu-minggu.
Dalam langkah signifikan bagi komunitas sumber terbuka (open-source), Alibaba telah mengonfirmasi bahwa bobot (weights) untuk kelas Qwen-Max akan tersedia secara publik minggu depan, menantang dominasi model-model mutakhir (frontier models) yang tertutup seperti GPT dan Claude.
Membuktikan Otonomi Melalui Pengodean dan Penelitian
Untuk mendemonstrasikan kemampuan agentiknya, Alibaba menyajikan beberapa studi kasus berisiko tinggi di mana model tersebut beroperasi tanpa intervensi manusia:
- Rekayasa Perangkat Lunak: Selama periode 16 hari, Qwen3.8-Max secara otonom mengembangkan alat baris perintah
oh-my-cli. Ia mengelola isu GitHub-nya sendiri, menulis kode, menjalankan pengujian, serta mengeksekusi 265 commit dan 127 pull request. - Reproduksi Ilmiah: Ditugaskan untuk mereproduksi hasil dari makalah "Unified Data Selection for LLM Reasoning", model ini menghabiskan 125 jam waktu komputasi untuk menulis 7.600 baris kode. Ia tidak hanya mereplikasi penelitian asli tetapi juga meningkatkan skor tolok ukur (benchmark) matematika AIME24 sebesar 2,7 poin.
- Sains Data Kompetitif: Dalam tantangan WWW2025 Multimodal Dialogue Intent Recognition, model ini mengungguli 458 dari 526 tim manusia, meningkatkan akurasinya dari 0,60 menjadi 0,853 dalam waktu 24 jam.
Melampaui Perangkat Lunak: Desain Chip dan Simulasi Fiskal
Penalaran Qwen3.8-Max meluas ke bidang perangkat keras dan ekonomi. Dalam tugas desain sirkuit kriptografi, model ini secara iteratif mengurangi desain yang "gemuk" dari 8.298 gerbang logika menjadi hanya 678 gerbang. Menggunakan alat OpenROAD, hal ini menghasilkan pengurangan luas fisik chip sebesar 81%.
Dalam simulasi ritel kompleks yang disebut E-Commerce-Bench, model ini mengelola beberapa toko daring melalui simulasi tahun fiskal. Dimulai dengan 100.000 yuan, ia menavigasi negosiasi pemasok, mengidentifikasi 152 penipu, dan mengelola gangguan rantai pasokan untuk berakhir dengan 416.252 yuan—meningkatkan modal awalnya empat kali lipat dan mengungguli pesaing terdekatnya, GLM 5.2, secara signifikan.
Batas Multimodal dan Dominasi Tolok Ukur
Model ini juga mendobrak batasan pemrosesan multimodal, yang mampu menangani dokumen setebal 200 halaman dan video yang melebihi 100 jam. Alibaba juga memperkenalkan RecreationBench, sebuah tolok ukur yang menguji kemampuan agen untuk merekonstruksi aplikasi yang sedang berjalan (di Windows, macOS, Android, dll.) hanya melalui interaksi visual dan keyboard, tanpa akses ke kode sumber.
Menurut tolok ukur internal, Qwen3.8-Max bersaing langsung dengan model-model tingkat atas, menempati posisi mendekati atau di atas Claude Opus 4.8 dan GPT-5.6 Sol di beberapa kategori, termasuk skor unggulan 93 pada PaperBench.
Poin-Poin Penting
- Skala Masif: Qwen3.8-Max memiliki total 2,4 triliun parameter dan 95 miliar parameter aktif, yang dioptimalkan untuk alur kerja otonom multi-hari.
- Penguasaan Agentik: Model ini telah menunjukkan kemampuan untuk menangani rekayasa perangkat lunak yang kompleks, optimasi desain chip, dan manajemen fiskal skala penuh secara otonom.
- Dampak Bobot Terbuka (Open-Weight): Tidak seperti banyak model mutakhir lainnya, Alibaba berencana untuk merilis bobot (weights) untuk kelas Qwen-Max, memberikan pengembang akses yang belum pernah ada sebelumnya ke kecerdasan agentik tingkat tinggi.
