Qwen2.5-Max daripada Alibaba dan V3-Flash daripada DeepSeek memasuki pasaran minggu ini, masing-masing mengambil jalan berbeza untuk inferens AI yang lebih murah. Alibaba hanya mengaktifkan kira-kira 95 bilion parameter bagi setiap pertanyaan dengan reka bentuk mixture-of-experts (MoE) 2.4 trilion parameternya; DeepSeek memangkas seni bina untuk mengurangkan harga bagi setiap token. Perlumbaan senjata AI kini diukur dalam dolar bagi setiap token, bukan sekadar saiz model.
Daripada "Lebih Banyak Parameter" kepada "Kos Lebih Rendah"
Selama bertahun-tahun, metrik utama dalam pembangunan model bahasa besar (LLM) ialah jumlah parameter. OpenAI, Google dan lain-lain berbangga kerana berjaya melepasi halangan trilion parameter, dengan andaian bahawa lebih besar bermakna lebih pintar. Alibaba dan DeepSeek menunjukkan bahawa pengiraan ini telah berubah.
Qwen2.5-Max daripada Alibaba masih bergantung pada skala, tetapi ia menambah satu teknik penjimatan kos. Dalam model padat (dense model), setiap parameter berjalan pada setiap inferens, menjadikan rangkaian 2.4 trilion parameter sebagai sebuah "raksasa" yang kuat menggunakan tenaga. MoE membahagikan rangkaian kepada banyak "pakar" (experts) dan menghalakan setiap permintaan ke satu subset. Penghala (router) Qwen2.5-Max memilih kira-kira 95 bilion parameter untuk sebarang prom, memberikan kuasa penaakulan sistem trilion parameter sambil mengekalkan kependaman (latency) dan tenaga dalam kawalan.
DeepSeek mengetepikan terus cita-cita trilion parameter. Model V3-Flash miliknya dibina untuk berjalan dengan murah, pantas, dan pada skala besar. Syarikat itu memasarkan model tersebut dengan "harga inferens ultra-rendah," menyasarkan pembangun yang memproses berjuta-juta token setiap hari tanpa membebankan kewangan. Harga tepat tidak didedahkan, tetapi mesejnya jelas: jika sesebuah syarikat pemula (startup) tidak mampu membayar kadar per-token Barat, V3-Flash menjadi alternatif yang berdaya maju.
Mengapa Kos Inferens Menjadi Kelebihan Daya Saing
Kos inferens menjadi penting apabila model keluar dari makmal dan memasuki fasa pengeluaran. Perusahaan yang menyepadukan LLM ke dalam bot sembang, saluran analisis dokumen, atau enjin cadangan akan mendapati bahawa harga pada tahap token mendominasi perbelanjaan operasi. Model yang menelan kos separuh daripada harga per-token boleh menggandakan bajet untuk inisiatif lain—lebih banyak data, trafik yang lebih tinggi, atau ciri tambahan.
Kedua-dua firma China ini menyasarkan segmen pasaran yang berbeza. MoE Alibaba menjanjikan prestasi tinggi untuk tugas kompleks yang berat dengan penaakulan, sambil mengekalkan bajet pengkomputeran bagi setiap permintaan pada tahap sederhana. Sementara itu, model DeepSeek yang lebih ramping menarik minat beban kerja volum tinggi yang sensitif terhadap kependaman, di mana kuasa mentah kurang penting berbanding kos yang boleh diramal.
Kedua-dua strategi ini boleh mencabar penyedia Barat yang menggabungkan model besar dengan harga premium. Jika pembangun mencapai hasil yang setanding dengan harga token yang lebih murah, insentif untuk terus menggunakan API yang mahal akan semakin lemah.
Pertaruhan bagi Ekosistem AI Global
- Syarikat Pemula dan PKS: Kos inferens yang lebih rendah merendahkan halangan bagi produk berasaskan AI. Pasukan yang dahulunya memerlukan modal tambahan untuk bil API kini boleh membina prototaip dan melancarkan produk dengan bajet yang lebih ketat.
- Perusahaan: Korporat besar yang menjalankan perkhidmatan AI dalaman boleh mengurangkan perbelanjaan operasi, sekali gus membebaskan dana untuk pemerolehan data, penalaan halus (fine-tuning) model, atau pengkomputeran tambahan.
- Penyedia Barat: Model hasil mereka bergantung pada caj per-token. Peralihan ke arah alternatif yang memfokuskan kos memaksa mereka untuk menurunkan harga atau membezakan diri melalui keupayaan yang belum dapat ditandingi oleh model yang lebih murah.
- Pengawal Selia dan Pembuat Dasar: AI yang lebih mampu milik boleh mempercepatkan penggunaan merentas sektor, sekali gus menimbulkan persoalan tentang pengawasan, privasi data, dan kepantasan automasi.
Imbangan (Trade-offs) dan Hujah Balas
Model MoE seperti Qwen2.5-Max bukanlah sesuatu yang tanpa kesan. Logik penghalaan menambah kerumitan kejuruteraan, dan pengaktifan jarang (sparse activation) boleh menghasilkan prestasi yang tidak sekata merentas jenis pertanyaan. Jika penghala tersilap, sesuatu permintaan mungkin melibatkan pakar yang sub-optimum, sekali gus menjejaskan kualiti output. Selain itu, perkakasan masih memihak kepada pengkomputeran padat; pemecut khusus untuk inferens MoE belum lagi meluas, yang boleh mengehadkan peningkatan kecekapan dalam dunia nyata.
Falsafah mengutamakan kos DeepSeek juga membawa risiko. Harga yang agresif sering bermaksud kekangan yang lebih ketat pada saiz model dan data latihan, yang berpotensi mengehadkan prestasi. Bagi aplikasi yang memerlukan penaakulan yang halus, model yang lebih murah mungkin tidak mencukupi, mendorong pengguna kembali kepada alternatif yang lebih besar dan lebih mahal.
Akhir sekali, "kecerdasan bagi setiap dolar" hanyalah satu paksi persaingan. Kependaman, kebolehpercayaan, sokongan ekosistem, dan pematuhan terhadap peraturan serantau tetap menjadi faktor penentu. Syarikat yang menawarkan pakej seimbang merentas semua dimensi ini berkemungkinan besar akan mendominasi, bukan sekadar mereka yang memenangi perang harga.
Apa yang Perlu Diperhatikan Seterusnya
- Penerbitan penanda aras: Penilaian bebas terhadap kecekapan penghalaan MoE Qwen2.5-Max dan kos token V3-Flash akan mendedahkan sama ada keterujaan (hype) diterjemahkan kepada penjimatan yang boleh diukur.
- Perkembangan perkakasan: Penggunaan pemecut yang dioptimumkan untuk pengaktifan jarang (sparse activation) boleh mempertingkatkan manfaat MoE, manakala GPU tujuan umum mungkin mengekalkan daya saing model padat (dense models).
- Respons harga: Penyedia Barat mungkin melaraskan peringkat (tiers) mereka atau menambah ciri penjimatan kos seperti diskaun inferens berkelompok (batch inference) atau pelesenan atas premis (on-premise).
- Langkah kawal selia: Apabila AI yang lebih murah tersebar, kerajaan mungkin memperkenalkan piawaian ketelusan dan keselamatan yang boleh mempengaruhi cara model ini digunakan pada skala besar.
Rumusan
Qwen2.5-Max berasaskan MoE daripada Alibaba dan V3-Flash kos rendah daripada DeepSeek menunjukkan bahawa perlumbaan AI kini bergantung kepada helaian bajet sama banyak seperti jumlah parameter. Syarikat yang menawarkan keupayaan bahasa yang canggih sambil mengekalkan bil setiap token yang rendah akan membuka akses AI kepada set pengguna yang lebih luas, sekali gus mengubah dinamik persaingan yang sekian lama memihak kepada model yang paling besar dan paling mahal.
