Qwen2.5-Max milik Alibaba dan V3-Flash milik DeepSeek meluncur ke pasar minggu ini, masing-masing mengambil jalur berbeda untuk inferensi AI yang lebih murah. Alibaba hanya mengaktifkan sekitar 95 miliar parameter per kueri dengan desain mixture-of-experts (MoE) 2,4 triliun parameternya; DeepSeek memangkas arsitekturnya untuk menekan harga per token. Perlombaan senjata AI kini diukur dalam dolar per token, bukan sekadar ukuran model.
Dari “Lebih Banyak Parameter” ke “Biaya Lebih Rendah”
Selama bertahun-tahun, metrik utama dalam pengembangan large-language-model (LLM) adalah jumlah parameter. OpenAI, Google, dan lainnya membanggakan keberhasilan menembus batas satu triliun parameter, dengan asumsi bahwa semakin besar berarti semakin pintar. Alibaba dan DeepSeek menunjukkan bahwa kalkulasi tersebut telah bergeser.
Qwen2.5-Max milik Alibaba masih mengandalkan skala, tetapi ia menambahkan trik penghematan biaya. Dalam model padat (dense model), setiap parameter berjalan pada setiap inferensi, mengubah jaringan 2,4 triliun parameter menjadi mesin yang haus daya. MoE membagi jaringan menjadi banyak "pakar" (experts) dan mengarahkan setiap permintaan ke subset tertentu. Router Qwen2.5-Max memilih sekitar 95 miliar parameter untuk setiap prompt, memberikan kekuatan penalaran sistem satu triliun parameter sambil tetap menjaga latensi dan energi tetap terkendali.
DeepSeek sepenuhnya melewatkan ambisi satu triliun parameter. Model V3-Flash miliknya dibangun untuk berjalan murah, cepat, dan dalam skala besar. Perusahaan tersebut memasarkan modelnya dengan fokus pada “harga inferensi ultra-rendah,” menargetkan pengembang yang memproses jutaan token setiap hari tanpa menguras kantong. Harga pastinya tidak diungkapkan, tetapi pesannya jelas: jika sebuah startup tidak mampu membayar tarif per-token ala Barat, V3-Flash menjadi alternatif yang layak.
Mengapa Biaya Inferensi Menjadi Keunggulan Kompetitif
Biaya inferensi menjadi penting ketika model keluar dari laboratorium dan masuk ke tahap produksi. Perusahaan yang menanamkan LLM ke dalam chatbot, alur analisis dokumen, atau mesin rekomendasi akan segera menyadari bahwa penetapan harga tingkat token mendominasi biaya operasional. Model yang biayanya setengah lebih murah per token dapat menggandakan anggaran untuk inisiatif lain—lebih banyak data, lalu lintas yang lebih tinggi, atau fitur tambahan.
Kedua perusahaan Tiongkok tersebut menargetkan segmen pasar yang berbeda. MoE milik Alibaba menjanjikan performa tinggi untuk tugas-tugas kompleks yang berat akan penalaran, sambil menjaga anggaran komputasi per permintaan tetap moderat. Sementara itu, model DeepSeek yang lebih ramping menarik bagi beban kerja bervolume tinggi dan sensitif terhadap latensi, di mana tenaga mentah kurang penting dibandingkan biaya yang dapat diprediksi.
Kedua strategi ini dapat menggerus penyedia Barat yang membundel model besar dengan harga premium. Jika pengembang dapat mencapai hasil yang sebanding dengan harga token yang lebih murah, insentif untuk tetap menggunakan API mahal akan melemah.
Taruhan bagi Ekosistem AI Global
- Startup dan UKM: Biaya inferensi yang lebih rendah menurunkan hambatan bagi produk berbasis AI. Tim yang dulunya membutuhkan modal tambahan untuk tagihan API kini dapat membuat prototipe dan meluncurkan produk dengan anggaran yang lebih ketat.
- Perusahaan: Korporasi besar yang menjalankan layanan AI internal dapat memangkas biaya operasional, membebaskan dana untuk akuisisi data, fine-tuning model, atau komputasi tambahan.
- Penyedia Barat: Model pendapatan mereka bergantung pada biaya per-token. Pergeseran ke arah alternatif yang berfokus pada biaya memaksa mereka untuk menurunkan harga atau melakukan diferensiasi pada kemampuan yang belum bisa ditandingi oleh model yang lebih murah.
- Regulator dan Pembuat Kebijakan: AI yang lebih terjangkau dapat mempercepat adopsi di berbagai sektor, memunculkan pertanyaan tentang pengawasan, privasi data, dan kecepatan otomatisasi.
Pertukaran (Trade-offs) dan Argumen Penyeimbang
Model MoE seperti Qwen2.5-Max bukanlah solusi tanpa biaya. Logika routing menambah kompleksitas rekayasa, dan aktivasi jarang (sparse activation) dapat menghasilkan performa yang tidak merata di berbagai jenis kueri. Jika router salah sasaran, sebuah permintaan mungkin menggunakan pakar yang sub-optimal, sehingga menurunkan kualitas output. Selain itu, perangkat keras masih lebih mendukung komputasi padat (dense compute); akselerator khusus untuk inferensi MoE belum tersebar luas, yang dapat membatasi peningkatan efisiensi di dunia nyata.
Filosofi mengutamakan biaya milik DeepSeek juga membawa risiko. Penetapan harga yang agresif sering kali berarti batasan yang lebih ketat pada ukuran model dan data pelatihan, yang berpotensi membatasi performa. Untuk aplikasi yang menuntut penalaran bernuansa, model yang lebih murah mungkin tidak memadai, sehingga mendorong pengguna kembali ke alternatif yang lebih besar dan lebih mahal.
Akhirnya, “kecerdasan per dolar” hanyalah satu poros kompetisi. Latensi, keandalan, dukungan ekosistem, dan kepatuhan terhadap regulasi regional tetap menjadi faktor penentu. Perusahaan yang menawarkan paket seimbang di semua dimensi ini kemungkinan besar akan mendominasi, bukan hanya mereka yang memenangkan perang harga.
Apa yang Perlu Diperhatikan Selanjutnya
- Rilis benchmark: Evaluasi independen terhadap efisiensi routing MoE Qwen2.5-Max dan biaya token V3-Flash akan mengungkap apakah hype tersebut menghasilkan penghematan yang terukur.
- Perkembangan perangkat keras: Adopsi akselerator yang dioptimalkan untuk aktivasi sparse dapat memperkuat manfaat MoE, sementara GPU serbaguna mungkin menjaga model dense tetap kompetitif.
- Respons penetapan harga: Penyedia Barat mungkin menyesuaikan tingkatan (tier) mereka atau menambahkan fitur penghematan biaya seperti diskon inferensi batch atau lisensi on-premise.
- Langkah regulasi: Seiring meluasnya AI yang lebih murah, pemerintah mungkin memperkenalkan standar transparansi dan keamanan yang dapat memengaruhi cara model-model ini diterapkan dalam skala besar.
Kesimpulan
Qwen2.5-Max berbasis MoE milik Alibaba dan V3-Flash berbiaya rendah milik DeepSeek menunjukkan bahwa persaingan AI kini sangat bergantung pada lembar anggaran sebagaimana halnya pada jumlah parameter. Perusahaan yang menghadirkan kemampuan bahasa yang canggih sambil menjaga biaya per token tetap rendah akan membuka akses AI bagi lebih banyak pengguna, mengubah dinamika kompetitif yang selama ini menguntungkan model-model terbesar dan termahal.
