Laporan perkongsian token Vercel bagi bulan Jun menunjukkan model pemberat terbuka (open-weight models) mengendalikan 29% token gerbang, meningkat daripada 11% pada bulan April, dengan DeepSeek sahaja menyumbang sebanyak 22.6% daripada jumlah tersebut. Lonjakan ini menandakan peralihan yang pantas: pembangun kini beralih daripada penggunaan satu model "terbaik" dan mula menganggap model AI sebagai infrastruktur yang boleh-laluan (routable infrastructure).
Mengapa pembangun menganggap model sebagai infrastruktur
Model pemberat terbuka yang murah—kebanyakannya daripada penyedia China—berharga jauh lebih rendah berbanding tawaran premium seperti Anthropic. Untuk tugasan rutin seperti pengekstrakan kod, pembersihan teks, atau pencarian data mudah, model yang menelan kos sen berbanding dolar boleh menjadi lebih menarik, walaupun ia mungkin beberapa peratus kurang tepat.
Hasilnya ialah satu corak reka bentuk baharu. Sesuatu aplikasi terlebih dahulu menghantar permintaan kepada model kos rendah untuk bahagian kerja yang "membosankan". Jika output melepasi semakan kualiti yang mudah, saluran (pipeline) akan diteruskan; jika tidak, model yang lebih mahal akan dipanggil untuk semakan kedua atau keputusan akhir. Logik penghalaan (routing logic) menjadi komponen kritikal, bukannya pemilihan satu model sahaja.
Apa yang dikatakan oleh angka-angka tersebut
Data Vercel, yang diambil daripada gerbangnya yang mengendalikan pelbagai penyedia AI, menunjukkan model pemberat terbuka beralih daripada pinggiran kepada arus perdana. Pada bulan April, ia merangkumi lebih sedikit daripada satu persepuluh daripada semua token; menjelang Jun, ia menghampiri satu pertiga. DeepSeek, sebuah model dari China, menyumbang lebih daripada satu perlima daripada jumlah volum token secara bersendirian.
Model kelas atasan masih mendominasi perbelanjaan. Anthropic, sebagai contoh, terus menguasai sebahagian besar perbelanjaan wang kerana harga bagi setiap token adalah lebih tinggi. Pengiraannya mudah: model murah memenangi kerja volum tinggi dengan margin rendah, manakala model mahal mengekalkan tugasan berimpak tinggi dengan margin tinggi.
Implikasi kepada ejen AI
Seorang ejen AI biasanya melaksanakan urutan langkah: perancangan, pengambilan data, pemanggilan alatan, dan pemurnian hasil. Apabila setiap langkah boleh ditugaskan kepada model yang paling kos efektif, kos operasi keseluruhan akan turun secara mendadak.
- Pengambilan dan pengekstrakan data selalunya hanya memerlukan pemahaman bahasa asas, satu tugasan yang dikuasai oleh model murah.
- Keputusan akhir—bahagian yang menentukan sama ada jawapan itu boleh diterima—kekal sebagai domain model premium yang mempunyai kebolehpercayaan lebih tinggi.
Pendekatan berlapis ini membolehkan pembangun mengautomasikan beban kerja yang lebih besar tanpa melambungkan bajet. Ia juga memaksa peralihan daripada "pilih model terbaik" kepada "ukur kejayaan bagi setiap langkah dan halakan mengikut kesesuaian."
Risiko dan had
Ekonominya sangat menarik, tetapi peralihan ini tidaklah tanpa rintangan.
- Pematuhan: Sesetengah bidang kuasa mengenakan peraturan pengendalian data yang ketat yang mungkin mengehadkan penggunaan model yang dihoskan di luar negara.
- Kerumitan pengehosan: Model premium yang besar sukar untuk dijalankan secara dalaman (in-house), jadi organisasi mesti bergantung kepada API luaran, yang boleh meningkatkan isu kependaman (latency) dan kebimbangan terhadap kuncian vendor (vendor-lock).
Disebabkan faktor-faktor ini, model murah tidak mungkin akan menggantikan model premium sepenuhnya. Sebaliknya, ia menjadi pilihan utama untuk kerja rutin, manakala model premium kekal dalam "lapisan keputusan" di mana kosnya yang lebih tinggi adalah wajar.
Apa yang perlu diperhatikan seterusnya
- Alatan untuk penghalaan: Memandangkan lapisan penghalaan menjadi semakin penting, kita boleh menjangkakan gelombang SDK dan platform yang mengautomasikan pemilihan model berdasarkan kependaman, kos, dan ambang keyakinan (confidence thresholds).
Pembangun yang mula mengukur kejayaan pada peringkat tugasan, menjejaki percubaan semula (retries), dan memisahkan kerja "volum" daripada "keputusan" secara jelas akan berada dalam kedudukan terbaik untuk mendapat manfaat daripada minda infrastruktur yang sedang muncul ini.
Rumusan: Stak AI sedang berubah daripada pilihan satu model kepada masalah penghalaan, di mana model pemberat terbuka yang murah mengendalikan sebahagian besar kerja dan model premium dikhaskan untuk keputusan berimpak tinggi. Menguasai penghalaan tersebut akan menjadi kelebihan daya saing seterusnya bagi pembina AI.
