Harga LLM sentiasa berubah. Suatu bulan bajet inferens anda berfungsi tepat seperti yang diramalkan; bulan berikutnya, penyedia melaraskan kadar setiap token dan perbelanjaan bulanan anda berubah tanpa sebarang permintaan tambahan yang diproses. Itulah yang baru sahaja berlaku. GMICloud, Novita, dan StreamLake semuanya telah mengemas kini harga model mereka, dan jika anda menjalankan beban kerja pengeluaran—atau pun saluran paip eksperimen—semakan ini perlu diteliti dengan mendalam. Bukan kerana pasaran sedang runtuh, tetapi kerana perbezaan kecil dalam ekonomi token akan memberi kesan besar apabila anda memproses berjuta-juta token sehari.

Siapakah Penyedia Ini

GMICloud, Novita, dan StreamLake masing-masing memainkan peranan yang berbeza dalam timbunan infrastruktur AI, tetapi kini mereka bertindih secara langsung dari segi kos menjalankan model bahasa besar.

GMICloud mengendalikan awan GPU berprestasi tinggi dan menawarkan katalog LLM hos yang semakin berkembang untuk pembangun yang mahukan akses API tanpa perlu menguruskan kluster mereka sendiri. Novita membina reputasinya melalui penyewaan GPU yang berpatutan dan penyajian model, menarik minat jurutera yang lebih menyukai model pemberat terbuka (open-weight models) dengan harga diskaun berbanding premium yang dikenakan oleh penyedia hyperscaler terbesar. StreamLake, yang berkembang daripada ekosistem awan dan media ByteDance, membawa kepakaran infrastruktur video ke dalam perlumbaan inferens dan menyediakan model melalui platform yang juga mengendalikan beban kerja pemprosesan media yang berat.

Tiada satu pun daripada mereka merupakan nama yang dikenali ramai seperti OpenAI atau Anthropic. Itulah sebabnya mengapa perubahan harga mereka sangat penting. Mereka berada dalam segmen pertengahan pasaran yang agresif, di mana margin adalah kecil, diskaun adalah biasa, dan persaingan untuk menarik pembangun adalah berterusan. Apabila tiga platform dalam segmen ini mengubah kad kadar mereka pada masa yang hampir sama, mereka secara kolektif menetapkan semula penanda aras bagi kos menjalankan model sumber terbuka atau model yang telah ditala halus (fine-tuned).

Apa Yang Berubah

Kemas kini tersebut menjejaskan harga penggunaan LLM merentasi ketiga-tiga perkhidmatan tersebut. Naren, menulis sebagai narevbot di Dev.to, mendokumentasikan butiran khusus dalam satu hantaran yang memperincikan pelarasan model demi model untuk GMICloud, Novita, dan StreamLake. Anda boleh membaca perbandingan penuh di sini.

Daripada menyebut angka sen-setiap-token yang mungkin berubah lagi sebelum anda selesai membaca perenggan ini, perkara yang paling penting ialah perubahan tersebut adalah bersifat struktural. Setiap penyedia telah mengimbangi semula cara mereka mengenakan caj untuk token, dan dalam sesetengah kes, semakan tersebut mengubah model mana yang paling murah untuk beban kerja tertentu. Ini jarang sekali merupakan kenaikan atau penurunan harga secara menyeluruh. Satu penyedia mungkin menurunkan harga input sambil menaikkan harga output. Penyedia lain mungkin tidak menyentuh model parameter kecil tetapi menaikkan kadar pada titik akhir (endpoint) konteks panjang. Oleh kerana ketiga-tiganya menyokong pelbagai kombinasi Llama, Qwen, Mistral, dan seni bina lain, kesan buruk atau manfaatnya bergantung sepenuhnya pada model mana yang anda hantar melalui API yang mana.

Mengapa Bil Anda Berubah Walaupun Trafik Kekal Sama

Untuk memahami impaknya, lihat bagaimana pengebilan LLM sebenarnya berfungsi. Anda hampir sentiasa dikenakan caj secara berasingan untuk token input dan token output, dan nisbah antara keduanya menentukan kos efektif anda. Bot sokongan pelanggan yang mengendalikan sepuluh ribu perbualan sehari mungkin puratanya menggunakan dua ribu token input dan empat ratus token output bagi setiap sembang. Dengan kadar gabungan tiga dolar bagi setiap satu juta token, itu adalah kira-kira lapan puluh empat dolar sehari. Jika penyedia menaikkan harga outputnya sebanyak dua puluh peratus sahaja, kos harian akan meningkat melebihi sembilan puluh dolar. Dalam tempoh satu suku tahun, itu adalah hampir seribu dolar perbelanjaan tambahan untuk trafik yang sama.

Skalakan perkara itu kepada saluran paip penjanaan kandungan atau sistem penjanaan dipertingkat pencarian (retrieval-augmented generation) yang mengendalikan berjuta-juta token sejam, dan penyedia yang anda pilih akan menjadi item perbelanjaan yang besar. GMICloud, Novita, dan StreamLake tahu perkara ini. Perubahan harga mereka adalah langkah kedudukan yang sengaja bertujuan untuk kes penggunaan tertentu: kerja kelompok (batch jobs) volum tinggi, aplikasi sembang kependaman rendah (low-latency), atau tugas ringkasan konteks panjang.

Kerumitan menambah satu lagi lapisan. Sesetengah platform menambah caj minimum bagi setiap permintaan, yuran pegun (idle fees) untuk throughput yang disediakan, atau caj tambahan untuk lonjakan had kadar (rate-limit bursts). Perubahan dalam caj permintaan minimum lebih menjejaskan pengguna volum rendah berbanding pengguna volum tinggi. Peralihan dalam diskaun inferens kelompok mungkin mengurangkan kos penjanaan laporan malam anda sambil membiarkan bil API masa nyata anda tidak berubah. Membaca tajuk berita “updated pricing” tidak mencukupi. Anda perlu membaca matriks tersebut.

Cara Bertindak Tanpa Bertindak Melampau

Apabila kadar berubah, kebanyakan pasukan kejuruteraan melakukan salah satu daripada dua kesilapan. Mereka sama ada mengabaikan perubahan tersebut dan menyerap lebihan kos secara diam-diam, atau mereka panik.