Harga LLM adalah target yang terus berubah. Bulan ini anggaran inferensi Anda berperilaku persis seperti yang diperkirakan; bulan berikutnya, penyedia menyesuaikan tarif per tokennya dan pengeluaran bulanan Anda bergeser tanpa ada satu pun permintaan tambahan yang lewat. Itulah yang baru saja terjadi. GMICloud, Novita, dan StreamLake semuanya memperbarui harga model mereka, dan jika Anda menjalankan beban kerja produksi—atau bahkan alur kerja eksperimental—revisi ini layak untuk dicermati secara mendalam. Bukan karena pasar sedang runtuh, tetapi karena perbedaan kecil dalam ekonomi token akan terakumulasi secara brutal saat Anda memproses jutaan token setiap hari.
Siapa Penyedia Ini
GMICloud, Novita, dan StreamLake masing-masing memainkan peran yang berbeda dalam tumpukan infrastruktur AI, tetapi kini mereka bersaing langsung dalam hal biaya menjalankan model bahasa besar (LLM).
GMICloud mengoperasikan cloud GPU berperforma tinggi dan menawarkan katalog LLM yang dihosting yang terus berkembang bagi para pengembang yang menginginkan akses API tanpa harus mengelola klaster mereka sendiri. Novita membangun reputasinya di sekitar penyewaan GPU yang terjangkau dan layanan model, menarik para insinyur yang lebih menyukai model open-weight dengan harga diskon dibandingkan harga premium yang dikenakan oleh hyperscaler terbesar. StreamLake, yang tumbuh dari ekosistem cloud dan media ByteDance, membawa keahlian infrastruktur video ke dalam persaingan inferensi dan menyediakan model melalui platform yang juga menangani beban kerja pemrosesan media yang berat.
Tidak ada dari mereka yang merupakan nama populer seperti OpenAI atau Anthropic. Itulah alasan mengapa pergerakan harga mereka sangat penting. Mereka berada di tingkat menengah yang agresif di pasar, di mana margin tipis, diskon umum terjadi, dan persaingan untuk menarik pengembang berlangsung terus-menerus. Ketika tiga platform di tingkat ini mengubah daftar harga mereka pada waktu yang hampir bersamaan, mereka secara kolektif menetapkan ulang tolok ukur biaya menjalankan model open-source atau fine-tuned.
Apa yang Berubah
Pembaruan tersebut memengaruhi harga penggunaan LLM di ketiga layanan tersebut. Naren, menulis sebagai narevbot di Dev.to, mendokumentasikan rincian spesifiknya dalam sebuah postingan yang merinci penyesuaian model demi model untuk GMICloud, Novita, dan StreamLake. Anda dapat membaca perbandingan lengkapnya di sini.
Daripada menyebutkan angka sen per token yang mungkin berubah lagi sebelum Anda selesai membaca paragraf ini, poin krusialnya adalah bahwa perubahan tersebut bersifat struktural. Setiap penyedia menyeimbangkan kembali cara mereka menagih token, dan dalam beberapa kasus, revisi tersebut mengubah model mana yang paling murah untuk beban kerja tertentu. Ini jarang sekali berupa kenaikan atau penurunan harga secara menyeluruh. Satu penyedia mungkin menurunkan harga input sambil menaikkan harga output. Penyedia lain mungkin membiarkan model parameter kecil tidak berubah tetapi menaikkan tarif pada endpoint konteks panjang. Karena ketiganya mendukung berbagai kombinasi Llama, Qwen, Mistral, dan arsitektur lainnya, dampak atau manfaatnya sepenuhnya bergantung pada model mana yang Anda arahkan melalui API mana.
Mengapa Tagihan Anda Berubah Meskipun Trafik Tetap Stabil
Untuk memahami dampaknya, lihatlah bagaimana penagihan LLM sebenarnya bekerja. Anda hampir selalu ditagih secara terpisah untuk token input dan token output, dan rasio di antara keduanya menentukan biaya efektif Anda. Bot dukungan pelanggan yang menangani sepuluh ribu percakapan sehari mungkin rata-rata menggunakan dua ribu token input dan empat ratus token output per chat. Dengan harga gabungan tiga dolar per satu juta token, itu berarti sekitar delapan puluh empat dolar per hari. Jika penyedia menaikkan harga outputnya hanya sebesar dua puluh persen, biaya harian akan melonjak melampaui sembilan puluh dolar. Dalam satu kuartal, itu berarti tambahan pengeluaran hampir seribu dolar untuk trafik yang identik.
Tingkatkan skala tersebut ke alur kerja pembuatan konten atau sistem retrieval-augmented generation yang menangani jutaan token per jam, dan penyedia yang Anda pilih menjadi pos pengeluaran yang serius. GMICloud, Novita, dan StreamLake mengetahui hal ini. Perubahan harga mereka adalah langkah pemosisian yang disengaja yang ditujukan untuk kasus penggunaan tertentu: pekerjaan batch bervolume tinggi, aplikasi chat latensi rendah, atau tugas ringkasan konteks panjang.
Kompleksitas menambah lapisan lainnya. Beberapa platform menambahkan biaya minimum per permintaan, biaya idle untuk throughput yang disediakan, atau biaya tambahan untuk lonjakan batas kecepatan (rate-limit bursts). Perubahan pada biaya minimum permintaan jauh lebih merugikan pengguna bervolume rendah dibandingkan pengguna bervolume tinggi. Pergeseran dalam diskon inferensi batch mungkin memotong biaya pembuatan laporan malam Anda sambil membiarkan tagihan API real-time Anda tidak berubah. Membaca judul "pembaruan harga" saja tidak cukup. Anda harus membaca matriksnya.
Cara Merespons Tanpa Bereaksi Berlebihan
Ketika tarif berubah, sebagian besar tim engineering melakukan salah satu dari dua kesalahan. Mereka entah mengabaikan perubahan tersebut dan secara diam-diam menanggung pembengkakan biaya, atau mereka panik.
