Novita baru-baru ini telah mengemas kini harga LLM miliknya. Bagi pasukan yang menjalankan inferens pengeluaran melalui platform tersebut, ayat itu sepatutnya mencetuskan audit segera terhadap perbelanjaan semasa anda. Perubahan kadar API jarang berlaku pada waktu yang sesuai, dan apabila ia melibatkan pelbagai peringkat model, impaknya terhadap penggunaan bulanan anda boleh menjadi lebih mendadak daripada yang dijangkakan.

Mengapa Harga Inferens Perlu Mendapat Perhatian Anda

Kebanyakan aplikasi AI moden tidak dibina di atas kluster GPU yang diuruskan sendiri. Pembangun menghalakan permintaan ke penyedia inferens seperti Novita kerana alternatifnya melibatkan perolehan perkakasan, pengurusan penggunaan vLLM atau TGI, dan pengendalian cold starts semasa lonjakan trafik. Kemudahan tersebut sangat berharga. Ia juga dikira mengikut penggunaan. Setiap token yang dijana menambah bil yang terkumpul merentasi sesi pengguna, tugasan latar belakang, dan alatan dalaman.

Apabila penyedia melaraskan harganya, kesannya akan merebak ke seluruh stack anda. Sebuah bot sembang yang mengendalikan sepuluh ribu perbualan pelanggan sehari mungkin menggunakan empat puluh juta token input dan dua belas juta token output dalam seminggu. Ubah kadar bagi setiap satu juta walaupun hanya beberapa dolar, dan perbezaan bulanan tersebut akan menjadi ketara dengan cepat. Bagi produk bootstrapped atau pasukan yang beroperasi dengan margin yang kecil, perbezaan (delta) tersebut boleh menghapuskan keuntungan. Pembantu pengekodan yang berjalan sebagai sambungan pelayar, saluran paip ringkasan berkelompok yang diproses semalaman, atau alatan carian dalaman yang membuat pertanyaan kepada model pada setiap muatan halaman, semuanya berkongsi kerentanan yang sama. Ekonomi unit mereka bergantung pada harga tepat bagi token seterusnya.

Apa yang Berubah di Novita

Novita telah memperkenalkan kos baharu yang menjejaskan model yang berbeza dalam katalognya. Syarikat tersebut tidak mengeluarkan kenaikan atau pengurangan peratusan yang seragam secara menyeluruh. Sebaliknya, pelarasan adalah berbeza mengikut model, yang bermaksud bil anda akan berubah bergantung pada titik akhir (endpoint) yang anda gunakan.

Jika aplikasi anda menghalakan semua trafik melalui satu model bahasa besar yang tunggal, pengiraan anda adalah mudah. Bandingkan kadar lama dengan kadar baharu dan unjurkan kerugian atau penjimatan. Namun, kebanyakan tetapan pengeluaran adalah lebih rumit. Pasukan sering mengekalkan logik penghalaan yang menghantar pertanyaan mudah ke model yang lebih ringan dan menyimpan model yang lebih berat untuk tugas penaakulan yang kompleks. Pasukan lain menjalankan ujian A/B merentasi beberapa model untuk membandingkan kependaman (latency) dan kualiti. Dalam senario tersebut, peralihan harga pada satu atau dua model sahaja boleh memesongkan keseluruhan struktur kos anda.

Ang