Microsoft telah menambah tier AI Gateway khusus kepada Azure API Management (APIM). Langkah ini menandakan bahawa panggilan LLM kini dianggap sebagai beban kerja yang berasingan, bukan sekadar titik akhir API yang lain.

Mengapa trafik LLM merosakkan gateway klasik

Satu prompt boleh menelan kos seratus kali ganda lebih tinggi daripada yang lain, namun gateway API standard melihat kedua-duanya sebagai satu permintaan tunggal. Gateway tersebut mengira jumlah panggilan, bukannya bilangan token yang diproses oleh model. Permintaan yang menghantar beberapa ratus token dan satu lagi yang menghantar beribu-ribu token menghasilkan metrik jumlah permintaan yang serupa, walaupun yang terakhir boleh menelan kos berkali-kali ganda lebih tinggi.

Empat fakta menjadikan had berasaskan permintaan tidak berguna untuk AI:

  • Kos ≠ jumlah permintaan. Pengebilan terikat pada token, bukan berapa banyak panggilan HTTP yang anda buat.
  • Isipadu token berubah secara drastik. Satu pertanyaan mungkin merupakan soalan pendek; satu lagi mungkin merangkumi dokumen yang panjang.
  • Pilihan model mengubah harga. LLM yang berbeza mengenakan kadar yang berbeza bagi setiap token.
  • Penstriman menyembunyikan bil akhir. Apabila respons distrim, jumlah token tidak diketahui sehingga penstriman tamat.

Jika anda terus mengukur permintaan sahaja, anda akan berakhir dengan data pemantauan yang tidak memberitahu apa-apa tentang perbelanjaan sebenar.

Apa yang diubah oleh tier AI Gateway

Kebanyakan polisi yang diperlukan untuk mengawal penggunaan token sudah pun wujud dalam tier APIM standard—ditulis sebagai peraturan XML dan dipaparkan pada papan pemuka tersuai. Tier AI menggabungkan keupayaan yang sama itu ke dalam pengalaman yang dibina khusus:

  • Pengasingan penskalaan untuk trafik AI.
  • Konfigurasi yang dipermudahkan yang menghapuskan keperluan untuk polisi XML yang dibuat secara manual.

Peralihan teras adalah dari segi operasi: anda tidak lagi perlu menulis kod yang kompleks atau menyelenggara papan pemuka berasingan untuk menguatkuasakan bajet token. Tier ini menyediakan antara muka sedia ada untuk kawalan tersebut.

Bila perlu bertukar – panduan berasaskan trafik

  • AI hanyalah sebahagian kecil daripada trafik anda. Teruskan menggunakan tier APIM sedia ada dan tambah polisi token jika anda memerlukan kawalan yang terperinci.
  • AI mendominasi panggilan anda. Beralih ke tier AI untuk mengasingkan penskalaan dan mengekalkan tadbir urus kos yang kemas.
  • Anda ingin mengelakkan beban kerja kejuruteraan (engineering overhead). Alat terbina dalam tier ini menghapuskan masa yang dihabiskan untuk membina dan menyelenggara polisi tersuai.

Perbelanjaan terbesar bukanlah harga langganan; ia adalah jam kejuruteraan yang dihabiskan untuk menampal jurang dalam gateway generik supaya ia dapat memahami ekonomi token.

Pelan tindakan fasa pratonton (preview)

Microsoft masih menawarkan tier AI dalam fasa pratonton. Anggap ia sebagai tapak ujian, bukan pelancaran produksi.

  1. Pilih beban kerja AI dalaman yang bervolume tinggi. Pilih perkhidmatan yang menjana trafik token paling banyak.
  2. Lalukan beban kerja tersebut melalui tier AI. Gunakan konfigurasi baharu untuk menangkap penggunaan token bagi setiap pengguna.
  3. Kumpul data perbelanjaan token selama beberapa minggu. Bandingkan jumlah token dan kos berkaitan dengan pemantauan sedia ada anda.
  4. Gunakan garis dasar (baseline) untuk maklumat belanjawan. Tentukan sama ada manfaat kawalan kos tier tersebut mengatasi had fasa pratontonnya.

Jangan pindahkan beban kerja produksi yang kritikal kepada perkhidmatan pratonton sehingga ia mencapai ketersediaan umum (general availability).

Pandangan balas: tidak semua orang memerlukan tier berasingan

Jika organisasi anda hanya melakukan panggilan sekali-sekala ke LLM, kos tambahan tier AI mungkin tidak berbaloi. Anda boleh mencapai tadbir urus tahap token dengan rangka kerja polisi sedia ada, walaupun dengan lebih banyak usaha manual. Tier ini sangat berguna apabila trafik AI merupakan bahagian yang besar dan semakin berkembang dalam permukaan API anda.

Kesimpulan

Tier AI Gateway mengakui bahawa trafik LLM berkelakuan secara fundamental berbeza daripada panggilan API tradisional. Dengan beralih daripada pengiraan permintaan kepada tadbir urus berasaskan token, ia memberikan cara praktikal kepada pembangun untuk mengawal perbelanjaan AI tanpa lemas dalam kod tersuai. Bagi pasukan yang penggunaan AI mereka sudah besar—atau dijangka berkembang—menguji fasa pratonton sekarang dapat membantu membina garis dasar perbelanjaan token.