Mengapa bil melonjak
Apabila pasukan mula-mula menambah AI generatif, mereka menghantar setiap permintaan pengguna ke model terbaharu dan paling berupaya. Apabila trafik meningkat, kos setiap permintaan turut meningkat selari, dan lembaran kerja CFO menunjukkan perbelanjaan mengatasi pertumbuhan pengguna. Penyelesaian pantas yang biasa—"gunakan sahaja model yang lebih murah"—gagal dalam persekitaran produksi kerana pertanyaan yang berbeza memerlukan tahap penaakulan yang berbeza. Pemacu sebenar adalah bagaimana permintaan dihantar, bukan model mana yang sentiasa digunakan.
Membina lapisan penghalaan (routing layer) yang menjimatkan wang
Jurutera tersebut melayan perkhidmatan inferens seperti komponen produksi yang lain: tentukan peringkat (tiers), tetapkan SLA, dan laksanakan bajet kependaman (latency). Seni bina yang terhasil mempunyai empat bahagian utama yang secara kolektif memberikan pengurangan sebanyak 95%.
Penghalaan bertingkat
Bahagian hadapan (front-end) yang ringkas mengklasifikasikan setiap permintaan masuk mengikut tahap kesukaran. Kira-kira 95% pertanyaan jatuh ke dalam peringkat "murah" yang menjalankan model sederhana; hanya 5% yang paling sukar akan ditingkatkan ke model premium. Klasifikasi boleh berasaskan peraturan (contohnya, panjang teks, kehadiran kata kunci khusus domain) atau dipelajari daripada data peningkatan sejarah. Dengan menetapkan peringkat kos rendah sebagai laluan utama, kos bulanan chatbot tersebut jatuh daripada $420 kepada $28.
Penyesuaian saiz model (Model right-sizing)
Memadankan keupayaan model dengan kerumitan tugas memberikan penjimatan terbesar:
- Sembang ringkas – gunakan model ringan berbanding tawaran utama (penjimatan 97.5%).
- Klasifikasi – tukar model bersaiz sederhana kepada alternatif yang lebih murah (penjimatan 98.3%).
- Ringkasan – gantikan model peringkat teratas dengan model julat pertengahan (penjimatan 97.2%).
Nama model yang tepat tidaklah kritikal; prinsipnya adalah untuk menyimpan model yang paling berupaya sebagai simpanan bagi segelintir pertanyaan yang benar-benar memerlukannya.
Pengekalan pintar (Smart caching)
Setiap padanan cache (cache hit) menghapuskan panggilan rangkaian dan caj API. Cache Redis teragih menyimpan respons yang berjaya serta jawapan "negatif" ("Saya tidak tahu"). Apabila soalan yang tidak boleh dijawab yang sama muncul semula, sistem akan mengembalikan jawapan "Saya tidak tahu" yang telah disimpan dalam cache dan bukannya memanggil model buat kali kedua. Melalui beribu-ribu permintaan, langkah ini sahaja sudah dapat mengurangkan sebahagian besar daripada bil.
Pemampatan prompt
Prompt yang panjang meningkatkan penggunaan token, yang diterjemahkan secara langsung kepada kos. Pasukan menjalankan pengecil (summarizer) murah di bahagian klien atau dalam langkah pra-pemprosesan, mengecilkan konteks 2,000 token kepada kira-kira 400 token sebelum ia sampai ke model yang mahal. Pengurangan token ini berganda merentasi semua permintaan, memberikan penjimatan besar tanpa mengubah pengalaman pengguna akhir.
Pemprosesan berkelompok strategik (Strategic batching)
Pemprosesan berkelompok (batching) mengumpulkan beberapa permintaan bebas ke dalam satu panggilan API tunggal. Peraturan asasnya mudah: jika pengguna sedang menunggu jawapan, jangan buat batching; jika permintaan berjalan di latar belakang (laporan malam, tugasan berjadual), kelompokkan semuanya. Tugasan berkelompok waktu malam sahaja sudah dapat mengurangkan lagi 10-20% daripada perbelanjaan.
Memantau gelung pengoptimuman
Anda tidak boleh menambah baik apa yang anda tidak ukur. Jurutera tersebut menetapkan empat metrik mingguan:
- Kos setiap permintaan yang dipecahkan mengikut peringkat.
- Kadar padanan cache (cache-hit rate) untuk setiap laluan penghalaan.
- Kadar peningkatan daripada peringkat murah ke premium.
- Perbelanjaan bagi setiap segmen pelanggan.
Nombor-nombor ini mendedahkan penyimpangan (drift)—contohnya, kadar peningkatan yang meningkat mungkin menandakan logik klasifikasi terlalu agresif atau kualiti model murah telah merosot. Pasukan melakukan iterasi pada ambang (thresholds), penetapan model, dan polisi cache setiap minggu, menjadikan kawalan kos sebagai satu tabiat dan bukannya tindak balas krisis.
Rumusan
Lapisan penghalaan yang berdisiplin yang mengklasifikasikan permintaan, menyesuaikan saiz model, melakukan caching secara agresif, memampatkan prompt, dan mengelompokkan kerja latar belakang boleh mengurangkan perbelanjaan AI-API sehingga 95% sambil mengekalkan kebolehpercayaan yang tinggi. Layan timbunan (stack) inferens sebagai perkhidmatan produksi: tentukan peringkat, ukur hasil, dan lakukan iterasi setiap minggu.
