Bil perkhidmatan AI kami melonjak kepada $31,000 bulan ini—lebih tiga kali ganda daripada jumlah yang kami bajetkan—kerana satu baris kod menghantar kira-kira 80% trafik kami ke model yang paling mahal, GPT-4o.
Mengapa bil melonjak
Kami membina sistem ini untuk kebolehpercayaan: respons pantas, masa henti sifar, penskalaan lancar. Pilihan tersebut telah mewujudkan "kebocoran memori" (memory leak) klasik dalam penggunaan token—token terus dibelanjakan pada model yang sebenarnya berlebihan untuk kebanyakan interaksi.
Peralihan kejuruteraan: kos sebagai kebimbangan seni bina
Menganggap perbelanjaan AI sebagai masalah kewangan menyembunyikan pemacu sebenar: kod yang menentukan model mana yang menjalankan setiap permintaan. Memindahkan pemilihan model ke dalam lapisan penghalaan (routing layer) telah menukarkan perbelanjaan tersembunyi kepada pemboleh ubah yang boleh dikawal.
1. Padankan model dengan tugasan
Peraturannya mudah: gunakan model terkecil yang memenuhi keperluan kualiti. Kami memetakan empat jenis permintaan biasa kepada alternatif yang lebih murah:
- Sembang ringkas → DeepSeek V4 Flash (jimat 97.5%)
- Klasifikasi → Qwen3-8B (jimat 98.3%)
- Penjanaan kod → DeepSeek Coder (jimat 97.5%)
- Ringkasan → Qwen3-32B (jimat 97.2%)
Peratusan tersebut mencerminkan jurang harga token secara langsung antara model yang dipilih dengan GPT-4o. Imbalannya adalah sedikit penurunan dalam keupayaan bagi tugasan yang tidak memerlukan penaakulan tahap tinggi.
2. Penghalaan bertingkat, seperti CDN
Kami membina penghala dua peringkat yang menghantar setiap permintaan ke model murah terlebih dahulu. Jika respons gagal dalam pemeriksaan kualiti pantas—tahap keyakinan di bawah ambang atau entiti yang diperlukan hilang—kami akan menghalakan semula permintaan tersebut secara automatik ke model peringkat lebih tinggi. Mekanisme sandaran (fallback) ini mengekalkan pengalaman pengguna sambil hanya mengenakan caj model premium apabila benar-benar diperlukan.
3. Simpan cache prom yang berulang
Banyak interaksi menggunakan semula prom sistem atau teks FAQ yang sama. Dengan menyimpan cache output tersebut, kami dapat mengelakkan pengiraan semula respons yang serupa. Cache dalam memori (in-memory cache) mengurangkan kos prom berulang sebanyak kira-kira 30% dalam ujian kami.
4. Mampatkan prom sebelum dihantar
Prom sistem yang panjang menggunakan token pada kadar yang sama dengan kandungan pengguna. Kami menambah pra-pemproses yang menjalankan peringkas (summarizer) murah pada prom tersebut, memotongnya kepada konteks penting sebelum menghantarnya ke model yang mahal. Langkah itu sahaja telah menjimatkan beribu-ribu dolar setahun dalam perbelanjaan token.
Impak dunia nyata
Sebuah chatbot sebelum ini menelan kos $420 / bulan. Selepas menghalakan 85% daripada pertanyaan ke model yang lebih murah dan menggunakan caching, bil tersebut turun kepada $28. Latensi bertambah baik kerana model yang lebih ringan memberikan respons lebih pantas, dan laluan sandaran jarang dicetuskan.
Kesimpulan
Anggap perbelanjaan AI sebagai keputusan seni bina utama. Halakan permintaan ke model yang sesuai, tambah sandaran berasaskan kualiti, simpan cache prom berulang, dan mampatkan input—anda boleh memotong kos sambil mengekalkan kebolehpercayaan.
