Mengapa tagihan membengkak
Saat tim pertama kali menambahkan AI generatif, mereka mengirimkan setiap permintaan pengguna ke model terbaru dan paling mumpuni. Seiring bertambahnya trafik, biaya per permintaan naik secara beriringan, dan spreadsheet CFO menunjukkan pengeluaran yang melampaui pertumbuhan pengguna. Solusi cepat yang biasa dilakukan—"gunakan saja model yang lebih murah"—gagal dalam tahap produksi karena kueri yang berbeda membutuhkan tingkat penalaran yang berbeda pula. Tuas utamanya adalah bagaimana permintaan dikirim, bukan model mana yang selalu digunakan.
Membangun lapisan perutean (routing layer) yang menghemat biaya
Insinyur tersebut memperlakukan layanan inferensi seperti komponen produksi lainnya: tentukan tingkatan (tiers), tetapkan SLA, dan terapkan anggaran latensi. Arsitektur yang dihasilkan memiliki empat bagian yang bekerja bersama untuk memberikan pengurangan biaya sebesar 95%.
Perutean bertingkat (Tiered routing)
Sebuah front-end yang ringan mengklasifikasikan setiap permintaan yang masuk berdasarkan tingkat kesulitan. Sekitar 95% kueri masuk ke tingkatan "murah" yang menjalankan model sederhana; hanya 5% yang tersulit yang dieskalasi ke model premium. Klasifikasi dapat berbasis aturan (misalnya, panjang teks, keberadaan kata kunci spesifik domain) atau dipelajari dari data eskalasi historis. Dengan mengutamakan tingkatan berbiaya rendah, biaya bulanan chatbot turun dari $420 menjadi $28.
Penyesuaian ukuran model (Model right-sizing)
Menyesuaikan kemampuan model dengan kompleksitas tugas memberikan penghematan terbesar:
- Chat sederhana – gunakan model ringan alih-alih penawaran unggulan (hemat 97,5%).
- Klasifikasi – tukar model ukuran menengah dengan alternatif yang lebih murah (hemat 98,3%).
- Peringkasan – ganti model tingkat atas dengan model kelas menengah (hemat 97,2%).
Nama model yang tepat tidaklah krusial; prinsipnya adalah menyimpan model yang paling mumpuni sebagai cadangan untuk sedikit kueri yang benar-benar membutuhkannya.
Caching cerdas (Smart caching)
Setiap cache hit menghilangkan panggilan jaringan dan biaya API. Cache Redis terdistribusi menyimpan respons yang berhasil maupun jawaban "negatif" ("Saya tidak tahu"). Ketika pertanyaan yang tidak dapat dijawab yang sama muncul kembali, sistem mengembalikan jawaban "Saya tidak tahu" yang tersimpan di cache alih-alih memanggil model untuk kedua kalinya. Melalui ribuan permintaan, hal ini saja sudah memangkas sebagian besar tagihan.
Kompresi prompt
Prompt yang panjang mendorong penggunaan token, yang secara langsung berdampak pada biaya. Tim menjalankan peringkas murah di sisi klien atau dalam langkah pra-pemrosesan, memperkecil konteks 2.000 token menjadi sekitar 400 token sebelum mencapai model yang mahal. Pengurangan token ini berlipat ganda di seluruh permintaan, memberikan penghematan besar tanpa mengubah pengalaman pengguna akhir.
Batching strategis (Strategic batching)
Batching mengelompokkan beberapa permintaan independen ke dalam satu panggilan API tunggal. Aturan praktisnya sederhana: jika pengguna sedang menunggu jawaban, jangan lakukan batching; jika permintaan berjalan di latar belakang (laporan malam hari, pekerjaan terjadwal), lakukan batching untuk semuanya. Pekerjaan batch di malam hari saja sudah memangkas 10-20% pengeluaran lainnya.
Memantau siklus optimasi
Anda tidak bisa memperbaiki apa yang tidak Anda ukur. Insinyur tersebut menetapkan empat metrik mingguan:
- Biaya per permintaan yang dirinci berdasarkan tingkatan.
- Tingkat cache-hit untuk setiap jalur perutean.
- Tingkat eskalasi dari tingkatan murah ke premium.
- Pengeluaran per segmen pelanggan.
Angka-angka ini menunjukkan adanya penyimpangan (drift)—misalnya, meningkatnya tingkat eskalasi mungkin menandakan bahwa logika klasifikasi terlalu agresif atau kualitas model murah telah menurun. Tim melakukan iterasi pada ambang batas, penetapan model, dan kebijakan cache setiap minggu, mengubah pengendalian biaya menjadi sebuah kebiasaan, bukan sekadar respons terhadap krisis.
Kesimpulan
Lapisan perutean yang disiplin yang mengklasifikasikan permintaan, menyesuaikan ukuran model, melakukan caching secara agresif, mengompresi prompt, dan melakukan batching pada pekerjaan latar belakang dapat memangkas pengeluaran AI-API hingga 95% sambil tetap menjaga keandalan yang tinggi. Perlakukan tumpukan (stack) inferensi sebagai layanan produksi: tentukan tingkatan, ukur hasil, dan lakukan iterasi setiap minggu.
