Seorang peneliti mandiri mencatat setiap token yang dikonsumsi oleh agen riset berbasis LLM miliknya selama sebulan dan berhasil memangkas tagihan sebesar 31%. Pengeluaran turun dari $945 menjadi $651, sementara tingkat keberhasilan sedikit meningkat dari 91% menjadi 93%, sebuah hasil yang akan diperhatikan oleh siapa pun yang menjalankan alur kerja AI yang sensitif terhadap biaya.
Mengapa data tingkat token itu penting
Sebagian besar pengguna LLM hanya melihat tagihan akhir – sebuah jumlah total yang menyembunyikan biaya dari setiap sub-tugas. Agen milik peneliti tersebut melakukan tiga tindakan inti: mencari dokumen SEC, menyusun draf laporan, dan merangkai sintesis riset. Tanpa data granular, ia tidak bisa mengetahui apakah $312 yang ia bayarkan pada bulan Juni telah digunakan dengan baik.
Untuk mengungkap kebocoran tersembunyi tersebut, ia menambahkan lapisan logging PostgreSQL yang menangkap nama model, jumlah token, jenis tugas, dan biaya per panggilan. Setelah 30 hari, data tersebut memberikan gambaran yang jelas:
- Pencarian dokumen SEC – 41% dari total pengeluaran
- Penyusunan draf laporan – 28%
- Sintesis riset – 17%
- Pemeriksaan kualitas – 9%
- Lain-lain – 5%
Angka-angka tersebut menunjukkan bahwa langkah termahal bukanlah model itu sendiri, melainkan bagaimana agen memasukkan hasil pencarian mentah ke dalam prompt.
Tiga penyesuaian yang mendorong penghematan
1. Ringkas sebelum membuat prompt
Awalnya, agen memasukkan 20 hasil pencarian mentah ke dalam setiap prompt, yang membengkakkan input dengan jumlah token yang besar. Ia memasukkan peringkas murah terlebih dahulu, sehingga memangkas input. Biaya per tugas pencarian turun dari $0,84 menjadi $0,19 – sebuah pengurangan sebesar 77%.
2. Arahkan pemeriksaan sederhana ke model yang lebih murah
Pemeriksaan kualitas awalnya dijalankan pada model kelas atas yang berbiaya $0,09 per pemeriksaan. Ia menggantinya dengan model berharga lebih rendah untuk sebagian besar pemeriksaan lulus/gagal, sehingga memotong harga per pemeriksaan menjadi $0,01. Model yang lebih murah menjawab dengan benar dalam 89% kasus; kegagalan apa pun akan diteruskan ke model asli, sehingga menjaga akurasi sambil memangkas biaya sebesar 87%.
3. Lewati pemeriksaan saat tingkat kepercayaan tinggi
Ia menambahkan aturan untuk melewati langkah pemeriksaan kualitas kapan pun tingkat keberhasilan historis tugas tersebut tinggi dan panjang output berada dalam batas yang diharapkan. Hal ini mengeliminasi sekitar 60% pemeriksaan yang sebenarnya tidak perlu dijalankan.
Hasilnya
Dengan tiga perubahan tersebut, catatan bulanan menjadi seperti ini:
- Total pengeluaran: $945 → $651 (pemangkasan 31%)
- Biaya pencarian SEC per tugas: $0,84 → $0,19 (pemangkasan 77%)
- Biaya pemeriksaan kualitas per tugas: $0,09 → $0,01 (pemangkasan 87%)
- Tingkat keberhasilan keseluruhan: 91% → 93%
Tingkat keberhasilan yang lebih tinggi menunjukkan bahwa prompt yang lebih pendek mengurangi noise dan membantu model fokus pada pertanyaan inti.
Peringatan dan poin sanggahan
Pendekatan ini bergantung pada dua asumsi. Pertama, peringkas yang lebih murah harus tetap mempertahankan informasi yang cukup untuk penalaran lanjutan; jika ia membuang detail penting, kualitas output bisa menurun. Kedua, model berbiaya rendah yang digunakan untuk pemeriksaan kualitas tidaklah sempurna; akurasinya yang sebesar 89% berarti sebagian kecil kesalahan masih dapat mencapai produk akhir, meskipun jalur eskalasi dapat menangkap sebagian besar dari kesalahan tersebut. Pengguna dengan kebutuhan kepatuhan yang lebih ketat mungkin memerlukan ambang batas yang lebih ketat atau langkah validasi tambahan.
Apa artinya ini bagi praktisi LLM
- Dasbor granular adalah pemenangnya. Laporan pengeluaran tingkat tinggi menyembunyikan pemborosan token. Mencatat penggunaan per tugas mengungkap inefisiensi yang jika tidak dilakukan akan tetap tersembunyi.
- Model frontier tidak selalu diperlukan. Model murah dapat mengompresi data atau membuat keputusan biner sederhana tanpa mengorbankan kualitas secara keseluruhan.
Biaya tersembunyi dari agen LLM sering kali adalah pekerjaan tidak terukur yang dilakukannya. Dengan menginstrumentasi aliran token dan menerapkan optimasi yang ditargetkan, peneliti tersebut mengubah tagihan bulanan $945 menjadi operasional yang lebih ramping seharga $651 sambil meningkatkan performa. Bagi siapa pun yang menyusun anggaran beban kerja AI, pelajarannya jelas: ukur setiap token, lalu biarkan data menentukan di mana harus melakukan pemangkasan.
