Seorang penyelidik solo merekodkan setiap token yang digunakan oleh ejen penyelidikan berasaskan LLM miliknya selama sebulan dan berjaya mengurangkan bil sebanyak 31%. Perbelanjaan menurun daripada $945 kepada $651 manakala kadar kejayaan meningkat sedikit daripada 91% kepada 93%, satu hasil yang pasti akan menarik perhatian sesiapa sahaja yang menjalankan aliran kerja AI yang sensitif terhadap kos.

Mengapa data pada tahap token itu penting

Kebanyakan pengguna LLM hanya melihat invois akhir – jumlah pukal yang menyembunyikan kos bagi setiap sub-tugasan. Ejen penyelidik tersebut melakukan tiga tindakan teras: mencari pemfailan SEC, merangka laporan, dan menyusun sintesis penyelidikan. Tanpa data terperinci, beliau tidak dapat menentukan sama ada $312 yang dibayar pada bulan Jun itu berbaloi.

Untuk mendedahkan kebocoran tersembunyi, beliau menambah lapisan log PostgreSQL yang merakam nama model, jumlah token, jenis tugasan, dan kos bagi setiap panggilan. Selepas 30 hari, data tersebut memberikan gambaran yang jelas:

  • Carian pemfailan SEC – 41% daripada jumlah perbelanjaan
  • Merangka laporan – 28%
  • Sintesis penyelidikan – 17%
  • Semakan kualiti – 9%
  • Pelbagai – 5%

Angka-angka tersebut menunjukkan bahawa langkah yang paling mahal bukanlah model itu sendiri, tetapi bagaimana ejen tersebut memasukkan hasil carian mentah ke dalam prompt.

Tiga pengubahsuaian yang memacu penjimatan

1. Ringkaskan sebelum anda membuat prompt

Pada asalnya, ejen tersebut memasukkan 20 hasil carian mentah ke dalam setiap prompt, yang menyebabkan jumlah token input meningkat dengan banyak. Beliau memasukkan alat ringkasan yang murah terlebih dahulu, sekali gus mengurangkan input tersebut. Kos bagi setiap tugasan carian turun daripada $0.84 kepada $0.19 – pengurangan sebanyak 77%.

2. Alihkan semakan mudah ke model yang lebih murah

Semakan kualiti dijalankan pada model kelas atasan yang menelan kos $0.09 bagi setiap semakan. Beliau menggantikannya dengan model yang lebih murah untuk kebanyakan semakan lulus/gagal, mengurangkan harga setiap semakan kepada $0.01. Model yang lebih murah itu menjawab dengan betul sebanyak 89% daripada masa; sebarang kegagalan akan diserahkan kepada model asal, sekali gus mengekalkan ketepatan sambil mengurangkan kos sebanyak 87%.

3. Langkau semakan apabila tahap keyakinan adalah tinggi

Beliau menambah peraturan untuk melangkau langkah semakan kualiti apabila kadar kejayaan sejarah tugasan tersebut adalah tinggi dan panjang output berada dalam julat yang dijangkakan. Ini menghapuskan kira-kira 60% semakan yang sepatutnya dijalankan.

Hasilnya

Dengan tiga perubahan tersebut, lejar bulanan kelihatan seperti ini:

  • Jumlah perbelanjaan: $945 → $651 (potongan 31%)
  • Kos carian SEC bagi setiap tugasan: $0.84 → $0.19 (potongan 77%)
  • Kos semakan kualiti bagi setiap tugasan: $0.09 → $0.01 (potongan 87%)
  • Kadar kejayaan keseluruhan: 91% → 93%

Kadar kejayaan yang lebih tinggi menunjukkan bahawa prompt yang lebih pendek mengurangkan gangguan (noise) dan membantu model fokus pada soalan teras.

Amaran dan hujah balas

Pendekatan ini bergantung kepada dua andaian. Pertama, alat ringkasan yang lebih murah mesti mengekalkan maklumat yang mencukupi untuk penaakulan seterusnya; jika ia membuang butiran kritikal, kualiti output boleh terjejas. Kedua, model kos rendah yang digunakan untuk semakan kualiti tidaklah sempurna; ketepatan 89% bermakna sebahagian kecil ralat masih akan sampai ke produk akhir, walaupun laluan eskalasi dapat menangkap kebanyakan daripadanya. Pengguna dengan keperluan pematuhan yang lebih ketat mungkin memerlukan ambang yang lebih ketat atau langkah pengesahan tambahan.

Apa maksudnya bagi pengamal LLM

  • Papan pemuka terperinci adalah pemenang. Laporan perbelanjaan peringkat tinggi menyembunyikan pembaziran token. Merekod penggunaan bagi setiap tugasan mendedahkan ketidakcekapan yang jika tidak