Agen berbasis LLM Anda mungkin berjalan sempurna dalam demo, lalu melambat dan membengkakkan tagihan setelah beberapa kali interaksi. Penyebab tersembunyinya bukanlah model yang tidak stabil—melainkan token drift, yaitu pembengkakan prompt secara bertahap yang harus diproses model setiap saat.

Token drift terjadi ketika setiap interaksi menambah lebih banyak teks ke dalam konteks input model. Riwayat percakapan, skema alat (tool schemas), respons API, dan dokumen yang diambil semuanya menumpuk, sehingga setiap panggilan berikutnya membawa payload yang lebih besar. Karena waktu pemrosesan dan harga model meningkat seiring dengan jumlah token input, biayanya melonjak secara kuadratik alih-alih linear.

Mengapa masalah ini muncul di produksi, bukan di demo

Implementasi nyata menyimpan segalanya: setiap ucapan pengguna, setiap output alat, setiap potongan pengetahuan yang diambil. Akumulasi ini tetap tersembunyi sampai latensi melonjak dan tagihan datang.

Sumber umum token drift

  • Transkrip berulang – Menyimpan setiap pesan lama di dalam prompt alih-alih meringkas atau membuangnya.
  • Skema alat yang berat – Mengirimkan definisi JSON yang besar untuk kapabilitas alat pada setiap giliran.
  • Hasil alat yang besar – Menyertakan respons API lengkap atau baris database yang berisi lebih banyak data daripada yang sebenarnya dibutuhkan agen.
  • Pembengkakan RAGRetrieval-augmented generation (RAG) yang menambahkan banyak potongan dokumen, yang beberapa di antaranya sudah usang atau tidak relevan.
  • Memori duplikat – Menggabungkan ringkasan, objek status (state object), dan transkrip mentah secara bersamaan, yang mengulang informasi yang sama sebanyak tiga kali.

Masing-masing hal ini menambah token yang tidak memberikan kekuatan penalaran baru, namun justru membengkakkan ukuran prompt.

Cara menjaga anggaran token tetap terkendali

1. Gunakan desain konteks berlapis

  • Instruksi stabil – Letakkan prompt sistem dan aturan keamanan di bagian atas dan gunakan referensi alih-alih mengirimkannya kembali di setiap giliran.
  • Status terstruktur – Simpan representasi ringkas dari tujuan, keputusan, dan pengenal (identifiers) yang dapat dibaca agen dengan cepat.
  • Riwayat terkompresi – Ringkas giliran lama dalam paragraf pendek yang mudah dibaca manusia, dan perbarui hanya saat ambang batas tercapai.
  • Giliran terbaru – Sertakan beberapa pesan terakhir secara verbatim untuk menjaga kontinuitas.

Memisahkan teks konstan dari konten yang dapat diringkas mencegah Anda mengirim ulang kata-kata yang sama berulang kali.

2. Pangkas output alat

  • Ekstrak hanya bidang (fields) yang benar-benar digunakan agen; hapus deskripsi yang bertele-tele.
  • Ganti hasil yang besar dengan ringkasan singkat atau ID referensi, dan simpan seluruh payload di database, cache, atau blob store.
  • Saat sebuah alat mengembalikan daftar, kirimkan hanya N item teratas yang penting untuk keputusan saat ini.

3. Terapkan peringkasan cerdas

  • Lewati peringkasan setelah setiap giliran; pemrosesan ekstra akan menambah beban (overhead).
  • Perbarui ringkasan hanya ketika akumulasi jumlah token dari giliran lama melewati batas yang telah ditentukan.
  • Simpan fakta penting—ID, jumlah, stempel waktu (timestamps)—dalam penyimpanan terstruktur alih-alih menyematkannya dalam prosa, agar ringkasan tetap pendek.

4. Pantau metrik yang tepat

  • Catat penggunaan token per panggilan model, bukan hanya per permintaan pengguna. Ini akan mengungkap pertumbuhan tersembunyi pada sisi input.
  • Pantau jumlah token input yang ditambahkan setiap giliran; lonjakan mendadak menunjukkan sumber drift.
  • Pisahkan token yang di-cache (digunakan kembali dari panggilan sebelumnya) dari token yang baru dibuat; hanya token yang pertama yang memicu drift.

Perlakukan prompt sebagai sumber daya yang terbatas, bukan transkrip yang tak terbatas. Dengan mengukur, meringkas, dan memangkas secara sengaja, Anda menjaga agen LLM tetap cepat, terjangkau, dan siap untuk skala produksi.

Kesimpulan: Token drift secara diam-diam meningkatkan biaya dan memperlambat agen. Identifikasi bagian prompt yang terus membengkak, kompres atau eksternalisasi bagian tersebut, dan pantau penggunaan token per panggilan. Pendekatan yang disiplin mengubah kejutan tagihan yang tidak terduga menjadi operasi yang dapat dikelola dan ramah anggaran.