Log memori ejen LLM pengeluaran berkembang daripada fail 2 KB kepada 29,446 bait, menyebabkan jumlah token yang dibaca oleh ejen meningkat daripada kira-kira 500 kepada 7,360 bagi setiap larian — satu perbelanjaan tersembunyi yang muncul tanpa sebarang amaran pada papan pemuka pemantauan. Pembangun di sebalik ejen tersebut menyatakan bahawa kenaikan kos pembacaan yang senyap ini adalah contoh nyata bagi “agent cost drift,” satu masalah yang boleh menghakis bajet walaupun sistem kelihatan berfungsi seperti biasa.
Apakah itu agent cost drift?
Agent cost drift menerangkan peningkatan beransur-ansur dalam kos pengkomputeran operasi rutin ejen AI, yang disebabkan oleh keadaan (state) ejen itu sendiri yang semakin berkembang. Dalam contoh ini, ejen tersebut menyelenggara fail log kerja yang merekodkan sebab ia menolak topik artikel sebelum ini. Setiap entri baharu menambah satu perenggan penaakulan, dan fail tersebut dibaca sepenuhnya sebelum ejen menjana kandungan baharu. Oleh kerana log tersebut berkembang secara kuadratik — setiap entri bukan sahaja menambah panjangnya sendiri tetapi juga merujuk kepada entri terdahulu — jumlah teks yang perlu diproses oleh ejen meningkat dengan lebih pantas dari semasa ke semasa.
Penyimpangan ini bukanlah lonjakan atau kegagalan; ia adalah "cukai" linear yang terkumpul. Ejen tersebut masih menghasilkan dua artikel sehari, dan papan pemuka tidak menunjukkan sebarang ralat, namun setiap larian kini menggunakan 7,360 token, berbanding kira-kira 500 sebulan yang lalu. Memandangkan kebanyakan penyedia LLM mengenakan caj mengikut token, peningkatan token bagi setiap larian diterjemahkan secara langsung kepada kos operasi yang lebih tinggi.
Mengapa ia penting
- Impak bajet – Harga berasaskan token bermakna setiap token tambahan yang dibaca adalah wang yang dibelanjakan. Jumlah token meningkat daripada 500 kepada 7,360.
Mekanisme tersembunyi
Corak pertumbuhan fail tersebut adalah kunci utama. Log baris demi baris yang hanya menambah entri baharu akan meningkat secara linear, tetapi kerana setiap entri menjelaskan penaakulan di sebalik penolakan terdahulu, panjang teks tersebut akan terkumpul. Hasilnya ialah lengkung pertumbuhan kuadratik: menggandakan jumlah entri akan menggandakan saiz fail lebih daripada dua kali ganda, dan jumlah token yang diperlukan untuk memprosesnya berkembang dengan lebih pantas lagi.
Pembangun jarang menyedari peningkatan kos ini kerana setiap entri “muncul masuk akal dengan sendirinya.” Output ejen kekal betul, dan log tersebut terus menjalankan fungsinya, sekali gus menyembunyikan ketidakcekapan tersebut.
Strategi mitigasi
Pembangun mencadangkan penyusunan semula log dalam tiga bahagian:
- Fail entri terbaharu – Simpan fail kecil yang dibaca secara aktif yang hanya mengandungi beberapa entri terbaharu yang diperlukan untuk mengelakkan pengulangan serta-merta.
- Indeks padat – Simpan ringkasan satu baris untuk entri lama. Indeks tersebut boleh diimbas dengan cepat untuk menyemak pertindihan topik tanpa perlu menarik keseluruhan perenggan.
- Teks penuh arkib – Pindahkan keseluruhan penaakulan sejarah ke fail arkib berasingan yang tidak dibaca oleh ejen semasa operasi normal.
Pendekatan ini mengekalkan keupayaan ejen untuk mengelakkan pengulangan topik sambil mengurangkan beban token bagi setiap larian secara drastik.
Cara mengesan cost drift dalam ejen anda
- Pantau pembacaan token – Rekodkan jumlah token yang digunakan oleh ejen semasa memuatkan fail memorinya setiap kali ia berjalan.
- Pantau mengikut masa – Bandingkan jumlah token hari ini dengan jumlah dari seminggu atau sebulan yang lalu. Trend peningkatan yang stabil menandakan adanya penyimpangan.
Sekadar mengesahkan bahawa fail masih boleh dimuatkan tanpa ralat adalah tidak mencukupi; anda mesti mengukur kos muatan tersebut.
Apa yang perlu diperhatikan seterusnya
Agent cost drift adalah cukai halimunan yang boleh menghakis bajet AI anda secara senyap. Dengan menganggap fail memori ejen sebagai pusat kos — mengukur pembacaan token, memerhatikan lengkung pertumbuhan, dan menyusun semula log — anda boleh mengekalkan cukai yang rendah dan output yang tajam.
Sertai perbincangan: https://t.me/GyaanSetuAi
