Üretim ortamındaki bir LLM ajanının bellek günlüğü, 2 KB'lık bir dosyadan 29.446 bayta yükselerek ajanın her çalıştırmada okuduğu token sayısını yaklaşık 500'den 7.360'a çıkardı — bu, izleme panelinde herhangi bir uyarı vermeden ortaya çıkan gizli bir giderdi. Ajanın arkasındaki geliştirici, okuma maliyetindeki bu sessiz artışın, sistem normal çalışıyor gibi görünse bile bütçeleri eritebilen bir sorun olan "ajan maliyet kayması"nın (agent cost drift) somut bir örneği olduğunu söylüyor.
Ajan maliyet kayması nedir?
Ajan maliyet kayması, bir yapay zeka ajanının rutin operasyonlarının hesaplama maliyetinde, ajanın kendi büyüyen durumu (state) nedeniyle meydana gelen kademeli artışı tanımlar. Örnekte ajan, önceki makale konularını neden reddettiğini kaydeden bir iş günlüğü dosyası tutmaktadır. Her yeni giriş, bir paragraflık bir akıl yürütme ekler ve ajan yeni içerik oluşturmadan önce dosya tamamen okunur. Günlük karesel olarak genişlediğinden —her giriş sadece kendi uzunluğunu eklemekle kalmaz, aynı zamanda önceki girişlere de atıfta bulunur— ajanın işlemesi gereken metin miktarı zamanla hızlanır.
Bu kayma ani bir sıçrama veya bir hata değildir; bileşik olarak artan doğrusal bir vergidir. Ajan hâlâ günde iki makale üretmektedir ve panelde hata görünmemektedir, ancak her çalıştırma artık bir ay önce yaklaşık 500 olan token sayısının aksine 7.360 token tüketmektedir. Çoğu LLM sağlayıcısı token başına ücret aldığı için, çalıştırma başına düşen token artışı doğrudan daha yüksek işletme maliyetlerine dönüşür.
Neden önemli?
- Bütçe etkisi – Token tabanlı fiyatlandırma, okunan her ekstra tokenın harcanan para olduğu anlamına gelir. Token sayısı 500'den 7.360'a çıktı.
Gizli mekanikler
Dosyanın büyüme modeli kilit noktadır. Sadece yeni girişleri ekleyen satır satır bir günlük doğrusal olarak artardı; ancak her giriş önceki retlerin arkasındaki mantığı açıkladığı için metin uzunluğu bileşik olarak artar. Sonuç, karesel bir büyüme eğrisidir: giriş sayısını iki katına çıkarmak, dosya boyutunu iki kattan fazla artırır ve bunu işlemek için gereken token sayısı daha da hızlı büyür.
Geliştiriciler artan maliyeti nadiren fark ederler çünkü her giriş "kendi başına mantıklıdır". Ajanın çıktısı doğru kalmaya devam eder ve günlük amacına hizmet etmeye devam ederek verimsizliği maskeler.
Azaltma stratejisi
Geliştirici, günlüğün üç aşamalı bir şekilde yeniden yapılandırılmasını öneriyor:
- Son girişler dosyası – Hemen tekrarları önlemek için gereken yalnızca son birkaç girişi içeren, aktif olarak okunan küçük bir dosya tutun.
- Kompakt indeks – Eski girişler için tek satırlık bir özet saklayın. İndeks, tam paragrafları çekmeden konu tekrarını kontrol etmek için hızlıca taranabilir.
- Arşivlenmiş tam metin – Tüm geçmiş akıl yürütme süreçlerini, ajanın normal çalışma sırasında okumayacağı ayrı bir arşiv dosyasına taşıyın.
Bu yaklaşım, ajanın konu tekrarından kaçınma yeteneğini korurken, çalıştırma başına düşen token yükünü önemli ölçüde azaltır.
Ajanlarınızdaki maliyet kaymasını nasıl tespit edersiniz?
- Token okumalarını ölçümleyin – Ajanın her çalıştığında bellek dosyasını yüklerken tükettiği token sayısını kaydedin.
- Zaman içinde takip edin – Bugünkü token sayısını bir hafta veya bir ay öncekiyle karşılaştırın. İstikrarlı bir yukarı yönlü eğilim, maliyet kaymasına işaret eder.
Dosyanın hâlâ hatasız bir şekilde yüklenip yüklenmediğini doğrulamak yetersizdir; o yüklemenin maliyetini ölçmeniz gerekir.
Bundan sonra neye dikkat edilmeli?
Ajan maliyet kayması, yapay zeka bütçenizi sessizce kemirebilen görünmez bir vergidir. Ajanın bellek dosyasını bir maliyet merkezi olarak ele alarak —token okumalarını ölçerek, büyüme eğrilerini izleyerek ve günlükleri yeniden yapılandırarak— vergiyi düşük ve çıktıyı keskin tutabilirsiniz.
Tartışmaya katılın: https://t.me/GyaanSetuAi
