Tek bir araştırmacı, LLM tabanlı araştırma ajanının bir ay boyunca tükettiği her bir token'ı kaydetti ve faturadan %31 tasarruf sağladı. Harcamalar $945'tan $651'e düşerken, başarı oranı %91'den %93'e yükseldi; bu, maliyet odaklı yapay zeka iş akışları yürüten herkesin dikkatini çekecek bir sonuç.
Token düzeyindeki veriler neden önemliydi
Çoğu LLM kullanıcısı yalnızca nihai faturayı görür; bu da her bir alt görevin maliyetini gizleyen toplu bir tutardır. Araştırmacının ajanı üç temel eylem gerçekleştiriyordu: SEC dosyalarını aramak, rapor taslakları hazırlamak ve araştırma sentezlerini bir araya getirmek. Ayrıntılı veriler olmadan, Haziran ayında ödediği $312'nin verimli harcanıp harcanmadığını anlayamıyordu.
Gizli sızıntıyı ortaya çıkarmak için model adı, token sayısı, görev türü ve çağrı başına maliyeti yakalayan bir PostgreSQL günlükleme (logging) katmanı ekledi. 30 günün sonunda veriler net bir tablo çizdi:
- SEC dosyası araması – toplam harcamanın %41'i
- Rapor taslağı hazırlama – %28
- Araştırma sentezi – %17
- Kalite kontrolleri – %9
- Çeşitli – %5
Rakamlar, en pahalı adımın modelin kendisi değil, ajanın ham arama sonuçlarını istemlere (prompts) nasıl beslediği olduğunu gösteriyordu.
Tasarrufu sağlayan üç küçük değişiklik
1. İstemden önce özetleyin
Başlangıçta ajan, her bir isteme 20 ham arama sonucunu dolduruyor ve bu da girdi token sayısını büyük ölçüde artırıyordu. Önce ucuz bir özetleyici ekleyerek girdiyi kısalttı. Arama görevi başına maliyet $0,84'ten $0,19'a düştü; bu, %77'lik bir azalma demekti.
2. Basit kontrolleri daha ucuz bir modele yönlendirin
Kalite kontrolleri, kontrol başına $0,09 maliyeti olan üst düzey bir model üzerinde çalışıyordu. Çoğu geçti/kaldı (pass/fail) kontrolü için daha düşük fiyatlı bir model kullanarak kontrol başına maliyeti $0,01'e indirdi. Daha ucuz model, durumların %89'unda doğru yanıt verdi; herhangi bir hata durumunda ise süreç orijinal modele aktarılarak (escalation) doğruluk korunurken maliyet %87 oranında düşürüldü.
3. Güven oranı yüksek olduğunda kontrolleri atlayın
Görevin geçmiş başarı oranı yüksek olduğunda ve çıktı uzunluğu beklenen sınırlar içinde kaldığında, kalite kontrol adımını atlamak için bir kural ekledi. Bu, zaten çalışacak olan kontrollerin yaklaşık %60'ını ortadan kaldırdı.
Sonuçlar
Üç değişiklik uygulandıktan sonra aylık hesap dökümü şu şekildeydi:
- Toplam harcama: $945 → $651 (%31 düşüş)
- Görev başına SEC arama maliyeti: $0,84 → $0,19 (%77 düşüş)
- Görev başına kalite kontrol maliyeti: $0,09 → $0,01 (%87 düşüş)
- Genel başarı oranı: %91 → %93
Daha yüksek başarı oranı, daha kısa istemlerin gürültüyü azalttığını ve modelin temel soruya odaklanmasına yardımcı olduğunu gösteriyor.
Uyarılar ve karşı görüşler
Bu yaklaşım iki varsayıma dayanıyor. Birincisi, ucuz özetleyicinin sonraki akıl yürütme süreçleri için yeterli bilgiyi koruması gerekir; eğer kritik ayrıntıları atarsa çıktı kalitesi düşebilir. İkincisi, kalite kontrolleri için kullanılan düşük maliyetli model mükemmel değildir; %89 doğruluk oranı, hataların küçük bir kısmının hala nihai ürüne ulaştığı anlamına gelir, ancak hata aktarma yolu bunların çoğunu yakalar. Daha sıkı uyumluluk ihtiyaçları olan kullanıcıların daha dar eşik değerlerine veya ek doğrulama adımlarına ihtiyacı olabilir.
LLM uygulayıcıları için bu ne anlama geliyor
- Ayrıntılı paneller kazandırır. Üst düzey harcama raporları token israfını gizler. Kullanımı görev başına kaydetmek, aksi takdirde gizli kalacak olan verimsizlikleri ortaya çıkarır.
- En gelişmiş modeller her zaman gerekli değildir. Ucuz bir model, genel kaliteyi bozmadan verileri sıkıştırabilir veya basit ikili kararlar verebilir.
Bir LLM ajanının gizli maliyeti, genellikle yaptığı ölçülmemiş işlerdir. Araştırmacı, token akışını izleyerek ve hedeflenmiş optimizasyonlar uygulayarak, performansı artırırken $945'lık aylık faturayı $651'lik daha yalın bir operasyona dönüştürdü. Yapay zeka iş yüklerini bütçelendiren herkes için ders açık: Her bir token'ı ölçün, ardından verilerin nerede kesinti yapılacağını söylemesine izin verin.
