Yeni bir “proaktif bellek” modülü, büyük dil modeli ajanlarının çekirdek modeli ince ayar (fine-tuning) yapmaya gerek kalmadan görev gereksinimlerini, ortam gerçeklerini ve geçmiş hataları takip etmesini sağlıyor. Kıyaslama testlerinde bu ekleme, Sonnet 4.5'in Terminal-Bench 2.0 üzerindeki puanını 8,3 yüzde puanı, τ2-Bench paketinde ise 6,8 puan artırdı; SETA ile eğitilmiş bir bellek ajanı, görülmemiş problemler üzerinde dondurulmuş bir modelin pass@1 değerini %37,6'dan %41,1'e çıkardı.

Ajanlar neden rotadan sapıyor

Bir LLM tabanlı ajan çok adımlı bir prosedürü takip ederken, dahili “durumu” bozulur. Araştırmacılar bunu “davranışsal durum bozulması” (behavioral state decay) olarak adlandırıyor: model önceki talimatları, temel gerçekleri veya halihazırda yaptığı hataları unutuyor. Sonuç, bir görevin tamamlanmadan çok önce yarıda kesilmesine neden olan bir kötü karar silsilesidir.

Alışılagelmiş çözüm, modelin tek seferde odaklanabileceği metin parçası olan bağlam penceresini (context window) genişletmektir. Bu, ancak görev pencerenin boyutunu aşana kadar yardımcı olur; eski bilgiler atılır ve bozulma yeniden başlar.

Sadece ihtiyaç duyulduğunda devreye giren bir hatırlatıcı

Yeni yaklaşım, ana modelin akıl yürütme izini takip eden ve hedefe yönelik hatırlatıcılar sunan hafif bir yardımcı bellek ajanı ekliyor. Bellek modülü, geçmiş kesitlerden oluşan statik bir liste çekmek yerine, ne zaman ve neyin sunulacağına karar vererek yalnızca ana modelin rotadan saptığı görüldüğünde harekete geçiyor.

Bellek öğrenicisi ayrı bir şekilde eğitildiği için birincil eylem modeli dondurulmuş halde kalır. Çalışma, bu ayrımın uzun vadeli kıyaslamalarda hala önemli kazanımlar sağladığını göstererek, proaktif hatırlatıcıların sınırlı bir bağlam penceresini telafi edebileceğini kanıtlıyor.

Rakamlar ne söylüyor

  • Terminal-Bench 2.0: Sonnet 4.5, temel seviyesinin (baseline) 8,3 puan üzerine çıkıyor.
  • τ2-Bench paketi: Aynı model 6,8 puan iyileşme gösteriyor.
  • Elde tutulan (held-out) testlerde Pass@1: SETA ile eğitilmiş bir bellek ajanı, dondurulmuş bir modeli %37,6'dan %41,1'e yükseltiyor.

Bu artışlar, ana modelin herhangi bir ek ince ayarı yapılmadan gerçekleşir, bu nedenle bellek bileşeni mevcut uygulamalara dahil edilebilir veya mevcut uygulamalardan çıkarılabilir.

Mevcut çalışmanın sınırları

Deneyler şu noktaları test etmekle yetinmektedir:

  • Ölçek: Bellek modülünün milyarlarca parametreli modellerle veya milyonlarca adım süren görevlerle aynı şekilde çalıştığına dair henüz bir kanıt yok.
  • Üretim maliyeti: Hatırlatıcıları depolamak ve geri çağırmak ek yük (overhead) getirir, ancak çalışma gerçek dünya sistemlerinde gereken ekstra bellek veya işlem gücünü nicel olarak belirtmiyor.

Sırada ne var

Gelecekteki kıyaslama paketlerinin ham bağlam boyutundan daha fazlasını ölçmesi gerekecek. Durum bozulmasını açıkça takip eden ve aktif hatırlatıcı sistemleri ödüllendiren testler, bir ajanın uzun vadeli güvenilirliği hakkında daha net bir tablo sunacaktır. Araştırmacılar ayrıca proaktif belleğin hem model boyutu hem de operasyonel maliyet açısından verimli bir şekilde ölçeklendiğini de göstermelidir.

Özetle: Ayrı olarak eğitilmiş küçük bir bellek modülü, büyük dil modeli ajanları için bir denetleyici görevi görerek sapmaları bir görevi aksatmadan önce yakalayabilir ve düzeltebilir.