Meta AI, komut satırı kıyaslamasında (benchmark) otonom yapay zeka asistanlarının başarı oranlarını %38'den %46'ya, çok alanlı konuşma kıyaslamasında ise %55'ten %62'ye çıkaran çift ajanlı bir bellek sistemi tanıttı. Bu artış, değişmeyen bir "eylem" (action) modelinin, görevin son adımlarını izleyen ve bağlamın kopma tehlikesi taşıdığı durumlarda devreye giren özel bir "bellek" (memory) koçu ile eşleştirilmesinden kaynaklanıyor.
Uzun süren yapay zeka görevlerindeki gizli kusur
Bir dil modeli çok adımlı bir problemi ele aldığında, her tur konuşma geçmişine daha fazla metin ekler. Modelin bir sonraki hamlesi tüm transkript tarafından yönlendirilmelidir, ancak uygulamada ilgili gerçekler gömülü kalır. Meta araştırmacıları bunu "davranışsal durum bozulması" (behavioral state decay) olarak adlandırıyor – bağlam penceresi genişledikçe ajanın amaç duygusunun kademeli olarak kaybı. Pencereyi sadece genişletmek sorunu çözmez; bilgi mevcut olabilir ancak artık modelin tahminlerini etkilemiyor olabilir.
Geleneksel bellek eklentileri bir belgeyi geri çağırır veya yanıtları kişiselleştirir. Geçmişteki bir bilginin mevcut eylemi etkileyecek kadar kritik olup olmadığına asla karar vermezler. Sonuç olarak, uzun süreli otonom ajanlar rotadan sapar, hataları tekrarlar veya etkileşimin başında belirtilen kritik bir kısıtlamayı gözden kaçırır.
Yürütmeyi denetimden ayırmak
Meta'nın cevabı, yürütme motorunu denetleyici bir bellek katmanından ayıran, tak-çalıştır bir mimaridir.
- Action Agent (Eylem Ajanı) – komutlar veren, araçları çağıran ve görünür çıktıyı üreten değiştirilmemiş bir dil modeli. Deneylerde bu model Claude Sonnet 4.5'tir.
- Memory Agent (Bellek Ajanı) – en son adımların kayan penceresini periyodik olarak gözden geçiren ikinci bir model. Denemelerde bu model Claude Opus 4.6'dır.
Bellek ajanı üç parçalı bir bellek bankası tutar:
- Private Status Field (Özel Durum Alanı) – eylem ajanının göremediği ilerleme ve risk hakkındaki dahili bayraklar (flags).
- Knowledge Memory (Bilgi Belleği) – dosya yolları, yapılandırma değerleri veya API uç noktaları gibi sabit gerçekler.
- Procedural Memory (Prosedürel Bellek) – başarısız komutlar ve bunları çözen düzeltmeler de dahil olmak üzere neyin işe yaradığına ve neyin başarısız olduğuna dair bir günlük.
Bellek ajanı tüm transkripti özetlemek yerine müdahale edip etmeyeceğine karar verir. Kritik bir detayın unutulduğunu tespit ederse kısa bir hatırlatma ekler; aksi takdirde sessiz kalarak ekstra token kullanımından ve gecikmeden kaçınır.
Kıyaslamalar konsepti kanıtlıyor
Meta sistemi iki halka açık set üzerinde test etti:
| Kıyaslama | Temel başarı | Çift ajanlı başarı |
|---|---|---|
| Terminal-Bench 2.0 (komut satırı) | %38 | %46 |
| tau2-Bench (perakende, havayolu, telekom) | %55 | %62 |
Artışlar dikkat çekicidir çünkü her iki satırda da aynı eylem modeli görünmektedir; sadece bellek katmanı değişmiştir. Anahtar kelime aramasına dayanan ve yaygın olarak kullanılan bir üretim bellek katmanı olan Mem0 ile karşılaştırıldığında, Meta'nın yaklaşımı daha iyi performans gösterdi. Simüle edilmiş bir havayolu rezervasyon senaryosunda, kullanıcı yanlış bir şekilde "Gold statüsü" iddiasında bulundu. Bellek ajanı uyumsuzluğu yakaladı, eylem modeline havayolunun API'sinden gelen doğrulanmış sadakat durumu kontrolüne güvenmesini hatırlattı ve işlem doğru şekilde ilerledi.
Endüstri neden dikkat etmeli
Sonuç, her geçen gün büyüyen modellere bağımlı olmayan bir yol haritası sunuyor. Bağlam yönetimini hafif bir denetleyiciye devrederek geliştiriciler, ana modelin parametre sayısını artırmadan onlarca adımı kapsayan görevler (yazılım hata ayıklama, karmaşık müşteri hizmetleri akışları veya otonom veri boru hatları) için güvenilirliği artırabilirler.
Otonom ajanlar inşa eden şirketler için bu mimari şunları sunar:
- Azaltılmış hata sapması – sistem, unutulan kısıtlamalara karşı aktif olarak koruma sağlar.
- Token verimliliği – müdahaleler seçicidir, bu nedenle eylem modeli daha az ilgisiz token işler.
- Modüler yükseltmeler – bellek koçu, eylem çekirdeğini yeniden eğitmeden daha yeni bir modelle değiştirilebilir.
Ödünleşimler ve açık sorular
Sırada ne var
Özet: Özel bir bellek koçu, temel akıl yürütme modelini yeniden tasarlamaya gerek kalmadan başarı oranlarında çift haneli artışlar sağlayarak davranışsal durum bozulmasını durdurabilir. Ödünleşim, eklenen sistem karmaşıklığıdır; ancak getirisi —daha güvenilir otonom ajanlar— harcanan ekstra mühendislik çabasına değebilir.
