Yeni bir kıyaslama, RAM tabanlı bir scratchpad ile yerel bir SQLite-vec kasasının (vault) birleşiminden oluşan iki katmanlı bir bellek tasarımının, popüler bir bulut vektör deposuna bağlı olan aylık 135 dolarlık faturayı ortadan kaldırırken, medyan sorgu sürelerini 100 ms'nin altına düşürdüğünü gösteriyor. Otonom yapay zeka ajanları geliştiren yazılımcılar, kıyaslamada daha hızlı çalışan ve aylık maliyeti olmayan tamamen yerel (on-premise) bir kurulum çalıştırabilirler.

Mevcut bellek yaklaşımları neden yetersiz kalıyor

Yapay zeka ajanlarının genellikle dar bir yanıt penceresi içinde binlerce geçmiş etkileşimi, bilgiyi veya araç çağrısı (tool-call) sonucunu hatırlaması gerekir. Çoğu ekip, her bir embedding'i yönetilen bir vektör veritabanına aktarır ve her arama için uzak vektör aramasına güvenir. Bu model ölçeklenebilir, ancak her sorguyu ağ üzerinden geçmeye zorlayarak gidiş-dönüş süresini ve aylık harcamayı artırır. Kıyaslamada, bulut hizmetinin medyan gecikmesi 127 ms olarak ölçülmüş ve aylık fatura 135 doları aşmıştır; ayrıca test süresince bir kesinti de kaydedilmiştir.

Belleği iki katmana ayırmak

İki katmanlı mimari, "çalışma belleğini" (working memory) "uzun süreli depolamadan" (long-term storage) ayırır:

L1 Scratchpad (RAM)

  • Tamamen işlem belleğinde (process memory) yaşar.
  • Mevcut görev bağlamını ve en son araç çağrılarını tutar.
  • Ham dizeleri (raw strings) saklar; herhangi bir embedding oluşturulmaz.
  • Sonuçları 3 ms'nin altında, bir CPU önbelleğiyle (cache) kıyaslanabilir hızda döndürür.

L2 Vault (SQLite-vec)

  • Diğer tüm embedding'leri, vektör arama yetenekleriyle genişletilmiş yerel bir SQLite veritabanında saklar.
  • Kıyaslamada kullanılan 14.726 belleğin tamamını yönetir.
  • Eşleşmeleri yaklaşık 94 ms içinde döndürür; bu da birçok gerçek zamanlı ajan için 100 ms'lik hedefin oldukça altındadır.
  • Ana makinenin depolama alanı dışında hiçbir maliyeti yoktur.

SQLite-vec, standart bir ilişkisel dosyaya yaklaşık en yakın komşu (approximate nearest-neighbor) araması ekleyen açık kaynaklı bir eklentidir. Veritabanı ajanla aynı makinede bulunduğu için ağ üzerinden bir geçiş (network hop) gerekmez ve motor, aramaları hızlı tutmak için mevcut SQLite indeksleme yöntemlerini yeniden kullanır.

Önemli rakamlar

Sistem Medyan gecikme Aylık maliyet Bildirilen güvenilirlik
Bulut vektör deposu (Pinecone) 127 ms ~$135 Kesintiler gözlemlendi
Yerel SQLite-vec kasası (vault) 94 ms $0 %100 çalışma süresi

Maliyet farkı, aylık yaklaşık 135 dolara karşı 0 dolardır.

Kasayı düzenli tutmak

Tüm embedding'lerin ham bir dökümü, alaka düzeyini seyreltebilir. Kıyaslamanın yazarı, bellekleri güncellik ve sıklığa göre puanlayan bir azalma (decay) sistemi tanıttı:

  • Yeni veya sık erişilen öğeler daha yüksek ağırlık alır.
  • Bir süredir dokunulmayan öğeler kademeli olarak ağırlık kaybeder.
  • Ağırlıklı azalma, "getirme gürültüsünü" (retrieval noise) —yani alakasız eşleşmeleri— %34 oranında azaltır.

Düşük puanlı girişleri budayarak veya indekste alt sıralara çekerek, ajan güncel olmayan verilerden kaçınırken kasayı tutarlı performans için yeterince yalın tutar.

Sonuç

Dar bir zaman kısıtı altında binlerce belleği yönetmesi gereken yapay zeka ajanları için, RAM öncelikli bir scratchpad ile yerel bir SQLite-vec kasasının eşleştirilmesi, tamamen bulut tabanlı vektör depolarına karşı pragmatik bir alternatif sunar. Bu yaklaşım, yanıt sürelerini kısaltır, yinelenen bulut ücretlerini ortadan kaldırır ve kesintisiz hizmet sunarken, alakasız verileri budama yeteneğini de korur. Bu nedenle, iki katmanlı modeli benimsemek ajanları daha hızlı, daha ucuz ve daha güvenilir hale getirebilir.