Agentic retrieval, geleneksel geri çağırma ile zenginleştirilmiş üretim (RAG) boru hatlarının bir sonraki adımı olarak öne çıkarılıyor; halüsinasyon görmeyi durduran ve bilgiyi nasıl getireceği konusunda "düşünmeye" başlayan üretim seviyesinde yapay zeka sistemleri vaat ediyor. Destekleyenler, bu yaklaşımın, büyük belge koleksiyonlarında bir sorguyu yanıtlama maliyetini, tüm derlemi bir modelin bağlam penceresine beslemekle karşılaştırıldığında 82 kata kadar düşürebileceğini söylüyor; bu, üretken yapay zekayı ölçeklendiren her işletme için önemli bir tasarruftur.
Eski RAG boru hattı neden yetersiz kalıyor
Klasik RAG iş akışı sabit bir dizidir: belgeleri parçalara (chunk) ayırır, her parçayı yoğun bir vektör uzayına gömer (embed) ve ardından kullanıcı sorgusu için en yüksek puanlı vektörleri çeker. Demolarda bu yöntem düzenli görünür; model birkaç "ilgili" pasaj alır ve güvenle yanıt verir. Ancak üretim aşamasında, bu güven genellikle yersizdir.
Sorunu tetikleyen üç sistemsel kusur vardır:
- Vektör benzerliği ≠ alaka düzeyi. İki pasaj, zıt gerçekleri ifade etseler bile matematiksel olarak birbirine yakın olabilir, bu da modelin yanlış iddiayı alıntılamasına yol açar.
- Parçalanma gerçekleri bozar. Sabit parçalama (chunking), rutin olarak tek bir ifadeyi ortadan ikiye böler. Model sadece yarısını alırsa, eksik parçayı yeniden oluşturamaz.
- Karmaşık sorgular. Gerçek dünyadaki sorular, çoğu embedding modelinin eğitim verilerinden sapar, bu nedenle benzerlik araması ilgisiz parçalar döndürür.
Boru hattı yanlış bağlamı döndürdüğünde, sonraki dil modeli genellikle yüksek bir kesinlikle bir yanıt üretir ve sistem bir hata vermez. Sonuç, canlı bir hizmette tespit edilmesi zor olan sessiz bir başarısızlık olan "sessiz halüsinasyon"dur.
Hibrit geri çağırma: Kademeli bir çözüm
Yaygın bir yanıt, yoğun vektörlerin üzerine anahtar kelime araması katmanı ekleyerek, embedding'lerin kaçırdığı tam terim eşleşmelerini yakalayabilen hibrit bir geri çağırma mekanizması oluşturmaktır. Bir reranker (alınan listeyi öğrenilmiş bir alaka puanına göre yeniden sıralayan ikinci bir model) eklemek, hassasiyeti daha da artırır.
Hibrit geri çağırma hala statik bir senaryoyu takip eder: her sorgu, zorluğuna veya belirsizliğine bakılmaksızın aynı dizi adımı tetikler. Boru hattı, daha fazla veriye ihtiyacı olup olmadığına, karmaşık bir soruyu alt sorulara nasıl böleceğine veya geri çağrılan bir kesitin yetersiz olup olmadığına karar veremez.
Agentic retrieval aramayı bir karar süreci olarak ele alır
Agentic retrieval, sorunu bir insan araştırmacıyı taklit eden otonom bir "ajan" (agent) tarafından verilen bir dizi karar olarak yeniden tanımlar. Ajan şunları yapabilir:
- Sorguyu yeniden yazar. Aramadan önce günlük konuşma dilindeki veya belirsiz ifadeleri normalize ederek, geri çağırma modellerinin niyeti anlama olasılığını artırır.
- Geri çağırma gerekip gerekmediğini sorar. Basit sorgular için ajan doğrudan yanıt verir, böylece token tasarrufu sağlar ve gereksiz gürültüyü önler.
- Çok adımlı bir arama planlar. Karmaşık sorular daha küçük alt sorulara bölünür, her biri bağımsız olarak aranır ve ardından birleştirilir.
- Kendi kendini düzeltir. Eğer ilk sonuç zayıf görünüyorsa (örneğin düşük güven puanları veya çelişkili kanıtlar), ajan sorguyu farklı bir formülasyonla yeniden yayınlar veya arama kapsamını genişletir.
Maliyet argümanları: Uzun bağlam vs. geri çağırma
Bazı yorumcular, giderek büyüyen bağlam pencerelerinin geri çağırmayı gereksiz kıldığını savunuyor. Karşı görüş ise pragmatiktir: devasa bir derlemi bir modelin bağlamına beslemek, odaklanmış bir geri çağırmadan kat kat daha maliyetlidir. Tahminler, büyük veri setleri için geri çağırmanın, doğru yanıtlar için gereken bağlamsal temeli sağlarken 8 ila 82 kat daha ucuz olduğunu gösteriyor. Uzun bağlam pencereleri, küçük ve seçilmiş bir belge seti üzerinde nüanslı akıl yürütme için yararlı olmaya devam etse de ölçeklenebilir aramanın yerini tutamazlar.
Şeffaflık ve doğrulama
Üretim seviyesinde bir yapay zeka asistanı, kaynaklarını açıkça göstermelidir. Agentic retrieval, her iddiaya bir atıf ekleyerek bir insan incelemecinin doğrulama izini takip etmesine olanak tanır. Bu "çalışmanı göster" yaklaşımı güven inşa eder ve ajanın gelecekteki etkileşimlerde kaçınmayı öğrenebileceği zayıf geri çağırma yollarını gün yüzüne çıkarır.
Sırada ne var
- Araçlar.
- Değerlendirme standartları.
- Kurumsal pilot uygulamalar.
Özetle
Agentic retrieval, birçok demoda baskın olan statik ve hataya meyilli RAG boru hatlarının ötesine geçer. Bir yapay zeka sisteminin ne zaman ve nasıl arama yapacağına karar vermesine izin vererek, token kullanımını azaltır, maliyetleri önemli ölçüde düşürür ve en önemlisi, her yanıt için doğrulanabilir kaynaklar sunar.
