Testin nasıl kurulduğu

Yazar, iki ödeme kural kitabı belgesi etrafında küçük bir geri getirme ile zenginleştirilmiş üretim (RAG) sistemi kurdu ve iki kontrol gerçekleştirdi:

  • Recall testi – doğru sayfa ilk beş sonuç arasında yer aldı mı? Sonuç: %60.
  • Cevap testi – üretici tarafından oluşturulan nihai cevap doğru muydu? Sonuç: %90.

%40'lık bir fark imkansız görünüyordu. Eğer retriever on denemeden dördünde doğru sayfayı kaçırıyorsa, model nasıl olur da on denemeden dokuzunda doğru cevap verebiliyordu?

Retriever'ı “düzeltmeye” yönelik ilk girişimler

Geliştirici iki yaygın yöntem denedi:

  • Hibrit arama (Hybrid search) – sözcüksel (lexical) ve vektörel sinyallerin karıştırılması. Recall aynı kaldı.
  • Reranker – getirilen beş sayfanın yeniden sıralanması. Recall %70'e yükseldi ancak %90'lık cevap doğruluğunun hala çok gerisinde kaldı.

Her iki araç da yalnızca halihazırda getirilmiş olanları yeniden düzenler; aday setine hiç girmemiş bir sayfayı yoktan var edemezler. Sorun başka bir yerdeydi.

Bozuk olan model değil, metrikti

Başarıyı sayfa etiketiyle yargılamak yerine yazar, getirilen parçalardaki (chunks) gerçek olguları inceledi. Dört “başarısızlık” durumundan üçünde, doğru bilgi mevcuttu ancak test betiğinin beklediğinden farklı bir sayfada yer alıyordu. Değerlendirme, retriever'ı beklenmedik bir sayfada doğru cevabı bulduğu için cezalandırıyordu.

Metrik, “getirilen herhangi bir parça gerekli bilgiyi içeriyor mu?” şeklinde değiştirildiğinde, recall %90'a fırlayarak cevap doğruluğuyla eşleşti. Retriever çalışıyordu; değerlendirme çerçevesi ise çalışmıyordu.

Geleneksel recall neden yanıltıcı olabilir

  • Sayfa düzeyinde etiketleme, hayalet başarısızlıklar yaratır. Tek bir bilgi birkaç sayfada görünebilir. Sadece bir sayfayı ground truth (temel gerçeklik) olarak etiketlemek, diğer tüm doğru eşleşmeleri hata olarak kabul eder.
  • Küçük derlemler etkiyi artırır. Az sayıda belgeyle, tek bir yanlış etiketlenmiş sayfa, cevap doğruluğu sabit kalırken recall değerini dramatik bir şekilde değiştirebilir.
  • Embedding gürültüsü bilgileri gizler. Vektörler tüm sayfaları puanlar; çevredeki hukuki veya teknik metin, hedef cümlenin alaka sinyalini seyrelterek, bilgi mevcut olsa bile sayfanın sıralamada aşağı düşmesine neden olur.

RAG uygulayıcıları için pratik çıkarımlar

  • Sıralama hatalarını getirme (retrieval) hatalarından ayırın. Reranker'lar yalnızca ilkini düzeltir; eğer doğru parça aday setine hiç girmiyorsa, yeniden sıralama hiçbir işe yaramaz.
  • Test verilerini bilgi düzeyinde etiketleyin. Her sorguyu tek bir belge tanımlayıcısına değil, ihtiyaç duyduğu spesifik bilgi parçasına bağlayın.
  • Küçük veri setleri için büyük ölçekli kıyaslamalara (benchmarks) güvenmeyin. Küçük, alana özgü derlemler farklı davranır ve genel recall puanları yanıltıcı olabilir.
  • Embedding granülaritesine dikkat edin. Sayfa boyutundaki bir parça çok sayıda kelime içerir ve çevredeki hukuki metin, ilgilendiğiniz bilginin sıralamasını düşürebilir.

Özetle: Değerlendirme görevle uyumlu olmadığında, yüksek bir cevap doğruluğu puanı, düşük bir geleneksel recall değeriyle bir arada bulunabilir. Modeli değil, metriği düzeltmek zaman kazandırır, yanlış alarmları azaltır ve daha güvenilir RAG dağıtımları sağlar.