चाचणीची मांडणी कशी केली होती

लेखकाने दोन पेमेंट-रुलबुक (payment-rulebook) दस्तऐवजांवर आधारित एक लहान 'रिट्रिव्हल-ऑगमेंटेड जनरेशन' (RAG) सिस्टम तयार केली आणि दोन तपासण्या केल्या:

  • रिकॉल टेस्ट (Recall test) – पहिल्या पाच निकालांमध्ये योग्य पृष्ठ आले होते का? निकाल: 60 %.
  • आन्सर टेस्ट (Answer test) – जनरेटरने दिलेले अंतिम उत्तर बरोबर होते का? निकाल: 90 %.

४० % चा हा फरक अशक्य वाटत होता. जर रिट्रिव्हरने (retriever) दहापैकी चार वेळा योग्य पृष्ठ शोधण्यात चूक केली असेल, तर मॉडेल दहापैकी नऊ वेळा अचूक उत्तर कसे देऊ शकते?

रिट्रिव्हर "दुरुस्त" करण्याचे पहिले प्रयत्न

डेव्हलपरने दोन सामान्य युक्त्या वापरून पाहिल्या:

  • हायब्रिड सर्च (Hybrid search) – लेक्सिकल (lexical) आणि वेक्टर (vector) सिग्नल्सचे मिश्रण. रिकॉलमध्ये कोणताही बदल झाला नाही.
  • रीरँकर (Reranker) – मिळवलेल्या पाच पृष्ठांचा क्रम पुन्हा लावणे. रिकॉल ७० % पर्यंत वाढला, परंतु तो ९० % च्या उत्तर अचूकतेच्या (answer accuracy) खूप मागेच होता.

हे दोन्ही टूल्स आधीच मिळवलेल्या माहितीचा क्रम फक्त बदलू शकतात; जे पृष्ठ 'कँडिडेट सेट'मध्ये (candidate set) आलेच नाही, ते ते शोधून काढू शकत नाहीत. समस्या दुसरीच होती.

मॉडेल नाही, तर मेट्रिक (metric) चुकीचे होते

यशाचे मोजमाप केवळ पृष्ठाच्या लेबलवरून करण्याऐवजी, लेखकाने रिट्रिव्ह केलेल्या चंक्समधील (chunks) प्रत्यक्ष तथ्यांची (facts) तपासणी केली. चारपैकी तीन "चुकीच्या" प्रकरणांमध्ये, योग्य तथ्य तिथे उपलब्ध होते, परंतु ते टेस्ट स्क्रिप्टने अपेक्षित असलेल्या पृष्ठापेक्षा वेगळ्या पृष्ठावर होते. अनपेक्षित पृष्ठावर योग्य उत्तर मिळाल्यामुळे इव्हॅल्युएशनने (evaluation) रिट्रिव्हरला चुकीचे ठरवले.

जेव्हा मेट्रिक बदलून "मिळवलेल्या कोणत्याही चंकमध्ये आवश्यक तथ्य आहे का?" असे करण्यात आले, तेव्हा रिकॉल ९० % पर्यंत वाढला आणि तो उत्तर अचूकतेशी जुळला. रिट्रिव्हर व्यवस्थित काम करत होता; इव्हॅल्युएशन फ्रेमवर्कमध्ये दोष होता.

पारंपारिक रिकॉल दिशाभूल करणारा का असू शकतो

  • पेज-लेव्हल लेबलिंगमुळे काल्पनिक अपयश (phantom failures) निर्माण होतात. एकच तथ्य अनेक पृष्ठांवर असू शकते. केवळ एका पृष्ठाला 'ग्राउंड ट्रुथ' (ground truth) म्हणून टॅग केल्यामुळे, इतर सर्व योग्य निकाल चुकीचे मानले जातात.
  • लहान कॉर्पोरा (corpora) मुळे याचा परिणाम अधिक जाणवतो. कमी दस्तऐवज असल्यास, एका चुकीच्या लेबलमुळे रिकॉलमध्ये मोठी घट होऊ शकते, तर उत्तर अचूकता स्थिर राहते.
  • एम्बेडिंग नॉइज (Embedding noise) तथ्यांवर पडदा टाकतो. वेक्टर संपूर्ण पृष्ठांना स्कोअर देते; आजूबाजूचा कायदेशीर किंवा तांत्रिक मजकूर लक्ष्यित वाक्याचा प्रासंगिकता सिग्नल (relevance signal) कमी करतो, ज्यामुळे तथ्य असूनही त्या पृष्ठाचा रँक खाली येतो.

RAG व्यावसायिकांसाठी व्यावहारिक निष्कर्ष

  • रँकिंग आणि रिट्रिव्हलमधील अपयश वेगळे करा. रीरँकर्स फक्त रँकिंग सुधारू शकतात; जर योग्य चंक 'कँडिडेट सेट'मध्ये आलाच नाही, तर क्रम बदलून काहीही उपयोग होत नाही.
  • टेस्ट डेटा तथ्याच्या स्तरावर (fact level) लेबल करा. प्रत्येक क्वेरीला केवळ एका दस्तऐवजाच्या आयडीशी न जोडता, तिला आवश्यक असलेल्या विशिष्ट माहितीशी जोडा.
  • लहान डेटासेटसाठी मोठ्या प्रमाणावरील बेंचमार्कवर विश्वास ठेवू नका. लहान आणि विशिष्ट क्षेत्रातील कॉर्पोरा वेगळ्या प्रकारे काम करतात आणि सामान्य रिकॉल स्कोअर दिशाभूल करणारे असू शकतात.
  • एम्बेडिंग ग्रॅन्युलॅरिटीवर (embedding granularity) लक्ष द्या. एका पृष्ठाच्या आकाराच्या चंकमध्ये अनेक शब्द असतात आणि आजूबाजूचा कायदेशीर मजकूर तुमच्यासाठी महत्त्वाच्या तथ्याचा रँक कमी करू शकतो.

थोडक्यात सांगायचे तर: जेव्हा इव्हॅल्युएशन हे कार्याशी सुसंगत नसते, तेव्हा उच्च उत्तर-अचूकता स्कोअर आणि कमी पारंपारिक रिकॉल फिगर एकाच वेळी असू शकतात. मॉडेलऐवजी मेट्रिक सुधारल्यामुळे वेळ वाचतो, चुकीचे इशारे (false alarms) कमी होतात आणि अधिक विश्वासार्ह RAG उपयोजन (deployments) प्राप्त होते.