परीक्षण कैसे तैयार किया गया था
लेखक ने दो भुगतान-नियम पुस्तिका (payment-rulebook) दस्तावेजों के आधार पर एक छोटा रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम बनाया और दो जाँचें कीं:
- रिकॉल टेस्ट (Recall test) – क्या सही पेज शीर्ष पांच परिणामों में दिखाई दिया? परिणाम: 60%।
- आंसर टेस्ट (Answer test) – क्या जनरेटर द्वारा दिया गया अंतिम उत्तर सही था? परिणाम: 90%।
40% का अंतर असंभव लग रहा था। यदि रिट्रीवर (retriever) दस में से चार बार सही पेज नहीं ढूंढ पाया, तो मॉडल दस में से नौ बार सही उत्तर कैसे दे सकता था?
रिट्रीवर को "ठीक" करने के पहले प्रयास
डेवलपर ने दो सामान्य तरीके आजमाए:
- हाइब्रिड सर्च (Hybrid search) – लेक्सिकल (lexical) और वेक्टर संकेतों का मिश्रण। रिकॉल वही रहा।
- रीरैंकर (Reranker) – प्राप्त किए गए पांच पेजों को पुनर्व्यवस्थित करना। रिकॉल बढ़कर 70% हो गया, लेकिन फिर भी 90% की उत्तर सटीकता (answer accuracy) से काफी पीछे था।
दोनों उपकरण केवल उसी चीज़ को पुनर्व्यवस्थित करते हैं जो पहले से ही प्राप्त की जा चुकी है; वे ऐसे पेज को नहीं ला सकते जो कैंडिडेट सेट (candidate set) में कभी आया ही नहीं। समस्या कहीं और थी।
मॉडल नहीं, बल्कि मेट्रिक (metric) गलत था
सफलता का निर्णय पेज लेबल के आधार पर करने के बजाय, लेखक ने रिट्रीव किए गए चंक्स (chunks) में वास्तविक तथ्यों का निरीक्षण किया। चार में से तीन "मिस" (misses) के मामलों में, सही तथ्य मौजूद था, लेकिन वह उस पेज पर था जिसकी टेस्ट स्क्रिप्ट ने अपेक्षा नहीं की थी। मूल्यांकन ने रिट्रीवर को एक अप्रत्याशित पेज पर सही उत्तर खोजने के लिए दंडित किया।
जब मेट्रिक बदलकर "क्या किसी रिट्रीव किए गए चंक में आवश्यक तथ्य शामिल है?" कर दिया गया, तो रिकॉल बढ़कर 90% हो गया, जो उत्तर सटीकता के बराबर था। रिट्रीवर काम कर रहा था; मूल्यांकन ढांचा (evaluation framework) नहीं।
पारंपरिक रिकॉल भ्रामक क्यों हो सकता है
- पेज-लेवल लेबलिंग से काल्पनिक विफलताएं (phantom failures) पैदा होती हैं। एक ही तथ्य कई पेजों पर दिखाई दे सकता है। केवल एक पेज को 'ग्राउंड ट्रुथ' (ground truth) के रूप में टैग करने से अन्य सभी सही परिणामों को त्रुटि मान लिया जाता है।
- छोटे कॉर्पोरा (corpora) इस प्रभाव को बढ़ा देते हैं। कम दस्तावेजों के साथ, एक गलत लेबल वाला पेज रिकॉल को नाटकीय रूप से बदल सकता है, जबकि उत्तर सटीकता स्थिर रहती है।
- एम्बेडिंग शोर (Embedding noise) तथ्यों को छिपा देता है। वेक्टर पूरे पेज को स्कोर करता है; आसपास का कानूनी या तकनीकी टेक्स्ट लक्षित वाक्य के प्रासंगिकता संकेत (relevance signal) को कम कर देता है, जिससे तथ्य मौजूद होने के बावजूद पेज की रैंकिंग नीचे गिर जाती है।
RAG विशेषज्ञों के लिए व्यावहारिक सुझाव
- रैंकिंग को रिट्रीवल विफलताओं से अलग करें। रीरैंकर केवल पहले वाले (रैंकिंग) को ठीक करते हैं; यदि सही चंक कभी कैंडिडेट सेट में ही नहीं आता, तो पुनर्व्यवस्था करने से कोई लाभ नहीं होता।
- टेस्ट डेटा को तथ्य स्तर (fact level) पर लेबल करें। प्रत्येक क्वेरी को उसकी आवश्यक विशिष्ट जानकारी से जोड़ें, न कि केवल एक एकल दस्तावेज़ पहचानकर्ता (document identifier) से।
- छोटे डेटासेट के लिए बड़े पैमाने के बेंचमार्क पर भरोसा न करें। छोटे, डोमेन-विशिष्ट कॉर्पोरा अलग तरह से व्यवहार करते हैं, और सामान्य रिकॉल स्कोर भ्रामक हो सकते हैं।
- एम्बेडिंग ग्रैनुलैरिटी (embedding granularity) पर ध्यान दें। एक पेज के आकार के चंक में कई शब्द होते हैं, और आसपास का कानूनी टेक्स्ट आपके काम के तथ्य की रैंकिंग को कम कर सकता है।
निष्कर्ष: जब मूल्यांकन कार्य के साथ मेल नहीं खाता है, तो उच्च उत्तर-सटीकता स्कोर और कम पारंपरिक रिकॉल आंकड़े एक साथ मौजूद हो सकते हैं। मॉडल के बजाय मेट्रिक को ठीक करने से समय बचता है, गलत अलार्म कम होते हैं, और अधिक विश्वसनीय RAG डिप्लॉयमेंट प्राप्त होते हैं।
