சோதனை எவ்வாறு அமைப்பானது
ஆசிரியர் இரண்டு கட்டண விதிமுறை ஆவணங்களை (payment-rulebook documents) அடிப்படையாகக் கொண்டு ஒரு சிறிய retrieval-augmented generation (RAG) அமைப்பை உருவாக்கி, இரண்டு சோதனைகளைச் செய்தார்:
- Recall test – முதல் ஐந்து முடிவுகளில் சரியான பக்கம் இடம்பெற்றதா? முடிவு: 60 %.
- Answer test – ஜெனரேட்டரால் (generator) உருவாக்கப்பட்ட இறுதிப் பதில் சரியா? முடிவு: 90 %.
40% இடைவெளி சாத்தியமற்றதாகத் தோன்றியது. ஒரு பத்து முறைக்கு நான்கு முறை ரிட்ரீவர் (retriever) சரியான பக்கத்தைத் தவறவிட்டால், மாதிரி (model) எப்படி பத்து முறைக்கு ஒன்பது முறை சரியாகப் பதிலளிக்க முடியும்?
ரிட்ரீவரை "சரிசெய்ய" எடுக்கப்பட்ட முதல் முயற்சிகள்
டெவலப்பர் இரண்டு பொதுவான நுட்பங்களை முயன்றார்:
- Hybrid search – லெக்சிகல் (lexical) மற்றும் வெக்டர் (vector) சிக்னல்களைக் கலப்பது. Recall மாறாமல் இருந்தது.
- Reranker – பெறப்பட்ட ஐந்து பக்கங்களை மறுவரிசைப்படுத்துதல். Recall 70% ஆக உயர்ந்தது, ஆனால் 90% பதில் துல்லியத்திற்கு (answer accuracy) பின் தங்கியே இருந்தது.
இந்த இரண்டு கருவிகளும் ஏற்கனவே பெறப்பட்டவற்றை மட்டுமே மறுவரிசைப்படுத்துகின்றன; வேட்பாளர் தொகுப்பில் (candidate set) நுழையாத ஒரு பக்கத்தை அவை உருவாக்க முடியாது. பிரச்சனை வேறு எங்கோ இருந்தது.
மாதிரியில் அல்ல, அளவீட்டில் (metric) தான் பிழை இருந்தது
வெற்றியைக் கணக்கிட பக்க லேபிளைப் (page label) பயன்படுத்துவதற்குப் பதிலாக, ஆசிரியர் பெறப்பட்ட துண்டுகளில் (retrieved chunks) உள்ள உண்மையான தகவல்களை ஆய்வு செய்தார். நான்கு "தவறுகளில்" மூன்றிலும், சரியான தகவல் இருந்தது, ஆனால் சோதனை ஸ்கிரிப்ட் எதிர்பார்த்த பக்கத்தைத் தவிர வேறொரு பக்கத்தில் அது இருந்தது. எதிர்பாராத பக்கத்தில் சரியான பதிலைக் கண்டறிந்ததற்காக, மதிப்பீட்டு முறை ரிட்ரீவரைத் தண்டித்தது.
அளவீடு "பெறப்பட்ட ஏதேனும் ஒரு துண்டில் தேவையான தகவல் உள்ளதா?" என்று மாற்றப்பட்டபோது, recall 90% ஆக உயர்ந்தது, இது பதில் துல்லியத்துடன் ஒத்துப்போனது. ரிட்ரீவர் சரியாகச் செயல்பட்டது; மதிப்பீட்டு கட்டமைப்பு (evaluation framework) சரியாக இல்லை.
பாரம்பரிய recall ஏன் தவறாக வழிநடத்தலாம்
- பக்க அளவிலான லேபிளிங் (Page-level labeling) கற்பனையான தோல்விகளை உருவாக்குகிறது. ஒரு தகவல் பல பக்கங்களில் தோன்றலாம். ஒரு பக்கத்தை மட்டும் 'தரை உண்மை' (ground truth) என்று குறிப்பதே, மற்ற அனைத்து சரியான முடிவுகளையும் பிழைகளாகக் கருதும் சூழலை உருவாக்குகிறது.
- சிறிய தரவுத் தொகுப்புகள் (Small corpora) இந்த விளைவை அதிகப்படுத்துகின்றன. குறைவான ஆவணங்கள் இருக்கும்போது, ஒரு தவறாகக் குறிக்கப்பட்ட பக்கம் recall அளவை வியத்தகு முறையில் மாற்றக்கூடும், அதே நேரத்தில் பதில் துல்லியம் நிலையாக இருக்கும்.
- Embedding சத்தம் (noise) தகவல்களை மறைக்கிறது. வெக்டர் முழுப் பக்கங்களுக்கும் மதிப்பெண் வழங்குகிறது; சுற்றியுள்ள சட்ட அல்லது தொழில்நுட்ப உரைகள் இலக்கு வாக்கியத்தின் பொருத்தமான சிக்னலை (relevance signal) குறைத்து, தகவல் இருந்தபோதிலும் அந்தப் பக்கத்தின் தரவரிசையைக் குறைக்கின்றன.
RAG பயிற்சியாளர்களுக்கான நடைமுறைப் பாடங்கள்
- தரவரிசைப்படுத்துதலில் இருந்து மீட்டெடுப்புத் தோல்விகளைத் தனித்துப் பிரிக்கவும். Rerankers முந்தையதை (ranking) மட்டுமே சரிசெய்யும்; சரியான துண்டு (chunk) வேட்பாளர் தொகுப்பிலேயே இல்லை என்றால், மறுவரிசைப்படுத்துவது எந்தப் பயனும் தராது.
- சோதனைத் தரவை தகவல் மட்டத்தில் (fact level) லேபிளிங் செய்யவும். ஒவ்வொரு வினாவையும் (query) ஒரு ஆவண அடையாளத்துடன் இணைக்காமல், அதற்குத் தேவையான குறிப்பிட்ட தகவலுடன் இணைக்கவும்.
- சிறிய தரவுத் தொகுப்புகளுக்குப் பெரிய அளவிலான அளவுகோல்களை (benchmarks) நம்ப வேண்டாம். சிறிய, குறிப்பிட்ட துறை சார்ந்த தரவுத் தொகுப்புகள் வேறுபட்ட முறையில் செயல்படும், மேலும் பொதுவான recall மதிப்பெண்கள் ஏமாற்றமளிக்கலாம்.
- Embedding நுணுக்கத்தைக் (granularity) கவனியுங்கள். ஒரு பக்க அளவிலான துண்டு பல சொற்களைக் கொண்டிருக்கும், மேலும் சுற்றியுள்ள சட்ட உரைகள் நீங்கள் தேடும் தகவலின் தரவரிசையைக் குறைக்கலாம்.
சுருக்கமாகச் சொன்னால்: மதிப்பீடு பணியுடன் சரியாக ஒத்துப்போகாதபோது, அதிக பதில் துல்லியம் மற்றும் குறைந்த பாரம்பரிய recall ஆகிய இரண்டும் ஒரே நேரத்தில் இருக்கலாம். மாதிரியைச் சரிசெய்வதற்குப் பதிலாக அளவீட்டைச் சரிசெய்வது நேரத்தைச் சேமிக்கும், தவறான எச்சரிக்கைகளைக் குறைக்கும் மற்றும் மிகவும் நம்பகமான RAG பயன்பாடுகளை வழங்கும்.
