పరీక్షను ఎలా ఏర్పాటు చేశారు
రచయిత రెండు పేమెంట్-రూల్బుక్ (payment-rulebook) పత్రాల ఆధారంగా ఒక చిన్న రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్ (RAG) సిస్టమ్ను రూపొందించి, రెండు తనిఖీలు చేశారు:
- రీకాల్ టెస్ట్ (Recall test) – మొదటి ఐదు ఫలితాలలో సరైన పేజీ కనిపించిందా? ఫలితం: 60 %.
- ఆన్సర్ టెస్ట్ (Answer test) – జనరేటర్ అందించిన తుది సమాధానం సరైనదేనా? ఫలితం: 90 %.
40 % వ్యత్యాసం అసాధ్యంగా అనిపించింది. రిట్రీవర్ పదిసార్లు పరీక్షించినప్పుడు నాలుగుసార్లు సరైన పేజీని గుర్తించలేకపోతే, మోడల్ పదిసార్లు తొమ్మిదిసార్లు ఎలా సరైన సమాధానం చెప్పగలుగుతుంది?
రిట్రీవర్ను "సరిదిద్దడానికి" చేసిన మొదటి ప్రయత్నాలు
డెవలపర్ రెండు సాధారణ పద్ధతులను ప్రయత్నించారు:
- హైబ్రిడ్ సెర్చ్ (Hybrid search) – లెక్సికల్ (lexical) మరియు వెక్టర్ (vector) సిగ్నల్స్ను కలపడం. దీనివల్ల రీకాల్లో ఎలాంటి మార్పు లేదు.
- రీర్యాంకర్ (Reranker) – సేకరించిన ఐదు పేజీలను తిరిగి క్రమబద్ధీకరించడం. రీకాల్ 70 %కి పెరిగింది కానీ, 90 % ఆన్సర్ అక్యురసీ (answer accuracy) కంటే ఇంకా చాలా వెనుకబడి ఉంది.
ఈ రెండు సాధనాలు ఇప్పటికే సేకరించిన వాటిని మాత్రమే తిరిగి అమర్చుతాయి; క్యాండిడేట్ సెట్ (candidate set) లోకి రాని పేజీని అవి సృష్టించలేవు. సమస్య వేరే చోట ఉంది.
మోడల్ కాదు, మెట్రిక్ (metric) లోనే లోపం ఉంది
విజయాన్ని కేవలం పేజీ లేబుల్ ఆధారంగా నిర్ణయించకుండా, రచయిత రిట్రీవ్ చేయబడిన చంక్స్లోని (chunks) వాస్తవ సమాచారాన్ని పరిశీలించారు. నాలుగుసార్లు "మిస్" అయిన వాటిలో, మూడుసార్లు సరైన సమాచారం అందుబాటులో ఉంది, కానీ టెస్ట్ స్క్రిప్ట్ ఆశించిన పేజీ కాకుండా వేరే పేజీలో ఉంది. ఊహించని పేజీలో సరైన సమాధానాన్ని కనుగొన్నందుకు, ఎవాల్యుయేషన్ (evaluation) రిట్రీవర్ను తప్పుగా పరిగణించింది.
మెట్రిక్ను “రిట్రీవ్ చేయబడిన ఏదైనా చంక్లో అవసరమైన సమాచారం ఉందా?” అని మార్చినప్పుడు, రీకాల్ 90 %కి పెరిగి, ఆన్సర్ అక్యురసీతో సమానంగా ఉంది. అంటే రిట్రీవర్ సరిగ్గా పనిచేసింది; ఎవాల్యుయేషన్ ఫ్రేమ్వర్క్ సరిగ్గా లేదు.
సాంప్రదాయ రీకాల్ (traditional recall) ఎందుకు తప్పుదారి పట్టించవచ్చు
- పేజీ-స్థాయి లేబులింగ్ వల్ల తప్పుడు వైఫల్యాలు (phantom failures) కనిపిస్తాయి. ఒకే సమాచారం అనేక పేజీలలో ఉండవచ్చు. కేవలం ఒక పేజీని మాత్రమే 'గ్రౌండ్ ట్రూత్' (ground truth) గా గుర్తించడం వల్ల, మిగిలిన సరైన ఫలితాలను కూడా తప్పులుగా పరిగణిస్తారు.
- చిన్న కార్పస్ (corpora) వల్ల ఈ ప్రభావం ఎక్కువగా ఉంటుంది. తక్కువ పత్రాలు ఉన్నప్పుడు, ఒకే ఒక తప్పుగా లేబుల్ చేయబడిన పేజీ రీకాల్ను గణనీయంగా తగ్గించగలదు, కానీ ఆన్సర్ అక్యురసీ స్థిరంగానే ఉంటుంది.
- ఎంబెడ్డింగ్ నాయిస్ (Embedding noise) వల్ల సమాచారం దాగిపోవచ్చు. వెక్టర్స్ మొత్తం పేజీలకు స్కోర్లను ఇస్తాయి; చుట్టూ ఉన్న చట్టపరమైన లేదా సాంకేతిక సమాచారం వల్ల లక్ష్యంగా ఉన్న వాక్యం యొక్క ప్రాముఖ్యత (relevance signal) తగ్గుతుంది, దీనివల్ల సమాచారం అందుబాటులో ఉన్నప్పటికీ ఆ పేజీ ర్యాంకింగ్లో కిందకు పడిపోతుంది.
RAG నిపుణుల కోసం ఆచరణాత్మక సూచనలు
- ర్యాంకింగ్ను మరియు రిట్రీవల్ వైఫల్యాలను వేరుగా చూడండి. రీర్యాంకర్లు కేవలం ర్యాంకింగ్ను మాత్రమే సరిచేయగలవు; సరైన చంక్ క్యాండిడేట్ సెట్లోకి రాకపోతే, వాటిని తిరిగి క్రమబద్ధీకరించడం వల్ల ఎటువంటి ప్రయోజనం ఉండదు.
- టెస్ట్ డేటాను ఫ్యాక్ట్-లెవల్ (fact level) లో లేబుల్ చేయండి. ప్రతి క్వెరీని ఒకే డాక్యుమెంట్ ఐడెంటిఫైయర్తో కాకుండా, దానికి అవసరమైన నిర్దిష్ట సమాచారంతో అనుసంధానించండి.
- చిన్న డేటాసెట్ల కోసం పెద్ద స్థాయి బెంచ్మార్క్లను నమ్మకండి. చిన్న, డొమైన్-స్పెసిఫిక్ కార్పస్లు భిన్నంగా పనిచేస్తాయి మరియు సాధారణ రీకాల్ స్కోర్లు తప్పుదారి పట్టించవచ్చు.
- ఎంబెడ్డింగ్ గ్రాన్యులారిటీ (embedding granularity) పై దృష్టి పెట్టండి. ఒక పేజీ పరిమాణంలో ఉన్న చంక్లో చాలా పదాలు ఉంటాయి, మరియు చుట్టూ ఉన్న చట్టపరమైన పాఠ్యం మీరు కోరుకున్న సమాచారం యొక్క ర్యాంక్ను తగ్గించవచ్చు.
ముగింపు: ఎవాల్యుయేషన్ టాస్క్తో సరిగ్గా సరిపోనప్పుడు, అధిక ఆన్సర్-అక్యురసీ స్కోరు మరియు తక్కువ సాంప్రదాయ రీకాల్ స్కోరు రెండూ ఉండవచ్చు. మోడల్ను కాకుండా మెట్రిక్ను సరిదిద్దడం వల్ల సమయం ఆదా అవుతుంది, తప్పుడు హెచ్చరికలు తగ్గుతాయి మరియు మరింత నమ్మదగిన RAG డిప్లాయ్మెంట్లను పొందవచ్చు.
