పరీక్షను ఎలా ఏర్పాటు చేశారు

రచయిత రెండు పేమెంట్-రూల్‌బుక్ (payment-rulebook) పత్రాల ఆధారంగా ఒక చిన్న రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్ (RAG) సిస్టమ్‌ను రూపొందించి, రెండు తనిఖీలు చేశారు:

  • రీకాల్ టెస్ట్ (Recall test) – మొదటి ఐదు ఫలితాలలో సరైన పేజీ కనిపించిందా? ఫలితం: 60 %.
  • ఆన్సర్ టెస్ట్ (Answer test) – జనరేటర్ అందించిన తుది సమాధానం సరైనదేనా? ఫలితం: 90 %.

40 % వ్యత్యాసం అసాధ్యంగా అనిపించింది. రిట్రీవర్ పదిసార్లు పరీక్షించినప్పుడు నాలుగుసార్లు సరైన పేజీని గుర్తించలేకపోతే, మోడల్ పదిసార్లు తొమ్మిదిసార్లు ఎలా సరైన సమాధానం చెప్పగలుగుతుంది?

రిట్రీవర్‌ను "సరిదిద్దడానికి" చేసిన మొదటి ప్రయత్నాలు

డెవలపర్ రెండు సాధారణ పద్ధతులను ప్రయత్నించారు:

  • హైబ్రిడ్ సెర్చ్ (Hybrid search) – లెక్సికల్ (lexical) మరియు వెక్టర్ (vector) సిగ్నల్స్‌ను కలపడం. దీనివల్ల రీకాల్‌లో ఎలాంటి మార్పు లేదు.
  • రీర్యాంకర్ (Reranker) – సేకరించిన ఐదు పేజీలను తిరిగి క్రమబద్ధీకరించడం. రీకాల్ 70 %కి పెరిగింది కానీ, 90 % ఆన్సర్ అక్యురసీ (answer accuracy) కంటే ఇంకా చాలా వెనుకబడి ఉంది.

ఈ రెండు సాధనాలు ఇప్పటికే సేకరించిన వాటిని మాత్రమే తిరిగి అమర్చుతాయి; క్యాండిడేట్ సెట్ (candidate set) లోకి రాని పేజీని అవి సృష్టించలేవు. సమస్య వేరే చోట ఉంది.

మోడల్ కాదు, మెట్రిక్ (metric) లోనే లోపం ఉంది

విజయాన్ని కేవలం పేజీ లేబుల్ ఆధారంగా నిర్ణయించకుండా, రచయిత రిట్రీవ్ చేయబడిన చంక్స్‌లోని (chunks) వాస్తవ సమాచారాన్ని పరిశీలించారు. నాలుగుసార్లు "మిస్" అయిన వాటిలో, మూడుసార్లు సరైన సమాచారం అందుబాటులో ఉంది, కానీ టెస్ట్ స్క్రిప్ట్ ఆశించిన పేజీ కాకుండా వేరే పేజీలో ఉంది. ఊహించని పేజీలో సరైన సమాధానాన్ని కనుగొన్నందుకు, ఎవాల్యుయేషన్ (evaluation) రిట్రీవర్‌ను తప్పుగా పరిగణించింది.

మెట్రిక్‌ను “రిట్రీవ్ చేయబడిన ఏదైనా చంక్‌లో అవసరమైన సమాచారం ఉందా?” అని మార్చినప్పుడు, రీకాల్ 90 %కి పెరిగి, ఆన్సర్ అక్యురసీతో సమానంగా ఉంది. అంటే రిట్రీవర్ సరిగ్గా పనిచేసింది; ఎవాల్యుయేషన్ ఫ్రేమ్‌వర్క్ సరిగ్గా లేదు.

సాంప్రదాయ రీకాల్ (traditional recall) ఎందుకు తప్పుదారి పట్టించవచ్చు

  • పేజీ-స్థాయి లేబులింగ్ వల్ల తప్పుడు వైఫల్యాలు (phantom failures) కనిపిస్తాయి. ఒకే సమాచారం అనేక పేజీలలో ఉండవచ్చు. కేవలం ఒక పేజీని మాత్రమే 'గ్రౌండ్ ట్రూత్' (ground truth) గా గుర్తించడం వల్ల, మిగిలిన సరైన ఫలితాలను కూడా తప్పులుగా పరిగణిస్తారు.
  • చిన్న కార్పస్ (corpora) వల్ల ఈ ప్రభావం ఎక్కువగా ఉంటుంది. తక్కువ పత్రాలు ఉన్నప్పుడు, ఒకే ఒక తప్పుగా లేబుల్ చేయబడిన పేజీ రీకాల్‌ను గణనీయంగా తగ్గించగలదు, కానీ ఆన్సర్ అక్యురసీ స్థిరంగానే ఉంటుంది.
  • ఎంబెడ్డింగ్ నాయిస్ (Embedding noise) వల్ల సమాచారం దాగిపోవచ్చు. వెక్టర్స్ మొత్తం పేజీలకు స్కోర్‌లను ఇస్తాయి; చుట్టూ ఉన్న చట్టపరమైన లేదా సాంకేతిక సమాచారం వల్ల లక్ష్యంగా ఉన్న వాక్యం యొక్క ప్రాముఖ్యత (relevance signal) తగ్గుతుంది, దీనివల్ల సమాచారం అందుబాటులో ఉన్నప్పటికీ ఆ పేజీ ర్యాంకింగ్‌లో కిందకు పడిపోతుంది.

RAG నిపుణుల కోసం ఆచరణాత్మక సూచనలు

  • ర్యాంకింగ్‌ను మరియు రిట్రీవల్ వైఫల్యాలను వేరుగా చూడండి. రీర్యాంకర్లు కేవలం ర్యాంకింగ్‌ను మాత్రమే సరిచేయగలవు; సరైన చంక్ క్యాండిడేట్ సెట్‌లోకి రాకపోతే, వాటిని తిరిగి క్రమబద్ధీకరించడం వల్ల ఎటువంటి ప్రయోజనం ఉండదు.
  • టెస్ట్ డేటాను ఫ్యాక్ట్-లెవల్ (fact level) లో లేబుల్ చేయండి. ప్రతి క్వెరీని ఒకే డాక్యుమెంట్ ఐడెంటిఫైయర్‌తో కాకుండా, దానికి అవసరమైన నిర్దిష్ట సమాచారంతో అనుసంధానించండి.
  • చిన్న డేటాసెట్‌ల కోసం పెద్ద స్థాయి బెంచ్‌మార్క్‌లను నమ్మకండి. చిన్న, డొమైన్-స్పెసిఫిక్ కార్పస్‌లు భిన్నంగా పనిచేస్తాయి మరియు సాధారణ రీకాల్ స్కోర్‌లు తప్పుదారి పట్టించవచ్చు.
  • ఎంబెడ్డింగ్ గ్రాన్యులారిటీ (embedding granularity) పై దృష్టి పెట్టండి. ఒక పేజీ పరిమాణంలో ఉన్న చంక్‌లో చాలా పదాలు ఉంటాయి, మరియు చుట్టూ ఉన్న చట్టపరమైన పాఠ్యం మీరు కోరుకున్న సమాచారం యొక్క ర్యాంక్‌ను తగ్గించవచ్చు.

ముగింపు: ఎవాల్యుయేషన్ టాస్క్‌తో సరిగ్గా సరిపోనప్పుడు, అధిక ఆన్సర్-అక్యురసీ స్కోరు మరియు తక్కువ సాంప్రదాయ రీకాల్ స్కోరు రెండూ ఉండవచ్చు. మోడల్‌ను కాకుండా మెట్రిక్‌ను సరిదిద్దడం వల్ల సమయం ఆదా అవుతుంది, తప్పుడు హెచ్చరికలు తగ్గుతాయి మరియు మరింత నమ్మదగిన RAG డిప్లాయ్‌మెంట్‌లను పొందవచ్చు.