പരിശോധന എങ്ങനെയാണ് ക്രമീകരിച്ചത്
രണ്ട് പേയ്മെന്റ് റൂൾബുക്ക് (payment-rulebook) രേഖകളെ അടിസ്ഥാനമാക്കി രചയിതാവ് ഒരു ചെറിയ റിട്രീവൽ-ഓഗ്മെന്റഡ് ജനറേഷൻ (RAG) സിസ്റ്റം നിർമ്മിക്കുകയും രണ്ട് പരിശോധനകൾ നടത്തുകയും ചെയ്തു:
- റീക്കോൾ ടെസ്റ്റ് (Recall test) – ശരിയായ പേജ് ആദ്യത്തെ അഞ്ച് ഫലങ്ങളിൽ ഉൾപ്പെട്ടിട്ടുണ്ടോ? ഫലം: 60%.
- ആൻസർ ടെസ്റ്റ് (Answer test) – ജനറേറ്റർ നൽകിയ അന്തിമ ഉത്തരം ശരിയായിരുന്നോ? ഫലം: 90%.
40% വ്യത്യാസം അസാധ്യമായി തോന്നിപ്പിച്ചു. പത്ത് തവണയിൽ നാല് തവണ റിട്രീവർ ശരിയായ പേജ് കണ്ടെത്താൻ പരാജയപ്പെട്ടാൽ, എങ്ങനെയാണ് മോഡലിന് പത്ത് തവണയിൽ ഒമ്പത് തവണയും ശരിയായ ഉത്തരം നൽകാൻ കഴിയുന്നത്?
റിട്രീവറിനെ "ശരിയാക്കാനുള്ള" ആദ്യ ശ്രമങ്ങൾ
ഡെവലപ്പർ രണ്ട് സാധാരണ രീതികൾ പരീക്ഷിച്ചു:
- ഹൈബ്രിഡ് സെർച്ച് (Hybrid search) – ലെക്സിക്കൽ (lexical), വെക്റ്റർ (vector) സിഗ്നലുകൾ കൂട്ടിച്ചേർത്തു. റീക്കോൾ മാറ്റമില്ലാതെ തുടർന്നു.
- റീറങ്കർ (Reranker) – കണ്ടെത്തിയ അഞ്ച് പേജുകളെ പുനക്രമീകരിച്ചു. റീക്കോൾ 70% ആയി ഉയർന്നെങ്കിലും, 90% ഉത്തരം കൃത്യതയിൽ നിന്ന് അത് ഏറെ പിന്നിലായി തുടർന്നു.
ഈ രണ്ട് ടൂളുകളും നേരത്തെ കണ്ടെത്തിയ കാര്യങ്ങളെ പുനക്രമീകരിക്കുക മാത്രമേ ചെയ്യുന്നുള്ളൂ; കാൻഡിഡേറ്റ് സെറ്റിൽ (candidate set) ഇല്ലാത്ത ഒരു പേജിനെ അവയ്ക്ക് കണ്ടെത്താൻ കഴിയില്ല. പ്രശ്നം മറ്റൊരിടത്തായിരുന്നു.
മോഡലല്ല, മെട്രിക് (metric) ആണ് തകരാറിലായത്
പേജ് ലേബലിനെ അടിസ്ഥാനമാക്കി വിജയം വിലയിരുത്തുന്നതിന് പകരം, റിട്രീവ് ചെയ്ത ഭാഗങ്ങളിലെ (chunks) യഥാർത്ഥ വസ്തുതകൾ രചയിതാവ് പരിശോധിച്ചു. നാല് തവണത്തെ "പരാജയങ്ങളിൽ" മൂന്ന് തവണയും ശരിയായ വസ്തുത അവിടെ ഉണ്ടായിരുന്നു, എന്നാൽ ടെസ്റ്റ് സ്ക്രിപ്റ്റ് പ്രതീക്ഷിച്ച പേജിലല്ല അത് ഉണ്ടായിരുന്നത്. പ്രതീക്ഷിക്കാത്ത ഒരു പേജിൽ നിന്ന് ശരിയായ ഉത്തരം കണ്ടെത്തിയതിന് മൂല്യനിർണ്ണയ രീതി (evaluation) റിട്രീവറിനെ ശിക്ഷിക്കുകയായിരുന്നു.
"റിട്രീവ് ചെയ്ത ഏതെങ്കിലും ഭാഗത്ത് ആവശ്യമായ വസ്തുതയുണ്ടോ?" എന്ന രീതിയിലേക്ക് മെട്രിക് മാറിയപ്പോൾ, റീക്കോൾ 90% ആയി ഉയരുകയും ഉത്തരം കൃത്യതയുമായി പൊരുത്തപ്പെടുകയും ചെയ്തു. റിട്രീവർ ശരിയായി പ്രവർത്തിച്ചിരുന്നു; എന്നാൽ മൂല്യനിർണ്ണയ ചട്ടക്കൂട് (evaluation framework) പരാജയപ്പെടുകയായിരുന്നു.
പരമ്പരാഗത റീക്കോൾ (traditional recall) എന്തുകൊണ്ട് തെറ്റിദ്ധരിപ്പിക്കാം
- പേജ് തലത്തിലുള്ള ലേബലിംഗ് വ്യാജ പരാജയങ്ങൾ സൃഷ്ടിക്കുന്നു. ഒരു വസ്തുത പല പേജുകളിൽ കാണപ്പെടാം. ഒരു പേജിനെ മാത്രം 'ഗ്രൗണ്ട് ട്രൂത്ത്' (ground truth) ആയി അടയാളപ്പെടുത്തുന്നത്, മറ്റ് ശരിയായ ഫലങ്ങളെയും തെറ്റുകളായി കണക്കാക്കാൻ കാരണമാകുന്നു.
- ചെറിയ കോർപ്പസുകൾ (corpora) ഈ ഫലത്തെ വർദ്ധിപ്പിക്കുന്നു. കുറഞ്ഞ രേഖകൾ ഉള്ളപ്പോൾ, ഒരു തെറ്റായ ലേബൽ നൽകിയ പേജ് റീക്കോളിനെ വലിയ തോതിൽ ബാധിച്ചേക്കാം, എന്നാൽ ഉത്തരം കൃത്യതയിൽ മാറ്റം വരില്ല.
- എംബെഡിംഗ് നോയിസ് (Embedding noise) വസ്തുതകളെ മറച്ചുവെക്കുന്നു. വെക്റ്റർ സ്കോറുകൾ മുഴുവൻ പേജുകളെയും വിലയിരുത്തുന്നു; ചുറ്റുമുള്ള നിയമപരമോ സാങ്കേതികമോ ആയ പാഠഭാഗങ്ങൾ ലക്ഷ്യമിട്ട വാക്യത്തിന്റെ പ്രസക്തി കുറയ്ക്കുകയും, വസ്തുത അവിടെ ഉണ്ടെങ്കിൽ പോലും ആ പേജിന്റെ റാങ്കിംഗ് താഴേക്ക് തള്ളുകയും ചെയ്യുന്നു.
RAG പ്രായോഗികമായി നടപ്പിലാക്കുന്നവർക്കുള്ള പാഠങ്ങൾ
- റാങ്കിംഗിനെയും റിട്രീവൽ പരാജയങ്ങളെയും വേർതിരിക്കുക. റീറങ്കറുകൾ റാങ്കിംഗിനെ മാത്രമേ ശരിയാക്കൂ; ശരിയായ ഭാഗം കാൻഡിഡേറ്റ് സെറ്റിൽ എത്തിയില്ലെങ്കിൽ പുനക്രമീകരണം കൊണ്ട് ഒരു പ്രയോജനവുമില്ല.
- ടെസ്റ്റ് ഡാറ്റ വസ്തുതാ അടിസ്ഥാനത്തിൽ (fact level) ലേബൽ ചെയ്യുക. ഓരോ ക്വറിയെയും ഒരു ഡോക്യുമെന്റ് ഐഡന്റിഫയറുമായി ബന്ധിപ്പിക്കുന്നതിന് പകരം, അതിന് ആവശ്യമായ കൃത്യമായ വിവരവുമായി ബന്ധിപ്പിക്കുക.
- ചെറിയ ഡാറ്റാസെറ്റുകൾക്കായി വലിയ ബെഞ്ച്മാർക്കുകളെ വിശ്വസിക്കരുത്. ചെറിയ, പ്രത്യേക മേഖലകളിലുള്ള കോർപ്പസുകൾ വ്യത്യസ്തമായി പ്രവർത്തിക്കുന്നു, അതിനാൽ പൊതുവായ റീക്കോൾ സ്കോറുകൾ തെറ്റിദ്ധരിപ്പിച്ചേക്കാം.
- എംബെഡിംഗ് ഗ്രാനുലാരിറ്റി (embedding granularity) ശ്രദ്ധിക്കുക. ഒരു പേജ് വലിപ്പമുള്ള ഭാഗത്ത് ധാരാളം വാക്കുകൾ ഉണ്ടാകാം, ചുറ്റുമുള്ള നിയമപരമായ പാഠഭാഗങ്ങൾ നിങ്ങൾ തിരയുന്ന വസ്തുതയുടെ റാങ്ക് കുറയ്ക്കാൻ കാരണമായേക്കാം.
ചുരുക്കത്തിൽ: മൂല്യനിർണ്ണയം ജോലിയുമായി പൊരുത്തപ്പെടാത്ത സാഹചര്യത്തിൽ, ഉയർന്ന ഉത്തരം കൃത്യതയും കുറഞ്ഞ പരമ്പരാഗത റീക്കോൾ നിരക്കും ഒരേസമയം ഉണ്ടാകാം. മോഡലിനെ ശരിയാക്കുന്നതിന് പകരം മെട്രിക് ശരിയാക്കുന്നത് സമയം ലാഭിക്കാനും തെറ്റായ മുന്നറിയിപ്പുകൾ ഒഴിവാക്കാനും കൂടുതൽ വിശ്വസനീയമായ RAG സംവിധാനങ്ങൾ ഉണ്ടാക്കാനും സഹായിക്കും.
