ટેસ્ટ કેવી રીતે સેટ કરવામાં આવી હતી
લેખકે બે પેમેન્ટ-રૂલબુક દસ્તાવેજો પર આધારિત એક નાની retrieval-augmented generation (RAG) સિસ્ટમ બનાવી અને બે ચકાસણીઓ કરી:
- Recall ટેસ્ટ – શું સાચું પેજ ટોચના પાંચ પરિણામોમાં દેખાયું? પરિણામ: 60%.
- Answer ટેસ્ટ – શું જનરેટર દ્વારા આપવામાં આવેલ અંતિમ જવાબ સાચો હતો? પરિણામ: 90%.
40% નો તફાવત અશક્ય લાગતો હતો. જો રીટ્રાઇવર (retriever) દસમાંથી ચાર વખત સાચું પેજ ચૂકી જાય, તો મોડેલ દસમાંથી નવ વખત સાચો જવાબ કેવી રીતે આપી શકે?
રીટ્રાઇવરને “સુધારવા” માટેના પ્રથમ પ્રયાસો
ડેવલપરે બે સામાન્ય યુક્તિઓ અજમાવી:
- Hybrid search – લેક્સિકલ (lexical) અને વેક્ટર સિગ્નલોનું મિશ્રણ. Recall સમાન રહ્યો.
- Reranker – મેળવેલા પાંચ પેજને ફરીથી ક્રમબદ્ધ કરવા. Recall વધીને 70% થયો પરંતુ તે હજુ પણ 90% એન્સર એક્યુરેસી (answer accuracy) કરતા ઘણો પાછળ હતો.
બંને સાધનો ફક્ત પહેલેથી મેળવેલી માહિતીને જ ફરીથી ગોઠવે છે; જે પેજ કેન્ડિડેટ સેટમાં ક્યારેય આવ્યું જ નથી તેને તેઓ લાવી શકતા નથી. સમસ્યા બીજે ક્યાંક હતી.
મોડેલ નહીં, પણ મેટ્રિક (metric) ખામીયુક્ત હતું
સફળતાનો નિર્ણય પેજ લેબલ દ્વારા કરવાને બદલે, લેખકે રીટ્રાઇવ કરેલા ચંક્સ (chunks) માં રહેલા વાસ્તવિક તથ્યોની તપાસ કરી. ચારમાંથી ત્રણ “મિસ” (misses) ના કિસ્સામાં, સાચો તથ્ય હાજર હતો, પરંતુ તે ટેસ્ટ સ્ક્રિપ્ટ અપેક્ષા રાખતી પેજ કરતા અલગ પેજ પર હતો. મૂલ્યાંકન પદ્ધતિએ અણધારી પેજ પર સાચો જવાબ શોધવા બદલ રીટ્રાઇવરને દંડિત (penalised) કર્યો.
જ્યારે મેટ્રિક બદલીને “શું કોઈપણ રીટ્રાઇવ કરેલા ચંકમાં જરૂરી તથ્ય છે?” કરવામાં આવ્યું, ત્યારે recall વધીને 90% થઈ ગયો, જે એન્સર એક્યુરેસી સાથે સુસંગત હતો. રીટ્રાઇવર કામ કરી રહ્યું હતું; મૂલ્યાંકન ફ્રેમવર્ક (evaluation framework) કામ નહોતું કરી રહ્યું.
પરંપરાગત recall શા માટે ભ્રામક હોઈ શકે છે
- પેજ-લેવલ લેબલિંગ કાલ્પનિક નિષ્ફળતાઓ ઊભી કરે છે. એક જ તથ્ય અનેક પેજ પર હોઈ શકે છે. માત્ર એક જ પેજને ગ્રાઉન્ડ ટ્રુથ (ground truth) તરીકે ટેગ કરવાથી અન્ય તમામ સાચા પરિણામોને ભૂલો તરીકે ગણવામાં આવે છે.
- નાના કોર્પોરા (corpora) આ અસરને વધારે છે. ઓછા દસ્તાવેજો હોવાથી, એક ખોટું લેબલ કરેલું પેજ recall માં મોટો ફેરફાર લાવી શકે છે જ્યારે એન્સર એક્યુરેસી સ્થિર રહે છે.
- એમ્બેડિંગ નોઈઝ (Embedding noise) તથ્યોને છુપાવે છે. વેક્ટર આખા પેજને સ્કોર આપે છે; આસપાસના કાયદાકીય અથવા ટેકનિકલ લખાણ લક્ષિત વાક્યના સુસંગતતા સિગ્નલને નબળું પાડે છે, જેના કારણે તથ્ય હાજર હોવા છતાં પેજનું રેન્કિંગ નીચે જાય છે.
RAG પ્રેક્ટિશનરો માટે વ્યવહારુ ઉપાયો
- રેન્કિંગને રીટ્રાઇવલ નિષ્ફળતાઓથી અલગ કરો. Rerankers ફક્ત પહેલાને (રેન્કિંગને) સુધારે છે; જો સાચો ચંક કેન્ડિડેટ સેટમાં ક્યારેય ન આવે, તો ફરીથી ક્રમબદ્ધ કરવાથી કોઈ ફાયદો થતો નથી.
- ટેસ્ટ ડેટાને તથ્ય સ્તરે (fact level) લેબલ કરો. દરેક ક્વેરીને તેના માટે જરૂરી ચોક્કસ માહિતી સાથે જોડો, નહીં કે માત્ર કોઈ એક દસ્તાવેજ આઈડેન્ટિફાયર સાથે.
- નાના ડેટાસેટ્સ માટે મોટા પાયાના બેન્ચમાર્ક પર વિશ્વાસ ન કરો. નાના, ડોમેન-વિશિષ્ટ કોર્પોરા અલગ રીતે વર્તે છે, અને સામાન્ય recall સ્કોર્સ ભ્રામક હોઈ શકે છે.
- એમ્બેડિંગ ગ્રેન્યુલારિટી (embedding granularity) પર ધ્યાન આપો. પેજ-સાઇઝના ચંકમાં ઘણા શબ્દો હોય છે, અને આસપાસનું કાયદાકીય લખાણ તમારા માટે મહત્વના તથ્યનું રેન્કિંગ ઘટાડી શકે છે.
સારાંશ: જ્યારે મૂલ્યાંકન કાર્ય સાથે સુસંગત ન હોય, ત્યારે ઉચ્ચ એન્સર-એક્યુરેસી સ્કોર અને નીચો પરંપરાગત recall આંકડો એકસાથે હોઈ શકે છે. મોડેલને બદલે મેટ્રિકને સુધારવાથી સમય બચે છે, ખોટા એલાર્મ ઘટે છે અને વધુ વિશ્વસનીય RAG ડિપ્લોયમેન્ટ્સ મળે છે.
