યુનિવર્સિટી ઓફ ઇલિનોઇસ અર્બાના-ચંપેન (University of Illinois Urbana-Champaign) ની એક સંશોધન ટીમે શોધી કાઢ્યું છે કે વ્યાપકપણે ઉપયોગમાં લેવાતા BIRD Text-to-SQL બેન્ચમાર્કમાં અડધાથી વધુ એનોટેશન ખોટા છે, જે ઘણા ડેવલપર્સ જે ચોકસાઈના સ્કોર (accuracy scores) પર આધાર રાખે છે તેના પર પ્રશ્નો ઉભા કરે છે.
આ બેન્ચમાર્ક શા માટે મહત્વપૂર્ણ છે
BIRD એ મોડેલ કુદરતી ભાષાના (natural-language) પ્રશ્નને SQL ક્વેરીમાં કેટલી સારી રીતે રૂપાંતરિત કરી શકે છે તે માપવા માટેનું સ્ટાન્ડર્ડ છે. પેપર્સ, પ્રોડક્ટ શીટ્સ અને હાયરિંગ ટેસ્ટમાં BIRD સ્કોરનો ઉલ્લેખ કરવામાં આવે છે. જો સાચાપણું નક્કી કરતા "ગોલ્ડ" (gold) SQL સ્ટેટમેન્ટ્સમાં ખામી હોય, તો વધુ સારી ક્વેરી લખતા મોડેલને દંડિત કરી શકાય છે, જ્યારે ભૂલભરેલા ગોલ્ડ જવાબની નકલ કરતા મોડેલને પુરસ્કાર આપી શકાય છે.
ભૂલનો દર કેવી રીતે બહાર આવ્યો
UIUC ટીમે BIRD-dev સ્પ્લિટમાંથી 238 નિષ્ફળતાઓનું પરીક્ષણ કર્યું. દરેક મોડેલ આઉટપુટ શા માટે ખોટું ગણવામાં આવ્યું તેનો અંદાજ લગાવવાને બદલે, તેઓએ મોડેલ દ્વારા જનરેટ કરેલ SQL અને ગોલ્ડ રેફરન્સ વચ્ચેની દરેક વિસંગતતાને મેન્યુઅલી ટેગ કરી. તેમના ઓડિટમાં જાણવા મળ્યું કે 52.8% કિસ્સાઓમાં એનોટેશનની ભૂલ છે—ખોટું SQL, ખોટું સ્કીમા (mismatched schema), અથવા ખોટી રીતે રચાયેલ નેચરલ-લેંગ્વેજ પ્રશ્ન.
એક પેટર્ન દ્વારા ફ્લેગ કરેલી ભૂલોના 19% ભાગનું કારણ મળ્યું: મોડેલે DISTINCT નો ઉપયોગ કર્યો હતો જ્યારે ગોલ્ડ ક્વેરીમાં તેનો ઉપયોગ નહોતો કર્યો. કલ્પના કરો કે કોઈ વપરાશકર્તા અસામાન્ય લેબ પરિણામો ધરાવતા દર્દીઓની સંખ્યા પૂછી રહ્યો છે. ગોલ્ડ જવાબ COUNT(ID) સાથેની રો (rows) ગણે છે. જો એક જ દર્દીના પાંચ અસામાન્ય લેબ રિપોર્ટ હોય, તો ગોલ્ડ ક્વેરી એકને બદલે પાંચ રિપોર્ટ બતાવે છે. મોડેલનું COUNT(DISTINCT ID) દરેક દર્દીને એક જ વાર સાચી રીતે ગણે છે. આ કિસ્સાઓમાં, બેન્ચમાર્ક મોડેલની ભૂલ નોંધે છે, ભલે મોડેલનો જવાબ ઈચ્છિત અર્થ (semantics) સાથે વધુ સારી રીતે સુસંગત હોય.
મોડેલ ડેવલપમેન્ટ પર વાસ્તવિક દુનિયાની અસર
ડેવલપર્સ ઘણીવાર પ્રોમ્પ્ટ્સમાં ફેરફાર કરીને, “don’t use DISTINCT” જેવા નિયમો ઉમેરીને અથવા બેન્ચમાર્ક ડેટા પર ફરીથી તાલીમ આપીને ઓછા BIRD સ્કોર સામે પ્રતિક્રિયા આપે છે. આ ફેરફારો રિપોર્ટેડ સ્કોર વધારી શકે છે, જે પ્રગતિનો ભ્રમ પેદા કરે છે. UIUC વિશ્લેષણ દર્શાવે છે કે આ “સુધારો” કદાચ માત્ર ખોટા જવાબ સાથે ઓવરફિટિંગ (overfitting) હોઈ શકે છે, જે વાસ્તવિક ડેટાબેઝ પર કામગીરી ઘટાડી શકે છે જ્યાં સુધારેલા લોજિકની જરૂર હોય છે.
સંશોધકોએ તેનાથી વિરુદ્ધ પરિસ્થિતિ દર્શાવી. મોડેલ અને ગોલ્ડ બંને ક્વેરીઝનું વિશ્લેષણ કર્યા પછી, તેઓએ સાત એવા કિસ્સાઓ ઓળખ્યા જ્યાં મોડેલે બે અલગ-અલગ કોલમને ભૂલથી એકમાં ભેગી કરી દીધી હતી. આ કિસ્સાઓમાં ગોલ્ડ SQL સાચું હતું. માત્ર તે વાસ્તવિક ભૂલોને સુધારેલા પ્રોમ્પ્ટ સાથે લક્ષ્ય બનાવીને, તેઓએ બેન્ચમાર્ક સ્કોર વધાર્યા વગર મોડેલની કામગીરી વધારી.
હિતધારકો (Stakeholders) માટે આ તારણોનો અર્થ શું છે
- સંશોધકો (Researchers): BIRD સ્કોર પર આધારિત પ્રકાશનોમાં એનોટેશનની ગુણવત્તા વિશે ચેતવણી આપવી જરૂરી છે. પેપર્સ વચ્ચેની સરખામણી સાચી પદ્ધતિગત પ્રગતિને બદલે બેન્ચમાર્ક નોઈઝ (noise) પ્રત્યેના અલગ-અલગ સહિષ્ણુતાને પ્રતિબિંબિત કરી શકે છે.
- પ્રોડક્ટ ટીમો (Product teams): રિલીઝ માટે માત્ર BIRD પર નિર્ભર રહેવું એ એવા મોડેલ્સ લોન્ચ કરવાનું જોખમ ઊભું કરે છે જેણે ભૂલભરેલી ક્વેરીઝનું પુનરાવર્તન કરવાનું શીખી લીધું હોય. પ્રોપ્રાઈટરી સ્કીમા પર વાસ્તવિક દુનિયાનું પરીક્ષણ આવશ્યક બની જાય છે.
- બેન્ચમાર્ક ક્યુરેટર્સ (Benchmark curators): ઊંચો ભૂલનો દર સૂચવે છે કે પદ્ધતિસરની સમીક્ષા હવે અનિવાર્ય છે. ગોલ્ડ સેટને સાફ કરવો અથવા સેકન્ડરી “વેરિફાઇડ” સ્પ્લિટ આપવાથી વિશ્વાસ પુનઃસ્થાપિત થઈ શકે છે.
એક વ્યવહારુ ઓડિટ વર્કફ્લો
UIUC ટીમ એક હળવી પ્રક્રિયા સૂચવે છે જે કોઈપણ Text-to-SQL બેન્ચમાર્ક પર લાગુ કરી શકાય છે:
- Parse મોડેલ દ્વારા જનરેટ કરેલ અને ગોલ્ડ બંને SQL સ્ટેટમેન્ટ્સને એબ્સ્ટ્રેક્ટ સિન્ટેક્સ ટ્રીઝમાં રૂપાંતરિત કરો.
- Align પસંદ કરેલા કોલમ્સ, ફિલ્ટર્સ, જોઇન્સ અને એગ્રીગેશન ફંક્શન્સમાં તફાવત શોધવા માટે સ્ટ્રક્ચરને ગોઠવો.
- Tag દરેક તફાવતને ટેગ કરો (દા.ત., વધારાની કોલમ, ખૂટતું ફિલ્ટર, ખોટું એગ્રીગેશન).
- Summarize મુખ્ય ભૂલ શ્રેણીઓને ઓળખવા માટે હિસ્ટોગ્રામમાં ટેગ્સનો સારાંશ આપો.
- Validate પ્રોમ્પ્ટ એન્જિનિયરિંગ માટે લક્ષ્ય તરીકે ઉપયોગ કરતા પહેલા દરેક હાઈ-ફ્રિકવન્સી ટેગ માટે ગોલ્ડ ક્વેરીને ચકાસો.
પ્રોમ્પ્ટ સુધારા માત્ર તે કિસ્સાઓ પર ધ્યાન કેન્દ્રિત કરીને જ્યાં ગોલ્ડ જવાબ નિર્વિવાદ રીતે સાચો હોય, ડેવલપર્સ “ખામીયુક્ત મેટ્રિક માટે ઓપ્ટિમાઇઝિંગ” ના બાલિશથી બચી શકે છે.
નિષ્કર્ષ
એક બેન્ચમાર્ક જે તેના અડધાથી વધુ ઉદાહરણોને ખોટી રીતે લેબલ કરે છે તે વિશ્વસનીય માપદંડ તરીકે કામ કરી શકતું નથી. UIUC અભ્યાસ દર્શાવે છે કે BIRD દ્વારા ફ્લેગ કરવામાં આવેલી ઘણી “ભૂલો” વાસ્તવમાં મોડેલની સફળતા છે, જ્યારે વાસ્તવિક ભૂલો સાચા ગોલ્ડ જવાબો પાછળ છુપાયેલી છે. ગોલ્ડ સેટનું ઓડિટ કરવું, ઇવેલ્યુએશન પાઇપલાઇન્સને સુધારવી અને બેન્ચમાર્ક સ્કોરને વ્યાપક વેલિડેશન વ્યૂહરચનાના એક ભાગ તરીકે ગણવા એ સુનિશ્ચિત કરવાના એકમાત્ર રસ્તા છે કે કાગળ પર થયેલા સુધારાઓ વાસ્તવિક દુનિયાની વિશ્વસનીયતામાં પરિવર્તિત થાય.
