SWE-Prime દર્શાવે છે કે દરેક સફળ ટ્રેજેક્ટરી (trajectory) ને મોડેલમાં ફીડ કરવાને બદલે, સાવચેતીપૂર્વક પસંદ કરેલા ૧૦% "pass" રન પર તાલીમ આપવાથી વધુ મજબૂત AI એજન્ટ્સ બને છે, જે "pass" લેબલને વિશ્વસનીય ગુણવત્તા ફિલ્ટર તરીકે માનવાની લાંબા સમયથી ચાલી આવતી આદત પર સવાલ ઉઠાવે છે.

કોડ-જનરેશન અથવા ઓટોમેટેડ ડીબગિંગ એજન્ટ્સ બનાવનાર કોઈપણ વ્યક્તિ માટે આ પરિણામ મહત્વનું છે: વધુ ડેટાનો અર્થ આપમેળે વધુ સારું પ્રદર્શન એવો નથી થતો, અને બાઈનરી pass/fail ફ્લેગ પરનું અવિચારી નિર્ભરતા વાસ્તવમાં મોડેલ્સને ભટકી જવા, નકામા ટૂલ કોલ્સનું પુનરાવર્તન કરવા અને તર્કને બદલે નસીબ પર આધાર રાખવાનું શીખવી શકે છે.

"pass" ફ્લેગ પર શા માટે વિશ્વાસ કરવામાં આવતો હતો

મોટાભાગના reinforcement-learning-from-human-feedback પાઇપલાઇન્સમાં, જ્યારે અંતિમ પરિણામ ટેસ્ટના માપદંડોને પૂર્ણ કરે છે, ત્યારે એન્જિનિયરો એક ટ્રેજેક્ટરી—જે અવલોકનો, ક્રિયાઓ અને ટૂલ ઇન્વોકેશનનો સંપૂર્ણ સિક્વન્સ છે—તેને "pass" તરીકે લેબલ કરે છે. ધારણા સરળ છે: જો એજન્ટ સફળ રહ્યો હોય, તો આખા એપિસોડમાં ઉપયોગી વર્તન હોવું જોઈએ. તેથી તેઓ દરેક પાસ થતા રનને ટ્રેનિંગ પૂલમાં નાખી દે છે, આશા સાથે કે મોડેલ સફળતા તરફ દોરી જનારા પેટર્નને ગ્રહણ કરશે.

આ ધારણાએ મહિનાઓ સુધી સોફ્ટવેર-એન્જિનિયરિંગ (SWE) એજન્ટ્સ માટે મોટા પાયે ડેટા કલેક્શનનું માર્ગદર્શન આપ્યું છે. તર્ક મજબૂત લાગે છે: "pass" એ સૂચવે છે કે એજન્ટે સમસ્યાનો ઉકેલ લાવી દીધો છે, તેથી એપિસોડ એ પોલિસીઓને મજબૂત બનાવવો જોઈએ જેનાથી તે શક્ય બન્યું હતું.

SWE-Prime એ શું અલગ કર્યું

SWE-Prime અભ્યાસે આ પદ્ધતિને બદલી નાખી. સંશોધકોએ કોડ-રાઈટિંગ કાર્યોના એક સ્ટાન્ડર્ડ બેન્ચમાર્ક લીધા અને સફળ રનને બે જૂથોમાં વહેંચી દીધા:

  1. બધી pass ટ્રેજેક્ટરીઓ – પરંપરાગત ટ્રેનિંગ સેટ, જેમાં ટેસ્ટ પાસ કરનાર દરેક એપિસોડ સામેલ છે.
  2. એક પસંદ કરેલ (curated) ૧૦% સબસેટ – સંપૂર્ણ સેટમાંથી હાથથી પસંદ કરેલ.

બંને જૂથોએ સમાન મોડેલ આર્કિટેક્ચર પર fine-tune કર્યું. જ્યારે અલગ રાખવામાં આવેલા (held-out) પ્રશ્નો પર મૂલ્યાંકન કરવામાં આવ્યું, ત્યારે પસંદ કરેલા સબસેટ પર તાલીમ પામેલા મોડેલે સંપૂર્ણ pass સેટ પર તાલીમ પામેલા મોડેલ કરતા વધુ સારું પ્રદર્શન કર્યું.

"pass" લેબલને બગાડતી પેટર્ન

અભ્યાસે pass ફ્લેગ પાછળ છુપાયેલા કેટલાક વારંવાર બનતા નિષ્ફળતાના પ્રકારોની યાદી બનાવી:

  • વારંવાર ટૂલ સ્પેમિંગ (Repeated tool spamming) – એક એજન્ટ અંતિમ રીતે સાચો આઉટપુટ મેળવતા પહેલા ડઝનબંધ વખત એક જ કમ્પાઈલર અથવા લિન્ટરનો ઉપયોગ કરી શકે છે. અંતિમ સફળતા તેની બિનકાર્યક્ષમતાને છુપાવી દે છે.
  • લાંબા ભટકતા તબક્કા (Long meandering phases) – એજન્ટો ક્યારેક સાચા ઉકેલ સુધી પહોંચતા પહેલા પાંચ અથવા વધુ અપ્રસ્તુત પગલાંઓ અપનાવે છે. એપિસોડ હજુ પણ "pass" સાથે સમાપ્ત થાય છે, છતાં ટ્રેજેક્ટરીનો મોટાભાગનો ભાગ કોઈ શૈક્ષણિક મૂલ્ય આપતો નથી.
  • સામાન્ય ટેસ્ટ (Trivial tests) – કેટલાક બેન્ચમાર્ક એટલા સરળ હોય છે કે એજન્ટ માત્ર એક અનુમાન અથવા કોઈ ખામીનો (loophole) ઉપયોગ કરીને સફળ થઈ શકે છે. "pass" લેબલ વાસ્તવિક તર્ક અને નસીબ વચ્ચે તફાવત કરી શકતું નથી.

જ્યારે આવા એપિસોડ્સ ફરીથી ટ્રેનિંગ લૂપમાં આવે છે, ત્યારે મોડેલ યાદચ્છિક ભટકણ અને ટૂલના અતિશય ઉપયોગને સફળતા સાથે જોડવાનું શીખે છે. અસરકારક રીતે, એજન્ટ "જ્યાં સુધી કંઈક કામ ન કરે ત્યાં સુધી પ્રયત્ન કરતા રહો" એવો નિયમ (heuristic) અપનાવી લે છે, જે કાર્યક્ષમતા અને સમજણની જરૂર હોય તેવા પ્રોડક્શન-ગ્રેડ સિસ્ટમ્સ માટે અણિચ્છનીય છે.

સેગમેન્ટ-સ્તરની ગુણવત્તા વિરુદ્ધ ટ્રેજેક્ટરી-સ્તરનું પરિણામ

SWE-Prime માંથી મળેલી એક મુખ્ય સમજ એ છે કે ટ્રેજેક્ટરીના એકંદર પરિણામ અને તેના ઘટક સેગમેન્ટ્સની ગુણવત્તા વચ્ચેનો તફાવત. ટ્રેજેક્ટરી એ એક સપાટી પરનું લેબલ છે: તે તમને જણાવે છે કે અંતિમ જવાબ સાચો હતો કે નહીં, પરંતુ તે આંતરિક નિર્ણય લેવાની પ્રક્રિયાને છુપાવે છે. અભ્યાસે અવલોકન કર્યું:

  • સારી ટ્રેજેક્ટરીઓમાં ખરાબ સેગમેન્ટ હોઈ શકે છે – અન્યથા કાર્યક્ષમ ઉકેલમાં કેટલાક બિનજરૂરી પગલાં હોઈ શકે છે જે અંતિમ જવાબમાં કોઈ ફાળો આપતા નથી.
  • નિષ્ફળ ટ્રેજેક્ટરીઓમાં શાનદાર સેગમેન્ટ છુપાયેલા હોઈ શકે છે – કોઈ અસંબંધિત ભૂલને કારણે ટેસ્ટ નિષ્ફળ જાય તે પહેલાં એજન્ટ એક સંપૂર્ણ તર્કબદ્ધ યોજના બનાવી શકે છે.

આખા રનને બદલે સેગમેન્ટ્સને સ્કોર કરીને, સંશોધકોએ એવા એપિસોડ્સ રાખ્યા જેમાં એજન્ટે પ્રથમ પગલાથી જ હેતુપૂર્વક કામ કર્યું હતું અને બાકીના કાઢી નાખ્યા. આ ટ્રેનિંગ સિગ્નલને તે તર્કબદ્ધ પેટર્ન સાથે સુસંગત બનાવે છે જેનું મોડેલ્સ દ્વારા અનુકરણ કરવા અમે ખરેખર ઈચ્છીએ છીએ.

ખર્ચ અને ઝડપના ફાયદા

ડેટાના દસમા ભાગ પર તાલીમ આપવાથી કમ્પ્યુટિંગ ખર્ચમાં પણ મોટો ઘટાડો થયો. ટીમને ઘણા ઓછા GPU કલાકોની જરૂર પડી, અને પાઇપલાઇન સંપૂર્ણ-પાસ સેટ માટે જરૂરી સમયના માત્ર એક ભાગમાં પૂર્ણ થઈ ગઈ. આ વિરોધાભાસ નોંધપાત્ર છે: તેઓએ વધુ સારું પ્રદર્શન મેળવતા કમ્પ્યુટિંગ માટે ઓછો ખર્ચ કર્યો. મર્યાદિત બજેટ અથવા મોટા પાયે ડિપ્લોયમેન્ટના લક્ષ્યો ધરાવતી સંસ્થાઓ માટે, આ બચત નોંધપાત્ર છે.

ક્યુરેશન (Curation) માટેનો પડકાર

આ અભિગમને અપનાવવામાં સૌથી મોટો અવરોધ એ છે કે "સારો સેગમેન્ટ" કયો ગણવો. SWE-Prime ટીમે નોંધ્યું કે મોંઘા રિવોર્ડ મોડેલ વગર સેગમેન્ટ્સને સ્કોર કરવા મુશ્કેલ છે અને તેના માટે ચતુર, હળવા (lightweight) મેટ્રિકની જરૂર છે.

મુખ્ય વાત (Takeaway)

SWE-Prime દર્શાવે છે કે ટ્રેનિંગ ડેટા માટે બાઈનરી “passed the test” ફ્લેગ એ એક અવિશ્વસનીય ફિલ્ટર છે. ભટકતા એપિસોડ્સ, બિનજરૂરી ટૂલ કોલ્સ અને અત્યંત સરળ રન દૂર કરીને, ડેવલપર્સ કોમ્પ્યુટ ખર્ચ ઘટાડીને વધુ સક્ષમ અને કાર્યક્ષમ એજન્ટ્સને ટ્રેન કરી શકે છે. બોધપાઠ સ્પષ્ટ છે: જથ્થા કરતાં ગુણવત્તા વધુ મહત્વની છે, અને સ્માર્ટ AI એજન્ટ્સ તરફનો માર્ગ દરેક સ્ટેપ ખરેખર શું યોગદાન આપે છે તેના ઝીણવટભર્યા મૂલ્યાંકનમાં રહેલો છે.