સંશોધકોએ Ring-Zero નામનું એક નવું રીઇન્ફોર્સમેન્ટ-લર્નિંગ ફ્રેમવર્ક જાહેર કર્યું છે જે એક ટ્રિલિયન-પેરામીટર લેંગ્વેજ મોડેલને ટોકન-બજેટ મર્યાદામાં રહીને તર્ક (reasoning) કરવાનું શીખવે છે, અને આ મોડેલે 2026 AIME ગણિતની પરીક્ષામાં 84.2% સ્કોર કર્યો છે. આ પરિણામ દર્શાવે છે કે, આ સ્કેલ પર, મોડેલ સમસ્યા ઉકેલવાની સ્ટેપ-બાય-સ્ટેપ આદતો મેળવી શકે છે જે એન્જિનિયરો પરંપરાગત રીતે પ્રોમ્પ્ટ્સમાં હાર્ડ-કોડ કરે છે.

તે શા માટે મહત્વનું છે

AIME-સ્તરનું પ્રદર્શન લાંબા સમયથી "માનવ-સ્તરના" ક્વોન્ટિટેટિવ રીઝનિંગ માટે એક બેન્ચમાર્ક રહ્યું છે. કોઈપણ માનવ-લેખિત ઉદાહરણો વિના 84.2% ની રેન્જ પ્રાપ્ત કરવી એ સૂચવે છે કે મોડેલની તર્ક કરવાની ક્ષમતાઓ ટ્રેનિંગ ડાયનેમિક્સમાંથી જ ઉદભવે છે, નહીં કે હાથથી બનાવેલા સ્કેફોલ્ડ્સ (scaffolds) માંથી. AI એજન્ટ્સ બનાવતી કંપનીઓ માટે, તેનો અર્થ સ્પષ્ટ છે: જટિલ પ્રોમ્પ્ટ રેસિપી લખવા અને જાળવવાની જગ્યાએ એક એવું ટ્રેનિંગ લૂપ આવી શકે છે જે મોડેલને શીખવે કે ક્યારે વધુ ઊંડાણપૂર્વક વિચારવું અને ક્યારે સસ્તો શોર્ટકટ વાપરવો.

પ્રોમ્પ્ટ એન્જિનિયરિંગથી ટ્રેનિંગ ડાયનેમિક્સ સુધી

વર્ષોથી, ડેવલપર્સ લાર્જ લેંગ્વેજ મોડેલ્સને મલ્ટી-સ્ટેપ રીઝનિંગ માટે તૈયાર કરવા માટે "સમસ્યાને ભાગોમાં વહેંચો" અથવા "તમારા જવાબની ચકાસણી કરો" જેવા પ્રોમ્પ્ટ ટેમ્પલેટ્સ પર આધાર રાખતા હતા. તે ટેમ્પલેટ્સ બાહ્ય સ્કેફોલ્ડિંગ તરીકે કામ કરે છે; મોડેલ સૂચનાઓનું પાલન કરે છે પરંતુ પ્રક્રિયાને આંતરિક રીતે અપનાવતું નથી. Ring-Zero આ વિચારધારાને બદલી નાખે છે. મોડેલને કાર્યના વર્ણન સાથે એક ચકાસી શકાય તેવો જવાબ (verifiable answer) મળે છે—એક ગ્રાઉન્ડ-ટ્રુથ જેને આપમેળે તપાસી શકાય છે. ત્યારબાદ તે પ્રયાસોની શ્રેણી બનાવે છે, અને જ્યારે પ્રયાસ ચકાસી શકાય તેવા જવાબ સાથે મેળ ખાય ત્યારે જ રિવોર્ડ મેળવે છે, અને રીઇન્ફોર્સમેન્ટ લર્નિંગ દ્વારા તેની પોલિસી અપડેટ કરે છે.

કારણ કે રિવોર્ડ એવા ઉદ્દેશ્ય સાથે જોડાયેલ છે જેમાં છેતરપિંડી કરવી મુશ્કેલ છે (જવાબ માત્ર સંભવિત જ નહીં, પણ સાચો હોવો જોઈએ), મોડેલ જાતે જ રીઝનિંગ પેટર્ન શોધી કાઢે છે. પેપર દલીલ કરે છે કે એકવાર વિશ્વસનીય રિવોર્ડ સિગ્નલ સેટ થઈ જાય પછી, મોડેલને ટ્રિલિયન પેરામીટર્સ સુધી સ્કેલ કરવાથી એવા પ્રકારની પ્રોમ્પ્ટ-એન્જિનિયરિંગ ટ્રિક્સ આપમેળે સામે આવે છે જે એન્જિનિયરોએ નાના મોડેલો માટે મેન્યુઅલી ઉમેરી હતી.

ચાર-તબક્કાની ટ્રેનિંગ પાઇપલાઇન

Ring-Zero ની ટ્રેનિંગ ચાર અલગ-અલગ તબક્કાઓ દ્વારા આગળ વધે છે:

  1. પ્રથમ તબક્કાનું RL – મોડેલ સંભવિત રીઝનિંગ ટ્રેસિસ (reasoning traces) શોધે છે, અને શીખે છે કે કયા ટોકન સિક્વન્સ સાચા જવાબો તરફ દોરી જાય છે.
  2. સેલ્ફ-ડિસ્ટિલેશન (Self-distillation) – ઉચ્ચ-ગુણવત્તાવાળા ટ્રેસિસ મોડેલમાં પાછા ફરે છે, જે ઉભરી આવતી રીઝનિંગ પેટર્નને સ્થિર કરે છે.
  3. બીજા તબક્કાનું RL – એક વધુ ઝીણવટભર્યું લૂપ અગાઉના સુધારાઓને જાળવી રાખીને પોલિસીને વધુ સચોટ બનાવે છે.
  4. ટાયર્ડ ટ્રેનિંગ (Tiered training) – મોડેલ સમસ્યાની મુશ્કેલીના આધારે ટૂંકા (≈2k ટોકન્સ) અને લાંબા (≈20k ટોકન્સ) રીઝનિંગ પાથ વચ્ચે પસંદગી કરીને ટોકન બજેટને બુદ્ધિપૂર્વક ફાળવવાનું શીખે છે.

ટાયર્ડ ટ્રેનિંગ એ પ્રોડક્શન માટે સૌથી વધુ સુસંગત ભાગ છે. વાસ્તવિક ડિપ્લોયમેન્ટમાં, દરેક વધારાનો ટોકન કમ્પ્યુટ ખર્ચ વધારે છે. મોડેલને એ ઓળખતા શીખવીને કે ક્યારે સમસ્યા ટૂંકા જવાબ માટે પૂરતી સરળ છે અને ક્યારે તે ઊંડાણપૂર્વક, મલ્ટી-સ્ટેપ વિશ્લેષણની માંગ કરે છે, Ring-Zero રીઝનિંગની ગુણવત્તાને સીધી આર્થિક કાર્યક્ષમતા સાથે જોડે છે.

શીખવાના બે તબક્કા: ડિસ્કવરી અને શાર્પનિંગ

લેખકો શીખવાની પ્રક્રિયાને બે તબક્કા તરીકે વર્ણવે છે:

  • ડિસ્કવરી (Discovery) – શરૂઆતના રીઇન્ફોર્સમેન્ટ-લર્નિંગ સ્ટેપ્સમાં ઘણો અવાજ (noise) હોય છે; મોડેલ વિવિધ પ્રકારની વ્યૂહરચનાઓ અજમાવે છે, જેમાંથી ઘણી નિષ્ફળ જાય છે. નવા રીઝનિંગ માર્ગો શોધવા માટે આ વિવિધતા (variance) આવશ્યક છે.
  • શાર્પનિંગ (Sharpening) – એકવાર આશાસ્પદ પેટર્ન સામે આવે, પછી પછીના RL સ્ટેપ્સ પોલિસીને વધુ સચોટ બનાવે છે, વિવિધતા ઘટાડે છે અને વર્તનને મજબૂત બનાવે છે.

આ પ્રગતિ મનુષ્યો કેવી રીતે સુધરે છે તેનું પ્રતિબિંબ પાડે છે: શરૂઆતમાં વિચારમંથન અને ત્યારબાદ કેન્દ્રિત અભ્યાસ. મુખ્ય સમજ એ છે કે "અસ્તવ્યસ્ત" શરૂઆતના તબક્કાને દબાવવાને બદલે સ્વીકારવો જોઈએ, કારણ કે તે પછીના રિફાઇનમેન્ટ માટે કાચો માલ પૂરો પાડે છે.

શું ખોટું થઈ શકે છે?

પેપરનો આશાવાદ કેટલાક ધારણાઓ પર આધારિત છે જેની તપાસ જરૂરી છે:

  • રિવોર્ડ ડિઝાઇન – આ ફ્રેમવર્કને એવા રિવોર્ડની જરૂર છે જે ચકાસી શકાય તેવો અને શોર્ટકટથી બચી શકે તેવો હોય. ઘણા વાસ્તવિક કાર્યો માટે, આવો રિવોર્ડ વ્યાખ્યાયિત કરવો સરળ નથી અને તેના માટે ખર્ચાળ એનોટેશન પાઇપલાઇનની જરૂર પડી શકે છે.
  • પર્યાવરણીય અવરોધો (Environmental bottlenecks) – લેખકો જણાવે છે કે મોડેલનું પ્રદર્શન તેના કદ દ્વારા નહીં, પરંતુ આસપાસના ઇવેલ્યુએશન ઇન્ફ્રાસ્ટ્રક્ચર (ટેસ્ટ સૂટ્સ, લોગ્સ, સ્પષ્ટ મેટ્રિક્સ) દ્વારા મર્યાદિત છે. તે ઇન્ફ્રાસ્ટ્રક્ચર બનાવવું અને જાળવવું એ મોટું એન્જિનિયરિંગ કાર્ય હોઈ શકે છે.
  • ટ્રેનિંગનો કમ્પ્યુટ ખર્ચ – મલ્ટીપલ RL સ્ટેજ સાથે ટ્રિલિયન-પેરામીટર મોડેલને ટ્રેન કરવું ખર્ચાળ છે. જોકે ટાયર્ડ ટ્રેનિંગ ઇન્ફરન્સ ખર્ચ ઘટાડે છે, પરંતુ શરૂઆતનું ટ્રેનિંગ બજેટ ઊંચું રહે છે, જે સંભવતઃ આ અભિગમને માત્ર સારી રીતે ભંડોળ ધરાવતી લેબ્સ સુધી મર્યાદિત કરી શકે છે.

આગળ શું જોવું

AI પ્રેક્ટિશનરો માટે વ્યવહારુ ઉપલબ્ધિઓ

  • પ્રોમ્પ્ટ્સને એકમાત્ર માધ્યમ તરીકે ન ગણો – તમે પ્રોમ્પ્ટ્સમાં જે વર્તન કોડ કરી રહ્યા છો, તે બદલે રિવોર્ડ-ડ્રિવન ટ્રેનિંગ લૂપ દ્વારા શીખી શકાય છે કે નહીં તે તપાસો.
  • ટોકન વપરાશને પ્રાથમિક ઉદ્દેશ્ય બનાવો – શરૂઆતમાં જ બજેટ-જાગૃત સિગ્નલો ઉમેરો; મોડેલ સચોટતા અને કમ્પ્યુટ ખર્ચ વચ્ચે સંતુલન જાળવવાનું શીખશે.
  • ફીડબેક લૂપ પૂર્ણ કરો – એવી સિસ્ટમ તૈનાત કરો જે આપમેળે કાર્યો પૂરા પાડે, ચકાસી શકાય તેવા જવાબો સામે પરિણામો માપે અને પરિણામોને ફરીથી ટ્રેનિંગમાં મોકલે. આ લૂપ એ જગ્યા છે જ્યાં મોડેલ તેની પોતાની કાર્યપ્રણાલી શોધે છે.

જ્યારે રિવોર્ડ સ્પષ્ટ હોય અને વાતાવરણ સફળતાને વિશ્વસનીય રીતે માપી શકે છે, ત્યારે મોડેલનું સ્કેલિંગ કરવું એ માત્ર ક્ષમતા વધારવા પૂરતું નથી—તે મોડેલને કેવી રીતે વિચારવું તે પસંદ કરવાનું શીખવે છે. હાથથી લખાયેલા માળખા (scaffolding) થી સ્વ-નિર્દેશિત તર્ક (self-directed reasoning) તરફનું આ પરિવર્તન આપણે AI એજન્ટ્સ કેવી રીતે બનાવીએ છીએ અને તેની કિંમત કેવી રીતે નક્કી કરીએ છીએ તે બદલી શકે છે.