ഗവേഷകർ Ring-Zero എന്ന് പേരിട്ടിരിക്കുന്ന പുതിയൊരു റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗ് (reinforcement-learning) ഫ്രെയിംവർക്ക് പ്രഖ്യാപിച്ചു. ഇത് ഒരു ട്രില്യൺ പാരാമീറ്ററുകളുള്ള ലാംഗ്വേജ് മോഡലിന് ടോക്കൺ ബജറ്റ് പരിധിക്കുള്ളിൽ നിന്നുകൊണ്ട് തന്നെ യുക്തിസഹമായി ചിന്തിക്കാൻ (reasoning) പഠിക്കാൻ സഹായിക്കുന്നു. ഈ മോഡൽ 2026-ലെ AIME മാത്സ് പരീക്ഷയിൽ 84.2% മാർക്ക് നേടി. എൻജിനീയർമാർ സാധാരണയായി പ്രോംപ്റ്റുകളിൽ കോഡ് ചെയ്ത് നൽകുന്ന ഘട്ടം ഘട്ടമായുള്ള പ്രശ്നപരിഹാര ശീലങ്ങൾ, ഇത്രയും വലിയ സ്കെയിലിൽ മോഡലിന് സ്വയം സ്വായത്തമാക്കാൻ കഴിയുമെന്നാണ് ഈ ഫലം കാണിക്കുന്നത്.
ഇതിന്റെ പ്രാധാന്യം
"മനുഷ്യതലത്തിലുള്ള" ക്വാണ്ടിറ്റേറ്റീവ് റീസണിംഗിന്റെ (quantitative reasoning) ഒരു മാനദണ്ഡമായി AIME നിലവാരത്തിലുള്ള പ്രകടനം കാലങ്ങളായി നിലനിൽക്കുന്നു. മനുഷ്യർ എഴുതിയ ഉദാഹരണങ്ങളില്ലാതെ തന്നെ 84.2% എന്ന നിലവാരത്തിൽ എത്തുന്നത്, മോഡലിന്റെ യുക്തിചിന്താശേഷി അതിന്റെ പരിശീലന രീതികളിൽ (training dynamics) നിന്ന് ഉദിച്ചുയരുന്നതാണെന്നും, മുൻകൂട്ടി തയ്യാറാക്കിയ ഘടനകളിൽ (scaffolds) നിന്നല്ലെന്നും സൂചിപ്പിക്കുന്നു. AI ഏജന്റുകൾ നിർമ്മിക്കുന്ന കമ്പനികളെ സംബന്ധിച്ചിടത്തോളം ഇതിന്റെ അർത്ഥം വ്യക്തമാണ്: സങ്കീർണ്ണമായ പ്രോംപ്റ്റ് രീതികൾ എഴുതി സൂക്ഷിക്കുന്നതിന് പകരം, എപ്പോൾ കൂടുതൽ ആഴത്തിൽ ചിന്തിക്കണമെന്നും എപ്പോൾ ലളിതമായ രീതിയിൽ മറുപടി നൽകിയാൽ മതിയാകുമെന്നും മോഡലിനെ പഠിപ്പിക്കുന്ന ഒരു ട്രെയിനിംഗ് ലൂപ്പ് ഉപയോഗിക്കാം.
പ്രോംപ്റ്റ് എഞ്ചിനീയറിംഗിൽ നിന്ന് ട്രെയിനിംഗ് ഡൈനാമിക്സിലേക്ക്
വർഷങ്ങളായി, വലിയ ലാംഗ്വേജ് മോഡലുകളെ പല ഘട്ടങ്ങളിലായുള്ള യുക്തിചിന്തയിലേക്ക് (multi-step reasoning) നയിക്കാൻ ഡെവലപ്പർമാർ "പ്രശ്നത്തെ ഭാഗങ്ങളായി തിരിക്കുക" അല്ലെങ്കിൽ "നിങ്ങളുടെ ഉത്തരം പരിശോധിക്കുക" തുടങ്ങിയ പ്രോംപ്റ്റ് ടെംപ്ലേറ്റുകളെയാണ് ആശ്രയിച്ചിരുന്നത്. ഈ ടെംപ്ലേറ്റുകൾ ഒരു ബാഹ്യമായ സഹായം (external scaffolding) പോലെയാണ് പ്രവർത്തിക്കുന്നത്; മോഡൽ നിർദ്ദേശങ്ങൾ പാലിക്കുന്നുണ്ടെങ്കിലും ആ പ്രക്രിയയെ അതിന്റെ ഉള്ളിൽ ഉൾക്കൊള്ളുന്നില്ല. Ring-Zero ഈ രീതിയെ മാറ്റുന്നു. മോഡലിന് ഒരു ടാസ്ക് വിവരണത്തോടൊപ്പം ഒരു പരിശോധിക്കാവുന്ന ഉത്തരം (verifiable answer) കൂടി നൽകുന്നു—ഇത് സ്വയമേവ പരിശോധിക്കാൻ കഴിയുന്ന ഒരു അടിസ്ഥാന സത്യമാണ് (ground-truth). തുടർന്ന് മോഡൽ ഒന്നിലധികം ശ്രമങ്ങൾ നടത്തുന്നു, ആ ശ്രമം നൽകപ്പെട്ട ഉത്തരവുമായി പൊരുത്തപ്പെടുമ്പോൾ മാത്രം പ്രതിഫലം (reward) ലഭിക്കുന്നു, റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗിലൂടെ മോഡൽ അതിന്റെ രീതികൾ (policy) പരിഷ്കരിക്കുന്നു.
പ്രതിഫലം എന്നത് വഞ്ചിക്കാൻ പ്രയാസമുള്ള ഒരു ലക്ഷ്യവുമായി (objective) ബന്ധപ്പെട്ടിരിക്കുന്നതിനാൽ (ഉത്തരം ശരിയായിരിക്കണം, കേവലം യുക്തിസഹമാണെന്ന് മാത്രം പോരാ), മോഡൽ സ്വയം റീസണിംഗ് പാറ്റേണുകൾ കണ്ടെത്തുന്നു. വിശ്വസനീയമായ ഒരു റിവാർഡ് സിഗ്നൽ നിലവിലുണ്ടെങ്കിൽ, മോഡലിനെ ഒരു ട്രില്യൺ പാരാമീറ്ററുകളിലേക്ക് വ്യാപിപ്പിക്കുന്നത് വഴി, ചെറിയ മോഡലുകൾക്കായി എൻജിനീയർമാർ മാനുവലായി നൽകിയിരുന്ന പ്രോംപ്റ്റ് എഞ്ചിനീയറിംഗ് തന്ത്രങ്ങൾ തനിയെ പുറത്തുവരുമെന്ന് ഈ പ്രബന്ധം വാദിക്കുന്നു.
നാല് ഘട്ടങ്ങളുള്ള പരിശീലന രീതി (training pipeline)
Ring-Zero-യുടെ പരിശീലനം നാല് വ്യത്യസ്ത ഘട്ടങ്ങളിലൂടെ കടന്നുപോകുന്നു:
- ഒന്നാം ഘട്ട RL – മോഡൽ സാധ്യമായ റീസണിംഗ് പാതകൾ പര്യവേക്ഷണം ചെയ്യുന്നു, ഏത് ടോക്കൺ ക്രമങ്ങളാണ് ശരിയായ ഉത്തരങ്ങളിലേക്ക് നയിക്കുന്നതെന്ന് പഠിക്കുന്നു.
- സെൽഫ്-ഡിസ്റ്റിലേഷൻ (Self-distillation) – ഉയർന്ന നിലവാരമുള്ള പാതകൾ തിരികെ മോഡലിലേക്ക് നൽകുന്നു, ഇത് രൂപപ്പെട്ടുവരുന്ന റീസണിംഗ് പാറ്റേണുകളെ സ്ഥിരപ്പെടുത്തുന്നു.
- രണ്ടാം ഘട്ട RL – നേരത്തെയുള്ള പുരോഗതി നിലനിർത്തിക്കൊണ്ട് തന്നെ കൂടുതൽ സൂക്ഷ്മമായ ഒരു ലൂപ്പ് മോഡലിന്റെ രീതികളെ (policy) പരിഷ്കരിക്കുന്നു.
- ടിയർഡ് ട്രെയിനിംഗ് (Tiered training) – പ്രശ്നത്തിന്റെ പ്രയാസത്തിനനുസരിച്ച് ചെറിയ (≈2 k tokens) അല്ലെങ്കിൽ വലിയ (≈20 k tokens) റീസണിംഗ് പാതകൾ തിരഞ്ഞെടുത്ത് ടോക്കൺ ബജറ്റ് ബുദ്ധിപരമായി വിനിയോഗിക്കാൻ മോഡൽ പഠിക്കുന്നു.
പ്രൊഡക്ഷൻ രംഗത്ത് ഏറ്റവും പ്രായോഗികമായ ഭാഗം ടിയർഡ് ട്രെയിനിംഗ് ആണ്. യഥാർത്ഥ ഉപയോഗങ്ങളിൽ, ഓരോ അധിക ടോക്കണും കമ്പ്യൂട്ടിംഗ് ചിലവ് വർദ്ധിപ്പിക്കുന്നു. ഒരു പ്രശ്നം ലളിതമായ ഒരു മറുപടിക്ക് മതിയാകുന്നതാണോ അതോ ആഴത്തിലുള്ള വിശകലനം ആവശ്യമാണോ എന്ന് തിരിച്ചറിയാൻ മോഡലിനെ പഠിപ്പിക്കുന്നതിലൂടെ, Ring-Zero റീസണിംഗ് ഗുണനിലവാരത്തെ സാമ്പത്തിക കാര്യക്ഷമതയുമായി നേരിട്ട് ബന്ധിപ്പിക്കുന്നു.
പഠനത്തിന്റെ രണ്ട് ഘട്ടങ്ങൾ: ഡിസ്കവറിയും ഷാർപ്പനിംഗും
പഠന പ്രക്രിയയെ രണ്ട് ഘട്ടങ്ങളായി എഴുത്തുകാർ വിവരിക്കുന്നു:
- ഡിസ്കവറി (Discovery) – ആദ്യകാല റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗ് ഘട്ടങ്ങൾ അസ്ഥിരമായിരിക്കും; മോഡൽ വൈവിധ്യമാർന്ന തന്ത്രങ്ങൾ പരീക്ഷിക്കുന്നു, അവയിൽ പലതും പരാജയപ്പെട്ടേക്കാം. പുതിയ റീസണിംഗ് പാതകൾ കണ്ടെത്തുന്നതിന് ഈ വ്യതിയാനം അത്യാവശ്യമാണ്.
- ഷാർപ്പനിംഗ് (Sharpening) – പ്രതീക്ഷजनकമായ ഒരു പാറ്റേൺ രൂപപ്പെട്ടുകഴിഞ്ഞാൽ, പിന്നീടുള്ള RL ഘട്ടങ്ങൾ മോഡലിന്റെ രീതികളെ കൂടുതൽ കൃത്യമാക്കുകയും വ്യതിയാനങ്ങൾ കുറയ്ക്കുകയും ചെയ്യുന്നു.
മനുഷ്യർ എങ്ങനെ മെച്ചപ്പെടുന്നു എന്നതിനെയാണ് ഈ പ്രക്രിയ സൂചിപ്പിക്കുന്നത്: ആദ്യം ആശയങ്ങൾ രൂപീകരിക്കുകയും (brainstorming) പിന്നീട് ശ്രദ്ധ കേന്ദ്രീകരിച്ച് പരിശീലിക്കുകയും ചെയ്യുന്നു. ആദ്യഘട്ടത്തിലെ ഈ "അലങ്കോലമായ" അവസ്ഥയെ അടിച്ചമർത്തുന്നതിന് പകരം സ്വീകരിക്കണം എന്നതാണ് ഇതിലെ പ്രധാന പാഠം, കാരണം പിൽക്കാലത്തെ പരിഷ്കരണത്തിന് ആവശ്യമായ അസംസ്കൃത വസ്തുക്കൾ നൽകുന്നത് ഈ ഘട്ടമാണ്.
എന്തൊക്കെ തെറ്റായേക്കാം?
ഈ പ്രബന്ധത്തിലെ ശുഭാപ്തിവിശ്വാസം ചില അനുമാനങ്ങളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്, അവ സൂക്ഷ്മമായി പരിശോധിക്കേണ്ടതുണ്ട്:
- റിവാർഡ് ഡിസൈൻ (Reward design) – ഈ ഫ്രെയിംവർക്കിന് പരിശോധിക്കാവുന്നതും എന്നാൽ ഷോർട്ട്കട്ടുകൾ ഉപയോഗിക്കാൻ കഴിയാത്തതുമായ ഒരു റിവാർഡ് ആവശ്യമാണ്. പല യഥാർത്ഥ ലോക ജോലികൾക്കും ഇത്തരമൊരു റിവാർഡ് നിർവചിക്കുന്നത് എളുപ്പമല്ല, അതിന് ചിലവേറിയ അനോട്ടേഷൻ പൈപ്പ്ലൈനുകൾ ആവശ്യമായി വന്നേക്കാം.
- പരിസ്ഥിതിപരമായ തടസ്സങ്ങൾ (Environmental bottlenecks) – മോഡലിന്റെ പ്രകടനം അതിന്റെ വലിപ്പത്താലല്ല, മറിച്ച് ചുറ്റുമുള്ള മൂല്യനിർണ്ണയ സംവിധാനങ്ങൾ (ടെസ്റ്റ് സ്യൂട്ടുകൾ, ലോഗുകൾ, വ്യക്തമായ മെട്രിക്സുകൾ) മൂലമാണ് പരിമിതമെന്ന് എഴുത്തുകാർ ചൂണ്ടിക്കാട്ടുന്നു. അത്തരം അടിസ്ഥാന സൗകര്യങ്ങൾ നിർമ്മിക്കുന്നതും പരിപാലിക്കുന്നതും വലിയൊരു എഞ്ചിനീയറിംഗ് പ്രയത്നമാണ്.
- പരിശീലനത്തിനുള്ള കമ്പ്യൂട്ട് ചിലവ് (Compute cost of training) – ഒന്നിലധികം RL ഘട്ടങ്ങളുള്ള ഒരു ട്രില്യൺ പാരാമീറ്റർ മോഡൽ പരിശീലിപ്പിക്കുന്നത് ചിലവേറിയതാണ്. ടിയർഡ് ട്രെയിനിംഗ് ഇൻഫറൻസ് ചിലവ് കുറയ്ക്കുന്നുണ്ടെങ്കിലും, തുടക്കത്തിലുള്ള പരിശീലന ചിലവ് വളരെ കൂടുതലായിരിക്കും, ഇത് ഈ രീതിയെ വലിയ ഫണ്ട് ഉള്ള ലാബുകളിൽ മാത്രം പരിമിതപ്പെടുത്തിയേക്കാം.
അടുത്തതായി ശ്രദ്ധിക്കേണ്ടവ
AI പ്രായോഗിക വിദഗ്ധർക്കുള്ള പ്രായോഗിക പാഠങ്ങൾ
- പ്രോംപ്റ്റുകളെ (prompts) ഏക മാർഗ്ഗമായി കാണരുത് – പ്രോംപ്റ്റുകളിൽ നിങ്ങൾ കോഡ് ചെയ്യുന്ന ഒരു പെരുമാറ്റം, പകരം റിവാർഡ് അധിഷ്ഠിത ട്രെയിനിംഗ് ലൂപ്പിലൂടെ (reward-driven training loop) പഠിച്ചെടുക്കാൻ കഴിയുമോ എന്ന് പരിശോധിക്കുക.
- ടോക്കൺ ഉപയോഗത്തെ (token usage) ഒരു പ്രധാന ലക്ഷ്യമായി മാറ്റുക – ബജറ്റ് പരിഗണിച്ചുകൊണ്ടുള്ള സിഗ്നലുകൾ നേരത്തെ തന്നെ ഉൾപ്പെടുത്തുക; കൃത്യതയും കമ്പ്യൂട്ട് ചിലവും (compute cost) തമ്മിൽ സന്തുലിതമാക്കാൻ മോഡൽ പഠിക്കും.
- ഫീഡ്ബാക്ക് ലൂപ്പ് (feedback loop) പൂർത്തിയാക്കുക – ടാസ്ക്കുകൾ സ്വയമേവ നൽകുന്നതും, പരിശോധിക്കാവുന്ന ഉത്തരങ്ങളുമായി ഫലങ്ങൾ താരതമ്യം ചെയ്യുന്നതും, ആ ഫലങ്ങൾ വീണ്ടും ട്രെയിനിംഗിലേക്ക് നൽകുന്നതുമായ ഒരു സംവിധാനം വിന്യസിക്കുക. ഈ ലൂപ്പിലൂടെയാണ് മോഡൽ അതിന്റെ സ്വന്തം പ്രവർത്തനരീതി (workflow) കണ്ടെത്തുന്നത്.
റിവാർഡ് വ്യക്തമാവുകയും പരിസ്ഥിതിക്ക് വിജയത്തെ വിശ്വസനീയമായി അളക്കാൻ കഴിയുകയും ചെയ്യുമ്പോൾ, മോഡൽ സ്കെയിൽ ചെയ്യുന്നത് കേവലം ശേഷി വർദ്ധിപ്പിക്കുക മാത്രമല്ല ചെയ്യുന്നത്—അത് എങ്ങനെ ചിന്തിക്കണം എന്ന് തിരഞ്ഞെടുക്കാൻ മോഡലിനെ പഠിപ്പിക്കുന്നു. കൈകൊണ്ട് തയ്യാറാക്കിയ സ്കാഫോൾഡിംഗിൽ (scaffolding) നിന്ന് സ്വയം നയിക്കപ്പെടുന്ന യുക്തിചിന്തയിലേക്കുള്ള (self-directed reasoning) ആ മാറ്റം, നമ്മൾ AI ഏജന്റുകളെ നിർമ്മിക്കുന്ന രീതിയെയും അവയുടെ വില നിശ്ചയിക്കുന്ന രീതിയെയും മാറ്റിമറിച്ചേക്കാം.
