ஆராய்ச்சியாளர்கள் Ring-Zero எனப்படும் புதிய வலுவூட்டல் கற்றல் (reinforcement-learning) கட்டமைப்பை அறிவித்துள்ளனர். இது ஒரு டிரில்லியன் அளவுருக்கள் கொண்ட மொழி மாதிரி, டோக்கன் வரம்பிற்குள் இருந்துகொண்டே தர்க்கரீதியாகச் சிந்திக்கக் கற்றுக்கொள்ள அனுமதிக்கிறது. இந்த மாதிரி 2026 AIME கணிதத் தேர்வில் 84.2% மதிப்பெண்களைப் பெற்றுள்ளது. இந்த முடிவு, இவ்வளவு பெரிய அளவில், பொறியாளர்கள் பாரம்பரியமாக புரோம்ப்ட்களில் (prompts) குறியீடு செய்துள்ள படிநிலை வாரியான சிக்கலைத் தீர்க்கும் பழக்கங்களை இந்த மாதிரியால் தானாகவே பெற முடியும் என்பதைக் காட்டுகிறது.

இது ஏன் முக்கியமானது

AIME அளவிலான செயல்திறன் என்பது நீண்டகாலமாக "மனித அளவிலான" அளவுசார் தர்க்கரீதியான சிந்தனைக்கான (quantitative reasoning) ஒரு அளவுகோலாக இருந்து வருகிறது. எந்தவொரு மனிதனால் எழுதப்பட்ட உதாரணங்களும் இன்றி 84.2% வரம்பை எட்டுவது, மாதிரியின் தர்க்கரீதியான திறன்கள் கைவினை முறையில் உருவாக்கப்பட்ட கட்டமைப்புகளிலிருந்து அல்லாமல், பயிற்சியின் இயக்கவியலிலிருந்தே (training dynamics) உருவாகின்றன என்பதைக் காட்டுகிறது. AI முகவர்களை (AI agents) உருவாக்கும் நிறுவனங்களுக்கு இதன் தாக்கம் தெளிவானது: விரிவான புரோம்ப்ட் முறைகளை (prompt recipes) எழுதி பராமரிப்பதற்குப் பதிலாக, எப்போது ஆழமாகச் சிந்திக்க வேண்டும் மற்றும் எப்போது ஒரு எளிய குறுக்குவழியே போதுமானது என்பதை மாதிரியைக் கற்பிக்கும் ஒரு பயிற்சிச் சுழற்சியால் (training loop) அவற்றை மாற்றியமைக்க முடியும்.

புரோம்ப்ட் இன்ஜினியரிங்கிலிருந்து பயிற்சி இயக்கவியல் வரை

பல ஆண்டுகளாக, பெரிய மொழி மாதிரிகளைப் பல படிநிலை தர்க்கரீதியான சிந்தனைக்குத் தூண்டுவதற்கு, டெவலப்பர்கள் "சிக்கலைத் துண்டுகளாகப் பிரிக்கவும்" அல்லது "உங்கள் விடையைச் சரிபார்க்கவும்" போன்ற புரோம்ப்ட் டெம்ப்ளேட்டுகளைச் சார்ந்தே இருந்தனர். அந்த டெம்ப்ளேட்டுகள் வெளிப்புறக் கட்டமைப்பாகச் செயல்படுகின்றன; மாதிரி அந்த அறிவுறுத்தல்களைப் பின்பற்றுகிறதே தவிர, அந்தச் செயல்முறையை உள்வாங்கிக் கொள்வதில்லை. Ring-Zero அந்த முறையை மாற்றுகிறது. மாதிரி ஒரு பணி விளக்கத்தைப் பெறும்போது அதனுடன் ஒரு சரிபார்க்கக்கூடிய விடையையும் (verifiable answer) பெறுகிறது—இது தானாகவே சரிபார்க்கப்படக்கூடிய ஒரு உண்மையான விடை (ground-truth) ஆகும். பின்னர் அது தொடர்ச்சியான முயற்சிகளை உருவாக்குகிறது, அந்த முயற்சி சரிபார்க்கக்கூடிய விடையுடன் பொருந்தும் போது மட்டுமே வெகுமதியைப் பெறுகிறது, மேலும் வலுவூட்டல் கற்றல் மூலம் தனது கொள்கையை (policy) மேம்படுத்திக் கொள்கிறது.

வெகுமதி என்பது ஏமாற்ற முடியாத ஒரு குறிக்கோளுடன் (விடை சரியாகவும் இருக்க வேண்டும், வெறும் நம்பத்தகுந்ததாக மட்டும் இருந்தால் போதாது) இணைக்கப்பட்டுள்ளதால், மாதிரி தர்க்கரீதியான முறைகளைத் தானாகவே கண்டறிகிறது. ஒரு நம்பகமான வெகுமதி சமிக்ஞை (reward signal) அமைக்கப்பட்டவுடன், மாதிரியை ஒரு டிரில்லியன் அளவுருக்களுக்கு விரிவுபடுத்துவது, சிறிய மாதிரிகளுக்காகப் பொறியாளர்கள் கைமுறையாகச் சேர்த்த புரோம்ப்ட்-இன்ஜினியரிங் நுணுக்கங்களை தானாகவே வெளிச்சத்திற்குக் கொண்டுவரும் என்று இந்த ஆய்வறிக்கை வாதிடுகிறது.

நான்கு படிநிலை பயிற்சி வழிமுறை

Ring-Zero-வின் பயிற்சி நான்கு தனித்துவமான நிலைகளில் நடைபெறுகிறது:

  1. முதல் நிலை RL – மாதிரி சாத்தியமான தர்க்கரீதியான தடயங்களை ஆராய்கிறது, எந்தத் டோக்கன் வரிசைகள் சரியான விடைகளுக்கு இட்டுச் செல்லும் என்பதைக் கற்றுக்கொள்கிறது.
  2. சுய-வடித்தல் (Self-distillation) – உயர்தரத் தடயங்கள் மீண்டும் மாதிரிக்குள் பாய்கின்றன, இது உருவாகி வரும் தர்க்கரீதியான முறைகளை நிலைப்படுத்துகிறது.
  3. இரண்டாம் நிலை RL – முந்தைய முன்னேற்றங்களைப் பாதுகாக்கும் அதே வேளையில், ஒரு நுணுக்கமான சுழற்சி கொள்கையை (policy) மேம்படுத்துகிறது.
  4. அடுக்குமுறைப் பயிற்சி (Tiered training) – சிக்கலின் கடினத்தன்மையைப் பொறுத்து, குறுகிய (≈2k டோக்கன்கள்) மற்றும் நீண்ட (≈20k டோக்கன்கள்) தர்க்கப் பாதைகளுக்கு இடையே தேர்ந்தெடுத்து, டோக்கன் வரம்புகளைத் புத்திசாலித்தனமாக ஒதுக்கீடு செய்ய மாதிரி கற்றுக்கொள்கிறது.

அடுக்குமுறைப் பயிற்சி என்பது நடைமுறைப் பயன்பாட்டிற்கு மிகவும் அவசியமான ஒன்றாகும். உண்மையான பயன்பாடுகளில், ஒவ்வொரு கூடுதல் டோக்கனும் கணக்கீட்டுச் செலவை (compute cost) அதிகரிக்கிறது. ஒரு சிக்கல் எப்போது ஒரு குறுகிய விடைக்கு போதுமானதாக இருக்கும் என்பதையும், எப்போது அது ஆழமான, பல படிநிலை பகுப்பாய்வை கோருகிறது என்பதையும் அடையாளம் காண மாதிரியைக் கற்பிப்பதன் மூலம், Ring-Zero தர்க்கரீதியான தரத்தை பொருளாதாரத் திறனுடன் நேரடியாக இணைக்கிறது.

கற்றலின் இரண்டு நிலைகள்: கண்டறிதல் மற்றும் கூர்மைப்படுத்துதல்

ஆசிரியர்கள் கற்றல் வளைவை (learning curve) இரண்டு நிலைகளைக் கொண்ட செயல்முறையாக விவரிக்கிறார்கள்:

  • கண்டறிதல் (Discovery) – ஆரம்பகால வலுவூட்டல் கற்றல் நிலைகள் குழப்பமானதாக இருக்கும்; மாதிரி பல்வேறு வகையான உத்திகளை முயற்சிக்கிறது, அவற்றில் பல தோல்வியடைகின்றன. புதிய தர்க்கரீதியான பாதைகளைக் கண்டறிவதற்கு இந்த மாறுபாடு (variance) அவசியமானது.
  • கூர்மைப்படுத்துதல் (Sharpening) – ஒரு நம்பிக்கைக்குரிய முறை உருவானதும், பிந்தைய RL நிலைகள் கொள்கையைத் துல்லியமாக்கி, மாறுபாட்டைக் குறைத்து, நடத்தையை உறுதிப்படுத்துகின்றன.

இந்த முன்னேற்றம் மனிதர்கள் எவ்வாறு முன்னேறுகிறார்கள் என்பதைப் பிரதிபலிக்கிறது: தொடக்கநிலை மூளைச்சலவை (brainstorming) மற்றும் அதைத் தொடர்ந்து கவனம் செலுத்திய பயிற்சி. முக்கியக் கருத்து என்னவென்றால், ஆரம்பக்கால "குழப்பமான" நிலையைத் தவிர்க்காமல் ஏற்றுக்கொள்ள வேண்டும், ஏனெனில் அது பிற்கால மேம்பாட்டிற்குத் தேவையான மூலப்பொருளை வழங்குகிறது.

என்ன தவறுகள் நடக்கலாம்?

இந்த ஆய்வறிக்கையின் நம்பிக்கை சில அனுமானங்களைச் சார்ந்துள்ளது, அவை ஆய்வுக்கு உட்படுத்தப்பட வேண்டும்:

  • வெகுமதி வடிவமைப்பு (Reward design) – இந்த கட்டமைப்பிற்குச் சரிபார்க்கக்கூடிய மற்றும் குறுக்குவழிகளைத் தவிர்க்கக்கூடிய ஒரு வெகுமதி தேவைப்படுகிறது. பல நிஜ உலகப் பணிகளுக்கு, இத்தகைய வெகுமதியை வரையறுப்பது எளிதல்ல மற்றும் இதற்கு அதிகச் செலவுமிக்க தரவுச் செயலாக்கக் குழாய்கள் (annotation pipelines) தேவைப்படலாம்.
  • சுற்றுச்சூழல் தடைகள் (Environmental bottlenecks) – மாதிரியின் செயல்திறன் அதன் அளவால் அல்லாமல், அதைச் சுற்றியுள்ள மதிப்பீட்டு உள்கட்டமைப்பால் (சோதனைத் தொகுப்புகள், பதிவுகள், தெளிவான அளவீடுகள்) மட்டுப்படுத்தப்படுகிறது என்று ஆசிரியர்கள் சுட்டிக்காட்டுகின்றனர். அந்த உள்கட்டமைப்பை உருவாக்குவதும் பராமரிப்பதும் ஒரு குறிப்பிடத்தக்க பொறியியல் முயற்சியாகும்.
  • பயிற்சியின் கணக்கீட்டுச் செலவு – பல RL நிலைகளுடன் ஒரு டிரில்லியன் அளவுருக்கள் கொண்ட மாதிரியைப் பயிற்றுவிப்பது செலவு மிக்கது. அடுக்குமுறைப் பயிற்சி (tiered training) ஊகக் கணக்கீட்டுச் செலவைக் (inference costs) குறைத்தாலும், ஆரம்பக்காலப் பயிற்சி வரவு (upfront training budget) அதிகமாகவே இருக்கும், இது இந்த அணுகுமுறையை நன்கு நிதியுதவி பெறும் ஆய்வகங்களுக்கு மட்டுமே மட்டுப்படுத்தக்கூடும்.

அடுத்து என்ன கவனிக்க வேண்டும்

AI பயிற்சியாளர்களுக்கான நடைமுறைப் பாடங்கள்

  • Prompt-களை மட்டுமே ஒரே கருவியாகக் கருதாதீர்கள் – நீங்கள் prompt-களில் குறியீடாக்கும் ஒரு நடத்தைக்கு பதிலாக, வெகுமதி சார்ந்த பயிற்சிச் சுழற்சி (reward-driven training loop) மூலம் அதைக் கற்றுக்கொள்ள முடியுமா என்று ஆராயுங்கள்.
  • Token பயன்பாட்டை ஒரு முதன்மையான இலக்காக மாற்றவும் – ஆரம்பத்திலேயே பட்ஜெட் சார்ந்த சமிக்ஞைகளைச் சேர்க்கவும்; துல்லியத்திற்கும் கணினிச் செலவிற்கும் (compute cost) இடையிலான சமநிலையைத் தக்கவைக்க மாடல் கற்றுக்கொள்ளும்.
  • பின்னூட்டச் சுழற்சியை (feedback loop) நிறைவு செய்யவும் – தானாகவே பணிகளை வழங்கும், சரிபார்க்கக்கூடிய விடைகளுடன் முடிவுகளை அளவிடும் மற்றும் முடிவுகளை மீண்டும் பயிற்சியில் சேர்க்கும் ஒரு அமைப்பைச் செயல்படுத்தவும். இந்தச் சுழற்சியில்தான் மாடல் தனது சொந்த பணிப்பாய்வை (workflow) கண்டறிகிறது.

வெகுமதி தெளிவாக இருக்கும்போதும், சூழலால் வெற்றியைத் துல்லியமாக அளவிட முடியும்போதும், மாடலை விரிவுபடுத்துவது வெறும் திறனை அதிகரிப்பது மட்டுமல்ல—அது எவ்வாறு சிந்திக்க வேண்டும் என்பதைத் தேர்ந்தெடுக்க மாடலுக்குக் கற்பிக்கிறது. கைமுறையாக எழுதப்பட்ட கட்டமைப்பிலிருந்து (hand-written scaffolding) சுய-இயக்கத் தர்க்கத்திற்கு (self-directed reasoning) மாறும் இந்த மாற்றம், நாம் AI ஏஜெண்டுகளை உருவாக்கும் மற்றும் அவற்றின் விலையை நிர்ணயிக்கும் முறையை மறுசீரமைக்கக்கூடும்.