ஆராய்ச்சியாளர்கள் Ring-Zero எனப்படும் புதிய வலுவூட்டல் கற்றல் (reinforcement-learning) கட்டமைப்பை அறிவித்துள்ளனர். இது ஒரு டிரில்லியன் அளவுருக்கள் கொண்ட மொழி மாதிரி, டோக்கன் வரம்பிற்குள் இருந்துகொண்டே தர்க்கரீதியாகச் சிந்திக்கக் கற்றுக்கொள்ள அனுமதிக்கிறது. இந்த மாதிரி 2026 AIME கணிதத் தேர்வில் 84.2% மதிப்பெண்களைப் பெற்றுள்ளது. இந்த முடிவு, இவ்வளவு பெரிய அளவில், பொறியாளர்கள் பாரம்பரியமாக புரோம்ப்ட்களில் (prompts) குறியீடு செய்துள்ள படிநிலை வாரியான சிக்கலைத் தீர்க்கும் பழக்கங்களை இந்த மாதிரியால் தானாகவே பெற முடியும் என்பதைக் காட்டுகிறது.
இது ஏன் முக்கியமானது
AIME அளவிலான செயல்திறன் என்பது நீண்டகாலமாக "மனித அளவிலான" அளவுசார் தர்க்கரீதியான சிந்தனைக்கான (quantitative reasoning) ஒரு அளவுகோலாக இருந்து வருகிறது. எந்தவொரு மனிதனால் எழுதப்பட்ட உதாரணங்களும் இன்றி 84.2% வரம்பை எட்டுவது, மாதிரியின் தர்க்கரீதியான திறன்கள் கைவினை முறையில் உருவாக்கப்பட்ட கட்டமைப்புகளிலிருந்து அல்லாமல், பயிற்சியின் இயக்கவியலிலிருந்தே (training dynamics) உருவாகின்றன என்பதைக் காட்டுகிறது. AI முகவர்களை (AI agents) உருவாக்கும் நிறுவனங்களுக்கு இதன் தாக்கம் தெளிவானது: விரிவான புரோம்ப்ட் முறைகளை (prompt recipes) எழுதி பராமரிப்பதற்குப் பதிலாக, எப்போது ஆழமாகச் சிந்திக்க வேண்டும் மற்றும் எப்போது ஒரு எளிய குறுக்குவழியே போதுமானது என்பதை மாதிரியைக் கற்பிக்கும் ஒரு பயிற்சிச் சுழற்சியால் (training loop) அவற்றை மாற்றியமைக்க முடியும்.
புரோம்ப்ட் இன்ஜினியரிங்கிலிருந்து பயிற்சி இயக்கவியல் வரை
பல ஆண்டுகளாக, பெரிய மொழி மாதிரிகளைப் பல படிநிலை தர்க்கரீதியான சிந்தனைக்குத் தூண்டுவதற்கு, டெவலப்பர்கள் "சிக்கலைத் துண்டுகளாகப் பிரிக்கவும்" அல்லது "உங்கள் விடையைச் சரிபார்க்கவும்" போன்ற புரோம்ப்ட் டெம்ப்ளேட்டுகளைச் சார்ந்தே இருந்தனர். அந்த டெம்ப்ளேட்டுகள் வெளிப்புறக் கட்டமைப்பாகச் செயல்படுகின்றன; மாதிரி அந்த அறிவுறுத்தல்களைப் பின்பற்றுகிறதே தவிர, அந்தச் செயல்முறையை உள்வாங்கிக் கொள்வதில்லை. Ring-Zero அந்த முறையை மாற்றுகிறது. மாதிரி ஒரு பணி விளக்கத்தைப் பெறும்போது அதனுடன் ஒரு சரிபார்க்கக்கூடிய விடையையும் (verifiable answer) பெறுகிறது—இது தானாகவே சரிபார்க்கப்படக்கூடிய ஒரு உண்மையான விடை (ground-truth) ஆகும். பின்னர் அது தொடர்ச்சியான முயற்சிகளை உருவாக்குகிறது, அந்த முயற்சி சரிபார்க்கக்கூடிய விடையுடன் பொருந்தும் போது மட்டுமே வெகுமதியைப் பெறுகிறது, மேலும் வலுவூட்டல் கற்றல் மூலம் தனது கொள்கையை (policy) மேம்படுத்திக் கொள்கிறது.
வெகுமதி என்பது ஏமாற்ற முடியாத ஒரு குறிக்கோளுடன் (விடை சரியாகவும் இருக்க வேண்டும், வெறும் நம்பத்தகுந்ததாக மட்டும் இருந்தால் போதாது) இணைக்கப்பட்டுள்ளதால், மாதிரி தர்க்கரீதியான முறைகளைத் தானாகவே கண்டறிகிறது. ஒரு நம்பகமான வெகுமதி சமிக்ஞை (reward signal) அமைக்கப்பட்டவுடன், மாதிரியை ஒரு டிரில்லியன் அளவுருக்களுக்கு விரிவுபடுத்துவது, சிறிய மாதிரிகளுக்காகப் பொறியாளர்கள் கைமுறையாகச் சேர்த்த புரோம்ப்ட்-இன்ஜினியரிங் நுணுக்கங்களை தானாகவே வெளிச்சத்திற்குக் கொண்டுவரும் என்று இந்த ஆய்வறிக்கை வாதிடுகிறது.
நான்கு படிநிலை பயிற்சி வழிமுறை
Ring-Zero-வின் பயிற்சி நான்கு தனித்துவமான நிலைகளில் நடைபெறுகிறது:
- முதல் நிலை RL – மாதிரி சாத்தியமான தர்க்கரீதியான தடயங்களை ஆராய்கிறது, எந்தத் டோக்கன் வரிசைகள் சரியான விடைகளுக்கு இட்டுச் செல்லும் என்பதைக் கற்றுக்கொள்கிறது.
- சுய-வடித்தல் (Self-distillation) – உயர்தரத் தடயங்கள் மீண்டும் மாதிரிக்குள் பாய்கின்றன, இது உருவாகி வரும் தர்க்கரீதியான முறைகளை நிலைப்படுத்துகிறது.
- இரண்டாம் நிலை RL – முந்தைய முன்னேற்றங்களைப் பாதுகாக்கும் அதே வேளையில், ஒரு நுணுக்கமான சுழற்சி கொள்கையை (policy) மேம்படுத்துகிறது.
- அடுக்குமுறைப் பயிற்சி (Tiered training) – சிக்கலின் கடினத்தன்மையைப் பொறுத்து, குறுகிய (≈2k டோக்கன்கள்) மற்றும் நீண்ட (≈20k டோக்கன்கள்) தர்க்கப் பாதைகளுக்கு இடையே தேர்ந்தெடுத்து, டோக்கன் வரம்புகளைத் புத்திசாலித்தனமாக ஒதுக்கீடு செய்ய மாதிரி கற்றுக்கொள்கிறது.
அடுக்குமுறைப் பயிற்சி என்பது நடைமுறைப் பயன்பாட்டிற்கு மிகவும் அவசியமான ஒன்றாகும். உண்மையான பயன்பாடுகளில், ஒவ்வொரு கூடுதல் டோக்கனும் கணக்கீட்டுச் செலவை (compute cost) அதிகரிக்கிறது. ஒரு சிக்கல் எப்போது ஒரு குறுகிய விடைக்கு போதுமானதாக இருக்கும் என்பதையும், எப்போது அது ஆழமான, பல படிநிலை பகுப்பாய்வை கோருகிறது என்பதையும் அடையாளம் காண மாதிரியைக் கற்பிப்பதன் மூலம், Ring-Zero தர்க்கரீதியான தரத்தை பொருளாதாரத் திறனுடன் நேரடியாக இணைக்கிறது.
கற்றலின் இரண்டு நிலைகள்: கண்டறிதல் மற்றும் கூர்மைப்படுத்துதல்
ஆசிரியர்கள் கற்றல் வளைவை (learning curve) இரண்டு நிலைகளைக் கொண்ட செயல்முறையாக விவரிக்கிறார்கள்:
- கண்டறிதல் (Discovery) – ஆரம்பகால வலுவூட்டல் கற்றல் நிலைகள் குழப்பமானதாக இருக்கும்; மாதிரி பல்வேறு வகையான உத்திகளை முயற்சிக்கிறது, அவற்றில் பல தோல்வியடைகின்றன. புதிய தர்க்கரீதியான பாதைகளைக் கண்டறிவதற்கு இந்த மாறுபாடு (variance) அவசியமானது.
- கூர்மைப்படுத்துதல் (Sharpening) – ஒரு நம்பிக்கைக்குரிய முறை உருவானதும், பிந்தைய RL நிலைகள் கொள்கையைத் துல்லியமாக்கி, மாறுபாட்டைக் குறைத்து, நடத்தையை உறுதிப்படுத்துகின்றன.
இந்த முன்னேற்றம் மனிதர்கள் எவ்வாறு முன்னேறுகிறார்கள் என்பதைப் பிரதிபலிக்கிறது: தொடக்கநிலை மூளைச்சலவை (brainstorming) மற்றும் அதைத் தொடர்ந்து கவனம் செலுத்திய பயிற்சி. முக்கியக் கருத்து என்னவென்றால், ஆரம்பக்கால "குழப்பமான" நிலையைத் தவிர்க்காமல் ஏற்றுக்கொள்ள வேண்டும், ஏனெனில் அது பிற்கால மேம்பாட்டிற்குத் தேவையான மூலப்பொருளை வழங்குகிறது.
என்ன தவறுகள் நடக்கலாம்?
இந்த ஆய்வறிக்கையின் நம்பிக்கை சில அனுமானங்களைச் சார்ந்துள்ளது, அவை ஆய்வுக்கு உட்படுத்தப்பட வேண்டும்:
- வெகுமதி வடிவமைப்பு (Reward design) – இந்த கட்டமைப்பிற்குச் சரிபார்க்கக்கூடிய மற்றும் குறுக்குவழிகளைத் தவிர்க்கக்கூடிய ஒரு வெகுமதி தேவைப்படுகிறது. பல நிஜ உலகப் பணிகளுக்கு, இத்தகைய வெகுமதியை வரையறுப்பது எளிதல்ல மற்றும் இதற்கு அதிகச் செலவுமிக்க தரவுச் செயலாக்கக் குழாய்கள் (annotation pipelines) தேவைப்படலாம்.
- சுற்றுச்சூழல் தடைகள் (Environmental bottlenecks) – மாதிரியின் செயல்திறன் அதன் அளவால் அல்லாமல், அதைச் சுற்றியுள்ள மதிப்பீட்டு உள்கட்டமைப்பால் (சோதனைத் தொகுப்புகள், பதிவுகள், தெளிவான அளவீடுகள்) மட்டுப்படுத்தப்படுகிறது என்று ஆசிரியர்கள் சுட்டிக்காட்டுகின்றனர். அந்த உள்கட்டமைப்பை உருவாக்குவதும் பராமரிப்பதும் ஒரு குறிப்பிடத்தக்க பொறியியல் முயற்சியாகும்.
- பயிற்சியின் கணக்கீட்டுச் செலவு – பல RL நிலைகளுடன் ஒரு டிரில்லியன் அளவுருக்கள் கொண்ட மாதிரியைப் பயிற்றுவிப்பது செலவு மிக்கது. அடுக்குமுறைப் பயிற்சி (tiered training) ஊகக் கணக்கீட்டுச் செலவைக் (inference costs) குறைத்தாலும், ஆரம்பக்காலப் பயிற்சி வரவு (upfront training budget) அதிகமாகவே இருக்கும், இது இந்த அணுகுமுறையை நன்கு நிதியுதவி பெறும் ஆய்வகங்களுக்கு மட்டுமே மட்டுப்படுத்தக்கூடும்.
அடுத்து என்ன கவனிக்க வேண்டும்
AI பயிற்சியாளர்களுக்கான நடைமுறைப் பாடங்கள்
- Prompt-களை மட்டுமே ஒரே கருவியாகக் கருதாதீர்கள் – நீங்கள் prompt-களில் குறியீடாக்கும் ஒரு நடத்தைக்கு பதிலாக, வெகுமதி சார்ந்த பயிற்சிச் சுழற்சி (reward-driven training loop) மூலம் அதைக் கற்றுக்கொள்ள முடியுமா என்று ஆராயுங்கள்.
- Token பயன்பாட்டை ஒரு முதன்மையான இலக்காக மாற்றவும் – ஆரம்பத்திலேயே பட்ஜெட் சார்ந்த சமிக்ஞைகளைச் சேர்க்கவும்; துல்லியத்திற்கும் கணினிச் செலவிற்கும் (compute cost) இடையிலான சமநிலையைத் தக்கவைக்க மாடல் கற்றுக்கொள்ளும்.
- பின்னூட்டச் சுழற்சியை (feedback loop) நிறைவு செய்யவும் – தானாகவே பணிகளை வழங்கும், சரிபார்க்கக்கூடிய விடைகளுடன் முடிவுகளை அளவிடும் மற்றும் முடிவுகளை மீண்டும் பயிற்சியில் சேர்க்கும் ஒரு அமைப்பைச் செயல்படுத்தவும். இந்தச் சுழற்சியில்தான் மாடல் தனது சொந்த பணிப்பாய்வை (workflow) கண்டறிகிறது.
வெகுமதி தெளிவாக இருக்கும்போதும், சூழலால் வெற்றியைத் துல்லியமாக அளவிட முடியும்போதும், மாடலை விரிவுபடுத்துவது வெறும் திறனை அதிகரிப்பது மட்டுமல்ல—அது எவ்வாறு சிந்திக்க வேண்டும் என்பதைத் தேர்ந்தெடுக்க மாடலுக்குக் கற்பிக்கிறது. கைமுறையாக எழுதப்பட்ட கட்டமைப்பிலிருந்து (hand-written scaffolding) சுய-இயக்கத் தர்க்கத்திற்கு (self-directed reasoning) மாறும் இந்த மாற்றம், நாம் AI ஏஜெண்டுகளை உருவாக்கும் மற்றும் அவற்றின் விலையை நிர்ணயிக்கும் முறையை மறுசீரமைக்கக்கூடும்.
