ABSeeker-இன் புதிய “Answer-Backtracked Credit Assignment” (ABC) முறை, நீண்ட காலத் தேடல் முகவர்கள் (long-horizon search agents) இறுதிப் பதிலுக்கு மட்டும் தகுதியைப் பெறுவதற்குப் பதிலாக, ஒவ்வொரு தனிப்பட்ட படிநிலைக்கும் தகுதியைப் பெற அனுமதிக்கிறது. இதன் மூலம் பயிற்சியளிக்கப்பட்ட 4 பில்லியன் அளவுருக்கள் கொண்ட ஒரு மாதிரி, ஏற்கனவே மிகப்பெரிய போட்டியாளர்களைச் சமன் செய்ய அல்லது அவர்களை விடச் சிறப்பாகச் செயல்பட முடிகிறது.

இந்த முன்னேற்றம் முக்கியமானது, ஏனெனில் தற்போதுள்ள பெரும்பாலான முகவர்கள் ஒரு பணியின் முடிவில் மட்டுமே மதிப்பிடப்படுகின்றன. இறுதிப் பதில் சரியாக இருந்தால், அந்த முழுச் செயல்பாடும் சிறப்பாகக் கருதப்படுகிறது; அது தவறாக இருந்தால், முழுத் தொடர்ச்சியும் மோசமானது எனக் கருதப்படுகிறது. இந்த 'வெற்றி அல்லது தோல்வி' என்ற ஒருமுனைப் பின்னூட்டம் உண்மையான கற்றல் சிக்னலை மறைத்துவிடுகிறது—அதாவது, ஒரு தவறுக்கு அடுத்து நடந்த ஒரு நல்ல நகர்வு அல்லது தற்செயலாகச் சரியான முடிவுக்கு இட்டுச் சென்ற தேவையற்ற கிளிக் போன்றவற்றை இது அடையாளம் காணாது. ABSeeker-இன் அணுகுமுறை இந்த விதியையே மாற்றியமைக்கிறது.

பழைய அணுகுமுறை ஏன் போதவில்லை

ஒரு முகவர் தேடும்போது, குறியீடு எழுதும்போதோ அல்லது ஆதாரங்களைச் சேகரிக்கும்போதோ, அது பொதுவாகப் பல நடவடிக்கைகளை எடுக்கிறது: வினவல்களை (queries) அனுப்புதல், பக்கங்களைத் திறத்தல், கட்டளைகளை இயக்குதல், கணினி நிலையைச் சரிபார்த்தல் போன்றவை. பதினைந்து படிநிலைகளைக் கொண்ட ஒரு செயல்முறையில், முந்தைய படிநிலைகள் சரியாக இருந்தபோதிலும், ஒரு சிறிய தவறு கூட இறுதிப் பதிலைத் தவறாக மாற்றிவிடும். மாறாக, சரியான பதிலுடன் முடிவடையும் ஒரு செயல்முறை, பல படிநிலைகள் எந்த மதிப்பையும் சேர்க்காமல், வெறும் தற்செயலான அதிர்ஷ்டத்தின் அடிப்படையில் அமைந்திருக்கலாம். இறுதி முடிவை மட்டுமே வைத்துப் பயிற்சியளிப்பது, அந்த முழுப் பாதையையும் ஒரு கருப்புப் பெட்டியாக (black box) கருதத் தூண்டுகிறது, இதனால் எந்தத் துணை நடத்தைகள் உண்மையில் பயனுள்ளவை என்பதைக் கண்டறிவது கடினமாகிறது.

இந்தச் சூழல் மென்பொருள் பொறியியலில் பிழைத்திருத்தம் (debugging) செய்வதைப் போன்றது. டெவலப்பர்கள் ஒவ்வொரு வரியையும் ஆராய்ந்து, தோல்வியடையும் பகுதியைத் தனிமைப்படுத்திச் சரிசெய்வார்கள். ஆனால், முகவர்களுக்குத் தங்களின் உள் செயல்பாடுகளைப் பற்றிய இத்தகைய "தணிக்கைப் பாதை" (receipt/audit trail) வழங்கப்படவில்லை. அந்தத் தணிக்கைப் பாதை இல்லாமல், ஒரு முன்னேற்றம் சிறந்த காரணத்தினால் ஏற்பட்டதா அல்லது வெறும் தற்செயலா என்பதைக் கண்டறிய டெவலப்பர்களால் முடியாது, மேலும் மோசமான பழக்கவழக்கங்களை முறையாகத் திருத்தவும் முடியாது.

ABC எவ்வாறு தகுதியை மறுசீரமைக்கிறது

Answer-Backtracked Credit Assignment முறை சரியான இறுதிப் பதிலிலிருந்து பின்னோக்கிச் செயல்படுகிறது. இது முதலில் அந்தப் பதிலைத் தீர்மானிக்கத் தேவையான அத்தியாவசியத் தடயங்களை—குறிப்பிட்ட ஆதாரங்கள், இடைநிலை முடிவுகள் அல்லது நிலைச் சரிபார்ப்புகள்—வெளியே எடுக்கிறது. பின்னர், பதிவு செய்யப்பட்ட தடயத்தின் வழியாகப் பின்னோக்கிச் சென்று, ஒவ்வொரு நடவடிக்கையையும் அந்தத் தடயங்களுடன் ஒப்பிட்டு மதிப்பெண் வழங்குகிறது. தேவையான ஒரு தடயத்திற்கு நேரடியாகப் பங்களித்த நடவடிக்கை நேர்மறைத் தகுதியைப் பெறுகிறது; தேவையற்ற அல்லது தீங்கு விளைவிக்கும் நடவடிக்கை எதிர்மறை அல்லது பூஜ்ஜிய மதிப்பெண்ணைப் பெறுகிறது.

இந்த மதிப்பெண் முறையை அடிப்படையாகக் கொண்டு இரண்டு பயிற்சி முறைகள் உருவாக்கப்பட்டுள்ளன:

  • ABC-SFT (Supervised Fine-Tuning) இழப்புச் செயல்பாட்டை (loss function) மறுசீரமைக்கிறது, இதனால் அதிகத் தகுதியைப் பெற்ற படிநிலைகள் மாதிரியின் மீது அதிகத் தாக்கத்தை ஏற்படுத்துகின்றன. வரலாற்று ரீதியாகப் பயனுள்ள தடயங்களுக்கு இட்டுச் சென்ற நடவடிக்கைகளுக்கு முன்னுரிமை அளிக்க மாதிரி கற்றுக்கொள்கிறது.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) ஒவ்வொரு படிநிலை மதிப்பெண்களையும் வலுவூட்டல் கற்றலுக்கான (reinforcement learning) வெகுமதி சிக்னலாகக் கருதுகிறது, இதன் மூலம் பதிலைப் பெற உதவிய தேடலின் குறிப்பிட்ட பகுதிகளை இது வலுப்படுத்துகிறது.

வெற்றி/தோல்வி என்ற இருமுனை லேபிளை, பங்களிப்பின் நுணுக்கமான வரைபடமாக மாற்றுவதன் மூலம், ABC மாதிரிக்கு மிகவும் செழுமையான கற்றல் சிக்னலை வழங்குகிறது.

ஆரம்பகால முடிவுகள் வலுவாகப் பேசுகின்றன

ஆராய்ச்சியாளர்கள் ABC முறையை, மாறிவரும் தேடல் நிலையைத் தொடர்ந்து கண்காணிக்கும் ஒரு context-management அடுக்கு கொண்ட 4 பில்லியன் அளவுருக்கள் கொண்ட ஒரு சிறிய மாதிரிக்குச் செயல்படுத்திப் பார்த்தனர். வழக்கமாகப் பெரிய முகவர்களுக்கே சாதகமாக இருக்கும் ஒப்பீட்டுப் பணிகளில் (benchmark tasks), ABC மூலம் பயிற்சியளிக்கப்பட்ட மாதிரி அந்தப் பெரிய அமைப்புகளைச் சமன் செய்தது அல்லது அவர்களை விடச் சிறப்பாகச் செயல்பட்டது. மாதிரியின் அளவை அதிகரிக்காமலேயே இந்தச் செயல்திறன் அதிகரிப்பு கிடைத்துள்ளது, இது சிறந்த தகுதி ஒதுக்கீடு (credit assignment), வெறும் அளவுருக்களின் எண்ணிக்கைக்கு மாற்றாக அமையலாம் என்பதைக் காட்டுகிறது.

இதன் முக்கியக் கருத்து எளிமையானது: எது வேலை செய்தது என்பதற்கான தெளிவான ஆதாரத்தை மாதிரிக்கு வழங்கினால், அது அதே அளவு பயிற்சித் தரவிலிருந்து அதிக மதிப்பைப் பெற முடியும்.

நிஜ உலக முகவர்களுக்கு இதன் பொருள் என்ன

குறியீடு உதவியாளர்கள், இலக்கிய ஆய்வு பாட்கள், வாடிக்கையாளர் சேவை கருவிகள் எனப் பல படிநிலைகளைக் கொண்ட பணிகளைச் செய்யும் எந்தவொரு முகவரும் அதன் நடவடிக்கைகளின் தடயத்தைச் சார்ந்துள்ளன. அந்தத் தடயத்தைப் பாதுகாப்பதும் மதிப்பீடு செய்வதும் ஒரு கூடுதல் வசதி மட்டுமல்ல; அது பயனுள்ள கற்றலுக்கு அவசியமானது என்பதை ABC காட்டுகிறது.

  • Coding agents திட்டத்தை, இயக்கப்பட்ட ஒவ்வொரு கட்டளையையும் மற்றும் குறியீட்டைச் சரிபார்க்கும் சோதனை முடிவுகளையும் பதிவு செய்ய வேண்டும்.
  • Research agents தாங்கள் அனுப்பிய வினவல்கள், திறந்த ஆதாரங்கள் மற்றும் பிரித்தெடுத்த ஆதாரங்களைச் சேமித்து வைத்திருக்க வேண்டும்.
  • Support agents தீர்வை நோக்கி இட்டுச் சென்ற ஒவ்வொரு நிலைச் சரிபார்ப்பு மற்றும் முடிவெடுத்தல் புள்ளிகளையும் பதிவு செய்ய வேண்டும்.

இந்தத் தடயங்கள் கிடைக்கும்போது, ABC துல்லியமாகத் தகுதியை ஒதுக்க முடியும், இது மாதிரி நல்ல பழக்கவழக்கங்களை வலுப்படுத்தவும், திறமையாகத் தவறாகக் கருதப்படக்கூடிய தற்செயலான குறுக்குவழிகளைத் தவிர்க்கவும் அனுமதிக்கிறது.

முரண்பட்ட கருத்துக்கள் மற்றும் நடைமுறைத் தடைகள்

ABC-இன் நன்மைகள் கூடுதல் சிக்கல்களுடன் வருகின்றன.

இறுதி முடிவு

Answer-Backtracked Credit Assignment என்பது ஏஜென்ட்கள் தேடுதல், குறியீட்டு முறை (code) மற்றும் பகுத்தறிதல் ஆகியவற்றை எவ்வாறு கற்றுக்கொள்ள வேண்டும் என்பதற்கான அணுகுமுறையையே மாற்றியமைக்கிறது. இறுதி இலக்கை மட்டும் மதிப்பிடுவதற்குப் பதிலாக, அந்தப் பாதையில் மேற்கொள்ளப்படும் சரியான நகர்வுகளுக்கு வெகுமதி அளிப்பதன் மூலம், ஒரு மிதமான அளவுள்ள மாதிரி (modestly sized model), மிகப் பெரிய மாதிரிகளைப் போலவே திறம்பட கற்க இது வழிவகை செய்கிறது. பல படிநிலைகளைக் கொண்ட பணிகளைச் செய்ய வேண்டிய ஏஜென்ட்களை உருவாக்குபவர்களுக்கு, trace-centric பயிற்சி முறையைத் தேர்ந்தெடுப்பது என்பது ஒரு விருப்பத்தேர்வு அல்ல—அது நம்பகமான, தணிக்கை செய்யக்கூடிய மற்றும் இறுதியில் புத்திசாலித்தனமான AI-க்கான வழியாகும்.