SWE-Prime ஆய்வு, கவனமாகத் தேர்ந்தெடுக்கப்பட்ட 10% "pass" ஓட்டங்களின் (runs) மூலம் பயிற்சி அளிப்பது, ஒவ்வொரு வெற்றிகரமான பாதையையும் (trajectory) மாடலுக்குள் செலுத்துவதை விட வலிமையான AI ஏஜெண்டுகளை உருவாக்குகிறது என்பதைக் காட்டுகிறது. இது, ஒரு "pass" லேபிளை நம்பகமான தரக் கட்டுப்பாட்டு வடிகட்டியாகக் கருதும் நீண்டகாலப் பழனத்தை கேள்விக்குள்ளாக்குகிறது.

குறியீடு உருவாக்கம் (code-generation) அல்லது தானியங்கி பிழைத்திருத்த (automated debugging) ஏஜெண்டுகளை உருவாக்கும் எவருக்கும் இந்த முடிவு முக்கியமானது: அதிக தரவு என்பது தானாகவே சிறந்த செயல்திறனாக மாறாது; மேலும், pass/fail என்ற இருமக் குறியீட்டை (binary flag) மட்டுமே நம்பியிருப்பது, மாடல்களுக்குத் தேவையற்ற முறையில் அலைவதற்கும், பயனற்ற கருவி அழைப்புகளைத் (tool calls) திரும்பத் திரும்பச் செய்வதற்கும், மற்றும் பகுத்தறிவை விட அதிர்ஷ்டத்தைச் சார்ந்திருப்பதற்கும் கற்றுக்கொடுக்கக்கூடும்.

ஏன் “pass” குறியீடு நம்பப்பட்டு வந்தது

பெரும்பாலான reinforcement-learning-from-human-feedback வழிமுறைகளில் (pipelines), இறுதி முடிவு சோதனைத் தரநிலைகளை (test criteria) பூர்த்தி செய்யும் போது, பொறியாளர்கள் ஒரு பாதையை (trajectory)—அதாவது அவதானிப்புகள், செயல்கள் மற்றும் கருவி அழைப்புகளின் முழுத் தொடரை—"pass" என்று லேபிளிடកម្ម செய்கிறார்கள். இதன் அனுமானம் எளிமையானது: ஏஜென்ட் வெற்றி பெற்றால், அந்த முழு நிகழ்வும் (episode) பயனுள்ள நடத்தையைக் கொண்டிருக்க வேண்டும் என்பதாகும். எனவே, வெற்றிக்கு வழிவகுத்த முறைகளை மாடல் உள்வாங்கிக் கொள்ளும் என்ற நம்பிக்கையில், ஒவ்வொரு வெற்றிகரமான ஓட்டத்தையும் அவர்கள் பயிற்சித் தொகுப்பில் (training pool) சேர்க்கிறார்கள்.

அந்த அனுமானம் பல மாதங்களாக மென்பொருள் பொறியியல் (SWE) ஏஜெண்டுகளுக்கான பெரிய அளவிலான தரவு சேகரிப்பை வழிநடத்தி 왔து. இதன் தர்க்கம் வலுவாகத் தோன்றுகிறது: ஒரு "pass" என்பது ஏஜென்ட் சிக்கலைத் தீர்த்துவிட்டது என்பதைக் குறிக்கிறது, எனவே அந்த நிகழ்வு அதைச் சாத்தியமாக்கிய கொள்கைகளை (policies) வலுப்படுத்த வேண்டும்.

SWE-Prime வித்தியாசமாகச் செய்தது என்ன

SWE-Prime ஆய்வு இந்த அணுகுமுறையை மாற்றியமைத்தது. ஆராய்ச்சியாளர்கள் குறியீடு எழுதும் பணிகளின் ஒரு தரப்படுத்தப்பட்ட அளவுகோலை (benchmark) எடுத்து, வெற்றிகரமான ஓட்டங்களை இரண்டு குழுக்களாகப் பிரித்தனர்:

  1. அனைத்து pass பாதைகள் (All pass trajectories) – சோதனையில் வெற்றி பெற்ற அனைத்து நிகழ்வுகளையும் கொண்ட வழக்கமான பயிற்சித் தொகுப்பு.
  2. தேர்ந்தெடுக்கப்பட்ட 10% துணைத் தொகுப்பு (A curated 10% subset) – முழுத் தொகுப்பிலிருந்து கையால் தேர்ந்தெடுக்கப்பட்டவை.

இரண்டு குழுக்களும் ஒரே மாதிரியான மாடல் கட்டமைப்புகளைக் கொண்டு (model architectures) நுணுக்கமாகப் பயிற்றுவிக்கப்பட்டன (fine-tuned). புதிய சிக்கல்களில் (held-out problems) மதிப்பீடு செய்யப்பட்டபோது, தேர்ந்தெடுக்கப்பட்ட துணைத் தொகுப்பின் மூலம் பயிற்றுவிக்கப்பட்ட மாடல், முழு pass தொகுப்பின் மூலம் பயிற்றுவிக்கப்பட்ட மாடலை விடச் சிறந்த செயல்திறனை வெளிப்படுத்தியது.

“pass” லேபிளைச் சிதைக்கும் முறைகள்

ஒரு "pass" குறியீட்டிற்குப் பின்னால் மறைந்திருக்கும் பல தொடர்ச்சியான தோல்வி முறைகளை இந்த ஆய்வு பட்டியலிட்டது:

  • தொடர்ச்சியான கருவி பயன்பாடு (Repeated tool spamming) – ஒரு ஏஜென்ட் சரியான வெளியீட்டைப் பெறுவதற்கு முன்பு, ஒரே கம்பைலர் (compiler) அல்லது லின்டரை (linter) டஜன் கணக்கான முறை பயன்படுத்தக்கூடும். இறுதி வெற்றி அந்தத் திறமையின்மைய மறைத்துவிடுகிறது.
  • நீண்ட நேரத் திசைமாற்றங்கள் (Long meandering phases) – ஏஜெண்டுகள் சில நேரங்களில் சரியான தீர்வை அடைவதற்கு முன்பு ஐந்து அல்லது அதற்கு மேற்பட்ட தேவையற்ற படிகளை மேற்கொள்ளலாம். அந்த நிகழ்வு இறுதியில் "pass" என்று முடிந்தாலும், அந்தப் பாதையின் பெரும்பகுதி எந்தப் பயனுள்ள கற்றலையும் வழங்காது.
  • எளிமையான சோதனைகள் (Trivial tests) – சில அளவுகோல்கள் மிகவும் எளிதானவை, இதனால் ஒரு ஏஜென்ட் ஒருமுறை ஊகிப்பதன் மூலமோ அல்லது ஒரு ஓட்டையைப் (loophole) பயன்படுத்துவதன் மூலமோ வெற்றி பெற முடியும். "pass" லேபிள் உண்மையான பகுத்தறிவிற்கும் அதிர்ஷ்டத்திற்கும் இடையிலான வேறுபாட்டைத் தெரியப்படுத்துவதில்லை.

இத்தகைய நிகழ்வுகள் மீண்டும் பயிற்சிச் சுழற்சிக்குள் (training loop) நுழையும் போது, மாடல் தேவையற்ற அலைந்து திரிவதையும் கருவியைத் தவறாகப் பயன்படுத்துவதையும் வெற்றியுடன் தொடர்புபடுத்தக் கற்றுக்கொள்கிறது. இதன் விளைவாக, ஏஜென்ட் "ஏதாவது ஒன்று வேலை செய்யும் வரை முயற்சித்துக் கொண்டே இரு" என்ற ஒரு முறையை (heuristic) உள்வாங்கிக் கொள்கிறது; இது செயல்திறன் மற்றும் விளக்கமளிக்கும் திறன் (interpretability) தேவைப்படும் உற்பத்தித் தர (production-grade) அமைப்புகளுக்கு விரும்பத்தகாதது.

பகுதி அளவிலான தரம் மற்றும் பாதை அளவிலான முடிவு

SWE-Prime வழங்கிய முக்கிய நுண்ணறிவு என்னவென்றால், ஒரு பாதையின் ஒட்டுமொத்த முடிவிற்கும் அதன் உள்ளமைக்கப்பட்ட பகுதிகளின் (segments) தரத்திற்கும் இடையிலான வேறுபாடுதான். ஒரு பாதை என்பது ஒரு மேலோட்டமான லேபிள் மட்டுமே: இறுதி விடை சரியா என்பதை அது சொல்லும், ஆனால் அதன் உள்ளே இருக்கும் முடிவெடுக்கும் செயல்முறையை அது மறைத்துவிடும். இந்த ஆய்வு பின்வருவனவற்றைக் கவனித்தது:

  • நல்ல பாதைகளில் மோசமான பகுதிகள் இருக்கலாம் – ஒரு திறமையான தீர்வு, இறுதி விடைக்கு எந்தப் பங்களிப்பும் இல்லாத சில வீணான படிகளைக் கொண்டிருக்கலாம்.
  • தோல்வியடைந்த பாதைகளில் சிறந்த பகுதிகள் மறைந்திருக்கலாம் – ஒரு ஏஜென்ட் மிகச் சிறந்த முறையில் திட்டமிட்ட பிறகு, தொடர்பற்ற ஒரு பிழை காரணமாகச் சோதனை தோல்வியடையலாம்.

முழு ஓட்டங்களுக்குப் பதிலாகப் பகுதிகளை மதிப்பிடுவதன் மூலம் (scoring segments), ஏஜென்ட் முதல் படியிலிருந்தே திட்டமிட்டுச் செயல்பட்ட நிகழ்வுகளை மட்டும் ஆராய்ச்சியாளர்கள் தக்கவைத்துக் கொண்டு, மற்றவற்றைத் தவிர்த்தனர். இது மாடல்கள் எந்த வகையான பகுத்தறிவு முறைகளைப் பின்பற்ற வேண்டும் என்று நாம் விரும்புகிறோமோ, அதற்கேற்ப பயிற்சித் சிக்னலை (training signal) சீரமைக்கிறது.

செலவு மற்றும் வேக நன்மைகள்

பத்தில் ஒரு பங்குத் தரவைக் கொண்டு பயிற்சி அளிப்பது கணக்கீட்டுச் செலவுகளை (compute expenses) வியத்தகு முறையில் குறைத்தது. குழுவிற்கு மிகக் குறைந்த GPU நேரமே தேவைப்பட்டது, மேலும் முழு pass தொகுப்பிற்குத் தேவைப்படும் நேரத்தின் ஒரு சிறு பகுதியில் இந்த வழிமுறை முடிந்துவிட்டது. இதில் உள்ள முரண்பாடு வியப்பளிக்கிறது: அவர்கள் குறைந்த கணக்கீட்டுச் செலவில் அதிக செயல்திறனைப் பெற்றனர். குறைந்த பட்ஜெட் அல்லது பெரிய அளவிலான பயன்பாட்டு இலக்குகளைக் கொண்ட நிறுவனங்களுக்கு, இந்தச் சேமிப்பு மிகவும் முக்கியமானது.

தேர்ந்தெடுக்கும் சவால்

இந்த அணுகுமுறையை ஏற்றுக்கொள்வதில் உள்ள மிகப்பெரிய தடையானது, எது ஒரு "நல்ல பகுதி" என்பதை வரையறுப்பதே ஆகும். விலையுயர்ந்த வெகுமதி மாடல் (reward model) இல்லாமல் பகுதிகளை மதிப்பிடுவது கடினம் என்றும், அதற்கு ஒரு புத்திசாலித்தனமான, இலகுவான அளவுகோல் (lightweight metric) தேவை என்றும் SWE-Prime குழு குறிப்பிட்டது.

முக்கியக் கருத்து

SWE-Prime, ஒரு இருமநிலை "சோதனையில் தேர்ச்சி பெற்றது" (passed the test) என்ற குறியீடு பயிற்சித் தரவிற்கான நம்பகத்தன்மையற்ற வடிகட்டி என்பதை நிரூபிக்கிறது. திசைமாறும் நிகழ்வுகள், தேவையற்ற கருவி அழைப்புகள் மற்றும் மிக எளிதான செயல்பாடுகளை நீக்குவதன் மூலம், மேம்பாட்டாளர்கள் கணினிச் செலவுகளைக் குறைக்கும் அதே வேளையில், அதிகத் திறன் கொண்ட மற்றும் திறமையான முகவர்களைப் பயிற்றுவிக்க முடியும். பாடம் தெளிவானது: அளவை விட தரம் முக்கியமானது, மேலும் புத்திசாலித்தனமான AI முகவர்களை நோக்கிய பாதை என்பது ஒவ்வொரு படியும் உண்மையில் எதற்கெல்லாம் பங்களிக்கிறது என்பதன் நுணுக்கமான மதிப்பீட்டில் உள்ளது.