SEED ஆய்வுக் கட்டுரையின் ஆசிரியர்கள், வலுவூட்டல் கற்றல் (RL) முகவர்கள் தங்களின் சொந்தத் தோல்விப் பதிவுகளைப் புதிய பயிற்சித் தரவுகளாக மாற்ற உதவும் ஒரு முறையை வெளிப்படுத்தியுள்ளனர். இது ALFWorld benchmark-இல் சராசரி மதிப்பெண்களை 91.8 ஆக உயர்த்துகிறது மற்றும் பயிற்சித் தரவின் அளவை தோராயமாக 40% குறைக்கிறது. இதே நுட்பம் முகவர்கள் இதுவரை பார்த்திராத பணிகளில் 15.3 புள்ளிகள் உயர்வை ஏற்படுத்துகிறது, இதன் மூலம் கூடுதல் மனித மேற்பார்வை இன்றி ஒரு மாதிரி (model) தனது தவறுகளிலிருந்து கற்றுக்கொள்ள முடியும் என்பதை இது நிரூபிக்கிறது.
ஏன் RL முகவர்களுக்கு வெற்றி/தோல்வி (pass/fail) குறித்த தகவல் மட்டும் போதாது
வழக்கமான RL அமைப்புகள் ஒரு நீண்ட நிகழ்வின் (episode) முடிவில் மட்டுமே முகவருக்கு வெகுமதி அளிக்கின்றன. இந்தத் தகவல் அந்த முடிவு தவறானது என்று மட்டுமே கூறுகிறது, ஆனால் பிழை எங்கு ஏற்பட்டது என்பதைப் பற்றி எதுவும் சொல்லவில்லை. ஒரு தவறு பத்து படிகள் முன்னரே நடந்திருந்தால்—ஒருவேளை தவறான தேடல் சொல் பயன்படுத்தப்பட்டிருக்கலாம் அல்லது தவறான கோப்பு திறக்கப்பட்டிருக்கலாம்—இறுதித் தகவல் அந்த இடைப்பட்ட அனைத்துத் தகவல்களையும் நீக்கிவிடுகிறது. இந்த இழப்பு காரணமாக, தோல்விக்கு வழிவகுக்கும் அரிய வடிவங்களைக் கண்டறிய ஆராய்ச்சியாளர்கள் மிகப்பெரிய அளவிலான நிகழ்வுகளைச் சேகரிக்க வேண்டிய கட்டாயத்திற்குத் தள்ளப்படுகிறார்கள்.
SEED எவ்வாறு பின்னூட்டச் சுழற்சியை (feedback loop) மாற்றுகிறது
SEED (Self-Evolving On-Policy Distillation) ஒவ்வொரு நிகழ்விற்குப் பிறகும் இரண்டாவது கற்றல் நிலையைச் சேர்க்கிறது:
- பணியை முடித்தல் – முகவர் பணியை முழுமையாகச் செய்து, வழக்கமான வெற்றி/தோல்வி லேபிளைப் பெறுகிறது.
- சொந்தப் பதிவுகளைப் படித்தல் – செயல்பாடுகள், அவதானிப்புகள் மற்றும் இடைப்பட்ட முடிவுகளின் வரிசை மாதிரியிடம் (model) மீண்டும் வழங்கப்படுகிறது.
- இயற்கை மொழிப் பாடங்களை எழுதுதல் – என்ன தவறு நடந்தது என்பதை விளக்கும் குறுகிய வாக்கியங்களை மாதிரி உருவாக்குகிறது, உதாரணமாக, “தேடல் சொல் ‘X’ பொருத்தமற்ற முடிவுகளைத் தந்தது” அல்லது “‘Z’-க்கு பதிலாக ‘Y’ என்ற கோப்பு திறக்கப்பட்டது”.
- பாடங்களை policy updates ஆக மாற்றியமைத்தல் – அந்த வாக்கியங்கள் ஒரு புதிய on-policy distillation படிநிலைக்கு இலக்காக மாறுகின்றன, இது திருத்தத்திற்குப் பின்னால் உள்ள தர்க்கத்தைக் கற்றுக் கொடுக்கிறது.
உருவாக்கப்பட்ட பாடங்கள் inference time-இல் பயன்படுத்தப்படும் prompts அல்ல; அவை கொள்கையை (policy) மறுவடிவமைக்கும் உள் பயிற்சி சமிக்ஞைகள் (internal training signals) ஆகும். நடைமுறையில், முகவர் தனது சொந்த ஆசிரியராக மாறி, மூலத் தோல்விப் பதிவுகளைக் கட்டமைக்கப்பட்ட அறிவாக மாற்றுகிறது.
நினைவகத் தந்திரங்களை விட இந்த அணுகுமுறை ஏன் அதிகத் திறன் வாய்ந்தது
ஒரு பொதுவான தீர்வு என்னவென்றால், குறிப்பிடத்தக்க நிலைகளை அல்லது குறிப்புகளைப் பின்னர் நினைவுகூருவதற்காக ஒரு வெளிப்புற நினைவகத் தொகுப்பை (external memory buffer) இணைப்பதாகும். அந்த உத்தி ஒரு விரிவான “கோப்பு அலமாரியை” உருவாக்குகிறது, அங்கு முகவர் சரியான நேரத்தில் சரியான தகவலைத் திரும்பப் பெறக் கற்றுக்கொள்ள வேண்டும்—இது ஒரு கடினமான சிக்கலாகும், மேலும் இது கூடுதல் சுமையையும் (overhead) ஏற்படுத்துகிறது, மேலும் செயல் மற்றும் விளைவு இடையிலான காரணத் தொடர்பைத் தவறவிடவும் வாய்ப்புள்ளது.
SEED இந்தத் தேடல் சிக்கலைத் தவிர்க்கிறது. Distillation மூலம் பாடத்தை நேரடியாக policy-க்குள் இணைப்பதன் மூலம், முகவர் திருத்தத்தை ஒரு குறிப்பாகப் பார்க்காமல், ஒரு திறனாகத் தன்னுள் உள்வாங்கிக் கொள்கிறது. இதன் விளைவாக, பிழை கண்டறிதல் மற்றும் நடத்தை மாற்றம் ஆகியவற்றிற்கு இடையே ஒரு நெருக்கமான சுழற்சி உருவாகிறது.
முக்கியமான புள்ளிவிவரங்கள்
- ALFWorld benchmark – சராசரி மதிப்பெண் 91.8, இது அதே சூழலைப் பயன்படுத்தும் வழக்கமான RL முறைகளை விட சிறந்தது.
- தரவுத் திறன் (Data efficiency) – சுமார் 40% குறைவான பயிற்சி நிகழ்வுகளுடன் அதே அல்லது சிறந்த செயல்திறனைப் பெறுகிறது.
- பொதுமைப்படுத்துதல் (Generalization) – பார்க்கப்படாத பணிகளில், இந்த முறை வழக்கமான RL-ஐ விட 15.3 புள்ளிகள் அதிகம் பெறுகிறது, இது சுய-உருவாக்கப்பட்ட பாடங்கள் மாற்றத்தக்க தர்க்க வடிவங்களைப் பிடிக்கின்றன என்பதைக் காட்டுகிறது.
இந்த எண்கள், சிக்கலான முகவிகளுக்கான பயிற்சியில் கணக்கீட்டு மற்றும் தரவுச் செலவைக் குறைக்க SEED உதவும் என்பதைக் காட்டுகின்றன, இது மிகப்பெரிய உருவகப்படுத்துதல் (simulation) வளங்கள் இல்லாத குழுக்களுக்கு ஒரு வரப்பிரசாதமாகும்.
அபாயங்கள் மற்றும் வரம்புகள்
இந்த நுட்பம் தனது சொந்த அனுபவத்தைத் சரியாகப் புரிந்துகொள்ளும் மாதிரியின் திறனைச் சார்ந்துள்ளது. முகவர் சூழலைத் தவறாகப் புரிந்துகொண்டால்—உதாரணமாக, ஒரு தோல்விக்குத் தவறான காரணத்தைக் கூறினால்—அது நம்பிக்கையுடன் தவறான பாடத்தை உருவாக்கக்கூடும். இத்தகைய கற்பனையான (hallucinated) ஆலோசனைகளின் அடிப்படையில் பயிற்சி செய்வது தவறான பழக்கங்களை வலுப்படுத்தக்கூடும். ஆய்வாளர்கள் சில நேரங்களில் ஆழமான சிக்கல்களை மறைக்கும் வகையில் மிகத் தெளிவான விளக்கங்களை உருவாக்குகிறார்கள் என்ற மனிதர்களின் post-mortems ஆய்வுகளுடன் இது ஒத்துப்போவதாக ஆசிரியர்கள் குறிப்பிடுகின்றனர்.
அடுத்து கவனிக்க வேண்டியவை
- தற்போதுள்ள RL pipelines உடன் ஒருங்கிணைத்தல் – SEED ஒரு post-episode செயலாக்கப் படிநிலையை மட்டுமே சேர்ப்பதால், குறைந்த பொறியியல் முயற்சியுடன் பல தற்போதுள்ள பயிற்சிச் சுழற்சிகளில் இதைப் பயன்படுத்த முடியும்.
RL முகவிகளை உருவாக்கும் டெவலப்பர்கள், நிகழ்வுப் பதிவுகளை (episode logs) வெறும் ஆவணத் தரவாக மட்டும் பார்க்காமல் கையாளத் தொடங்க வேண்டும். ஒவ்வொரு முறை இயங்கிய பிறகும், பின்வருவனவற்றைச் சுட்டிக்காட்டச் சொல்லுங்கள்:
- பணியை மிகவும் முன்னேற்றிய முடிவு.
- அதிகப்படியான படங்களை வீணடிக்கக் காரணமான அனுமானம்.
- பிழையை முன்னரே கண்டறிய முடிந்த ஒரு எளிய சரிபார்ப்பு.
அந்தக் குறிப்புகளைத் தற்காலிகமான prompts ஆகத் திரும்ப வழங்குவதற்குப் பதிலாக, SEED முன்மொழியும்து போல ஒரு distillation படிநிலைக்குள் அவற்றை வழங்கவும். இதன் பலன் தெளிவானது: சிறந்த செயல்திறன், குறைந்த தரவு, மற்றும் தனது சொந்தத் தவறுகளை விளக்கக் கற்றுக்கொள்ளும் ஒரு மாதிரி.
முக்கியக் கருத்து: தோல்விப் பதிவுகளைத் தானாகவே உருவாக்கப்பட்ட பாடங்களாக மாற்றுவது, குறைவான வெகுமதி பின்னூட்டங்களை ஒரு செழுமையான, மீண்டும் பயன்படுத்தக்கூடிய பயிற்சி சமிக்ஞையாக மாற்றி, வேகமான மற்றும் அதிக தரவு-திறன் கொண்ட RL-க்கான ஒரு நடைமுறைப் பாதையை வழங்குகிறது.
