ஒரு புதிய “முன்னெச்சரிக்கை நினைவக” (proactive memory) தொகுதி, பெரிய மொழி மாதிரி (large-language-model) முகவர்கள் மைய மாதிரியை நுணுக்கமான பயிற்சி (fine-tuning) செய்யாமலேயே, பணித் தேவைகள், சூழல் உண்மைகள் மற்றும் கடந்த காலத் தோல்விகளைக் கண்காணிக்க அனுமதிக்கிறது. ஒப்பீட்டுத் தேர்வுகளில் (benchmark tests), இந்தத் தொகுதியானது Sonnet 4.5-ன் மதிப்பெண்ணை Terminal-Bench 2.0 இல் 8.3 சதவீதப் புள்ளிகளாகவும், τ2-Bench தொகுப்பில் 6.8 புள்ளிகளாகவும் உயர்த்தியுள்ளது; SETA மூலம் பயிற்சி பெற்ற ஒரு நினைவக முகவர், புதிய சிக்கல்களில் ஒரு முடக்கப்பட்ட (frozen) மாதிரியின் pass@1 மதிப்பை 37.6 % இலிருந்து 41.1 % ஆக உயர்த்தியுள்ளது.
முகவர்கள் ஏன் திசைமாறுகின்றன
ஒரு LLM-ஆல் இயக்கப்படும் முகவர் பல படிநிலைகளைக் கொண்ட ஒரு செயல்முறையைப் பின்பற்றும் போது, அதன் உள்நிலை (internal state) சிதைகிறது. ஆராய்ச்சியாளர்கள் இதை “நடத்தை நிலைச் சிதைவு” (behavioral state decay) என்று அழைக்கிறார்கள்: அதாவது மாதிரி முந்தைய அறிவுறுத்தல்கள், முக்கிய உண்மைகள் அல்லது ஏற்கனவே செய்த தவறுகளை மறந்துவிடுகிறது. இதன் விளைவாகத் தொடர்ச்சியான தவறான முடிவுகள் எடுக்கப்பட்டு, பணி முடிவடைவதற்கு நீண்ட காலத்திற்கு முன்பே அது பாதியிலேயே நின்றுவிடுகிறது.
இதற்கான வழக்கமான தீர்வு சூழல் சாளரத்தை (context window) — அதாவது மாதிரி ஒரே நேரத்தில் கவனிக்கும் உரைத் துண்டு — பெரிதாக்குவதாகும். ஆனால் பணி அந்தச் சாளரத்தின் அளவைத் தாண்டும் வரை மட்டுமே அது உதவும்; பழைய தகவல்கள் நீக்கப்பட்டு, சிதைவு மீண்டும் தொடங்கும்.
தேவைப்படும்போது மட்டும் செயல்படும் நினைவூட்டல்
புதிய அணுகுமுறை ஒரு இலகுரக துணை நினைவக முகவரைச் சேர்க்கிறது. இது முக்கிய மாதிரியின் தர்க்கப் பாதையை (reasoning trace) கவனித்து, தேவையான நினைவூட்டல்களைச் சேர்க்கிறது. கடந்த காலத் துண்டுகளின் நிலையான பட்டியலைப் பயன்படுத்துவதற்குப் பதிலாக, முக்கிய மாதிரி திசைமாறத் தொடங்கும் போது மட்டும் எப்போது மற்றும் எதை முன்னிலைப்படுத்த வேண்டும் என்பதை இந்த நினைவகத் தொகுதி தீர்மானிக்கிறது.
நினைவகக் கற்றல் (memory learner) தனித்தனியாகப் பயிற்சி அளிக்கப்படுவதால், முதன்மைச் செயல் மாதிரி முடக்கப்பட்டே (frozen) இருக்கும். இந்தத் தனித்தன்மை, நீண்ட காலத் தேர்வுகளில் (long-horizon benchmarks) குறிப்பிடத்தக்க முன்னேற்றத்தைத் தருகிறது; அதாவது முன்னெச்சரிக்கை நினைவூட்டல்கள் ஒரு வரையறுக்கப்பட்ட சூழல் சாளரத்தின் குறையை ஈடுசெய்ய முடியும் என்பதை இது நிரூபிக்கிறது.
புள்ளிவிவரங்கள் என்ன சொல்கின்றன
- Terminal-Bench 2.0: Sonnet 4.5 அதன் அடிப்படை மதிப்பை விட 8.3 புள்ளிகள் உயர்கிறது.
- τ2-Bench suite: அதே மாதிரி 6.8 புள்ளிகள் முன்னேறுகிறது.
- Held-out சோதனைகளில் Pass@1: SETA மூலம் பயிற்சி பெற்ற நினைவக முகவர், ஒரு முடக்கப்பட்ட மாதிரியின் மதிப்பை 37.6 % இலிருந்து 41.1 % ஆக உயர்த்துகிறது.
இந்த முன்னேற்றங்கள் முக்கிய மாதிரியில் எந்த கூடுதல் நுணுக்கமான பயிற்சியும் (fine-tuning) செய்யப்படாமல் நிகழ்கின்றன, எனவே இந்த நினைவகத் தொகுதியை தற்போதுள்ள பயன்பாடுகளில் எளிதாக மாற்றிக் கொள்ள முடியும்.
தற்போதைய ஆய்வின் வரம்புகள்
இந்தச் சோதனைகள் பின்வருவனவற்றைச் சோதிப்பதில்லை:
- அளவு (Scale): பில்லியன் கணக்கான அளவுருக்களைக் (parameters) கொண்ட மாதிரிகள் அல்லது மில்லியன் கணக்கான படிநிலைகளைக் கொண்ட பணிகளில் இந்த நினைவகத் தொகுதி இதேபோல் செயல்படும் என்பதற்கு இன்னும் சான்றுகள் இல்லை.
- உற்பத்திச் செலவு (Production cost): நினைவூட்டல்களைச் சேமிப்பதும் மீட்டெடுப்பதும் கூடுதல் சுமையை (overhead) ஏற்படுத்துகிறது, ஆனால் ஒரு நிஜ உலக அமைப்பில் தேவைப்படும் கூடுதல் நினைவகம் அல்லது கணக்கீட்டுத் திறனை (compute) இந்த ஆய்வு அளவிடுவதில்லை.
அடுத்து கவனிக்க வேண்டியவை
எதிர்கால ஒப்பீட்டுத் தொகுப்புகள் வெறும் சூழல் அளவை (context size) மட்டும் அளவிடுவதை விட மேலானவற்றை அளவிட வேண்டியிருக்கும். நிலைச் சிதைவை (state decay) வெளிப்படையாகக் கண்காணித்து, செயல்படும் நினைவூட்டல் அமைப்புகளுக்குப் வெகுமதி அளிக்கும் சோதனைகள், ஒரு முகவரின் நீண்டகால நம்பகத்தன்மை குறித்த தெளிவான பிம்பத்தை வழங்கும். மேலும், முன்னெச்சரிக்கை நினைவகம் மாதிரி அளவு மற்றும் செயல்பாட்டுச் செலவு ஆகிய இரண்டிலும் திறம்பட அளவிடப்பட (scale) வேண்டும் என்பதையும் ஆராய்ச்சியாளர்கள் நிரூபிக்க வேண்டும்.
முக்கியக் கருத்து: ஒரு சிறிய, தனித்தனியாகப் பயிற்சி அளிக்கப்பட்ட நினைவகத் தொகுதி, பெரிய மொழி மாதிரி முகவர்களுக்கான ஒரு கண்காணிப்பாளராக (watchdog) செயல்பட்டு, ஒரு பணி திசைமாறுவதற்கு முன்பே அதைத் தடுத்துச் சரிசெய்ய முடியும்.
