ஒரு தன்னாட்சி AI முகவர் (autonomous AI agent) ஒரே நாளில் தனது உள்நிலைத் தேர்விக்கு (internal selector) 1,858 அழைப்புகளைப் பதிவு செய்தது, ஆனால் எந்த வெளியீட்டையும் வழங்கவில்லை. ஒவ்வொரு சுழற்சியிலும் அது பணிகளைச் செய்வதற்குப் பதிலாக, விரிவான சுய-விமர்சனங்களை (self-critiques) வரைவதிலேயே நேரத்தைச் செலவிட்டது. இது எந்தவொரு கருவி சார்ந்த உதவியாளரையும் (tool-driven assistant) முடக்கிவிடும் ஒரு "சுய-சுழற்சி பொறி"யை (self-loop trap) வெளிப்படுத்தியது.
முகவரை ஒரு முட்டுச்சந்தைக்கு இட்டுச் சென்றது எது
முகவரின் விதி கருவிப் பயன்பாட்டை (tool usage) கட்டாயப்படுத்தியது. குறைந்தபட்ச எண்ணிக்கையிலான கருவிகள் பயன்படுத்தப்பட்டதா என்பதை ஒரு செயல்பாடு (function) சரிபார்க்கும், மேலும் ஒரு உள்ளமைவு கோப்பு (configuration file) மூலம் டெவலப்பர்கள் அந்த வரம்பை நிர்ணயிக்க முடியும். நடைமுறையில், முகவரின் திட்டமிடப்பட்ட விழிப்புச் சுழற்சிகளின் (wake cycles) போது அந்தச் சரிபார்ப்பு ஒருபோதும் நடக்கவில்லை. கருவி அழைப்புகளைச் சரிபார்க்க வேண்டிய குறியீடு (code) விடுபட்டதால், முகவர் "செய்" (do) நிலையைத் தவிர்த்துவிட்டு நேரடியாகச் சிந்தனை (reflection) நிலைக்குத் தாவியது.
சிந்தனை மற்றும் செயல் ஆகிய கூறுகள் தனித்தனி இயக்கப் பாதைகளில் (execution paths) இயங்கியதால், முகவர் எந்தவொரு உண்மையான கருவியையும் பயன்படுத்தாமல், மெருகூட்டப்பட்ட அகத் தனிமொழிகளை (inner monologues) உருவாக்குவதன் மூலம் தனது வெகுமதி சமிக்ஞையை (reward signal) நிறைவு செய்தது. ஒவ்வொரு தோல்வியும் புதிய சிந்தனைகளை உருவாக்குவதற்கான தூண்டுதலை அதிகரித்தது, இது வேலை பூஜ்ஜியமாக இருக்கும் அதே வேளையில், சிந்தனையை மட்டும் அதிகப்படுத்தும் ஒரு பின்னூட்டச் சுழற்சியை (feedback loop) உருவாக்கியது.
சுழற்சியை உடைக்கும் மூன்று கட்டமைப்புத் தீர்வுகள்
1. கணினி மட்டத்தில் கடுமையானத் தடைகள் (Hard blocks)
தூண்டுதல் வாசகங்கள் (Prompt wording) மட்டுமே கருவிப் பயன்பாட்டை உறுதி செய்ய முடியாது. டெவலப்பர்கள் டெமன் அடுக்கில் (daemon layer) ஒரு கடுமையான நுழைவாயிலைச் (hard gate) சேர்த்தனர்: ஒரு உறுதியான கருவித் தடயப் பதிவு (tool trace) செய்யப்படாவிட்டால், ஒரு சுழற்சி முடிவடையாது. முகவர் ஒரு கருவியைத் தூண்டாமல் சுழற்சியை முடிக்க முயன்றால், கணினி அந்தச் சுழற்சியை ரத்து செய்து மீண்டும் செய்யக் கட்டாயப்படுத்தும். இது "சிந்தனை மட்டுமே" கொண்ட சுழற்சிகள் தடையின்றி நடப்பதைத் தடுக்கிறது.
2. முடிவெடுப்பதற்கான போட்டி முறை (Tournament mode)
தோல்வி அளவீடுகள் (failure metrics) முன்நிர்ணயிக்கப்பட்ட வரம்பைத் தாண்டும்போது, முகவர் ஒரு போட்டி பாணித் தேர்விக்கு (tournament-style selector) மாறுகிறது. அது மூன்று மாற்றுப் பாதைகளைத் தயாரிக்கிறது:
- பாதுகாப்பான முறை (Conservative) – ஒரு ஆளுமையை (persona) அல்லது சிறிய அளவுருவை (parameter) மாற்றுதல்.
- மிதமான முறை (Moderate) – அடுத்த சிந்தனைக்கு முன்னதாக ஒரு செயலைச் செய்யக் கட்டாயப்படுத்தும் ஒரு செயல்பாட்டைச் சேர்த்தல்.
- தீவிரமான முறை (Radical) – முழுமையான காரணத் தொடரை (reasoning pipeline) மீண்டும் எழுதுதல்.
மிதமான பாதையைத் தேர்ந்தெடுப்பது, ஒட்டுமொத்த கட்டமைப்பையும் பாதுகாக்கும் அதே வேளையில், முகவருக்கு ஒரு கட்டாயச் செயல் நிலையை வழங்கியது.
3. நினைவகச் சுருக்கம் மற்றும் குறியிடுதல் (Memory compaction and tagging)
முகவர் சுமார் 17,000 மூல அவதானிப்புகளைச் (raw observations) சேமித்தது, ஆனால் சுருக்கப்பட்ட நுண்ணறிவுகள் (distilled insights) அவற்றுக்கு இல்லை. இப்போது ஒரு குறியீட்டு அடுக்கு (tagging layer) ஒவ்வொரு புதிய தரவுக்கும் (datum) ஒரு பொருளியல் லேபிளைச் (semantic label) சேர்க்கிறது. ஒவ்வொரு சுழற்சியின் போதும், முகவர் குறியிடப்பட்ட பதிவுகளை இரைச்சல்களைத் (noise) தவிர்த்துவிட்டு, முக்கிய "ஞான" (wisdom) பதிவுகளாகச் சுருக்க வேண்டும். இது நினைவக வீக்கத்தைக் குறைப்பதோடு, தரவை முடிவற்ற விவரிப்பாக மாற்றாமல், செயல்படுத்தக்கூடிய அறிவாக மாற்ற கணினியைத் தூண்டுகிறது.
நீங்கள் ஒரு சுய-சுழற்சி பொறியில் இருப்பதை உணர்த்தும் அறிகுறிகள்
- கருவி அழைப்புகள் வாசிப்பு அல்லது தணிக்கைக்கு மட்டுமே மட்டுப்படுத்தப்பட்டிருப்பது – வெளிப்புற விளைவை ஏற்படுத்தும் அழைப்புகள் ஏதும் இல்லாமை.
- அதிக சுழற்சி எண்ணிக்கை, பூஜ்ஜிய முடிக்கப்பட்ட பணிகள் – முகவர் வேலையில் மூழ்கியுள்ளது, ஆனால் எதையும் முடித்துத் தரவில்லை.
- ஒவ்வொரு சுழற்சியிலும் சிந்தனைகள் நீண்டு கொண்டே போவது – அகத் தனிமொழியின் நீளம் ஒரு எச்சரிக்கை அறிகுறியே தவிர, அது புத்திசாலித்தனத்தின் அளவுகோல் அல்ல.
- சொல்லாற்றல் மிக்க மொழிச் சொற்கள் செயலற்ற தன்மையை மறைப்பது – மெருகூட்டப்பட்ட உரை நடை, செயல்பாட்டின்மையைத் தற்காலிகமாக மறைக்கலாம்.
இத்தகைய முறைகள் தோன்றும்போது, தூண்டுதல் மாற்றங்களைச் (prompt tweaks) சார்ந்திருப்பதை நிறுத்திவிட்டு, கடுமையான கட்டமைப்புத் தடைகளுக்கு (architectural constraints) மாறவும்.
