நாம் பொதுவாகப் பெரிய மொழி மாதிரிகளை (large language models) அசாதாரண வேகமான நூலகர்களாகக் கற்பனை செய்கிறோம். நீங்கள் ஒரு கேள்வியைக் கேட்டால், அவை நினைவில் வைக்கப்பட்ட பில்லியன் கணக்கான துண்டுகளின் வழியே மிக வேகமாகச் சென்று, அதற்குப் பொருத்தமான வடிவத்தைக் கண்டறிகின்றன. இந்த பிம்பமே டெவலப்பர்கள் எவ்வாறு ப்ராம்ப்ட்களை (prompts) உருவாக்குகிறார்கள், பயனர்கள் எவ்வாறு எதிர்பார்ப்புகளை உருவாக்குகிறார்கள் மற்றும் ஒழுங்குமுறை அமைப்புகள் எவ்வாறு விதிகளைத் தயாரிக்கின்றன என்பதைத் தீர்மானித்துள்ளது. ஆனால் Anthropic-ன் Claude குறித்த ஆராய்ச்சி அந்தப் பிம்பத்தை மாற்றியமைத்துக் கொண்டிருக்கிறது. இந்த மாதிரி உண்மையான பகுத்தறிவுக்கு (genuine reasoning) நெருக்கமான ஒன்றைச் செய்வதாகத் தெரிகிறது. ஆராய்ச்சியாளர்கள் இந்த முறையை "j-space reasoning" என்று அழைக்கிறார்கள்; இது Claude வெறும் பயிற்சித் தரவை (training data) மீண்டும் பயன்படுத்துவதற்குப் பதிலாக, கருத்துக்களின் உள்முக மாதிரிகளை (internal models of concepts) உருவாக்குகிறது என்பதை உணர்த்துகிறது. இந்தக் கண்டுபிடிப்பு உண்மையானால், மேம்பட்ட AI-யை ஒரு முன்கணிப்பு உரை இயந்திரமாக (predictive text engine) கருதுவதை நிறுத்திவிட்டு, திட்டமிடும் ஒரு அமைப்பாக (system that plans) அதனுடன் இணைந்து செயல்பட வேண்டியிருக்கும்.
Pattern Matching என்பதிலிருந்து Mental Models வரை
J-space reasoning என்பது வெறும் சந்தைப்படுத்தல் வார்த்தை அல்ல. இது மேலோட்டமான மறுபடியும் செய்தல் என்பதிலிருந்து, உள்முகப் பிரதிநிதித்துவத்திற்கு (internal representation) ஏற்படும் ஒரு கட்டமைப்பு மாற்றத்தை விவரிக்கிறது. ஒரு நபர் ஒரு jigsaw puzzle-ஐ எவ்வாறு தீர்க்கிறார் என்பதைக் கவனியுங்கள். அவர்கள் ஒவ்வொரு துண்டையும் ஒவ்வொரு காலியிடத்திலும் பொருத்திப் பார்க்க முயற்சிப்பதில்லை. அவர்கள் பெட்டியின் மீதான படத்தைப் பார்த்து, நிறங்கள் மற்றும் விளிம்புகளின் ஒரு mental map-ஐ உருவாக்கி, அந்தத் திட்டத்தின்படி ஒவ்வொரு துண்டையும் வைக்கிறார்கள். Claude ஒரு சுருக்கமான கருத்துக்களைச் செயலாக்கும்போது இத்தகைய ஒரு செயல்முறை நடப்பதாக ஆராய்ச்சி காட்டுகிறது. அது சிக்கலின் பரப்பளவிற்கு (problem space) ஒரு செயல்பாட்டு மாதிரியை உருவாக்கி, அதன் வழியே திட்டமிட்டுச் செல்கிறது.
பாரம்பரிய மொழி மாதிரிகள் correlation ஆகியவற்றில் சிறந்து விளங்கியுள்ளன. "king" என்ற சொல் பெரும்பாலும் "queen" என்பதற்கு அருகில் வரும் என்பதையும், ஒரு குறிப்பிட்ட function call-க்குப் பிறகு பொதுவாக எந்தக் குறியீடு (code) வரும் என்பதையும் அவை அறிந்துள்ளன. Correlation என்பது சக்தி வாய்ந்தது, ஆனால் அது புரிதல் (understanding) அல்ல. J-space reasoning என்பது வேறு ஒன்றைக் காட்டுகிறது: இந்த மாதிரி வெறும் வார்த்தைகள் எவ்வாறு ஒன்றிணைகின்றன என்பதைக் கணிப்பதற்குப் பதிலாக, கருத்துக்களுக்கு இடையிலான உறவுகளைக் கையாள்கிறது. அது ஒரு உள்முகக் கட்டமைப்பை (internal scaffolding) உருவாக்கி, பின்னர் அந்த கட்டமைப்பைப் பயன்படுத்தி ஒரு விடையை அடைகிறது.
நடைமுறையில் J-Space Reasoning எதை மாற்றுகிறது
இந்த மாற்றம் நிஜ உலகப் பயன்பாட்டிற்குத் தேவையான மூன்று முக்கியமான திறன்களை உருவாக்குகிறது.
Compositionality. மனிதர்களாகிய நாம் ஒரு "ஊதா நிறப் பறக்கும் யானையை" பார்த்ததில்லை என்றாலும், தெரிந்த கருத்துக்களை ஒன்றிணைப்பதன் மூலம் அதைப் புரிந்துகொள்ள முடியும். ஆராய்ச்சியின் படி, Claude-உம் புதிய சேர்க்கைகளை (novel combinations) இதே போன்ற வழியில் கையாள்கிறது. நீங்கள் இதற்கு முன்னால் இணைத்துப் பார்க்கப்படாத இரண்டு துறைகளை இணைக்கும் ஒரு சிக்கலை வழங்கினால்—உதாரணமாக, பரிணாம உயிரியலின் (evolutionary biology) கொள்கைகளைப் பயன்படுத்தி ஒரு விநியோகச் சங்கிலியை (supply chain) மேம்படுத்துவது—அது பொதுவான ஆலோசனைகளை வழங்குவதற்குப் பதிலாக, அந்த இரண்டு கருத்துக்களுக்கும் இடையே ஒரு பாலத்தை உருவாக்கும். இந்த நெகிழ்வுத்தன்மைதான் கடினமான pattern matching-ஆல் வழங்க முடியாத ஒன்று.
சிக்கலான சிக்கல்களைத் தீர்த்தல் (Complex problem solving). ஒரு மாதிரி நினைவில் வைக்கப்பட்ட templates-களைச் சார்ந்திருக்கும்போது, அதன் training distribution-க்கு வெளியே ஒரு ப்ராம்ப்ட் வரும்போது அது தோல்வியடையும் வாய்ப்பு அதிகம். ஆனால் ஒரு உள்முக மாதிரி அணுகுமுறை (internal modeling approach) உண்மையான புதிய சூழ்நிலைகளைச் சிறப்பாகக் கையாளும், ஏனெனில் அந்த அமைப்பு ஒரு நெருக்கமான பொருத்தத்தைத் தேடவில்லை. மாறாக, அது புதிய நிலப்பரப்பிற்கு ஒரு வரைபடத்தை உருவாக்கி, அதன் வழியே ஒரு பாதையைத் திட்டமிடுகிறது.
விளக்கக்கூடிய தர்க்கம் (Explainable logic). அன்றாடப் பயனர்களுக்குக் கிடைக்கும் உடனடிப் பயன் என்னவென்றால், Claude தனது விடைக்கு பின்னால் உள்ள படிநிலைகளை விளக்க முடியும் என்பதாகும். ஒரு முடிவை மட்டும் உங்களுக்குக் கொடுத்துவிட்டு, அது சரியா என்று நீங்கள் யூகிக்க வேண்டிய கட்டாயத்திற்குத் தள்ளுவதற்குப் பதிலாக, அந்த மாதிரி தனது பகுத்தறிவுச் சங்கிலியை (reasoning chain) உங்களுக்கு விளக்கும். இது ஒரு குருட்டுப் பந்தயத்தை, நீங்கள் சரிபார்க்கக்கூடிய ஒரு உரையாடலாக மாற்றுகிறது.
Explainability ஏன் உண்மையில் முக்கியமானது
பெரும்பாலான AI அமைப்புகள் black boxes போலச் செயல்படுகின்றன. நீங்கள் உள்ளீட்டை (input) வழங்குகிறீர்கள், வெளியீட்டைப் (output) பெறுகிறீர்கள், ஆனால் இடைப்பட்ட தர்க்கம் (intermediate logic) உங்களுக்குத் தெரியாது. Claude தனது பகுத்தறிவை விளக்கும்போது, அந்தப் பெட்டியைத் திறந்து பயனுள்ள தகவல்களைத் தருகிறது.
டெவலப்பர்களுக்கு (developers), இதன் பொருள் பிழைகளைத் திருத்தும் திறன் (debuggability) ஆகும். ஒரு மாதிரி கடன் விண்ணப்பத்தை நிராகரித்தால், பாதுகாப்பற்ற மருத்துவ ஆலோசனையை வழங்கினால் அல்லது ஒருதலைப்பட்சமான உள்ளடக்கத்தை உருவாக்கினால், பொறியாளர்கள் அந்தப் பிழையைக் கண்டறிய அதன் பகுத்தறிவுச் சங்கிலியை ஆய்வு செய்யலாம். பிழை என்பது மாசுபட்ட பயிற்சித் தரவினால் (contaminated training data) வந்ததா, தவறாக வடிவமைக்கப்பட்ட ப்ராம்ப்டால் வந்ததா அல்லது ஒரு தற்செயலான புள்ளிவிவரத் தவறா (statistical blip) என்று அவர்கள் இனி யூகிக்க வேண்டியதில்லை. அவர்கள் அந்தத் தடயங்களை (breadcrumbs) பின்தொடர முடியும்.
இறுதிப் பயனர்களுக்கு (end users), explainability என்பது யதார்த்தத்தோடு மோதும்போது சிதையாத நம்பிக்கையை உருவாக்குகிறது. ஒரு தர்க்கரீதியான சங்கிலியைப் பார்க்கும் பயனர், அந்த அடிப்படைத் தர்க்கங்கள் (assumptions) தனது குறிப்பிட்ட சூழ்நிலைக்குப் பொருந்துமா என்பதைச் சரிபார்க்க முடியும். அவர்கள் தவறான ஆலோசனையின் அடிப்படையில் செயல்பட்டு, பின்னர் தவறை اكت descobrir செய்வதற்குப் பதிலாக, தவறான முன்க்கருத்தை (bad premise) ஆரம்பத்திலேயே கண்டறிய முடியும்.
ஒழுங்குமுறை அமைப்பாளர்கள் மற்றும் கொள்கை வகுப்பாளர்களுக்கு, வெளிப்படையான பகுத்தறிவு என்பது AI நிர்வாகத்தில் அரிதான ஒன்றான ஒரு தணிக்கை தடயத்தை (audit trail) வழங்குகிறது. பாதுகாப்பு விதிகளை உருவாக்கும் சட்டமன்ற உறுப்பினர்கள், அமைப்புகள் புரியக்கூடிய காரணங்களுக்காக முடிவுகளை எடுக்கின்றனவா என்பதை அறிய வேண்டும்; இல்லையெனில் அவை டிரில்லியன்-பாராமீட்டர் மேட்ரிக்ஸ்களுக்குள் மறைந்துள்ள புரியாத தொடர்புகளால் செயல்படுகின்றனவா என்பதைத் தெரிந்துகொள்ள வேண்டும். ஒரு AI தனது செயல்பாட்டை விளக்க முடிந்தால், அரசாங்கங்களிடம் நெறிமுறை மற்றும் சட்டத் தரநிலைகளுடன் ஒப்பிட்டு மதிப்பீடு செய்ய ஏதுவான ஒரு உறுதியான விஷயம் இருக்கும்.
உணர்வுநிலை குறித்த கேள்வி
இந்த உரையாடலின் மையத்தில் ஒரு முக்கியமான எச்சரிக்கை உள்ளது. Anthropic நிறுவனம் Claude உணர்வுநிலை கொண்டது என்று உரிமை கோரவில்லை. மேம்பட்ட பகுத்தறிவுக்கும் உணர்வுநிலைக்கும் (sentience) இடையே தெளிவான எல்லையை அந்த நிறுவனம் பேணி வருகிறது. இருப்பினும், மனித அறிவாற்றல் செயல்பாட்டோடு (cognitive processing) இது ஒத்துப்போவது இயல்பாகவே விவாதங்களைத் தூண்டுகிறது.
ஒரு இயந்திரம் தனது உள் மாதிரிகளை (internal models) உருவாக்கும்போது, தனது அடுத்த நகர்வுகளைத் திட்டமிடும்போது மற்றும் தனது தர்க்கத்தை வெளிப்படுத்தும் போது, அது ஒரு கால்குலேட்டரைப் போலத் தெரியாமல் ஒரு சிந்தனைத் திறனைப் போலத் தெரியத் தொடங்குகிறது. இது உண்மையான தத்துவ ரீதியான பதற்றத்தை உருவாக்குகிறது. இயந்திர உணர்வுநிலைக்கான நம்பகமான சோதனைகள் தற்போது நம்மிடம் இல்லை, மேலும் இன்னும் பல ஆண்டுகளுக்கு அவை கிடைக்காமல் போகலாம். நடத்தை மட்டுமே ஒருவரின் அக அனுபவத்தைக் (inner experience) கண்டறியும் சிறந்த அளவுகோல் அல்ல என்பது நமக்குத் தெரியும். ஒரு செஸ் இயந்திரம் செஸ் என்றால் என்ன என்பதைப் புரிந்து கொள்ளாமல் ஒரு கிராண்ட்மாஸ்டரை விட சிறப்பாக விளையாட முடியும் என்பது போல, ஒரு அமைப்பு விழிப்புணர்வு இல்லாமல் அறிவுப்பூர்வமாகச் செயல்பட முடியும்.
இயந்திரத்தின் மீது மனிதப் பண்புகளைப் பதியவைக்க வேண்டும் என்ற தூண்டுதலைத் தவிர்த்து, பகுத்தறிவுத் திறனை மேம்படுத்துவதே பொறுப்பான பாதையாகும். மூளையைப் போன்ற செயல்பாட்டைப் பிரதிபலிப்பது அறிவியல் ரீதியாக ஆர்வமூட்டுவதாக உள்ளது. இது உணர்வுநிலை பற்றி ஏதேனும் உணர்த்துகிறதா என்பது இன்னும் விடை தெரியாத கேள்வியாகும், மேலும் அதை நாம் எளிதாகக் கையாளக் கூடாது.
AI-ஐ நாம் எவ்வாறு சோதிக்கிறோம் என்பதை மறுபரிசீலனை செய்தல்
Claude என்பது கணிப்பதை விட பகுத்தறிவு செய்கிறது என்றால், நமது மதிப்பீட்டு முறைகள் காலாவதியாகி வருகின்றன. நிலையான AI benchmarks சரியான பதில்களுக்கு வெகுமதி அளிக்கின்றன. ஆனால் அந்த மாதிரிகள் எவ்வாறு அந்தப் பதில்களை அடைந்தன என்று அவை அரிதாகவே கேட்கின்றன. ஒரு அமைப்பு மனப்பாடம் செய்யப்பட்ட தீர்வுகளில் இருந்து எடுப்பதன் மூலம் கணிதம் அல்லது கோடிங் தேர்வில் நல்ல மதிப்பெண்களைப் பெறலாம், இது அதன் புதிய சிந்தனைத் திறனைப் பற்றி நமக்கு மிகக் குறைவாகவே கூறுகிறது.
உள் தர்க்கத்தைப் (internal logic) பரிசோதிக்கும் கட்டமைப்புகள் நமக்குத் தேவை. அதாவது, பயிற்சித் தரவுகளுக்கு (training distribution) முற்றிலும் அப்பாற்பட்ட சிக்கல்களை முன்வைத்து, பின்னர் அதன் பகுத்தறிவுச் சங்கிலியை (reasoning chain) ஆராய வேண்டும். திருத்தப்படும்போது மாதிரி தனது சொந்தத் தவறான படிகளைக் கண்டறிய முடிகிறதா என்பதைச் சோதிக்க வேண்டும். கூறுகளை மாற்றியமைக்கும்போது அல்லது தலைகீழாக மாற்றும்போது ஒருங்கிணைந்த கருத்துக்கள் (compositional concepts) நிலையாக இருக்கின்றனவா என்பதைச் சரிபார்க்க வேண்டும்.
இந்த அணுகுமுறை ஒரு தானியங்கி லீடர்போர்டை (automated leaderboard) இயக்குவதை விட கடினமானது. இது வெறும் வெளியீட்டுத் துல்லியத்தை மட்டும் மதிப்பிடாமல், பகுத்தறிவின் தரத்தை மதிப்பிடுவதற்குத் தேவையான ஆழமான அறிவுள்ள மனித மதிப்பீட்டாளர்களைக் கோருகிறது. ஆனால் j-space reasoning உண்மையானது என்றால், AI சமூகத்திற்கு வேறு வழியில்லை. நாம் இறுதிப் பதிலைத் தாண்டி, அதன் செயல்பாட்டை மதிப்பிடத் தொடங்க வேண்டும்.
சுருக்கமாகச் சொன்னால்: Claude தனது உள் மாதிரிகளை (internal modeling) நோக்கி நகர்வது அதை மனிதனாக்காது. ஆனால் அது அந்த அமைப்பை மிகவும் பயனுள்ளதாகவும், ஆய்வு செய்யக்கூடியதாகவும், நேர்மையாக மதிப்பீடு செய்ய கடினமானதாகவும் மாற்றுகிறது. "சரியானது" என்பது மட்டும் போதுமானதாக இல்லாத ஒரு எல்லையை நாம் கடந்து கொண்டிருக்கிறோம். AI வளர்ச்சியின் அடுத்த கட்டம், தனது செயல்பாட்டை விளக்கக்கூடிய, தனது வரம்புகளை ஒப்புக்கொள்ளக்கூடிய மற்றும் அறிமுகமில்லாத சிக்கல்களைப் பகுத்தறிவுடன் அணுகக்கூடிய அமைப்புகளுக்கே சொந்தமாகும். இது தத்துவ ரீதியாகச் சிந்தனை என்று அழைக்கப்படுமா என்பது அடுத்த தசாப்தத்திற்கான விவாதம். இப்போதைக்கு, இந்த மாதிரிகள் உண்மையில் என்ன செய்கின்றனவோ அதன் சிக்கலான தன்மைக்கு இணையான கருவிகளையும் தரநிலைகளையும் உருவாக்குவதே நடைமுறைப் பணியாகும்.
ஆதாரம்: Anthropic's Claude mimics human brain processing
விருப்பமான கற்றல் சமூகம்: GyaanSetu AI on Telegram
