சத்யா நாடெல்லா தனது நிறுவனம் உருவாக்க உதவிய ஆய்வகங்களையே (labs) பகிரங்கமாக விமர்சித்துள்ளார். மிகப்பெரிய AI நிறுவனங்கள் தரவு உரிமையின் (data ownership) விதிகளை எவ்வாறு மாற்றி எழுதிக்கொண்டிருக்கின்றன என்பது குறித்து மைக்ரோசாப்ட் தலைமை நிர்வாக அதிகாரி ஒரு கடுமையான எச்சரிக்கையை விடுத்துள்ளார், அந்தச் செய்தி வழக்கத்திற்கு மாறான தாக்கத்தை ஏற்படுத்தியுள்ளது. சமீபத்திய வலைப்பதிவில், OpenAI மற்றும் Anthropic உள்ளிட்ட முன்னணி ஆய்வகங்கள் ஒரு முறைகேடான சந்தையை (rigged marketplace) உருவாக்கி வருவதாக நாடெல்லா குற்றம் சாட்டியுள்ளார். அவர்கள் பிரம்மாண்டமான மாதிரிகளை (massive models) பயிற்றுவிக்க பொதுத் தரவுகளைச் சேகரிக்கிறார்கள், பின்னர் அந்த மாதிரிகள் உருவாக்கும் வெளியீடுகளிலிருந்து (outputs) யாரும் கற்றுக்கொள்ளக் கூடாது என்பதற்காகத் தங்கள் சேவை விதிமுறைகளை (terms of service) அமல்படுத்துகிறார்கள். இதன் விளைவாக, நிறுவனங்கள் தங்கள் உரிமையுரிமை கொண்ட அறிவை (proprietary knowledge) இழந்துவிட்டு, அதற்கான கட்டணத்தையும் செலுத்த வேண்டிய கட்டாயத்திற்குத் தள்ளப்படுவதால், இது ஒரு ஒருவழி மதிப்புப் பரிமாற்றம் (one-way transfer of value) என்று அவர் வாதிடுகிறார்.
Distillation (வடித்தல் முறை) குறித்த இரட்டைத் தரநிலை
இந்தக் புகாரைப் புரிந்துகொள்ள, இந்த ஆய்வகங்கள் எதைத் தடுக்க இவ்வளவு ஆர்வமாக இருக்கின்றன என்பதைப் பார்ப்பது உதவியாக இருக்கும். Distillation என்பது ஒரு பொதுவான பயிற்சி முறையாகும், இதில் ஒரு சிறிய, சிறப்புத் திறன் கொண்ட மாதிரி (specialized model), இணையத்தில் உள்ள மூலத் தரவுகளைத் தொடக்கத்திலிருந்து உட்கொள்ளாமல், ஒரு பெரிய மாதிரியின் வெளியீடுகளிலிருந்து கற்றுக்கொள்கிறது. ஒரு ஸ்டார்ட்அப் அல்லது ஆராய்ச்சி குழு ஒரு முன்னணி மாதிரியில் (frontier model) மில்லியன் கணக்கான கேள்விகளை (prompts) உள்ளீடு செய்து, அதன் பதில்களைப் பெற்று, அந்தத் தரமான சிக்னல்களைப் பயன்படுத்தி உள்ளூர் முறையில் இயங்கக்கூடிய அல்லது ஒரு குறிப்பிட்ட தேவையைப் பூர்த்தி செய்யக்கூடிய ஒரு சிறிய மாதிரியைப் பயிற்றுவிக்கலாம். ஒரு அடிப்படை மாதிரியை (foundation model) ஆரம்பத்திலிருந்து உருவாக்குவதை விட இது மலிவானது மற்றும் ஆற்றல் பயன்பாடு குறைவானது.
OpenAI மற்றும் Anthropic ஆகிய இரண்டு நிறுவனங்களும் தங்கள் சேவை விதிமுறைகளில் இந்த நடைமுறையைத் தடை செய்துள்ளன. முறையான Distillation முறையைக் கண்டறியும்போது, அவர்கள் அதை ஒரு விதிமீறலாகக் கருதுகிறார்கள். இந்தத் தடைகள் பெரும்பாலும் போட்டியாளர்களைக் குறிவைக்கின்றன, குறிப்பாக சீனா போன்ற நாடுகளில் உள்ள AI நிறுவனங்கள், அசல் பயிற்சிச் செலவுகளைச் செய்யாமல், இந்த முறையைப் பயன்படுத்தித் திறனைக் குறைத்து ஈடுகட்ட முயல்வதாகக் குற்றம் சாட்டப்படுகிறது.
இந்தக் கொள்கையின் மையத்திலிருக்கும் பதற்றத்தை நாடெல்லா சுட்டிக்காட்டினார். இந்த ஆய்வகங்களே இணையத்தில் உள்ள பொதுத் தரவுகள், புத்தகங்கள், மன்றங்கள் (forums), குறியீட்டு களஞ்சியங்கள் (code repositories) மற்றும் கட்டுரைகளைத் திரட்டித் தங்கள் முதன்மை மாதிரிகளை உருவாக்கின; இவை அனைத்தும் பொதுவில் கிடைக்கும் தரவுகளில் பயிற்சி செய்வது 'நியாயமான பயன்பாடு' (fair use) என்ற சட்ட வாதத்தின் கீழ்தான் செய்யப்பட்டன. அவர்கள் பொதுவான வளங்களை (commons) சுரண்டினார்கள். ஆனால் இப்போது, அந்த மாதிரிகளின் வெளியீடுகளைப் பொதுவான கற்பித்தல் பொருளாக யாரும் பயன்படுத்தக் கூடாது என்பதற்காகச் சட்ட ரீதியான தடைகளை விதிக்கிறார்கள். "நீங்கள் உலகின் திறந்த அறிவிலிருந்து கற்றுக்கொள்ளலாம், ஆனால் எங்களிடமிருந்து யாரும் கற்றுக்கொள்ள முடியாது" என்பது போல அவர்கள் செயல்படுகிறார்கள்.
இந்தச் சமச்சீரற்ற தன்மை (asymmetry) வெறும் கல்விசார் விவாதங்களைத் தாண்டி முக்கியமானது. இது ஒரு சில உள்கட்டமைப்பு வழங்குநர்கள் (infrastructure providers) யார் எதை அறியலாம் என்பதைத் தீர்மானிக்கும் ஒரு படிநிலையை (hierarchy) உருவாக்குகிறது. மனிதகுலத்தின் வெளியிடப்பட்ட அறிவைப் பயன்படுத்துவதற்கு 'நியாயமான பயன்பாடு' (fair use) என்ற வாதம் போதுமானதாக இருந்தால், அந்த மாதிரிகளின் வெளியீடுகள் ஒரு தனியார்மயமாக்கப்பட்ட பொதுச் சொத்தாக (privatized commons) மாறத் தொடங்குகின்றன. போட்டியாளர்கள் மற்றும் வாடிக்கையாளர்கள் என அனைவரும் அந்தத் தரவை புதிய கருவிகளாக மாற்றத் தடை செய்யப்படுகிறார்கள். இதன் மூலம் லாபம் அனைத்தும் மிகப்பெரிய ஆய்வகங்களை நோக்கி மட்டுமே செல்கிறது.
உங்கள் சொந்த அறிவிற்காக இருமுறை பணம் செலுத்துதல்
தற்போதைய பொருளாதாரச் சிக்கலை விவரிக்க நாடெல்லா "தலைகீழ் தகவல் முரண்பாடு" (reverse information paradox) என்ற சொல்லைப் பயன்படுத்தினார். அவரது பார்வையில், நிறுவனங்கள் தற்போது செயற்கை நுண்ணறிவுக்காக இருமுறை பணம் செலுத்துகின்றன, ஆனால் அதில் ஒரு கட்டணம் மட்டுமே இன்வாய்ஸில் (invoice) காட்டப்படுகிறது.
முதல் செலவு வெளிப்படையானது. நிறுவனங்கள் API கிரெடிட்களை வாங்குகின்றன, Copilot சந்தாவைப் பெறுகின்றன அல்லது சாட்பாட் (chatbot) சேவைகளைப் பெறுகின்றன. இரண்டாவது செலவு மறைமுகமானது. ஒரு ஊழியர் ஒரு தவறான தகவலை (hallucinated fact) திருத்தும்போது அல்லது ஒரு பதிலைப் பயனுள்ளதாக மதிப்பிடும்போதோ அல்லது ஒரு அறிக்கையைச் செம்மைப்படுத்தும்போதோ, அந்தச் செயல் நாடெல்லா "exhaust" என்று அழைக்கும் ஒரு தரவை உருவாக்குகிறது. இது உண்மையான பணியின் போது உருவாகும் திருத்தங்கள், விருப்பத் தரவுகள் (preference data) மற்றும் உரையாடல் பதிவுகளின் (interaction logs) தொகுப்பாகும்.
இந்த 'exhaust' வெறும் டிஜிட்டல் குப்பைகள் அல்ல. இதில் கடினமாகப் பெறப்பட்ட வணிகத் தர்க்கங்கள் (business logic) அடங்கியிருக்கலாம். ஒரு லாஜிஸ்டிக்ஸ் குழு, நிறுவனம் பல ஆண்டுகளாக உருவாக்கிய உள் கட்டுப்பாடுகளைப் பயன்படுத்தி கப்பல் வழித்தடங்களை மேம்படுத்த ஒரு மாதிரியிடம் கேட்கலாம். ஒரு சட்டத் துறை, ஒரு ஒப்பந்தத்தின் மொழி நிறுவனத்தின் பாணிக்கு ஏற்ப இருக்கும் வரை அதைத் திருத்திக் கொண்டே இருக்கலாம். ஒரு மருந்து ஆராய்ச்சி குழு, மூலோபாய முன்னுரிமைகளை வெளிப்படுத்தும் வகையில் மருத்துவத் தரவுகளைக் கேள்வி கேட்கலாம். இந்தத் தொடர்புகள் ஒரு மூன்றாம் தரப்பு API வழியாகச் செல்லும்போது, அந்த வழங்குநர் முழுப் பரிமாற்றத்தையும் பார்க்கிறார். அந்த குறிப்பிட்ட துறைக்கு எது சிறந்த பதில்கள் என்பதை அந்த மாதிரி கற்றுக்கொள்கிறது.
காலப்போக்கில், இந்தத் பின்னூட்டம் (feedback), வாடிக்கையாளர் எந்தத் குறிப்பிட்ட பணிக்காக அந்த மாதிரியைப் பயன்படுத்தினாரோ, அந்தப் பணியில் அதன் திறனை மேம்படுத்துகிறது. அதன் பிறகு, அந்த வழங்குநர் அந்த மேம்படுத்தப்பட்ட திறனை வாடிக்கையாளரின் போட்டியாளருக்கு விற்கலாம் அல்லது அதே போன்ற ஒரு புதிய தயாரிப்பை அறிமுகப்படுத்தலாம். அசல் நிறுவனம் சந்தா கட்டணங்களைச் செலுத்தியது மட்டுமல்லாமல், தனது தனிப்பட்ட நிபுணத்துவத்தை தானமாக வழங்கியதுடன், தனது போட்டியாளரையே பயிற்றுவிப்பதாகவும் மாறியுள்ளது.
ஏன் Sovereign AI என்பது வெறும் சொல் என்பதிலிருந்து ஒரு உத்தியாக மாறுகிறது
இந்தத் தரவு இழப்பிற்கு தர்க்கரீதியான பதில், கற்றல் சுழற்சியின் (learning loop) மீதான கட்டுப்பாட்டை மீண்டும் பெறுவதாகும். நதேலாவின் வாதம், Microsoft-ஐ ஒரு வித்தியாசமான வகை நில உரிமையாளராக நிலைநிறுத்துவதற்காகத் திட்டமிடப்பட்டுள்ளது என்பது தெளிவாகத் தெரிகிறது. வாடிக்கையாளர்கள் தங்கள் அறிவை ஒரு மையப்படுத்தப்பட்ட கருப்புப் பெட்டிக்குள் (black box) செலுத்த வேண்டும் என்று வலியுறுத்துவதற்குப் பதிலாக, வாடிக்கையாளரே சாவிகளை வைத்திருக்கும் சூழல்களுக்காக அவர் வாதிடுகிறார்.
இங்குதான் இறையாண்மை கொண்ட AI (sovereign AI) குறித்த உரையாடல் நடைமுறை ரீதியான முக்கியத்துவத்தைப் பெறுகிறது. ஒரு தனிப்பட்ட கிளவுட் (private cloud), நிறுவனத்தின் உள்ளேயே இருக்கும் தரவு மையம் (on-premise data center) அல்லது மிகக் கட்டுப்பாடான ஒரு மெய்நிகர் நெட்வொர்க்கிற்குள் (virtual network) மாடல்களை இயக்குவது என்பது, அந்தத் தரவு பரிமாற்றங்கள் நிறுவனத்தின் எல்லைக்கு வெளியே ஒருபோதும் செல்லாது என்பதைக் குறிக்கிறது. நிறுவனம் நவீன அடிப்படை மாடல்களின் (foundation models) பலனைப் பெறுகிறது, ஆனால் அதன் weights, prompts மற்றும் முன்னுரிமைத் தரவுகள் (preference data) ஆகியவை நிறுவனம் நிர்வகிக்கும் எல்லைக்குள்ளேயே இருக்கும்.
Microsoft தனது Azure கிளவுட் வணிகத்தை, தனிப்பட்ட பயன்பாடுகள் (private deployments) மற்றும் பிராந்திய தரவு இருப்பு (regional data residency) ஆகிய இந்த வாக்குறுதியைச் சுற்றியே கட்டமைத்துள்ளது. தனது பதிவில், நிறுவனங்கள் தங்களின் அறிவுசார் சொத்துக்களை (intellectual property) தெரியாமல் ஒரு தொலைதூர மாடல் வழங்குநருக்கு அனுப்பிவிடாமல், தங்களின் சொந்தப் பயிற்சி மற்றும் அனுமானங்களை (training and inference) ஹோஸ்ட் செய்யக்கூடிய ஒரு தளமாக Microsoft இருக்க விரும்புகிறது என்பதை நதேலா உணர்த்தியுள்ளார். இந்த முன்மொழிவு நேரடியானது: சக்திவாய்ந்த AI-ஐப் பயன்படுத்துங்கள், ஆனால் அதன் விளைவுகளை (exhaust) உங்களிடமே வைத்துக்கொள்ளுங்கள்.
மற்ற விற்பனையாளர்களும் இதே போன்ற கருத்துக்களைக் கூறி வருகின்றனர், ஆனால் OpenAI உடனான Microsoft-ன் ஆழமான கூட்டாண்மை காரணமாக நதேலாவின் தலையீடு கூடுதல் முக்கியத்துவம் பெறுகிறது. ஒரு CEO-விற்கு...
