Anthropic-ன் $1.5 பில்லியன் திருட்டுத் தரவுத் தீர்வு: ஒரு சாதனை இழப்பு மற்றும் மூலோபாய வெற்றி
தனது மாதிரிகளைப் (models) பயிற்றுவிக்கத் திருடப்பட்ட தரவுத்தளங்களைப் (pirated databases) பயன்படுத்தியதாக எழுந்த புகாரைத் தொடர்ந்து, புத்தக ஆசிரியர்களின் குழுவுடன் Anthropic நிறுவனம் $1.5 பில்லியன் மதிப்பிலான ஒரு வரலாற்றுச் சிறப்புமிக்கத் தீர்வினை எட்டியுள்ளது. இந்த மிகப்பெரிய இழப்பீடு ஒரு நிதி ரீதியான பின்னடைவாக இருந்தாலும், இந்த வழக்கின் சட்ட நுணுக்கங்கள், 'நியாயமான பயன்பாடு' (fair use) தொடர்பாக ஒட்டுமொத்த AI தொழில்துறைக்கும் ஒரு குறிப்பிடத்தக்க வெற்றியைத் தரக்கூடும்.
சாதனைத் தீர்வு குறித்த விவரங்கள்
2021 மற்றும் 2022-க்கு இடையில், Anthropic நிறுவனம் LibGen மற்றும் PiLiMi போன்ற புகழ்பெற்ற திருட்டுத் தரவுத்தளங்களிலிருந்து புத்தகங்களைத் தரவிறக்கம் செய்தது போன்ற ஆதாரங்கள் வெளிவந்ததைத் தொடர்ந்து, சான் பிரான்சிஸ்கோவில் உள்ள ஒரு கூட்டாட்சி நீதிமன்றம் இந்த முக்கியத் தீர்வினை அங்கீகரித்துள்ளது. சுமார் 482,460 பட்டியலிடப்பட்ட படைப்புகளை உள்ளடக்கிய இந்தத் தீர்வு, கூட்டு நடவடிக்கை (class action) வரலாற்றில் முன்னெப்போதும் இல்லாத அளப்பரியதாகும்.
இதில் சம்பந்தப்பட்ட மொத்தப் படைப்புகளில், 91.3 சதவீதம் ஆசிரியர்களால் வெற்றிகரமாக உரிமை கோரப்பட்டன. ஒவ்வொரு உரிமை கோருபவரும் தோராயமாக $3,000 பெறுவார்கள், இது சட்டரீதியான குறைந்தபட்சத் தொகையை விட நான்கு மடங்கு அதிகம். இந்தச் சட்டத் தீர்வின் ஒரு பகுதியாக, அந்த காலகட்டத்தில் பயன்படுத்தப்பட்ட திருடப்பட்ட கோப்புகளை அழிக்க Anthropic நிறுவனம் கடமைப்பட்டுள்ளது. மிக முக்கியமாக, இந்தத் தீர்வு அந்த நிறுவனத்திற்கு முழுமையான விலக்கு அளிக்கவில்லை; AI வெளியீடுகள் அசல் படைப்புகளை மீண்டும் உருவாக்கினாலோ அல்லது Anthropic-ன் எதிர்காலத் தரவு சேகரிப்பு முறைகள் பதிப்புரிமைச் சட்டங்களை மீறினாலோ, வழக்குத் தொடர ஆசிரியர்களுக்கு உரிமை உண்டு.
AI வளர்ச்சியை ஆதரிக்கும் ஒரு தொழில்நுட்ப நுணுக்கம்
$1.5 பில்லியன் என்ற மலைக்க வைக்கும் தொகையையும் மீறி, இந்த வழக்கு ஏற்படுத்திய சட்ட முன்னுதாரணம் AI ஆய்வகங்களுக்கு ஆச்சரியப்படும் விதமாக சாதகமாக உள்ளது. இந்தத் தீர்வு திருடப்பட்ட ஆதாரங்களைப் பயன்படுத்துவதை மட்டுமே கையாள்கிறது, ஆனால் AI பயிற்சியின் சட்டபூர்வத்தன்மை குறித்து எந்த முடிவையும் வழங்கவில்லை.
நீதிபதி Alsup ஏற்கனவே ஒரு முக்கியமான வேறுபாட்டைக் குறிப்பிட்டுள்ளார்: சட்டப்பூர்வமாகப் பெறப்பட்ட புத்தகங்களைக் கொண்டு AI-க்கு பயிற்சியளிப்பது "மாற்றத்தக்கது—மிகவும் வியக்கத்தக்க வகையில் உள்ளது"—மேலும் இது 'நியாயமான பயன்பாடு' (fair use) கோட்பாட்டிற்குள் முழுமையாக வருகிறது. OpenAI, Google மற்றும் Meta போன்ற நிறுவனங்களுக்கு இந்த வேறுபாடு மிகவும் முக்கியமானது. தரவின் மூலம் (திருட்டு vs சட்டப்பூர்வமாகப் பெறுதல்) ஒரு பொறுப்புக்கூறலை (liability) ஏற்படுத்தினாலும், மொழி மற்றும் வடிவங்களைப் புரிந்துகொள்ள ஒரு மாதிரியைப் பயிற்றுவிக்கும் செயல்முறை சட்டப்படி தற்காத்துக் கொள்ளத்தக்கது என்பதை இது உணர்த்துகிறது.
தீர்க்கப்படாத பெருமளவிலான தரவுச் சேகரிப்பு (Mass Scraping) சவால்
இந்தத் தீர்ப்பு பெருமளவிலான தரவுத் தொகுப்புகளைப் பயன்படுத்திப் பயிற்றுவித்த ஆய்வகங்களுக்கு ஒரு உயிர்நாடியாக இருந்தாலும், "சட்டப்பூர்வமான தரவுச் சேகரிப்பு" குறித்த சட்டப் போராட்டம் இன்னும் முடிவுக்கு வரவில்லை. இணையதள உரிமையாளர்களின் வெளிப்படையான அனுமதியின்றி இணைய உள்ளடக்கங்களை பெருமளவில் சேகரிப்பது (mass scraping), சட்டப்பூர்வமான தரவுச் சேகரிப்பா அல்லது பதிப்புரிமை மீறலா? என்பதே முக்கியக் கேள்வியாக உள்ளது.
இந்தத் தீர்வு AI தொழில்துறைக்கான ஒரு இருமுனைச் சட்ட யதார்த்தத்தை எடுத்துக்காட்டுகிறது. நிறுவனங்கள் தங்களின் தரவுத் தொகுப்புகளில் (data pipelines) திருடப்பட்ட தரவுச் சேகரிப்புத் தளங்கள் இல்லை என்பதை உறுதி செய்வதன் மூலம் பெரும் அபராதங்களைத் தவிர்க்கலாம், ஆனால் இணைய வெளியீட்டாளர்கள் மற்றும் உள்ளடக்க உருவாக்குநர்களின் உரிமைகள் குறித்த நிச்சயமற்ற சூழலை அவர்கள் இன்னும் எதிர்கொள்கின்றனர். AI ஆய்வகங்கள் தொடர்ந்து வளர்ச்சியடையும் போது, மாற்றத்தக்கத் தொழில்நுட்ப முன்னேற்றத்திற்கும் அறிவுசார் சொத்துரிமைக்கும் இடையிலான மோதல், இந்தத் தொழில்துறையின் மிக முக்கியமான சட்டத் தடையாகத் தொடரும்.
முக்கியக் குறிப்புகள்
- சாதனைத் தொகை: LibGen போன்ற திருடப்பட்ட தரவுத்தளங்களைப் பயன்படுத்தியதற்காக Anthropic நிறுவனம் ஆசிரியர்களுக்கு $1.5 பில்லியன் செலுத்தவுள்ளது, இது கூட்டு நடவடிக்கை வரலாற்றில் மிகப்பெரிய பதிப்புரிமைத் தீர்வாகும்.
- நியாயமான பயன்பாட்டு முன்னுதாரணம்: சட்டப்பூர்வமாகப் பெறப்பட்ட தரவைக் கொண்டு AI-க்கு பயிற்சியளிப்பது "மிகவும் வியக்கத்தக்க வகையில் மாற்றத்தக்கது" என்று நீதிமன்றம் உறுதிப்படுத்தியுள்ளது, இது முறையான AI பயிற்சிக்கான ஒரு முக்கியச் சட்டப் பாதுகாப்பை வழங்குகிறது.
- தரவுத் தூய்மை முக்கியமானது: AI பயிற்சியின் சட்டபூர்வத்தன்மை என்பது பயிற்சியளிக்கும் செயல்முறையை விட, பயிற்சியளிக்கப் பயன்படுத்தப்படும் தரவின் மூலம் (provenance) மற்றும் அதன் நம்பகத்தன்மையையே பெரும்பாலும் சார்ந்துள்ளது என்பதை இந்தத் தீர்ப்பு வலியுறுத்துகிறது.
