அமெரிக்க நீதித்துறை (U.S. Department of Justice), ஊடக ஜாம்பவான்களுக்கும் AI மேம்பாட்டாளர்களுக்கும் இடையே தொடர்ந்து நடைபெற்று வரும் பதிப்புரிமைப் போரில் ஒரு முக்கியமான சட்டத் தலையீட்டைச் செய்துள்ளது. பதிப்புரிமை பெற்ற தரவுகளில் Large Language Models (LLMs)-ஐப் பயிற்றுவிப்பது "நியாயமான பயன்பாடு" (fair use) என்று வாதிடுவதன் மூலம், DOJ, OpenAI மற்றும் Microsoft போன்ற நிறுவனங்களுக்கு ஒரு மிகப்பெரிய சட்டப் பாதுகாப்பை வழங்கியுள்ளது.
DOJ-இன் வாதம்: பயிற்சி vs வெளியீடு
The New York Times தொடர்பான ஒருங்கிணைந்த வழக்கின் மையப்பகுதியில், ஒரு AI எவ்வாறு கற்றுக்கொள்கிறது மற்றும் அது எதை உருவாக்குகிறது என்பதற்கிடையேயான ஒரு அடிப்படை வேறுபாடு உள்ளது. The New York Times தனது மில்லியன் கணக்கான கட்டுரைகள், GPT-4 போன்ற மாதிரிகளைப் பயிற்றுவிக்க அனுமதியின்றி பயன்படுத்தப்பட்டதாகவும், இது பில்லியன் கணக்கான டாலர் இழப்புகளை ஏற்படுத்தி, செய்தித்தாளுடன் நேரடியாகப் போட்டியிடும் தயாரிப்புகளை உருவாக்கியுள்ளதாகவும் குற்றம் சாட்டுகிறது.
இருப்பினும், DOJ-இன் சமீபத்திய தாக்கல், பதிப்புரிமை மீறல் என்பது உள்ளீட்டுப் புள்ளியில் (ingestion) அல்ல, வெளியீட்டுப் புள்ளியில் (output) நிகழ்கிறது என்று வாதிடுகிறது. பயிற்சி நிலையில் முழுமையான படைப்புகள் நகலெடுக்கப்பட்டாலும், இந்த நகல்கள் ஒருபோதும் பொதுமக்களுக்குக் கிடைக்கக் கொடுக்கப்படுவதில்லை என்று துறை வாதிடுகிறது. மேலும், GPT-4 போன்ற மாதிரிகளின் வெளியீடுகள் "எப்போதும் இல்லாவிட்டாலும், பெரும்பாலும் அசல் மூலப் பொருட்களுடன் குறிப்பிடத்தக்க ஒற்றுமையைக் கொண்டிருப்பதில்லை" என்று DOJ உறுதிபடக் கூறுகிறது. பயிற்சி செயல்முறையை உருவாக்கப்பட்ட உள்ளடக்கத்திலிருந்து பிரிப்பதன் மூலம், இயந்திரக் கற்றல் (machine learning) செயல்பாட்டை சந்தை மாற்றீடு (market substitution) என்ற சட்டக் கருத்திலிருந்து பிரிக்க DOJ முயற்சிக்கிறது.
"ஹெமிங்வே ஒப்புமை" மற்றும் மனித படைப்பாற்றல்
இயந்திரக் கற்றல் என்ற கருத்தை எளிதில் புரியவைக்க, DOJ எழுத்தாளர் Joan Didion தொடர்பான ஒரு இலக்கிய ஒப்புமையைக் குறிப்பிட்டது. Didion டீனேஜராக இருந்தபோது, அவரது வாக்கிய அமைப்பைப் பகுப்பாய்வு செய்யவும், அவரது கலைத் திறனைக் கற்றுக்கொள்ளவும் Ernest Hemingway-இன் கதைகளை நகலெடுப்பார் என்று அந்தத் தாக்கல் குறிப்பிடுகிறது. சட்டம் இயந்திரப் பயிற்சியை ஒரு பதிப்புரிமை மீறலாகக் கருதினால், Didion போன்ற ஒரு எழுத்தாளர் ஒவ்வொரு முறை புதிய படைப்பை வெளியிடும் போதும் கோட்பாட்டளவில் பொறுப்பிற்கு உள்ளாக நேரிடும்; ஏனெனில் அவரது கற்றல் செயல்முறை அவரது அடுத்தடுத்த எழுத்துக்களுடன் பிரிக்க முடியாத வகையில் இணைக்கப்பட்டிருக்கும் என்று DOJ வாதிடுகிறது.
AI பயிற்சிக்காகக் கடுமையான பொறுப்பைத் திணிப்பது, பதிப்புரிமைச் சட்டம் பாதுகாக்க நினைக்கும் அதே படைப்பாற்றலையே முரண்பாடாக முடக்கிவிடும் என்று துறை மேலும் வாதிடுகிறது. மனிதர்கள் அசல் படைப்புகளைத் தயாரிக்கவும் திருத்தவும் LLM-களைப் பயன்படுத்துவது அதிகரித்து வருவதால், மிகப்பெரிய அளவிலான உரிமத் திட்டங்கள் இன்றி பயிற்சியைத் தடை செய்வது AI சார்ந்த கண்டுபிடிப்புகளை முடக்கிவிடும் என்று DOJ பரிந்துரைக்கிறது.
US Copyright Office-இடம் சவால் விடுதல்
DOJ-இன் நிலை, US Copyright Office-இன் சமீபத்திய கண்டுபிடிப்புகளுக்கு நேரடியாக முரணாக உள்ளது. முன்னாள் பதிவாளர் Shira Perlmutter இதற்கு முன்பே பொதுவான "நியாயமான பயன்பாடு" (fair use) தற்காப்புக்கு எதிராக வாதிட்டார். AI மனிதத் திறனை விடப் பல மடங்கு பெரிய அளவிலும் வேகத்திலும் செயல்படுகிறது என்பதையும், இது அசல் உள்ளடக்க உருவாக்குநர்களுடன் நேரடியாகப் போட்டியிடும் வணிக ரீதியான தயாரிப்புகளை உருவாக்குகிறது என்பதையும் அவர் சுட்டிக்காட்டினார்.
இந்த மதிப்பீட்டிற்கு எதிராக DOJ ஆக்ரோஷமாகச் செயல்பட்டுள்ளது. Perlmutter-இன் அறிக்கை எந்தக் கட்டாய சட்ட அதிகாரத்தையும் கொண்டிருக்கவில்லை என்றும், வழக்கு வாரியான பகுப்பாய்வு குறித்த நிறுவப்பட்ட வழக்குச் சட்டங்களைக் கருத்தில் கொள்ளத் தவறிவிட்டது என்றும் கூறி வருகிறது. பரந்த அளவிலான பொறுப்பைத் திணிப்பது ஒரு உரிம முறையை நடைமுறைப்படுத்த வேண்டிய கட்டாயத்தை ஏற்படுத்தும் என்றும், இது மேம்பட்ட AI மாதிரிகளின் வளர்ச்சியை சட்ட ரீதியாகவும் நிதி ரீதியாகவும் சாத்தியமற்றதாக்கும் என்றும் துறை எச்சரிக்கிறது.
முக்கியக் குறிப்புகள்
- பயிற்சி மற்றும் வெளியீட்டைப் பிரித்தல்: பயிற்சியிற்காக உரையை நகலெடுப்பதன் மூலம் கிடைக்கும் மாதிரியின் வெளியீடுகள் அசல் படைப்புகளுடன் "குறிப்பிடத்தக்க ஒற்றுமையைக்" கொண்டிருக்கவில்லை என்றால், அது பதிப்புரிமை மீறலாகாது என்று DOJ வாதிடுகிறது.
- கண்டுபிடிப்புகளைப் பாதுகாத்தல்: அனைத்துப் பயிற்சித் தரவுகளுக்கும் உரிமங்கள் தேவைப்படுவதால் படைப்பாற்றல் முடங்கும் என்றும், மனித உள்ளடக்க உருவாக்கத்திற்கு உதவும் LLM-களின் வளர்ச்சியைத் தடுக்கும் என்றும் துறை எச்சரிக்கிறது.
- ஒரு சட்ட வழிகாட்டி: இந்தத் தலையீடு DOJ மற்றும் US Copyright Office ஆகியவற்றுக்கு இடையே ஒரு முக்கியமான மோதலை உருவாக்குகிறது, இது generative AI-இன் எதிர்காலம் குறித்த ஒரு இறுதியான நீதிமன்றத் தீர்ப்பிற்கு வழிவகுக்கும்.
ARTICLE: அமெரிக்க நீதித்துறை, The New York Times-இன் பதிப்புரிமை வழக்கில் ஒரு amicus brief-ஐத் தாக்கல் செய்துள்ளது. இதில், பாதுகாக்கப்பட்ட உரையை நகலெடுப்பது Large Language Models (LLMs)-ஐப் பயிற்றுவிக்கப் பயன்படுவது "நியாயமான பயன்பாடு" (fair use) என்ற வரம்பிற்குள் வரும் என்று வாதிடுகிறது. இந்தத் தாக்கல் OpenAI மற்றும் Microsoft போன்ற நிறுவனங்களுக்கு ஒரு சட்டப் பாதுகாப்பை வழங்குகிறது; இது செய்தித்தாளின் மதிப்பீட்டின்படி பில்லியன் கணக்கான டாலர்கள் இருக்கலாம் எனக் கருதப்படும் இழப்பீட்டுத் தொகையிலிருந்து அவர்களைத் தற்காத்துக் கொள்ள உதவும்.
இந்த வழக்கு இப்போது ஏன் முக்கியமானது
AI மேம்பாட்டாளர்கள் அனுமதி இன்றி மில்லியன் கணக்கான செய்தித்தாள் கட்டுரைகளைத் தங்கள் மாதிரிகளில் உள்ளீடு செய்துள்ளனர் என்றும், பின்னர் The Times-இன் சொந்தச் செய்திகளுடன் நேரடியாகப் போட்டியிடும் தயாரிப்புகளை வெளியிட்டனர் என்றும் பலக் குற்றச்சாட்டுகளை இந்த வழக்கு ஒருங்கிணைக்கிறது. ஒரு நீதிமன்றம் DOJ-இன் fair-use வாதத்தை நிராகரித்தால், AI நிறுவனங்கள் மிகப்பெரிய உரிமக் கட்டணங்களைச் சந்திக்க நேரிடும் அல்லது அடுத்த தலைமுறை உரையாடல் முகவர்களின் (conversational agents) வளர்ச்சியை நிறுத்த வேண்டிய கட்டாயத்திற்குத் தள்ளப்படும்.
DOJ-இன் முக்கிய வாதம்
இந்தத் தாக்கல் AI பணிப்பாய்வை இரண்டு தனித்தனி நிலைகளாகப் பிரிக்கிறது. முதலாவதாக, மாதிரி (model) பெருமளவிலான உரைத் தொகுப்புகளை உள்வாங்குகிறது; இரண்டாவதாக, அது பயனர் தூண்டுதல்களுக்கு (prompts) பதில்களை உருவாக்குகிறது. பதிப்புரிமை பெற்ற ஒரு படைப்பு பொதுமக்கள் அணுகக்கூடிய வகையில் மறுஉருவாக்கம் செய்யப்படும்போது மட்டுமே பதிப்புரிமை மீறல் ஏற்படுகிறது என்று அந்தத் துறை கூறுகிறது. பயிற்சியின் போது நகலெடுக்கப்பட்டவை டெவலப்பரின் சேவையகங்களை (servers) விட்டு வெளியேறாததால், அந்த உள்வாங்கும் செயல்முறை அந்த வரம்பிற்குள் வருவதில்லை.
DOJ மேலும் நீண்டகால பதிப்புரிமைத் தரமான "குறிப்பிடத்தக்க ஒற்றுமை" (substantial similarity) சோதனையைச் சார்ந்துள்ளது. GPT-4 போன்ற மாதிரிகளால் வெளியாகும் உரை, "எப்போதும் இல்லாவிட்டாலும் பெரும்பாலும்" ஏதேனும் ஒரு தனி மூலத்திலிருந்து போதுமான அளவு வேறுபடுவதால், ஒரு வாதி தேவையான ஒற்றுமையை நிரூபிக்க முடியாது என்று அது வாதிடுகிறது. சுருக்கமாகச் சொன்னால், சட்ட ரீதியான கவனம் இறுதி வெளியீட்டின் மீது இருக்க வேண்டுமே தவிர, உள்நிலை கற்றல் செயல்முறையின் மீது இருக்கக்கூடாது என்று அந்தத் தாக்கல் வாதிடுகிறது.
விளக்கத்திற்காக ஒரு இலக்கிய ஒப்புமை
தொழில்நுட்ப வாதத்தை எளிதில் புரியவைக்க, எர்னஸ்ட் ஹெமிங்வேயின் பாணியைக் கற்க அவரது கதைகளைப் பிரதி எடுத்த ஒரு இளம் எழுத்தாளரைப் பற்றிய கதையை இந்தத் தாக்கல் குறிப்பிடுகிறது. அந்த கற்றல் பயிற்சியை ஒரு பதிப்புரிமை மீறலாகச் சட்டம் கருதினால், அந்த எழுத்தாளரின் படைப்பு அசல் என்றாலும், அவர் ஒவ்வொரு முறை புதிய படைப்பை வெளியிடும்போதும் அவர் மீது வழக்குத் தொடரப்படலாம் என்று DOJ கூறுகிறது. இதே தர்க்கத்தை AI-க்கு விரிவுபடுத்துவது "பதிப்புரிமைச் சட்டம் பாதுகாக்க வடிவமைக்கப்பட்ட படைப்பாற்றலையே முடக்கிவிடும்" என்று அந்தத் துறை எச்சரிக்கிறது.
AI டெவலப்பர்கள் மற்றும் உள்ளடக்க உருவாக்குநர்களுக்கான பாதிப்புகள்
- புத்தாக்க அபாயம்: பயிற்சியில் பயன்படுத்தப்படும் ஒவ்வொரு உரைக்கும் உரிமங்கள் (licenses) தேவைப்படுவது செலவுகளை மிக அதிகமாக உயர்த்தக்கூடும், இதனால் அதிநவீன மாதிரிகளை உருவாக்குவது நிதி ரீதியாகச் சாத்தியமற்றதாகிவிடும்.
- படைப்பாற்றல் பணிப்பாய்வு: மனித எழுத்தாளர்கள் வரைவு செய்தல், திருத்துதல் மற்றும் மூளைச்சலவை (brainstorming) ஆகியவற்றிற்கு LLM-களைப் பெரிதும் நம்பியிருக்கிறார்கள். பயிற்சியின் செயல்முறை சட்டவிரோதமானது எனக் கருதப்பட்டால், அந்தத் கருவிகள் மறைந்துவிடக்கூடும், இது பல்வேறு தொழில்துறைகளில் உள்ளடக்கங்கள் எவ்வாறு உருவாக்கப்படுகின்றன என்பதை மாற்றியமைக்கும்.
- சந்தை தாக்கம்: கேள்விகளுக்குப் பதிலளிக்க அல்லது செய்தியைப் போன்ற உரையை உருவாக்கக்கூடிய AI மாதிரிகள், அசல் செய்தியறிக்கையின் மதிப்பைச் சிதைப்பதாகவும், விளம்பர வருவாய் மற்றும் சந்தாக்களை (subscriptions) திசைதிருப்பக்கூடும் என்றும் செய்தித் தாள்த் துறை வாதிடுகிறது.
பதிப்புரிமை அலுவலகத்தின் மறுப்பு
முன்னாள் பதிவேடு ஷிரா பெர்ல்முட்டரின் கீழ் எழுதப்பட்ட அமெரிக்கப் பதிப்புரிமை அலுவலகத்தின் சமீபத்திய அறிக்கை, பொதுவான 'நியாயமான பயன்பாடு' (fair-use) வாதத்தை நிராகரித்தது. AI-யை மனிதக் கற்றலில் இருந்து வேறுபடுத்தும் மூன்று காரணிகளை அந்த அலுவலகம் சுட்டிக்காட்டியது: நகலெடுக்கப்பட்டப் பொருட்களின் அளவு, அவை செயலாக்கப்படும் வேகம் மற்றும் resulting மாதிரிகள் வணிகப் பொருட்களாகப் பேக் செய்யப்பட்டு விற்பனை செய்யப்படலாம் மற்றும் அவை மூல படைப்பாளிகளுடன் நேரடியாகப் போட்டியிடும் என்பதுதான்.
அந்த அறிக்கை கட்டாயமான சட்ட அதிகாரத்தைக் கொண்டிருக்கவில்லை என்றும், ஏற்கனவே உள்ள வழக்குச் சட்டங்கள் 'நியாயமான பயன்பாடு' குறித்த ஒவ்வொரு உண்மை அடிப்படையிலான பகுப்பாய்வை ஏற்கனவே கோருகின்றன என்றும் குறிப்பிட்டு DOJ அந்தப் புள்ளிகளை மறுக்கிறது. "பரந்த பொறுப்பை" (broad liability) சுமத்துவது, தொழில்துறையை ஒரு உரிம முறைக்குள் (licensing regime) தள்ளும் என்றும், இது "மேம்பட்ட AI மாதிரிகளின் வளர்ச்சியை சட்ட ரீதியாகவும் நிதி ரீதியாகவும் சாத்தியமற்றதாக்கும்" என்றும் அது எச்சரிக்கிறது.
அடுத்து என்ன நடக்கலாம்
டைம்ஸ் வழக்கை விசாரிக்கும் மாவட்ட நீதிமன்றம், DOJ-ன் நியாயமான பயன்பாட்டு நிலைப்பாட்டையும் பதிப்புரிமை அலுவலகத்தின் கண்டுபிடிப்புகளையும் ஒப்பிட்டுப் பார்க்க வேண்டியிருக்கும். DOJ-க்கு சாதகமான தீர்ப்பு கிடைத்தால், மாதிரியின் வெளியீடுகள் 'குறிப்பிடத்தக்க ஒற்றுமை' இல்லாமல் இருக்கும் வரை, பயிற்சியளிக்கும் தரவுகளை வெளிப்படையான அனுமதி இன்றி சேகரிக்கலாம் என்ற முன்னுதாரணத்தை உருவாக்கும். செய்தித் தாளுக்குச் சாதகமான முடிவு, உரிமப் பேச்சுவார்த்தைகளின் அலைகளைத் தூண்டக்கூடும், இது AI ஆராய்ச்சியின் பொருளாதாரத்தை மாற்றியமைக்க வாய்ப்புள்ளது.
சுருக்கம்
AI பயிற்சி என்பது நியாயமான பயன்பாடா இல்லையா என்ற கேள்வியை DOJ-ன் தாக்கல் ஒரு முக்கியமான நீதிமன்றப் போராக மாற்றியுள்ளது. இதன் முடிவு, டெவலப்பர்கள் ஏற்கனவே உள்ள உரையின் அடிப்படையில் சக்திவாய்ந்த மொழி மாதிரிகளைத் தொடர்ந்து உருவாக்க முடியுமா அல்லது அவர்கள் உள்வாங்கும் ஒவ்வொரு பொருளுக்கும் விலையுயர்ந்த உரிமங்களைப் பெற வேண்டுமா என்பதைத் தீர்மானிக்கும். இந்தத் தீர்ப்பு தொழில்நுட்பத் துறை, ஊடகத் துறை மற்றும் பரந்த படைப்புப் பொருளாதாரம் முழுவதும் தாக்கத்தை ஏற்படுத்தும்.
