அமெரிக்க நீதித்துறை (U.S. Department of Justice), ஊடக ஜாம்பவான்களுக்கும் AI மேம்பாட்டாளர்களுக்கும் இடையே தொடர்ந்து நடைபெற்று வரும் பதிப்புரிமைப் போரில் ஒரு முக்கியமான சட்டத் தலையீட்டைச் செய்துள்ளது. பதிப்புரிமை பெற்ற தரவுகளில் Large Language Models (LLMs)-ஐப் பயிற்றுவிப்பது "நியாயமான பயன்பாடு" (fair use) என்று வாதிடுவதன் மூலம், DOJ, OpenAI மற்றும் Microsoft போன்ற நிறுவனங்களுக்கு ஒரு மிகப்பெரிய சட்டப் பாதுகாப்பை வழங்கியுள்ளது.

DOJ-இன் வாதம்: பயிற்சி vs வெளியீடு

The New York Times தொடர்பான ஒருங்கிணைந்த வழக்கின் மையப்பகுதியில், ஒரு AI எவ்வாறு கற்றுக்கொள்கிறது மற்றும் அது எதை உருவாக்குகிறது என்பதற்கிடையேயான ஒரு அடிப்படை வேறுபாடு உள்ளது. The New York Times தனது மில்லியன் கணக்கான கட்டுரைகள், GPT-4 போன்ற மாதிரிகளைப் பயிற்றுவிக்க அனுமதியின்றி பயன்படுத்தப்பட்டதாகவும், இது பில்லியன் கணக்கான டாலர் இழப்புகளை ஏற்படுத்தி, செய்தித்தாளுடன் நேரடியாகப் போட்டியிடும் தயாரிப்புகளை உருவாக்கியுள்ளதாகவும் குற்றம் சாட்டுகிறது.

இருப்பினும், DOJ-இன் சமீபத்திய தாக்கல், பதிப்புரிமை மீறல் என்பது உள்ளீட்டுப் புள்ளியில் (ingestion) அல்ல, வெளியீட்டுப் புள்ளியில் (output) நிகழ்கிறது என்று வாதிடுகிறது. பயிற்சி நிலையில் முழுமையான படைப்புகள் நகலெடுக்கப்பட்டாலும், இந்த நகல்கள் ஒருபோதும் பொதுமக்களுக்குக் கிடைக்கக் கொடுக்கப்படுவதில்லை என்று துறை வாதிடுகிறது. மேலும், GPT-4 போன்ற மாதிரிகளின் வெளியீடுகள் "எப்போதும் இல்லாவிட்டாலும், பெரும்பாலும் அசல் மூலப் பொருட்களுடன் குறிப்பிடத்தக்க ஒற்றுமையைக் கொண்டிருப்பதில்லை" என்று DOJ உறுதிபடக் கூறுகிறது. பயிற்சி செயல்முறையை உருவாக்கப்பட்ட உள்ளடக்கத்திலிருந்து பிரிப்பதன் மூலம், இயந்திரக் கற்றல் (machine learning) செயல்பாட்டை சந்தை மாற்றீடு (market substitution) என்ற சட்டக் கருத்திலிருந்து பிரிக்க DOJ முயற்சிக்கிறது.

"ஹெமிங்வே ஒப்புமை" மற்றும் மனித படைப்பாற்றல்

இயந்திரக் கற்றல் என்ற கருத்தை எளிதில் புரியவைக்க, DOJ எழுத்தாளர் Joan Didion தொடர்பான ஒரு இலக்கிய ஒப்புமையைக் குறிப்பிட்டது. Didion டீனேஜராக இருந்தபோது, அவரது வாக்கிய அமைப்பைப் பகுப்பாய்வு செய்யவும், அவரது கலைத் திறனைக் கற்றுக்கொள்ளவும் Ernest Hemingway-இன் கதைகளை நகலெடுப்பார் என்று அந்தத் தாக்கல் குறிப்பிடுகிறது. சட்டம் இயந்திரப் பயிற்சியை ஒரு பதிப்புரிமை மீறலாகக் கருதினால், Didion போன்ற ஒரு எழுத்தாளர் ஒவ்வொரு முறை புதிய படைப்பை வெளியிடும் போதும் கோட்பாட்டளவில் பொறுப்பிற்கு உள்ளாக நேரிடும்; ஏனெனில் அவரது கற்றல் செயல்முறை அவரது அடுத்தடுத்த எழுத்துக்களுடன் பிரிக்க முடியாத வகையில் இணைக்கப்பட்டிருக்கும் என்று DOJ வாதிடுகிறது.

AI பயிற்சிக்காகக் கடுமையான பொறுப்பைத் திணிப்பது, பதிப்புரிமைச் சட்டம் பாதுகாக்க நினைக்கும் அதே படைப்பாற்றலையே முரண்பாடாக முடக்கிவிடும் என்று துறை மேலும் வாதிடுகிறது. மனிதர்கள் அசல் படைப்புகளைத் தயாரிக்கவும் திருத்தவும் LLM-களைப் பயன்படுத்துவது அதிகரித்து வருவதால், மிகப்பெரிய அளவிலான உரிமத் திட்டங்கள் இன்றி பயிற்சியைத் தடை செய்வது AI சார்ந்த கண்டுபிடிப்புகளை முடக்கிவிடும் என்று DOJ பரிந்துரைக்கிறது.

DOJ-இன் நிலை, US Copyright Office-இன் சமீபத்திய கண்டுபிடிப்புகளுக்கு நேரடியாக முரணாக உள்ளது. முன்னாள் பதிவாளர் Shira Perlmutter இதற்கு முன்பே பொதுவான "நியாயமான பயன்பாடு" (fair use) தற்காப்புக்கு எதிராக வாதிட்டார். AI மனிதத் திறனை விடப் பல மடங்கு பெரிய அளவிலும் வேகத்திலும் செயல்படுகிறது என்பதையும், இது அசல் உள்ளடக்க உருவாக்குநர்களுடன் நேரடியாகப் போட்டியிடும் வணிக ரீதியான தயாரிப்புகளை உருவாக்குகிறது என்பதையும் அவர் சுட்டிக்காட்டினார்.

இந்த மதிப்பீட்டிற்கு எதிராக DOJ ஆக்ரோஷமாகச் செயல்பட்டுள்ளது. Perlmutter-இன் அறிக்கை எந்தக் கட்டாய சட்ட அதிகாரத்தையும் கொண்டிருக்கவில்லை என்றும், வழக்கு வாரியான பகுப்பாய்வு குறித்த நிறுவப்பட்ட வழக்குச் சட்டங்களைக் கருத்தில் கொள்ளத் தவறிவிட்டது என்றும் கூறி வருகிறது. பரந்த அளவிலான பொறுப்பைத் திணிப்பது ஒரு உரிம முறையை நடைமுறைப்படுத்த வேண்டிய கட்டாயத்தை ஏற்படுத்தும் என்றும், இது மேம்பட்ட AI மாதிரிகளின் வளர்ச்சியை சட்ட ரீதியாகவும் நிதி ரீதியாகவும் சாத்தியமற்றதாக்கும் என்றும் துறை எச்சரிக்கிறது.

முக்கியக் குறிப்புகள்

  • பயிற்சி மற்றும் வெளியீட்டைப் பிரித்தல்: பயிற்சியிற்காக உரையை நகலெடுப்பதன் மூலம் கிடைக்கும் மாதிரியின் வெளியீடுகள் அசல் படைப்புகளுடன் "குறிப்பிடத்தக்க ஒற்றுமையைக்" கொண்டிருக்கவில்லை என்றால், அது பதிப்புரிமை மீறலாகாது என்று DOJ வாதிடுகிறது.
  • கண்டுபிடிப்புகளைப் பாதுகாத்தல்: அனைத்துப் பயிற்சித் தரவுகளுக்கும் உரிமங்கள் தேவைப்படுவதால் படைப்பாற்றல் முடங்கும் என்றும், மனித உள்ளடக்க உருவாக்கத்திற்கு உதவும் LLM-களின் வளர்ச்சியைத் தடுக்கும் என்றும் துறை எச்சரிக்கிறது.
  • ஒரு சட்ட வழிகாட்டி: இந்தத் தலையீடு DOJ மற்றும் US Copyright Office ஆகியவற்றுக்கு இடையே ஒரு முக்கியமான மோதலை உருவாக்குகிறது, இது generative AI-இன் எதிர்காலம் குறித்த ஒரு இறுதியான நீதிமன்றத் தீர்ப்பிற்கு வழிவகுக்கும்.

ARTICLE: அமெரிக்க நீதித்துறை, The New York Times-இன் பதிப்புரிமை வழக்கில் ஒரு amicus brief-ஐத் தாக்கல் செய்துள்ளது. இதில், பாதுகாக்கப்பட்ட உரையை நகலெடுப்பது Large Language Models (LLMs)-ஐப் பயிற்றுவிக்கப் பயன்படுவது "நியாயமான பயன்பாடு" (fair use) என்ற வரம்பிற்குள் வரும் என்று வாதிடுகிறது. இந்தத் தாக்கல் OpenAI மற்றும் Microsoft போன்ற நிறுவனங்களுக்கு ஒரு சட்டப் பாதுகாப்பை வழங்குகிறது; இது செய்தித்தாளின் மதிப்பீட்டின்படி பில்லியன் கணக்கான டாலர்கள் இருக்கலாம் எனக் கருதப்படும் இழப்பீட்டுத் தொகையிலிருந்து அவர்களைத் தற்காத்துக் கொள்ள உதவும்.

இந்த வழக்கு இப்போது ஏன் முக்கியமானது

AI மேம்பாட்டாளர்கள் அனுமதி இன்றி மில்லியன் கணக்கான செய்தித்தாள் கட்டுரைகளைத் தங்கள் மாதிரிகளில் உள்ளீடு செய்துள்ளனர் என்றும், பின்னர் The Times-இன் சொந்தச் செய்திகளுடன் நேரடியாகப் போட்டியிடும் தயாரிப்புகளை வெளியிட்டனர் என்றும் பலக் குற்றச்சாட்டுகளை இந்த வழக்கு ஒருங்கிணைக்கிறது. ஒரு நீதிமன்றம் DOJ-இன் fair-use வாதத்தை நிராகரித்தால், AI நிறுவனங்கள் மிகப்பெரிய உரிமக் கட்டணங்களைச் சந்திக்க நேரிடும் அல்லது அடுத்த தலைமுறை உரையாடல் முகவர்களின் (conversational agents) வளர்ச்சியை நிறுத்த வேண்டிய கட்டாயத்திற்குத் தள்ளப்படும்.

DOJ-இன் முக்கிய வாதம்

இந்தத் தாக்கல் AI பணிப்பாய்வை இரண்டு தனித்தனி நிலைகளாகப் பிரிக்கிறது. முதலாவதாக, மாதிரி (model) பெருமளவிலான உரைத் தொகுப்புகளை உள்வாங்குகிறது; இரண்டாவதாக, அது பயனர் தூண்டுதல்களுக்கு (prompts) பதில்களை உருவாக்குகிறது. பதிப்புரிமை பெற்ற ஒரு படைப்பு பொதுமக்கள் அணுகக்கூடிய வகையில் மறுஉருவாக்கம் செய்யப்படும்போது மட்டுமே பதிப்புரிமை மீறல் ஏற்படுகிறது என்று அந்தத் துறை கூறுகிறது. பயிற்சியின் போது நகலெடுக்கப்பட்டவை டெவலப்பரின் சேவையகங்களை (servers) விட்டு வெளியேறாததால், அந்த உள்வாங்கும் செயல்முறை அந்த வரம்பிற்குள் வருவதில்லை.

DOJ மேலும் நீண்டகால பதிப்புரிமைத் தரமான "குறிப்பிடத்தக்க ஒற்றுமை" (substantial similarity) சோதனையைச் சார்ந்துள்ளது. GPT-4 போன்ற மாதிரிகளால் வெளியாகும் உரை, "எப்போதும் இல்லாவிட்டாலும் பெரும்பாலும்" ஏதேனும் ஒரு தனி மூலத்திலிருந்து போதுமான அளவு வேறுபடுவதால், ஒரு வாதி தேவையான ஒற்றுமையை நிரூபிக்க முடியாது என்று அது வாதிடுகிறது. சுருக்கமாகச் சொன்னால், சட்ட ரீதியான கவனம் இறுதி வெளியீட்டின் மீது இருக்க வேண்டுமே தவிர, உள்நிலை கற்றல் செயல்முறையின் மீது இருக்கக்கூடாது என்று அந்தத் தாக்கல் வாதிடுகிறது.

விளக்கத்திற்காக ஒரு இலக்கிய ஒப்புமை

தொழில்நுட்ப வாதத்தை எளிதில் புரியவைக்க, எர்னஸ்ட் ஹெமிங்வேயின் பாணியைக் கற்க அவரது கதைகளைப் பிரதி எடுத்த ஒரு இளம் எழுத்தாளரைப் பற்றிய கதையை இந்தத் தாக்கல் குறிப்பிடுகிறது. அந்த கற்றல் பயிற்சியை ஒரு பதிப்புரிமை மீறலாகச் சட்டம் கருதினால், அந்த எழுத்தாளரின் படைப்பு அசல் என்றாலும், அவர் ஒவ்வொரு முறை புதிய படைப்பை வெளியிடும்போதும் அவர் மீது வழக்குத் தொடரப்படலாம் என்று DOJ கூறுகிறது. இதே தர்க்கத்தை AI-க்கு விரிவுபடுத்துவது "பதிப்புரிமைச் சட்டம் பாதுகாக்க வடிவமைக்கப்பட்ட படைப்பாற்றலையே முடக்கிவிடும்" என்று அந்தத் துறை எச்சரிக்கிறது.

AI டெவலப்பர்கள் மற்றும் உள்ளடக்க உருவாக்குநர்களுக்கான பாதிப்புகள்

  • புத்தாக்க அபாயம்: பயிற்சியில் பயன்படுத்தப்படும் ஒவ்வொரு உரைக்கும் உரிமங்கள் (licenses) தேவைப்படுவது செலவுகளை மிக அதிகமாக உயர்த்தக்கூடும், இதனால் அதிநவீன மாதிரிகளை உருவாக்குவது நிதி ரீதியாகச் சாத்தியமற்றதாகிவிடும்.
  • படைப்பாற்றல் பணிப்பாய்வு: மனித எழுத்தாளர்கள் வரைவு செய்தல், திருத்துதல் மற்றும் மூளைச்சலவை (brainstorming) ஆகியவற்றிற்கு LLM-களைப் பெரிதும் நம்பியிருக்கிறார்கள். பயிற்சியின் செயல்முறை சட்டவிரோதமானது எனக் கருதப்பட்டால், அந்தத் கருவிகள் மறைந்துவிடக்கூடும், இது பல்வேறு தொழில்துறைகளில் உள்ளடக்கங்கள் எவ்வாறு உருவாக்கப்படுகின்றன என்பதை மாற்றியமைக்கும்.
  • சந்தை தாக்கம்: கேள்விகளுக்குப் பதிலளிக்க அல்லது செய்தியைப் போன்ற உரையை உருவாக்கக்கூடிய AI மாதிரிகள், அசல் செய்தியறிக்கையின் மதிப்பைச் சிதைப்பதாகவும், விளம்பர வருவாய் மற்றும் சந்தாக்களை (subscriptions) திசைதிருப்பக்கூடும் என்றும் செய்தித் தாள்த் துறை வாதிடுகிறது.

பதிப்புரிமை அலுவலகத்தின் மறுப்பு

முன்னாள் பதிவேடு ஷிரா பெர்ல்முட்டரின் கீழ் எழுதப்பட்ட அமெரிக்கப் பதிப்புரிமை அலுவலகத்தின் சமீபத்திய அறிக்கை, பொதுவான 'நியாயமான பயன்பாடு' (fair-use) வாதத்தை நிராகரித்தது. AI-யை மனிதக் கற்றலில் இருந்து வேறுபடுத்தும் மூன்று காரணிகளை அந்த அலுவலகம் சுட்டிக்காட்டியது: நகலெடுக்கப்பட்டப் பொருட்களின் அளவு, அவை செயலாக்கப்படும் வேகம் மற்றும் resulting மாதிரிகள் வணிகப் பொருட்களாகப் பேக் செய்யப்பட்டு விற்பனை செய்யப்படலாம் மற்றும் அவை மூல படைப்பாளிகளுடன் நேரடியாகப் போட்டியிடும் என்பதுதான்.

அந்த அறிக்கை கட்டாயமான சட்ட அதிகாரத்தைக் கொண்டிருக்கவில்லை என்றும், ஏற்கனவே உள்ள வழக்குச் சட்டங்கள் 'நியாயமான பயன்பாடு' குறித்த ஒவ்வொரு உண்மை அடிப்படையிலான பகுப்பாய்வை ஏற்கனவே கோருகின்றன என்றும் குறிப்பிட்டு DOJ அந்தப் புள்ளிகளை மறுக்கிறது. "பரந்த பொறுப்பை" (broad liability) சுமத்துவது, தொழில்துறையை ஒரு உரிம முறைக்குள் (licensing regime) தள்ளும் என்றும், இது "மேம்பட்ட AI மாதிரிகளின் வளர்ச்சியை சட்ட ரீதியாகவும் நிதி ரீதியாகவும் சாத்தியமற்றதாக்கும்" என்றும் அது எச்சரிக்கிறது.

அடுத்து என்ன நடக்கலாம்

டைம்ஸ் வழக்கை விசாரிக்கும் மாவட்ட நீதிமன்றம், DOJ-ன் நியாயமான பயன்பாட்டு நிலைப்பாட்டையும் பதிப்புரிமை அலுவலகத்தின் கண்டுபிடிப்புகளையும் ஒப்பிட்டுப் பார்க்க வேண்டியிருக்கும். DOJ-க்கு சாதகமான தீர்ப்பு கிடைத்தால், மாதிரியின் வெளியீடுகள் 'குறிப்பிடத்தக்க ஒற்றுமை' இல்லாமல் இருக்கும் வரை, பயிற்சியளிக்கும் தரவுகளை வெளிப்படையான அனுமதி இன்றி சேகரிக்கலாம் என்ற முன்னுதாரணத்தை உருவாக்கும். செய்தித் தாளுக்குச் சாதகமான முடிவு, உரிமப் பேச்சுவார்த்தைகளின் அலைகளைத் தூண்டக்கூடும், இது AI ஆராய்ச்சியின் பொருளாதாரத்தை மாற்றியமைக்க வாய்ப்புள்ளது.

சுருக்கம்

AI பயிற்சி என்பது நியாயமான பயன்பாடா இல்லையா என்ற கேள்வியை DOJ-ன் தாக்கல் ஒரு முக்கியமான நீதிமன்றப் போராக மாற்றியுள்ளது. இதன் முடிவு, டெவலப்பர்கள் ஏற்கனவே உள்ள உரையின் அடிப்படையில் சக்திவாய்ந்த மொழி மாதிரிகளைத் தொடர்ந்து உருவாக்க முடியுமா அல்லது அவர்கள் உள்வாங்கும் ஒவ்வொரு பொருளுக்கும் விலையுயர்ந்த உரிமங்களைப் பெற வேண்டுமா என்பதைத் தீர்மானிக்கும். இந்தத் தீர்ப்பு தொழில்நுட்பத் துறை, ஊடகத் துறை மற்றும் பரந்த படைப்புப் பொருளாதாரம் முழுவதும் தாக்கத்தை ஏற்படுத்தும்.