മാധ്യമ ഭീമന്മാരും AI ഡെവലപ്പർമാരും തമ്മിൽ നടന്നുകൊണ്ടിരിക്കുന്ന പകർപ്പവകാശ യുദ്ധത്തിൽ യുഎസ് നീതിന്യായ വകുപ്പ് (DOJ) സുപ്രധാനമായ ഒരു നിയമപരമായ ഇടപെടൽ നടത്തിയിരിക്കുകയാണ്. പകർപ്പവകാശമുള്ള ഡാറ്റ ഉപയോഗിച്ച് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) പരിശീലിപ്പിക്കുന്നത് "ന്യായമായ ഉപയോഗം" (fair use) ആണെന്ന് വാദിച്ചുകൊണ്ട്, OpenAI, Microsoft തുടങ്ങിയ കമ്പനികൾക്ക് DOJ വലിയൊരു നിയമപരമായ കവചം ഒരുക്കിയിരിക്കുകയാണ്.
DOJ-യുടെ വാദം: പരിശീലനവും ഔട്ട്പുട്ടും തമ്മിലുള്ള വ്യത്യാസം
ദി ന്യൂയോർക്ക് ടൈംസ് ഉൾപ്പെട്ട സംയോജിത നിയമനടപടികളുടെ കാതൽ, ഒരു AI എങ്ങനെ പഠിക്കുന്നു എന്നതും അത് എന്താണ് ഉത്പാദിപ്പിക്കുന്നത് എന്നതും തമ്മിലുള്ള അടിസ്ഥാനപരമായ വ്യത്യാസമാണ്. തങ്ങളുടെ ദശലക്ഷക്കണക്കിന് ലേഖനങ്ങൾ GPT-4 പോലുള്ള മോഡലുകളെ പരിശീലിപ്പിക്കാൻ അനുമതിയില്ലാതെ ഉപയോഗിച്ചുവെന്നും, ഇത് കോടിക്കണക്കിന് ഡോളറിന്റെ നഷ്ടമുണ്ടാക്കുകയും പത്രവുമായി നേരിട്ട് മത്സരിക്കുന്ന ഉൽപ്പന്നങ്ങൾ സൃഷ്ടിക്കുകയും ചെയ്തുവെന്നും ന്യൂയോർക്ക് ടൈംസ് ആരോപിക്കുന്നു.
എന്നിരുന്നാലും, പകർപ്പവകാശ ലംഘനം സംഭവിക്കുന്നത് ഔട്ട്പുട്ട് ലഭിക്കുന്ന ഘട്ടത്തിലാണ്, ഡാറ്റ സ്വീകരിക്കുന്ന ഘട്ടത്തിലല്ല എന്ന് DOJ-യുടെ സമീപകാല ഫയലിംഗ് വാദിക്കുന്നു. പരിശീലന ഘട്ടത്തിൽ മുഴുവൻ കൃതികളും പകർപ്പെടുക്കുന്നുണ്ടെങ്കിലും, ഈ പകർപ്പുകൾ ഒരിക്കലും പരസ്യമായി ലഭ്യമാക്കുന്നില്ലെന്ന് വകുപ്പ് വാദിക്കുന്നു. കൂടാതെ, GPT-4 പോലുള്ള മോഡലുകളുടെ ഔട്ട്പുട്ടുകൾ പലപ്പോഴും യഥാർത്ഥ സ്രോതസ്സുമായി കാര്യമായ സാമ്യം കാണിക്കാറില്ലെന്നും DOJ അവകാശപ്പെടുന്നു. പരിശീലന പ്രക്രിയയെ ജനറേറ്റഡ് കണ്ടന്റിൽ നിന്ന് വേർതിരിക്കുന്നതിലൂടെ, മെഷീൻ ലേണിംഗ് പ്രക്രിയയെ മാർക്കറ്റ് സബ്സ്റ്റിറ്റ്യൂഷൻ (market substitution) എന്ന നിയമപരമായ സങ്കൽപ്പത്തിൽ നിന്ന് വേർപെടുത്താൻ DOJ ശ്രമിക്കുകയാണ്.
"ഹെമിംഗ്വേ അനലജി"യും മനുഷ്യസൃഷ്ടിപരമായ സർഗ്ഗാത്മകതയും
മെഷീൻ ലേണിംഗിന്റെ സങ്കൽപ്പം ലളിതമാക്കുന്നതിനായി, എഴുത്തുകാരി ജോൺ ഡിഡിയൻ്റെ ഉദാഹരണം ഉപയോഗിച്ചുള്ള ഒരു സാഹിത്യപരമായ ഉപമ DOJ ഉന്നയിച്ചു. കൗമാരപ്രായത്തിൽ, ഏണസ്റ്റ് ഹെമിംഗ്വേയുടെ വാചകഘടന വിശകലനം ചെയ്യാനും അദ്ദേഹത്തിന്റെ ശൈലി പഠിക്കാനും ഡിഡിయన్ അദ്ദേഹത്തിന്റെ കഥകൾ പകർത്തിയെഴുതാറുണ്ടായിരുന്നു എന്ന് ഫയലിംഗിൽ സൂചിപ്പിച്ചു. മെഷീൻ പരിശീലനത്തെ പകർപ്പവകാശ ലംഘനമായി നിയമം കണക്കാക്കുകയാണെങ്കിൽ, ഡിഡിയനെപ്പോലെയുള്ള ഒരു എഴുത്തുകാരൻ പുതിയ കൃതികൾ പ്രസിദ്ധീകരിക്കുമ്പോഴെല്ലാം സൈദ്ധാന്തികമായി നിയമപരമായ ഉത്തരവാദിത്തം നേരിടേണ്ടി വരുമെന്ന് DOJ വാദിക്കുന്നു, കാരണം അവരുടെ പഠന പ്രക്രിയ അവരുടെ എഴുത്തുമായി അഭേദ്യമായി ബന്ധപ്പെട്ടിരിക്കുന്നു.
AI പരിശീലനത്തിന് കർശനമായ ഉത്തരവാദിത്തം ചുമത്തുന്നത് പകർപ്പവകാശ നിയമം സംരക്ഷിക്കാൻ ഉദ്ദേശിക്കുന്ന സർഗ്ഗാത്മകതയെത്തന്നെ തടസ്സപ്പെടുത്തുമെന്നും വകുപ്പ് വാദിക്കുന്നു. മനുഷ്യർ തങ്ങളുടെ യഥാർവമായ കൃതികൾ തയ്യാറാക്കാനും എഡിറ്റ് ചെയ്യാനും LLM-കൾ കൂടുതൽ ഉപയോഗിച്ചുവരുന്ന സാഹചര്യത്തിൽ, വൻതോതിലുള്ള ലൈസൻസിംഗ് സംവിധാനങ്ങളില്ലാതെ പരിശീലനം അനുവദനീയമാക്കാതിരിക്കുന്നത് AI അധിഷ്ഠിത നവീകരണങ്ങളെ തളർത്തുമെന്ന് DOJ സൂചിപ്പിക്കുന്നു.
യുഎസ് കോപ്പിറൈറ്റ് ഓഫീസിനെ വെല്ലുവിളിക്കുന്നു
DOJ-യുടെ നിലപാട് യുഎസ് കോപ്പിറൈറ്റ് ഓഫീസിന്റെ സമീപകാല കണ്ടെത്തലുകളെ നേരിട്ട് എതിർക്കുന്നു. AI മനുഷ്യന്റെ കഴിവിനും അപ്പുറത്തുള്ള വേഗതയിലും വ്യാപ്തിയിലും പ്രവർത്തിക്കുന്നുവെന്നും, പലപ്പോഴും യഥാർത്ഥ ഉള്ളടക്ക സ്രഷ്ടികളുമായി നേരിട്ട് മത്സരിക്കുന്ന വാണിജ്യ ഉൽപ്പന്നങ്ങൾ സൃഷ്ടിക്കുന്നുവെന്നും ചൂണ്ടിക്കാട്ടി, മുൻ രജിസ്റ്റർ ഷിറ പെർൽമട്ടർ നേരത്തെ ഒരു പൊതുവായ "ന്യായമായ ഉപയോഗം" (fair use) പ്രതിരോധത്തിനെതിരെ വാദിച്ചിരുന്നു.
ഈ വിലയിരുത്തലിനെതിരെ ശക്തമായ നിലപാടെടുക്കുന്ന DOJ, പെർൽമട്ടറുടെ റിപ്പോർട്ടിന് നിയമപരമായ ബാധ്യതയൊന്നുമില്ലെന്നും ഓരോ കേസും പ്രത്യേകം വിശകലനം ചെയ്യുക എന്ന നിലവിലുള്ള നിയമപരമായ കീഴ്വഴക്കങ്ങളെ അത് പരിഗണിക്കുന്നില്ലെന്നും പ്രസ്താവിച്ചു. വിപുലമായ ഉത്തരവാദിത്തം ചുമത്തുന്നത് ഒരു ലൈസൻസിംഗ് സംവിധാനം നിർബന്ധമാക്കുമെന്നും, ഇത് അത്യാധുനിക AI മോഡലുകളുടെ വികസനം നിയമപരമായും സാമ്പത്തികമായും അസാധ്യമാക്കുമെന്നും വകുപ്പ് മുന്നറിയിപ്പ് നൽകുന്നു.
പ്രധാന കാര്യങ്ങൾ
- പരിശീലനവും ഔട്ട്പുട്ടും തമ്മിലുള്ള വേർതിരിവ്: resulting model outputs യഥാർത്ഥ കൃതികളുമായി "കാര്യമായ സാമ്യം" കാണിക്കുന്നില്ലെങ്കിൽ, പരിശീലനത്തിനായി ടെക്സ്റ്റ് പകർക്കുന്നത് പകർപ്പവകാശ ലംഘനമല്ലെന്ന് DOJ വാദിക്കുന്നു.
- നവീകരണത്തിന്റെ സംരക്ഷണം: എല്ലാ പരിശീലന ഡാറ്റയ്ക്കും ലൈസൻസ് ആവശ്യപ്പെടുന്നത് സർഗ്ഗാത്മകതയെ തടയുമെന്നും മനുഷ്യന്റെ ഉള്ളടക്ക നിർമ്മാണത്തിന് സഹായിക്കുന്ന LLM-കളുടെ വികസനത്തെ തടയുമെന്നും വകുപ്പ് മുന്നറിയിപ്പ് നൽകുന്നു.
- ഒരു നിയമപരമായ സൂചകമായി: ഈ ഇടപെടൽ DOJ-യും യുഎസ് കോപ്പിറൈറ്റ് ഓഫീസും തമ്മിലുള്ള വലിയൊരു തർക്കത്തിന് വഴിയൊരുക്കുന്നു, ഇത് ജനറേറ്റീവ് AI-യുടെ ഭാവിയിൽ നിർണ്ണായകമായ ഒരു കോടതി വിധിക്കായി വഴിയൊരുക്കും.
ARTICLE: യുഎസ് നീതിന്യായ വകുപ്പ് ന്യൂയോർക്ക് ടൈംസിൻ്റെ പകർപ്പവകാശ കേസിൽ ഒരു അമിക്സ് ബ്രീഫ് (amicus brief) സമർപ്പിച്ചു, ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (LLMs) പരിശീലിപ്പിക്കുന്നതിനായി സംരക്ഷിക്കപ്പെട്ട ടെക്സ്റ്റുകൾ പകർക്കുന്നത് ന്യായമായ ഉപയോഗമായി (fair use) കണക്കാക്കാമെന്ന് അവർ വാദിച്ചു. ഈ ഫയലിംഗ് OpenAI, Microsoft തുടങ്ങിയ കമ്പനികൾക്ക് ഒരു നിയമപരമായ കവചം നൽകുന്നു, ഇത് പത്രസ്ഥാപനം കോടിക്കണക്കിന് ഡോളർ നഷ്ടമുണ്ടാകുമെന്ന് കണക്കാക്കുന്ന നഷ്ടപരിഹാര തുകയിൽ നിന്ന് അവരെ ഒഴിവാക്കിയേക്കാം.
ഈ കേസ് ഇപ്പോൾ എന്തുകൊണ്ട് പ്രസക്തമാകുന്നു
AI ഡെവലപ്പർമാർ അനുമതിയില്ലാതെ ദശലക്ഷക്കണക്കിന് പത്രലേഖനങ്ങൾ അവരുടെ മോഡലുകളിലേക്ക് നൽകിയെന്നും, തുടർന്ന് ടൈംസിൻ്റെ സ്വന്തം റിപ്പോർട്ടിംഗുമായി നേരിട്ട് മത്സരിക്കുന്ന ഉൽപ്പന്നങ്ങൾ പുറത്തിറക്കിയെന്നും ഉള്ള പല ആരോപണങ്ങളും ഈ കേസ് സംയോജിപ്പിക്കുന്നു. കോടതി DOJ-യുടെ ന്യായമായ ഉപയോഗം (fair use) എന്ന വാദം നിരസിക്കുകയാണെങ്കിൽ, AI കമ്പനികൾക്ക് വൻതോതിലുള്ള ലൈസൻസിംഗ് ബില്ലുകൾ നേരിടേണ്ടി വരും അല്ലെങ്കിൽ അടുത്ത തലമുറ സംഭാഷണ ഏജന്റുകളുടെ (conversational agents) വികസനം നിർത്തിവെക്കാൻ നിർബന്ധിതരാകും.
DOJ-യുടെ പ്രധാന വാദം
ഈ രേഖ AI പ്രവർത്തനരീതിയെ രണ്ട് വ്യത്യസ്ത ഘട്ടങ്ങളായി തിരിക്കുന്നു. ഒന്നാമതായി, മോഡൽ വലിയ അളവിലുള്ള ടെക്സ്റ്റ് സമാഹാരങ്ങൾ സ്വീകരിക്കുന്നു; രണ്ടാമതായി, ഉപയോക്താക്കളുടെ പ്രോംപ്റ്റുകൾക്ക് മറുപടികൾ നൽകുന്നു. പകർപ്പവകാശമുള്ള ഒരു കൃതി പൊതുജനങ്ങൾക്ക് ലഭ്യമാകുന്ന രീതിയിൽ പുനർനിർമ്മിക്കപ്പെടുമ്പോൾ മാത്രമേ ലംഘനം സംഭവിക്കൂ എന്ന് വകുപ്പ് പറയുന്നു. പരിശീലനത്തിനായി ഉപയോഗിക്കുന്ന കോപ്പികൾ ഡെവലപ്പർമാരുടെ സെർവറുകളിൽ നിന്ന് പുറത്തേക്ക് പോകാത്തതിനാൽ, വിവരങ്ങൾ സ്വീകരിക്കുന്ന പ്രക്രിയ ആ പരിധിയിൽ വരുന്നില്ല.
ദീർഘകാലമായി നിലനിൽക്കുന്ന പകർപ്പവകാശ മാനദണ്ഡമായ “സാരമായ സാമ്യം” (substantial similarity) എന്ന പരിശോധനയെയും DOJ പിന്തുണയ്ക്കുന്നു. GPT-4 പോലുള്ള മോഡലുകൾ നൽകുന്ന ടെക്സ്റ്റ് ഔട്ട്പുട്ട്, ഏതെങ്കിലും ഒരു സ്രോതസ്സിൽ നിന്ന് "എപ്പോഴും അല്ലെങ്കിലും പലപ്പോഴും" തികച്ചും വ്യത്യസ്തമാണെന്നും അതിനാൽ ആവശ്യമായ സാമ്യം തെളിയിക്കാൻ ഒരു വാദിക്ക് കഴിയില്ലെന്നും ഇത് വാദിക്കുന്നു. ചുരുക്കത്തിൽ, നിയമപരമായ ശ്രദ്ധ ആന്തരിക പഠന പ്രക്രിയയിലല്ല, മറിച്ച് അന്തിമ ഔട്ട്പുട്ടിലായിരിക്കണം എന്ന് ഈ രേഖ വാദിക്കുന്നു.
ഈ പോയിന്റ് വിശദീകരിക്കാൻ ഒരു സാഹിത്യപരമായ ഉദാഹരണം
സാങ്കേതികമായ വാദം കൂടുതൽ ലളിതമായി മനസ്സിലാക്കാൻ, ഏണസ്റ്റ് ഹെമിംഗ്വേയുടെ ശൈലി പഠിക്കുന്നതിനായി അദ്ദേഹത്തിന്റെ കഥകൾ പകർത്തിയ ഒരു കൗമാരക്കാരിയായ എഴുത്തുകാരിയുടെ കഥ ഈ ഫയലിംഗിൽ ഉദ്ധരിക്കുന്നു. ആ പഠന പ്രക്രിയയെ പകർപ്പവകാശ ലംഘനമായി നിയമം കണക്കാക്കുകയാണെങ്കിൽ, ആ എഴുത്തുകാരിയുടെ കൃതികൾ ഒറിജിനൽ ആണെങ്കിൽ പോലും, അവ പ്രസിദ്ധീകരിക്കുമ്പോഴെല്ലാം അവരെതിരെ കേസ് ഫയൽ ചെയ്യാമെന്ന് DOJ പറയുന്നു. ഇതേ യുക്തി AI-യിലും പ്രയോഗിക്കുന്നത് "പകർപ്പവകാശ നിയമം സംരക്ഷിക്കാൻ രൂപകൽപ്പന ചെയ്തിട്ടുള്ള സർഗ്ഗാത്മകതയെ തന്നെ തളർത്തും" എന്ന് വകുപ്പ് മുന്നറിയിപ്പ് നൽകുന്നു.
AI ഡെവലപ്പർമാർക്കും ഉള്ളടക്ക സ്രഷ്ടാക്കൾക്കും നേരിടേണ്ടി വരുന്ന വെല്ലുവിളികൾ
- നവീകരണ ഭീഷണി (Innovation risk): പരിശീലനത്തിനായി ഉപയോഗിക്കുന്ന ഓരോ ടെക്സ്റ്റിനും ലൈസൻസ് ആവശ്യപ്പെടുന്നത് ചിലവ് അമിതമായി വർദ്ധിപ്പിക്കുകയും അത് അത്യാധുനിക മോഡലുകൾ നിർമ്മിക്കുന്നത് സാമ്പത്തികമായി അസാധ്യമാക്കുകയും ചെയ്തേക്കാം.
- സർഗ്ഗാത്മക പ്രവർത്തനരീതി (Creative workflow): എഴുത്തുകാർ ഡ്രാഫ്റ്റിംഗിനും എഡിറ്റിംഗിനും ബ്രെയിൻസ്റ്റോമിംഗിനുമായി LLM-കളെ കൂടുതൽ ആശ്രയിക്കുന്നുണ്ട്. പരിശീലന പ്രക്രിയ നിയമവിരുദ്ധമാണെന്ന് കണക്കാക്കിയാൽ, ആ ടൂളുകൾ ഇല്ലാതാകുകയും വ്യവസായങ്ങളിലുടനീളം ഉള്ളടക്കം നിർമ്മിക്കുന്ന രീതി മാറുകയും ചെയ്യും.
- വിപണിയിലെ സ്വാധീനം (Market impact): ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാനോ വാർത്താ രൂപത്തിലുള്ള ടെക്സ്റ്റ് നിർമ്മിക്കാനോ കഴിയുന്ന AI മോഡലുകൾ യഥാർത്ഥ റിപ്പോർട്ടിംഗിന്റെ മൂല്യം കുറയ്ക്കുമെന്നും, പരസ്യ വരുമാനത്തെയും സബ്സ്ക്രിപ്ഷനുകളെയും ബാധിക്കുമെന്നും പത്രവ്യവസായം വാദിക്കുന്നു.
കോപ്പിറൈറ്റ് ഓഫീസിന്റെ മറുവാദം
മുൻ രജിസ്റ്റർ ഷിറ പെർൽമട്ടറിന്റെ നേതൃത്വത്തിൽ തയ്യാറാക്കിയ യുഎസ് കോപ്പിറൈറ്റ് ഓഫീസിന്റെ സമീപകാല റിപ്പോർട്ട്, 'ഫെയർ-യൂസ്' (fair-use) എന്ന പൊതുവായ പ്രതിരോധത്തെ എതിർക്കുന്നു. AI-യെ മനുഷ്യന്റെ പഠനത്തിൽ നിന്ന് വേർതിരിക്കുന്ന മൂന്ന് ഘടകങ്ങൾ ഓഫീസ് ചൂണ്ടിക്കാട്ടി: പകർത്തിയ വിവരങ്ങളുടെ അമിതമായ അളവ്, അവ പ്രോസസ്സ് ചെയ്യുന്ന വേഗത, കൂടാതെ resulting models വാണിജ്യ ഉൽപ്പന്നങ്ങളായി വിൽക്കപ്പെടുകയും ഇത് സ്രോതസ്സ് സ്രഷ്ടികളുമായി നേരിട്ട് മത്സരിക്കുകയും ചെയ്യുന്നു എന്ന വസ്തുത.
ഈ പോയിന്റുകളെ DOJ തള്ളിക്കളയുന്നു. റിപ്പോർട്ടിന് നിയമപരമായ ബാധ്യതയില്ലെന്നും നിലവിലുള്ള നിയമങ്ങൾ ഫെയർ-യൂസിനെ ഓരോ വസ്തുതയ്ക്കും അനുസരിച്ച് വിശകലനം ചെയ്യാൻ ആവശ്യപ്പെടുന്നുണ്ടെന്നും വകുപ്പ് ചൂണ്ടിക്കാട്ടുന്നു. "വിപുലമായ ഉത്തരവാദിത്തം" (broad liability) അടിച്ചേൽപ്പിക്കുന്നത് വ്യവസായത്തെ ലൈസൻസിംഗ് രീതിയിലേക്ക് തള്ളിവിടുമെന്നും ഇത് "അത്യാധുനിക AI മോഡലുകളുടെ വികസനം നിയമപരമായും സാമ്പത്തികമായും അസാധ്യമാക്കും" എന്നും വകുപ്പ് മുന്നറിയിപ്പ് നൽകുന്നു.
ഇനി എന്ത് സംഭവിക്കാം
ടൈംസ് കേസ് കൈകാര്യം ചെയ്യുന്ന ഡിസ്ട്രിക്റ്റ് കോടതി, DOJ-യുടെ ഫെയർ-യൂസ് നിലപാടിനെയും കോപ്പിറൈറ്റ് ഓഫീസിന്റെ കണ്ടെത്തലുകളെയും താരതമ്യം ചെയ്യേണ്ടി വരും. DOJ-ക്ക് അനുകൂലമായ വിധി വന്നാൽ, മോഡലുകളുടെ ഔട്ട്പുട്ട് സാരമായ സാമ്യമില്ലാത്ത രീതിയിലാണെങ്കിൽ, വ്യക്തമായ അനുമതിയില്ലാതെ പരിശീലന ഡാറ്റ ശേഖരിക്കാമെന്നതിന് ഒരു മുൻ മാതൃകയാകും. പത്രവ്യവസായത്തിന് അനുകൂലമായ തീരുമാനം ലൈസൻസിംഗ് ചർച്ചകളുടെ ഒരു പരമ്പരയ്ക്ക് കാരണമായേക്കാം, ഇത് AI ഗവേഷണത്തിന്റെ സാമ്പത്തിക ഘടനയെ തന്നെ മാറ്റിമറിച്ചേക്കാം.
ചുരുക്കത്തിൽ
AI പരിശീലനം 'ഫെയർ-യൂസ്' ആണോ എന്ന ചോദ്യത്തെ ഒരു വലിയ കോടതി പോരാട്ടമാക്കി മാറ്റുകയാണ് DOJ-യുടെ ഫയലിംഗ്. നിലവിലുള്ള ടെക്സ്റ്റുകൾ ഉപയോഗിച്ച് ശക്തമായ ലാംഗ്വേജ് മോഡലുകൾ നിർമ്മിക്കുന്നത് തുടരാനാകുമോ അതോ ഓരോ വിവരത്തിനും വലിയ തുക നൽകി ലൈസൻസ് എടുക്കണോ എന്നത് ഇതിന്റെ ഫലം തീരുമാനിക്കും. ഈ തീരുമാനം ടെക് മേഖലയെയും മാധ്യമ വ്യവസായത്തെയും വിശാലമായ സർഗ്ഗാത്മക സമ്പദ്വ്യവസ്ഥയെയും ഒരുപോലെ സ്വാധീനിക്കും.
