സർഗ്ഗാത്മക സമൂഹം തങ്ങളുടെ ജീവിതകാലത്തെ അധ്വാനം വൻതോതിലുള്ള പരിശീലന ഡാറ്റാസെറ്റുകളിലേക്ക് (training datasets) മാറ്റപ്പെടുന്നത് വെറുതെ നോക്കിനിൽക്കുന്നില്ല. പ്രശസ്തരായ എഴുത്തുകാർ മുതൽ ഡിജിറ്റൽ ഇല്ലസ്ട്രേറ്റർമാർ വരെ, ബൗദ്ധിക സ്വത്തവകാശങ്ങൾ (intellectual property) അനുമതിയില്ലാതെ ശേഖരിക്കുന്നതിനെ ന്യായീകരിക്കാൻ AI ഭീമന്മാർ ഉപയോഗിക്കുന്ന "fair use" പ്രതിരോധത്തെ ചോദ്യം ചെയ്തുകൊണ്ട് നിയമനടപടികളുടെ ഒരു വലിയ തരംഗം വളർന്നുവരുന്നു.
അനുമതിയില്ലാത്ത പരിശീലന ഡാറ്റാസെറ്റുകളുടെ കണ്ടെത്തൽ
ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (large language models) പരിശീലിപ്പിക്കാൻ ഉപയോഗിച്ച കൃതികളെക്കുറിച്ചുള്ള വിവരങ്ങൾ അടങ്ങിയ ഒരു സെർച്ച് ചെയ്യാവുന്ന ഡാറ്റാസെറ്റ് The Atlantic പ്രസിദ്ധീകരിച്ചതിനെത്തുടർന്ന്, സ്രഷ്ടാക്കളും AI ഡെവലപ്പർമാരും തമ്മിലുള്ള സംഘർഷം അതിന്റെ പരമാവധിയിൽ എത്തി. The Feather Thief, The Fishermen and the Dragon തുടങ്ങിയ ആഴത്തിലുള്ള ഗവേഷണത്തിലൂടെ തയ്യാറാക്കിയ നോൺ-ഫിക്ഷൻ കൃതികൾക്ക് പേരുകേട്ട കിർക്ക് വാലസ് ജോൺസനെപ്പോലുള്ള എഴുത്തുകാരെ സംബന്ധിച്ചിടത്തോളം, ഈ കണ്ടെത്തൽ വ്യക്തിപരവും ആഴത്തിലുള്ളതുമായിരുന്നു. വർഷങ്ങളായുള്ള കഠിനമായ അന്വേഷണത്തിലൂടെയും എഴുത്തിലൂടെയും തയ്യാറാക്കിയ തന്റെ കൃതികൾ, അനുമതിയോ പ്രതിഫലമോ ഇല്ലാതെ ചാറ്റ്ബോട്ടുകളിലേക്ക് കടത്തിവിട്ടിരിക്കുകയാണെന്ന് ജോൺസൺ കണ്ടെത്തി.
ഈ പ്രതിഭാസം ഒറ്റപ്പെട്ട ഒരു സംഭവമല്ല, മറിച്ച് ഒരു വ്യവസ്ഥാപിത രീതിയാണ്. വർഷങ്ങളായുള്ള അധ്വാനത്തിന്റെ ഫലമായ തങ്ങളുടെ ഉടമസ്ഥതയിലുള്ള കൃതികൾ, "അതിസമ്പന്നരായ" കോർപ്പറേഷനുകൾ കെട്ടിപ്പടുക്കാൻ ഉപയോഗിക്കപ്പെടുന്നുണ്ടെന്ന് സർഗ്ഗാത്മക പ്രൊഫഷണലുകൾ തിരിച്ചറിയുന്നു. ഇത് വെറുമൊരു ആശങ്കയിൽ നിന്ന് സജീവമായ നിയമനടപടികളിലേക്കുള്ള മാറ്റത്തിന് കാരണമായിട്ടുണ്ട്; കലാകാരന്മാർ തങ്ങളുടെ ബൗദ്ധിക സ്വത്തവകാശത്തിന്മേൽ നിയന്ത്രണം തിരിച്ചുപിടിക്കാൻ ശ്രമിക്കുകയാണ്.
തന്ത്രപരമായ നിയമനടപടികൾ: ടെക് ഭീമന്മാരെ ലക്ഷ്യമിട്ട്
ജനറേറ്റീവ് AI മോഡലുകൾ നിർമ്മിക്കുന്ന രീതിയുടെ അടിസ്ഥാനപരമായ ഘടകങ്ങളെ ലക്ഷ്യമിട്ടുള്ളതാണ് ഈ നിയമപോരാട്ടം. കലാകാരന്മാർ കേവലം പകർപ്പവകാശ ലംഘന അവകാശവാദങ്ങളിൽ മാത്രം ഒതുങ്ങുന്നില്ല; കമ്പനികളെ ഉത്തരവാദിത്തമുള്ളവരാക്കാൻ 'terms of service' ലംഘനങ്ങൾ പോലുള്ള വഴികളും അവർ പരിശോധിക്കുന്നുണ്ട്.
ഉയർന്ന പ്രൊഫൈലുകളുള്ള നിയമപോരാട്ടങ്ങൾ ഇതിനകം തന്നെ ആരംഭിച്ചിട്ടുണ്ട്. പല സ്രഷ്ടാക്കളും Susman Godfrey പോലുള്ള പ്രത്യേക നിയമസംഘങ്ങളുമായി കൈകോർത്തു കഴിഞ്ഞു. അവർ നിലവിൽ വിവിധ എഴുത്തുകാർക്ക് വേണ്ടി Anthropic-നെതിരെ സുപ്രധാനമായ ഒരു കേസ് നയിക്കുന്നുണ്ട്. ഈ പ്രസ്ഥാനത്തിലെ മറ്റ് മുൻനിരക്കാരിൽ ഇല്ലസ്ട്രേറ്ററും കാർട്ടൂണിസ്റ്റുമായ സാറ ആൻഡേഴ്സൺ ഉൾപ്പെടുന്നു; AI ഭീമന്മാരെ നേരിട്ട് ചോദ്യം ചെയ്ത ആദ്യ വ്യക്തികളിൽ ഒരാളാണവർ. പ്രതിഫലം നൽകാതെയുള്ള ഡാറ്റാ സ്ക്രാപ്പിംഗിനെ (data scraping) ആശ്രയിക്കുന്ന വ്യവസായ രീതിയെ തകർക്കാനും, പരിശീലന ഡാറ്റാസെറ്റുകൾ എങ്ങനെ തയ്യാറാക്കണം എന്നതിന് പുതിയ മാനദണ്ഡങ്ങൾ കൊണ്ടുവരാനും ഈ കേസുകൾ ലക്ഷ്യമിടുന്നു.
"Fair Use" പോരാട്ടഭൂമി
ഈ കോടതികളിൽ നിലനിൽക്കുന്ന പ്രധാന സംഘർഷം "fair use" എന്നതിന്റെ നിയമപരമായ നിർവചനത്തിലാണ്. നിലവിലുള്ള ഡാറ്റ ഉപയോഗിച്ച് ഒരു മോഡലിനെ പരിശീലിപ്പിക്കുന്നത് പരിവർത്തനപരമായ (transformative) പ്രക്രിയയാണെന്നും അത് നിയമപരമായ സംരക്ഷണത്തിന് കീഴിലാണെന്നും AI കമ്പനികൾ വാദിക്കുന്നു. എന്നാൽ, ഒരു AI-ക്ക് ഒരു കലാകാരന്റെ പ്രത്യേക ശൈലിയോ ഒരു എഴുത്തുകാരന്റെ സവിശേഷമായ ശബ്ദമോ അനുകരിക്കാൻ കഴിയുമെങ്കിൽ, അത് പരിവർത്തനപരമായ ഒന്നല്ലാതാകുമെന്നും യഥാർത്ഥ കൃതിയുടെ മൂല്യം കുറയ്ക്കുന്ന നേരിട്ടുള്ള വിപണി പകരക്കാരനാകുമെന്നും സ്രഷ്ടാക്കൾ വാദിക്കുന്നു.
ഈ കേസുകൾ പുരോഗമിക്കുമ്പോൾ, അവ AI മേഖലയുടെ ഭാവി നിർണ്ണയിക്കും. നിലവിലെ "AI slop"—അതായത് ഗുണനിലവാരമില്ലാത്തതും മറ്റുള്ളവയിൽ നിന്ന് പകർത്തിയെടുത്തതുമായ ഉള്ളടക്കങ്ങളുടെ വൻതോതിലുള്ള ഉൽപ്പാദനം—നിയമപരമായി നിലനിൽക്കുമോ, അതോ വിവരസാമ്പത്തിക വ്യവസ്ഥയുടെ കേന്ദ്രമായ മനുഷ്യസ്രഷ്ടാക്കളെ സംരക്ഷിക്കുന്നതിനായി ലൈസൻസുള്ളതും ധാർമ്മികവുമായ ഡാറ്റാ ശേഖരണത്തിന്റെ ഒരു പുതിയ യുഗം വരണമോ എന്നത് ഈ കേസുകളുടെ ഫലം തീരുമാനിക്കും.
പ്രധാന കാര്യങ്ങൾ
- വ്യവസ്ഥാപിത ഡാറ്റാ സ്ക്രാപ്പിംഗ്: പ്രധാന AI മോഡലുകൾ, സ്രഷ്ടാക്കളുടെ അനുമതിയില്ലാതെ ആഴത്തിലുള്ള ഗവേഷണത്തിലൂടെ തയ്യാറാക്കിയ പുസ്തകങ്ങളും ഉടമസ്ഥതയിലുള്ള കലാസൃഷ്ടികളും അടങ്ങിയ പകർപ്പവകാശ ലംഘനം നടന്ന ഡാറ്റാസെറ്റുകൾ ഉപയോഗിക്കുന്നതായി കണ്ടെത്തിയിട്ടുണ്ട്.
- വൈവിധ്യമാർന്ന നിയമ തന്ത്രങ്ങൾ: പകർപ്പവകാശ ലംഘനം, terms of service ലംഘനം, "fair use" സിദ്ധാന്തത്തോടുള്ള വെല്ലുവിളികൾ എന്നിവയിലൂടെ നിയമനടപടികൾ AI കമ്പനികളെ ലക്ഷ്യമിടുന്നു.
- IP-യുടെ നിർണ്ണായക നിമിഷം: Anthropic പോലുള്ള കമ്പനികൾക്കെതിരെയുള്ള നിലവിലെ കേസുകളുടെ ഫലം, ജനറേറ്റീവ് AI യുഗത്തിൽ ബൗദ്ധിക സ്വത്തവകാശത്തിന് (IP) എത്രത്തോളം മൂല്യം നൽകണം എന്നതിനെക്കുറിച്ചുള്ള നിയമപരമായ മാതൃക നിശ്ചയിക്കും.
വിവാദം എങ്ങനെ പൊട്ടിപ്പുറപ്പെട്ടു
ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ പരിശീലിപ്പിക്കാൻ ഉപയോഗിച്ച പുസ്തകങ്ങൾ, ലേഖനങ്ങൾ, കലാസൃഷ്ടികൾ എന്നിവയുടെ സെർച്ച് ചെയ്യാവുന്ന ഒരു പട്ടിക ഒരു പ്രമുഖ മാഗസിൻ പ്രസിദ്ധീകരിച്ചതോടെയാണ് ഇതിന് തുടക്കമായത്. വർഷങ്ങളായുള്ള ഗവേഷണത്തിനും യാത്രകൾക്കും ശേഷം തയ്യാറാക്കിയ നോൺ-ഫിക്ഷൻ പുസ്തകങ്ങളുള്ള എഴുത്തുകാരനായ കിർക്ക് വാലസ് ജോൺസനെ സംബന്ധിച്ചിടത്തോളം, ഈ വെളിപ്പെടുത്തൽ വ്യക്തിപരമായിരുന്നു. താൻ ഒരു പതിറ്റാണ്ട് കൊണ്ട് പരിഷ്കരിച്ച വാക്കുകൾ, യാതൊരു റോയൽറ്റിയോ അംഗീകാരമോ ഇല്ലാതെ തന്റെ ശൈലി അതേപടി പുനർനിർമ്മിക്കാൻ കഴിയുന്ന ചാറ്റ്ബോട്ടുകളുടെ ഡാറ്റയുടെ ഭാഗമാണെന്ന് അദ്ദേഹം കണ്ടെത്തി.
ജോൺസന്റെ അനുഭവം ഒറ്റപ്പെട്ട ഒരു സംഭവമല്ല. സാഹിത്യം, ഇല്ലസ്ട്രേഷൻ, സംഗീതം, സിനിമ എന്നീ മേഖലകളിലെ സ്രഷ്ടാക്കൾ തങ്ങളുടെ പകർപ്പവകാശമുള്ള സൃഷ്ടികൾ വൻതോതിൽ ശേഖരിക്കപ്പെടുകയാണെന്ന് റിപ്പോർട്ട് ചെയ്യുന്നു. വ്യവസായ വിദഗ്ധർ "pirated datasets"-ന്റെ വ്യവസ്ഥാപിതമായ വേർതിരിച്ചെടുക്കൽ എന്ന് വിശേഷിപ്പിക്കുന്ന ഈ രീതി, ആശങ്കയെ ഏകോപിത നിയമനടപടികളാക്കി മാറ്റിയിരിക്കുന്നു. തങ്ങൾ സൃഷ്ടിക്കുന്ന മൂല്യം, സ്രഷ്ടാക്കൾക്ക് ഒന്നും ലഭിക്കാതെ, അവരുടെ അധ്വാനത്തിൽ നിന്ന് ലാഭമുണ്ടാക്കുന്ന ടെക് കോർപ്പറേറ്റുകളിലേക്ക് ഒഴുകുകയാണെന്ന് കലാകാരന്മാർ ഇപ്പോൾ വാദിക്കുന്നു.
പോരാട്ടത്തിന്റെ ഗതി നിർണ്ണയിക്കുന്ന നിയമനടപടികൾ
ജനറേറ്റീവ് AI മോഡലുകൾ നിർമ്മിക്കുന്ന രീതിയുടെ അടിസ്ഥാനപരമായ കാര്യങ്ങളെയാണ് ഈ നിയമപരമായ നീക്കങ്ങൾ ലക്ഷ്യം വെക്കുന്നത്. പകർപ്പവകാശ ലംഘനം മാത്രമല്ല, പ്ലാറ്റ്ഫോമുകളുടെ സ്വന്തം സേവന നിബന്ധനകളുടെ (terms of service) ലംഘനം കൂടിയായതിനാലാണ് വാദികൾ പരാതികൾ സമർപ്പിക്കുന്നത്. ഇന്റർനെറ്റ് സംസ്കാരത്തിന്റെ ഭാഗമായി മാറിയ ഇലസ്ട്രേറ്ററും കാർട്ടൂണിസ്റ്ററുമായ സാറ ആൻഡേഴ്സൺ, ഒരു AI കമ്പനിക്കെതിരെ നേരിട്ട് നിയമനടപടി സ്വീകരിച്ച ആദ്യകാല വിഷ്വൽ ആർട്ടിസ്റ്റുകളിൽ ഒരാളാണ്. തന്റെ സവിശേഷമായ വരകളും ഹാസ്യവും അനുകരിക്കാനുള്ള മോഡലിന്റെ കഴിവ് തന്റെ ഒറിജിനൽ കോമിക്സുകളുടെ വിപണിയെ തകർക്കുന്നുവെന്നും, ഇത് തന്റെ ബ്രാൻഡിനെ എല്ലാവർക്കും സൗജന്യമായി ഉപയോഗിക്കാവുന്ന ഒരു വിഭവമാക്കി മാറ്റുന്നുവെന്നും അവരുടെ പരാതിയിൽ പറയുന്നു.
ബൗദ്ധിക സ്വത്തവകാശ തർക്കങ്ങളിൽ (intellectual-property disputes) വൈദഗ്ധ്യമുള്ളവരും ടെക് ഭീമന്മാരെ വെല്ലുവിളിച്ച പരിചയസമ്പന്നരുമായ അഭിഭാഷകരാണ് ഈ കേസുകൾ കൈകാര്യം ചെയ്യുന്നത്. ഉപയോഗിച്ച കൃത്യമായ ഡാറ്റാസെറ്റുകൾ പുറത്തുകൊണ്ടുവരാൻ നിർബന്ധിക്കുക, തർക്കവിഷയമായ വിവരങ്ങൾ ഉപയോഗിക്കുന്നത് നിർത്തലാക്കാൻ കമ്പനികളെ പ്രേരിപ്പിക്കുക, മോഷ്ടിക്കപ്പെട്ട ഉള്ളടക്കത്തിന്റെ വാണിജ്യ മൂല്യം കണക്കിലെടുത്ത് നഷ്ടപരിഹാരം ആവശ്യപ്പെടുക എന്നിവയാണ് ഇവരുടെ തന്ത്രം.
"ഫെയർ യൂസ്" (fair use) വാദങ്ങൾ വെല്ലുവിളിക്കപ്പെടുന്നു
പരസ്യമായി ലഭ്യമായ ഡാറ്റ ഉപയോഗിച്ച് ഒരു മോഡലിനെ പരിശീലിപ്പിക്കുന്നത് നിയമം സംരക്ഷിക്കുന്ന ഒരു 'ട്രാൻസ്ഫോർമേറ്റീവ് യൂസ്' (transformative use) ആണെന്ന് AI ഡെവലപ്പർമാർ വാദിക്കുന്നു. മോഡൽ ഒരു കൃതിയും അതേപടി പകർത്തിവെക്കുന്നില്ലെന്നും, പകരം പുതിയ ടെക്സ്റ്റോ ചിത്രങ്ങളോ നിർമ്മിക്കാൻ സഹായിക്കുന്ന പാറ്റേണുകൾ പഠിക്കുകയാണെന്നും അവർ വാദിക്കുന്നു. ആ കാഴ്ചപ്പാടിൽ, ഈ പ്രക്രിയ ഒരു ഗവേഷകൻ അറിവ് നേടുന്നതിനായി നിരവധി പുസ്തകങ്ങൾ വായിക്കുന്നതിന് സമാനമാണ്, അല്ലാതെ അവ പകർത്തിയെടുക്കുന്നതിന് അല്ല.
എന്നാൽ, ഒരു എഴുത്തുകാരന്റെ ശൈലിയോ ഒരു കലാകാരന്റെ രീതിയോ കൃത്യമായി അനുകരിക്കുന്ന രീതിയിൽ ഔട്ട്പുട്ട് ലഭിക്കുമ്പോൾ, 'ട്രാൻസ്ഫോർമേഷൻ' എന്നത് വെറുമൊരു ഒഴികഴിവ് മാത്രമാണെന്ന് സ്രഷ്ടാക്കൾ തിരിച്ചടിക്കുന്നു. ഒരു നോവലിസ്റ്റിന്റെ പ്രത്യേക ശൈലിയിലും രീതിയിലും ഒരു ചാറ്റ്ബോട്ട് മറുപടി നൽകുകയോ, അല്ലെങ്കിൽ ഒരു ഇമേജ് ജനറേറ്റർ ഒരു ഇലസ്ട്രേറ്ററുടെ സൃഷ്ടികളിൽ നിന്ന് തിരിച്ചറിയാൻ കഴിയാത്ത വിധം ചിത്രങ്ങൾ നിർമ്മിക്കുകയോ ചെയ്യുമ്പോൾ, അത് വിപണിയിലെ യഥാർത്ഥ സൃഷ്ടികൾക്ക് പകരമായി മാറുന്നു. ഈ പകരക്കാരൻ നിലനിൽക്കുന്നത് പുസ്തകങ്ങൾ വിൽക്കുന്നതിനും കമ്മീഷനുകൾക്കും ലൈസൻസിംഗ് കരാറുകൾക്കും തടസ്സമാകുന്നുവെന്നും, വാണിജ്യപരമായ ആഘാതം കണക്കിലെടുക്കുമ്പോൾ "ഫെയർ യൂസ്" എന്ന പ്രതിരോധം നിലനിൽക്കില്ലെന്നും വാദികൾ പറയുന്നു.
എന്താണ് ഇതിൽ പണയമായിരിക്കുന്നത്
AI കമ്പനികൾ നേരിടുന്ന സാമ്പത്തിക സമ്മർദ്ദം – വൻതോതിലുള്ള ഡാറ്റാ സ്ക്രാപ്പിംഗ് (scraping) പകർപ്പവകാശ ലംഘനമാണെന്ന് കോടതികൾ വിധിക്കുകയാണെങ്കിൽ, കമ്പനികൾക്ക് വലിയ സാമ്പത്തിക പ്രത്യാഘാതങ്ങൾ നേരിടേണ്ടി വരും. ഇത് അവരുടെ ഡാറ്റാ പൈപ്പ്ലൈനുകളിൽ മാറ്റം വരുത്താൻ പ്രേരിപ്പിച്ചേക്കാം.
കോടതി രേഖകളും വിവരശേഖരണവും (discovery) – വരാനിരിക്കുന്ന രേഖകൾ ഏതെല്ലാം കൃതികളും ചിത്രങ്ങളുമാണ് ഉപയോഗിച്ചതെന്ന് കൃത്യമായി വെളിപ്പെടുത്തും, ഇത് ഡാറ്റാ ശേഖരണത്തിന്റെ വ്യാപ്തിയെക്കുറിച്ച് വ്യക്തമായ ചിത്രം നൽകും.
