പ്രധാന പകർപ്പവകാശ വിചാരണയിൽ തെളിവുകൾ ഒളിപ്പിച്ചു വെച്ചുവെന്ന് NYT OpenAI-ക്കെതിരെ ആരോപിക്കുന്നു
The New York Times-ഉം OpenAI-യും തമ്മിലുള്ള നിയമപോരാട്ടം നാടകീയമായ ഒരു വഴിത്തിരിവിൽ എത്തിയിരിക്കുന്നു. തങ്ങളുടെ ട്രെയിനിംഗ് ഡാറ്റാസെറ്റുകളെ സംബന്ധിച്ച തെളിവുകൾ AI ഭീമനായ OpenAI മനഃപൂർവ്വം മറച്ചുവെച്ചു എന്ന ആരോപണമാണ് ഇപ്പോൾ ഉയർന്നിരിക്കുന്നത്. ഈ സംഭവവികാസം, നിയമനടപടികളുടെ ശ്രദ്ധ പകർപ്പവകാശ ലംഘനത്തിൽ നിന്ന് നീതിന്യായ വ്യവസ്ഥയിലെ തെളിവ് ശേഖരണ പ്രക്രിയയുടെ (discovery process) വിശ്വാസ്യതയിലേക്കും മാറ്റാൻ ഇടയാക്കിയേക്കാം.
തെറ്റിദ്ധരിപ്പിക്കുന്ന ഡാറ്റാ രീതികളെക്കുറിച്ചുള്ള ആരോപണങ്ങൾ
തങ്ങളുടെ ട്രെയിനിംഗ് കോർപ്പസും (training corpus) ഉപഭോക്താക്കളുടെ ചാറ്റ് ലോഗുകളും തിരയാനുള്ള സാങ്കേതിക ശേഷിയെക്കുറിച്ച് OpenAI കള്ളം പറഞ്ഞുവെന്ന് The New York Times-ഉം The Daily News-ഉം അവകാശപ്പെടുന്നു. തങ്ങളുടെ കൂറ്റൻ ഡാറ്റാസെറ്റുകൾ തിരയുന്നത് സാങ്കേതികമായി പ്രയാസകരമാണെന്നും ഉപഭോക്താക്കളുടെ സ്വകാര്യതയെ ബാധിക്കുമെന്നും രണ്ട് വർഷമായി നീണ്ടുനിൽക്കുന്ന ഈ നിയമപോരാട്ടത്തിനിടയിൽ OpenAI വാദിച്ചു വരുന്നു.
എന്നാൽ, OpenAI ഡാറ്റ പ്രൈവസി എഞ്ചിനീയറായ വിന്നി മോണാക്കോയുടെ (Vinnie Monaco) സമീപകാല മൊഴിയുടെ (deposition) അടിസ്ഥാനത്തിൽ ഈ വാദങ്ങൾ ചോദ്യം ചെയ്യപ്പെട്ടിരിക്കുന്നു. പകർപ്പവകാശമുള്ള പത്രപ്രവർത്തന കൃതികൾ തിരിച്ചറിയുന്നതിനായി OpenAI ഇതിനകം തന്നെ തങ്ങളുടെ ട്രെയിനിംഗ് കോർപ്പസിൽ ആഭ്യന്തര പരിശോധനകൾ നടത്തിയിട്ടുണ്ടെന്ന് മോണാക്കോ വെളിപ്പെടുത്തിയതായി പറയപ്പെടുന്നു. കൂടാതെ, പകർപ്പവകാശ ലംഘനത്തിന്റെ വ്യാപ്തി ആഭ്യന്തരമായി വിലയിരുത്തുന്നതിനായി ഏകദേശം 78 ദശലക്ഷം പേരെ തിരിച്ചറിയാൻ കഴിയാത്ത രീതിയിലുള്ള (de-identified) ChatGPT സംഭാഷണങ്ങളുടെ ഒരു ഡാറ്റാബേസ് OpenAI തയ്യാറാക്കിയിട്ടുണ്ടെന്നും മൊഴി സൂചിപ്പിക്കുന്നു.
Project Giraffe-ഉം "Bloom" ഫിൽറ്ററും
ഒരുപക്ഷേ ഏറ്റവും പ്രധാനപ്പെട്ട സാങ്കേതിക വെളിപ്പെടുത്തൽ OpenAI നടപ്പിലാക്കിയ "Project Giraffe" എന്ന ടൂൾസെറ്റിനെക്കുറിച്ചുള്ളതാണ്. ഹർജിക്കാർ പറയുന്നത് അനുസരിച്ച്, കേസ് ഫയൽ ചെയ്തതിന് തൊട്ടുപിന്നാലെ, മോഡൽ പകർപ്പവകാശമുള്ള ഉള്ളടക്കം അതേപടി (verbatim) പുറത്തുവിടുന്ന "regurgitation" എന്ന പ്രതിഭാസം കണ്ടെത്താനും രേഖപ്പെടുത്താനും OpenAI ഈ പ്രോജക്റ്റിന്റെ ഭാഗമായി ഒരു "Bloom" ഫിൽറ്റർ ഉപയോഗിച്ചിരുന്നു.
ലോഗുകൾക്കുള്ളിൽ ഉള്ളടക്കം പുനരുൽപ്പാദിപ്പിക്കുന്ന പ്രത്യേക സന്ദർഭങ്ങൾ കണ്ടെത്തുന്നത് അസാധ്യമായ ഒരു ജോലിയാണെന്ന OpenAI-യുടെ മുൻപത്തെ നിലപാടിന് Project Giraffe-ന്റെ സാന്നിധ്യം വിരുദ്ധമാണ്. പകർപ്പവകാശ ലംഘനങ്ങൾ നിരീക്ഷിക്കാൻ OpenAI-ക്ക് സാധിക്കുമെന്ന് മാത്രമല്ല, അവ ട്രാക്ക് ചെയ്യുന്നതിനായി സജീവമായി അടിസ്ഥാന സൗകര്യങ്ങൾ ഒരുക്കുകയായിരുന്നുവെന്നും ഈ ടൂളുകൾ തെളിയിക്കുന്നുണ്ടെന്ന് ഹർജിക്കാർ വാദിക്കുന്നു.
ഡാറ്റാ വിശ്വാസ്യതയെയും തെളിവ് ശേഖരണത്തെയും കുറിച്ചുള്ള തർക്കങ്ങൾ
കോടതിക്ക് നൽകിയ ഡാറ്റയുടെ ഗുണനിലവാരവും തർക്കവിഷയമായിട്ടുണ്ട്. ഹർജിക്കാർ ആദ്യം 120 ദശലക്ഷം ചാറ്റ് ലോഗുകളുടെ സാമ്പിൾ ആവശ്യപ്പെട്ടെങ്കിലും, OpenAI അത് 20 ദശലക്ഷമായി കുറച്ചു. ഡിസംബറിൽ സാമ്പിൾ സമർപ്പിച്ചപ്പോൾ, അമിതമായ വിവരങ്ങൾ മറച്ചുവെച്ചതിനാൽ (redactions) അത് ഉപയോഗശൂന്യമാണെന്ന് കോടതി കണ്ടെത്തിയതായി റിപ്പോർട്ടുകൾ പറയുന്നു.
കോടതി ഉത്തരവിൻ്റെ ലംഘനത്തിലൂടെ കോടിക്കണക്കിന് ChatGPT ഔട്ട്പുട്ടുകൾ OpenAI നീക്കം ചെയ്തതായും നൽകിയ സാമ്പിളിൽ ദശലക്ഷക്കണക്കിന് ലോഗുകൾ മാറ്റിസ്ഥാപിച്ചതായും NYT ആരോപിക്കുന്നു. ഇതിന് മറുപടിയായി, OpenAI വക്താവ് ഡ്രൂ പുസറ്റേരി (Drew Pusateri) എല്ലാ ആരോപണങ്ങളും നിഷേധിച്ചു. തങ്ങളുടെ നിയമപോരാട്ടം ദുർബലമാകുമ്പോൾ ഉപഭോക്താക്കളുടെ സ്വകാര്യതയിലേക്ക് കടന്നുകയറാൻ Times ശ്രമിക്കുകയാണെന്ന് അദ്ദേഹം കുറ്റപ്പെടുത്തി.
എന്തുകൊണ്ടാണ് ഇത് AI വ്യവസായത്തിന് പ്രധാനമാകുന്നത്?
ജനറേറ്റീവ് AI വികസനത്തിൻ്റെ ഭാവിയിലേക്കും "fair use" എന്നതിൻ്റെ നിയമപരമായ അതിർവരമ്പുകളിലേക്കും നോക്കിക്കാണാവുന്ന ഒരു സൂചകമാണ് ഈ കേസ്. തെളിവുകൾ ഒളിപ്പിച്ചുവെച്ചുവെന്നോ തെളിവ് ശേഖരണ പ്രക്രിയയിൽ കൃത്രിമം കാണിച്ചുവെന്നോ കോടതി കണ്ടെത്തിയാൽ, AI കമ്പനികൾ തങ്ങളുടെ ട്രെയിനിംഗ് രീതികളും ഡാറ്റയുടെ ഉറവിടവും (data lineage) എങ്ങനെ വെളിപ്പെടുത്തണം എന്നതിന് ഇത് ഒരു മാതൃകയാകും. ഡെവലപ്പർമാർക്കും AI സ്ഥാപകർക്കും, വൻതോതിലുള്ള ഡാറ്റ ഉപയോഗിക്കുന്നതും ബൗദ്ധിക സ്വത്തവകാശവും (intellectual property rights) തമ്മിലുള്ള സങ്കീർണ്ണമായ ഇടങ്ങളിൽ എത്രത്തോളം സുതാര്യത ആവശ്യമാണെന്ന് ഈ വിധി വ്യക്തമാക്കും.
പ്രധാന കാര്യങ്ങൾ
- ആഭ്യന്തര നിരീക്ഷണ ടൂളുകൾ: പകർപ്പവകാശമുള്ള ഉള്ളടക്കം വീണ്ടും ഉപയോഗിക്കുന്നത് (regurgitation) സജീവമായി ട്രാക്ക് ചെയ്യാൻ OpenAI "Project Giraffe"-ഉം "Bloom" ഫിൽറ്ററും ഉപയോഗിച്ചതായി ആരോപണങ്ങൾ സൂചിപ്പിക്കുന്നു.
- വൈരുദ്ധ്യമുള്ള മൊഴികൾ: തങ്ങളുടെ ട്രെയിനിംഗ് ഡാറ്റ തിരയാനുള്ള സാങ്കേതിക ശേഷി OpenAI-ക്ക് ഉണ്ടായിരുന്നുവെന്ന് മൊഴിയിലെ തെളിവുകൾ സൂചിപ്പിക്കുന്നു, ഇത് സാങ്കേതികമായ പ്രയാസങ്ങൾ ഉണ്ടെന്ന അവരുടെ മുൻപത്തെ വാദങ്ങളെ തള്ളിക്കളയുന്നു.
- തെളിവ് ശേഖരണത്തിൻ്റെ വിശ്വാസ്യത: ഔട്ട്പുട്ടുകൾ നീക്കം ചെയ്തതിലൂടെയും ഉപയോഗശൂന്യമായ ഡാറ്റാ സാമ്പിളുകൾ നൽകിയതിലൂടെയും OpenAI കോടതിയുടെ ഉത്തരവുകൾ ലംഘിച്ചോ എന്നതിനെ ആശ്രയിച്ചാണ് ഇപ്പോൾ ഈ കേസ് മുന്നോട്ട് പോകുന്നത്.
