NYT એ મોટા કોપીરાઈટ ટ્રાયલમાં OpenAI પર પુરાવા છુપાવવાનો આરોપ લગાવ્યો

The New York Times અને OpenAI વચ્ચે ચાલી રહેલી કાનૂની લડાઈએ એક નાટકીય વળાંક લીધો છે, જેમાં એવો આરોપ લગાવવામાં આવ્યો છે કે AI જાયન્ટ તેના ટ્રેનિંગ ડેટાસેટ્સ અંગેના પુરાવાઓ જાણીજોઈને છુપાવી રહ્યું છે. આ વધતી જતી તણાવની સ્થિતિ કાયદાકીય કાર્યવાહીનું ધ્યાન કોપીરાઈટ ઉલ્લંઘનથી હટાવીને ન્યાયિક ડિસ્કવરી પ્રક્રિયાની અખંડિતતા તરફ વાળવાનો ખતરો ઊભો કરે છે.

છેતરપિંડીભરી ડેટા પદ્ધતિઓના આરોપો

The New York Times અને The Daily News નો દાવો છે કે OpenAI તેના ટ્રેનિંગ કોર્પસ અને ગ્રાહકોના ચેટ લોગ્સ બંનેને સર્ચ કરવાની તેની ટેકનિકલ ક્ષમતા અંગે અસત્ય બોલી રહ્યું છે. બે વર્ષની કાનૂની લડાઈ દરમિયાન, OpenAI એ દલીલ કરી છે કે તેના વિશાળ ડેટાસેટ્સને સર્ચ કરવું ટેકનિકલ રીતે મુશ્કેલ રહેશે અને તેનાથી વપરાશકર્તાની ગોપનીયતા સાથે સમાધાન થશે.

જોકે, OpenAI ના ડેટા પ્રાઇવસી એન્જિનિયર Vinnie Monaco ના તાજેતરના ડિપોઝિશન (સોગંદનામું) એ આ વિધાનને પડકાર્યું છે. એવો આરોપ છે કે Monaco એ ખુલાસો કર્યો હતો કે OpenAI એ ખાસ કરીને કોપીરાઈટ ધરાવતા પત્રકારત્વના કાર્યોને ઓળખવા માટે તેના ટ્રેનિંગ કોર્પસમાં આંતરિક સર્ચ પહેલેથી જ કરી લીધું હતું. વધુમાં, ડિપોઝિશન સૂચવે છે કે OpenAI એ સંભવિત કોપીરાઈટ ઉલ્લંઘનની માત્રાનું આંતરિક રીતે મૂલ્યાંકન કરવા માટે અંદાજે 78 મિલિયન ડિ-આઇડેન્ટિફાઇડ (de-identified) ChatGPT સંવાદોનો ડેટાબેઝ એકત્રિત કર્યો હતો.

Project Giraffe અને "Bloom" ફિલ્ટર

કદાચ સૌથી મહત્વપૂર્ણ ટેકનિકલ ખુલાસો "Project Giraffe" સાથે સંબંધિત છે, જે OpenAI દ્વારા અમલમાં મૂકવામાં આવેલા સાધનોનો એક સેટ છે. વાદીઓના જણાવ્યા અનુસાર, દાવો દાખલ થયાના થોડા સમય બાદ જ, OpenAI એ "regurgitation" (જ્યારે મોડેલ તેના આઉટપુટમાં કોપીરાઈટ ધરાવતા કન્ટેન્ટને શબ્દશઃ ફરીથી રજૂ કરે છે) ના કિસ્સાઓને શોધવા અને નોંધવા માટે આ પ્રોજેક્ટના ભાગ રૂપે "Bloom" ફિલ્ટરનો ઉપયોગ કર્યો હતો.

Project Giraffe નું અસ્તિત્વ OpenAI ના અગાઉના વલણથી વિરુદ્ધ છે, જેમાં તેણે દલીલ કરી હતી કે તેના લોગ્સમાં કન્ટેન્ટ રિપ્રોડક્શનના ચોક્કસ કિસ્સાઓને ઓળખવા એ અશક્ય કાર્ય હતું. વાદીઓ દલીલ કરે છે કે આ સાધનો સાબિત કરે છે કે OpenAI માત્ર કોપીરાઈટ ઉલ્લંઘનની દેખરેખ રાખવા માટે સક્ષમ જ નહોતું, પરંતુ તેને ટ્રેક કરવા માટે સક્રિયપણે ઇન્ફ્રાસ્ટ્રક્ચર પણ બનાવી રહ્યું હતું.

ડેટાની અખંડિતતા અને ડિસ્કવરી અંગેના વિવાદો

આ સંઘર્ષ કોર્ટને પૂરા પાડવામાં આવેલા ડેટાની ગુણવત્તા પર પણ કેન્દ્રિત રહ્યો છે. જ્યારે વાદીઓએ મૂળરૂપે 120 મિલિયન ચેટ લોગ્સના નમૂનાની માંગ કરી હતી, ત્યારે OpenAI એ આ આંકડાને ઘટાડીને 20 મિલિયન કર્યો હતો. જ્યારે ડિસેમ્બરમાં આ નમૂનો અંતે સબમિટ કરવામાં આવ્યો, ત્યારે અહેવાલ મુજબ કોર્ટે અતિશય રિડેક્શન (redactions - માહિતી છુપાવવા માટે કાળા પટ્ટા કરવા) ને કારણે તેને "બિનઉપયોગી" ગણાવ્યો હતો.

NYT એ વધુમાં એવો આરોપ લગાવ્યો છે કે OpenAI એ કોર્ટના આદેશ મુજબના પ્રિઝર્વેશન ઓર્ડરનું ઉલ્લંઘન કરીને અબજો ChatGPT આઉટપુટ્સ ડિલીટ કરી દીધા છે અને આપેલા નમૂનામાં લાખો લોગ્સ બદલી નાખ્યા છે. તેના જવાબમાં, OpenAI ના પ્રવક્તા Drew Pusateri એ તમામ આરોપોનો ઇનકાર કર્યો છે અને દલીલ કરી છે કે જેમ જેમ તેમનો કાનૂની કેસ નબળો પડી રહ્યો છે તેમ તેમ Times વપરાશકર્તાની ગોપનીયતામાં દખલ કરવાનો પ્રયાસ કરી રહ્યું છે.

AI ઉદ્યોગ માટે આ શા માટે મહત્વનું છે

આ કેસ જનરેટિવ AI વિકાસ અને "fair use" (વાજબી ઉપયોગ) ની કાનૂની સીમાઓ માટે એક માપદંડ સમાન છે. જો કોર્ટ એવું માને કે OpenAI એ પુરાવા છુપાવ્યા છે અથવા ડિસ્કવરીમાં છેડછાડ કરી છે, તો તે AI કંપનીઓએ તેમની ટ્રેનિંગ પદ્ધતિઓ અને ડેટા લિનેજ (data lineage) જાહેર કરવા માટે કેવી રીતે જવાબદાર રહેશે તેનો એક ન્યાયિક દાખલો બની શકે છે. ડેવલપર્સ અને AI ફાઉન્ડર્સ માટે, આ પરિણામ વિશાળ ડેટા ઇન્જેશન અને બૌદ્ધિક સંપદા અધિકારોના સંગમ પર પાર પાડતી વખતે જરૂરી પારદર્શિતાના સ્તરને સ્પષ્ટ કરશે.

મુખ્ય મુદ્દાઓ

  • આંતરિક મોનિટરિંગ સાધનો: આરોપો સૂચવે છે કે OpenAI એ કોપીરાઈટ ધરાવતા કન્ટેન્ટના રિગર્જિટેશન (regurgitation) ને સક્રિયપણે ટ્રેક કરવા માટે "Project Giraffe" અને "Bloom" ફિલ્ટરનો ઉપયોગ કર્યો હતો.
  • વિરોધાભાસી જુબાની: ડિપોઝિશનના પુરાવા સૂચવે છે કે OpenAI પાસે તેના ટ્રેનિંગ ડેટાને સર્ચ કરવાની ટેકનિકલ ક્ષમતા હતી, જે તેના અગાઉના ટેકનિકલ મુશ્કેલીના દાવાઓથી વિરુદ્ધ છે.
  • ડિસ્કવરીની અખંડિતતા જોખમમાં: હવે આ કાનૂની લડાઈ એ વાત પર નિર્ભર છે કે શું OpenAI એ આઉટપુટ્સ ડિલીટ કરીને અને "બિનઉપયોગી" રિડેક્ટેડ ડેટા નમૂનાઓ આપીને પ્રિઝર્વેશન ઓર્ડરનું ઉલ્લંઘન કર્યું છે કે નહીં.