ప్రధాన కాపీరైట్ విచారణలో సాక్ష్యాలను దాచిపెట్టినట్లు OpenAIపై NYT ఆరోపణ
The New York Times మరియు OpenAI మధ్య జరుగుతున్న చట్టపరమైన పోరాటం ఒక నాటకీయ మలుపు తిరిగింది. తన శిక్షణ డేటాసెట్ల (training datasets) గురించి సాక్ష్యాలను AI దిగ్గజం కావాలనేగా దాచిపెట్టిందనే ఆరోపణలు వచ్చాయి. ఈ పరిణామం వల్ల, ఈ దావా దృష్టి కాపీరైట్ ఉల్లంఘన నుండి న్యాయపరమైన డిస్కవరీ ప్రక్రియ (judicial discovery process) యొక్క సమగ్రత వైపు మళ్లే ప్రమాదం ఉంది.
మోసపూరిత డేటా పద్ధతుల ఆరోపణలు
తన శిక్షణ కార్పస్ (training corpus) మరియు కస్టమర్ చాట్ లాగ్లు రెండింటినీ వెతికే సాంకేతిక సామర్థ్యం గురించి OpenAI అబద్ధాలు చెబుతోందని The New York Times మరియు The Daily News పేర్కొన్నాయి. గత రెండేళ్ల నుండి జరుగుతున్న ఈ వ్యాజ్యంలో, తన భారీ డేటాసెట్లను వెతకడం సాంకేతికంగా భారమని మరియు అది వినియోగదారుల గోప్యతకు భంగం కలిగిస్తుందని OpenAI వాదిస్తోంది.
అయితే, OpenAI డేటా ప్రైవసీ ఇంజనీర్ విన్నీ మోనాకో (Vinnie Monaco) ఇచ్చిన ఇటీవలి డిపోజిషన్ ఈ వాదనను సవాలు చేసింది. కాపీరైట్ కలిగిన జర్నలిస్టిక్ పనులను గుర్తించడానికి OpenAI ఇప్పటికే తన శిక్షణ కార్పస్లో అంతర్గత శోధనలు చేపట్టిందని మోనాకో వెల్లడించినట్లు తెలుస్తోంది. అంతేకాకుండా, కాపీరైట్ ఉల్లంఘన యొక్క పరిధిని అంతర్గతంగా అంచనా వేయడానికి OpenAI సుమారు 78 మిలియన్ల డీ-ఐడెంటిఫైడ్ (de-identified) ChatGPT సంభాషణలతో కూడిన డేటాబేస్ను సేకరించిందని ఈ డిపోజిషన్ సూచిస్తోంది.
Project Giraffe మరియు "Bloom" ఫిల్టర్
బహుశా అత్యంత ముఖ్యమైన సాంకేతిక వెల్లడి "Project Giraffe"కు సంబంధించింది, ఇది OpenAI అమలు చేసిన సాధనాల సముదాయం. వాదుల ప్రకారం, దావా దాఖలు చేసిన కొద్దిసేపటికే, మోడల్ కాపీరైట్ చేసిన కంటెంట్ను దాని అవుట్పుట్లలో యథాతథంగా తిరిగి ఇచ్చే (regurgitation) సందర్భాలను గుర్తించడానికి మరియు నమోదు చేయడానికి OpenAI ఈ ప్రాజెక్ట్లో భాగంగా "Bloom" ఫిల్టర్ను ఉపయోగించింది.
తన లాగ్లలో కంటెంట్ పునరుత్పత్తి యొక్క నిర్దిష్ట సందర్భాలను గుర్తించడం అసాధ్యమని OpenAI గతంలో చెప్పిన వాదనకు Project Giraffe ఉనికి విరుద్ధంగా ఉంది. కాపీరైట్ ఉల్లంఘనను పర్యవేక్షించడమే కాకుండా, దానిని ట్రాక్ చేయడానికి OpenAI చురుకుగా మౌలిక సదుపాయాలను (infrastructure) నిర్మిస్తోందని ఈ సాధనాలు నిరూపిస్తున్నాయని వాదులు వాదిస్తున్నారు.
డేటా సమగ్రత మరియు డిస్కవరీపై వివాదాలు
కోర్టుకు అందించిన డేటా నాణ్యత కూడా ఈ వివాదానికి కేంద్రబిందువుగా మారింది. వాదులు మొదట 120 మిలియన్ల చాట్ లాగ్ల నమూనాను కోరగా, OpenAI ఆ సంఖ్యను 20 మిలియన్లకు తగ్గించేలా చర్చలు జరిపింది. డిసెంబర్లో ఆ నమూనాను సమర్పించినప్పుడు, అతిగా సమాచారాన్ని తొలగించడం (redactions) వల్ల అది "ఉపయోగపడదని" కోర్టు పేర్కొంది.
NYT ఇంకా ముందుకు వెళ్లి, కోర్టు ఆదేశించిన డేటా పరిరక్షణ ఉత్తర్వులను (preservation order) ఉల్లంఘిస్తూ OpenAI బిలియన్ల కొద్దీ ChatGPT అవుట్పుట్లను తొలగించిందని మరియు అందించిన నమూనాలో మిలియన్ల కొద్దీ లాగ్లను మార్చివేసిందని ఆరోపించింది. దీనికి ప్రతిస్పందనగా, OpenAI ప్రతినిధి డ్రూ పుసటెరి (Drew Pusateri) అన్ని ఆరోపణలను తోసిపుచ్చుతూ, తమ చట్టపరమైన కేసు బలహీనపడుతున్నందున వినియోగదారుల గోప్యతను ఉల్లంఘించడానికి Times ప్రయత్నిస్తోందని నిందలు వేశారు.
AI పరిశ్రమకు ఇది ఎందుకు ముఖ్యం
ఈ కేసు జనరేటివ్ AI అభివృద్ధి మరియు "fair use" (న్యాయమైన వినియోగం) యొక్క చట్టపరమైన సరిహద్దులకు ఒక సూచికగా నిలుస్తుంది. ఒకవేళ OpenAI సాక్ష్యాలను దాచిపెట్టిందని లేదా డిస్కవరీ ప్రక్రియను తారుమారు చేసిందని కోర్టు తేల్చితే, AI కంపెనీలు తమ శిక్షణ పద్ధతులను మరియు డేటా మూలాలను (data lineage) ఎలా వెల్లడించాలో ఇది ఒక ప్రామాణికంగా మారుతుంది. డెవలపర్లు మరియు AI వ్యవస్థాపకులకు, భారీ డేటా సేకరణ మరియు మేధో సంపత్తి హక్కుల మధ్య సమతుల్యతను పాటించేటప్పుడు ఎంతవరకు పారదర్శకత అవసరమో ఈ ఫలితం స్పష్టం చేస్తుంది.
ముఖ్య అంశాలు
- అంతర్గత పర్యవేక్షణ సాధనాలు: కాపీరైట్ చేసిన కంటెంట్ పునరుత్పత్తిని (regurgitation) చురుకుగా ట్రాక్ చేయడానికి OpenAI "Project Giraffe" మరియు "Bloom" ఫిల్టర్ను ఉపయోగించిందని ఆరోపణలు ఉన్నాయి.
- విరుద్ధమైన సాక్ష్యం: తన శిక్షణ డేటాను వెతికే సాంకేతిక సామర్థ్యం OpenAIకి ఉందని డిపోజిషన్ సాక్ష్యం సూచిస్తోంది, ఇది సాంకేతిక భారమని వారు గతంలో చేసిన వాదనలకు విరుద్ధంగా ఉంది.
- డిస్కవరీ సమగ్రత ప్రమాదంలో: అవుట్పుట్లను తొలగించడం మరియు "ఉపయోగపడని" ఎడిట్ చేసిన డేటా నమూనాలను అందించడం ద్వారా OpenAI పరిరక్షణ ఉత్తర్వులను ఉల్లంఘించిందా లేదా అనే అంశంపై ఇప్పుడు ఈ దావా ఆధారపడి ఉంది.
