NYT ਨੇ ਵੱਡੇ ਕਾਪੀਰਾਈਟ ਟਰਾਇਲ ਵਿੱਚ OpenAI 'ਤੇ ਸਬੂਤ ਛੁਪਾਉਣ ਦਾ ਦੋਸ਼ ਲਾਇਆ

The New York Times ਅਤੇ OpenAI ਵਿਚਕਾਰ ਚੱਲ ਰਹੀ ਕਾਨੂੰਨੀ ਲੜਾਈ ਨੇ ਇੱਕ ਡਰਾਮੇਟਿਕ ਮੋੜ ਲੈ ਲਿਆ ਹੈ, ਜਿਸ ਵਿੱਚ ਇਹ ਦੋਸ਼ ਲਗਾਏ ਗਏ ਹਨ ਕਿ AI ਦੀ ਇਸ ਦਿੱਗਜ ਕੰਪਨੀ ਨੇ ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਸੈੱਟਾਂ ਬਾਰੇ ਸਬੂਤ ਜਾਣਬੁੱਝ ਕੇ ਛੁਪਾਏ ਹਨ। ਇਹ ਵਧਦਾ ਤਣਾਅ ਮੁਕੱਦਮੇ ਦੇ ਫੋਕਸ ਨੂੰ ਕਾਪੀਰਾਈਟ ਉਲੰਘਣਾ ਤੋਂ ਹਟਾ ਕੇ ਨਿਆਂਇਕ ਖੋਜ ਪ੍ਰਕਿਰਿਆ (judicial discovery process) ਦੀ ਇਮਾਨਦਾਰੀ ਵੱਲ ਮੋੜਨ ਦੀ ਧਮਕੀ ਦਿੰਦਾ ਹੈ।

ਭਰਮਾਊ ਡੇਟਾ ਅਭਿਆਸਾਂ ਦੇ ਦੋਸ਼

The New York Times ਅਤੇ The Daily News ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ OpenAI ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਕੋਰਪਸ (training corpus) ਅਤੇ ਗਾਹਕਾਂ ਦੇ ਚੈਟ ਲੌਗਸ (chat logs) ਦੋਵਾਂ ਨੂੰ ਸਰਚ ਕਰਨ ਦੀ ਆਪਣੀ ਤਕਨੀਕੀ ਸਮਰੱਥਾ ਬਾਰੇ ਅਸਤਿਕਾਰਤ ਰਿਹਾ ਹੈ। ਦੋ ਸਾਲਾਂ ਦੀ ਇਸ ਕਾਨੂੰਨੀ ਲੜਾਈ ਦੌਰਾਨ, OpenAI ਨੇ ਇਹ ਦਲੀਲ ਦਿੱਤੀ ਹੈ ਕਿ ਆਪਣੇ ਵਿਸ਼ਾਲ ਡੇਟਾ ਸੈੱਟਾਂ ਦੀ ਸਰਚ ਕਰਨਾ ਤਕਨੀਕੀ ਤੌਰ 'ਤੇ ਬਹੁਤ ਮੁਸ਼ਕਲ ਹੋਵੇਗਾ ਅਤੇ ਇਸ ਨਾਲ ਉਪਭੋਗਤਾ ਦੀ ਨਿੱਜਤਾ (privacy) ਨਾਲ ਸਮਝੌਤਾ ਹੋਵੇਗਾ।

ਹਾਲਾਂਕਿ, OpenAI ਦੇ ਡੇਟਾ ਪ੍ਰਾਈਵੇਸੀ ਇੰਜੀਨੀਅਰ Vinnie Monaco ਦੇ ਇੱਕ ਹਾਲੀਆ ਬਿਆਨ (deposition) ਨੇ ਇਸ ਕਥਨ ਨੂੰ ਚੁਣੌਤੀ ਦਿੱਤੀ ਹੈ। ਅਜੋਖੇ ਦੋਸ਼ਾਂ ਅਨੁਸਾਰ, Monaco ਨੇ ਖੁਲਾਸਾ ਕੀਤਾ ਹੈ ਕਿ OpenAI ਨੇ ਖਾਸ ਤੌਰ 'ਤੇ ਕਾਪੀਰਾਈਟ ਕੀਤੇ ਗਏ ਪੱਤਰਕਾਰੀ ਕਾਰਜਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਕੋਰਪਸ ਦੀ ਅੰਦਰੂਨੀ ਸਰਚ ਪਹਿਲਾਂ ਹੀ ਕਰ ਲਈ ਸੀ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਬਿਆਨ ਇਹ ਵੀ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ OpenAI ਨੇ ਸੰਭਾਵੀ ਕਾਪੀਰਾਈਟ ਉਲੰਘਣਾ ਦੀ ਸੀਮਾ ਦਾ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ ਲਗਭਗ 78 ਮਿਲੀਅਨ ਡੀ-ਆਈਡੈਂਟੀਫਾਈਡ (de-identified) ChatGPT ਗੱਲਬਾਤ ਦਾ ਇੱਕ ਡੇਟਾਬੇਸ ਇਕੱਠਾ ਕੀਤਾ ਸੀ।

Project Giraffe ਅਤੇ "Bloom" ਫਿਲਟਰ

ਸ਼ਾਇਦ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਤਕਨੀਕੀ ਖੁਲਾਸਾ "Project Giraffe" ਨਾਲ ਸਬੰਧਤ ਹੈ, ਜੋ OpenAI ਦੁਆਰਾ ਲਾਗੂ ਕੀਤੇ ਗਏ ਟੂਲਜ਼ ਦਾ ਇੱਕ ਸਮੂਹ ਹੈ। ਮੁਦਈਆਂ (plaintiffs) ਅਨੁਸਾਰ, ਮੁਕੱਦਮਾ ਦਾਇਰ ਕੀਤੇ ਜਾਣ ਤੋਂ ਤੁਰੰਤ ਬਾਅਦ, OpenAI ਨੇ "regurgitation"—ਜਿੱਥੇ ਮਾਡਲ ਆਪਣੇ ਆਉਟਪੁੱਟ ਵਿੱਚ ਕਾਪੀਰਾਈਟ ਕੀਤੇ ਗਏ ਕੰਟੈਂਟ ਨੂੰ ਸ਼ਬਦ-ਬ-ਸ਼ਬਦ ਦੁਹਰਾਉਂਦਾ ਹੈ—ਦੇ ਮਾਮਲਿਆਂ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਰਿਕਾਰਡ ਕਰਨ ਲਈ ਇਸ ਪ੍ਰੋਜੈਕਟ ਦੇ ਹਿੱਸੇ ਵਜੋਂ "Bloom" ਫਿਲਟਰ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਸੀ।

Project Giraffe ਦਾ ਹੋਣਾ OpenAI ਦੇ ਪਿਛਲੇ ਇਸ ਪੱਖ ਦੇ ਉਲਟ ਹੈ ਕਿ ਉਸਦੇ ਲੌਗਸ ਵਿੱਚ ਕੰਟੈਂਟ ਰੀਪ੍ਰੋਡਕਸ਼ਨ ਦੇ ਖਾਸ ਮਾਮਲਿਆਂ ਦੀ ਪਛਾਣ ਕਰਨਾ ਇੱਕ ਅਸੰਭਵ ਕੰਮ ਸੀ। ਮੁਦਈਆਂ ਦਾ ਤਰਕ ਹੈ ਕਿ ਇਹ ਟੂਲ ਸਾਬਤ ਕਰਦੇ ਹਨ ਕਿ OpenAI ਨਾ ਸਿਰਫ਼ ਕਾਪੀਰਾਈਟ ਉਲੰਘਣਾ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਦੇ ਯੋਗ ਸੀ, ਸਗੋਂ ਇਸ ਨੂੰ ਟ੍ਰੈਕ ਕਰਨ ਲਈ ਸਰਗਰਮੀ ਨਾਲ ਬੁਨਿਆਦੀ ਢਾਂਚਾ ਵੀ ਤਿਆਰ ਕਰ ਰਿਹਾ ਸੀ।

ਡੇਟਾ ਦੀ ਇਮਾਨਦਾਰੀ ਅਤੇ ਖੋਜ (Discovery) ਬਾਰੇ ਵਿਵਾਦ

ਇਹ ਟਕਰਾਅ ਅਦਾਲਤ ਨੂੰ ਦਿੱਤੇ ਗਏ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ 'ਤੇ ਵੀ ਕੇਂਦਰਿਤ ਰਿਹਾ ਹੈ। ਜਦੋਂ ਮੁਦਈਆਂ ਨੇ ਅਸਲ ਵਿੱਚ 120 ਮਿਲੀਅਨ ਚੈਟ ਲੌਗਸ ਦੇ ਨਮੂਨੇ ਦੀ ਮੰਗ ਕੀਤੀ ਸੀ, ਤਾਂ OpenAI ਨੇ ਇਸ ਅੰਕੜੇ ਨੂੰ ਘਟਾ ਕੇ 20 ਮਿਲੀਅਨ ਕਰ ਦਿੱਤਾ। ਰਿਪੋਰਟਾਂ ਅਨੁਸਾਰ, ਜਦੋਂ ਦਸੰਬਰ ਵਿੱਚ ਅੰਤ ਵਿੱਚ ਨਮੂਨਾ ਪੇਸ਼ ਕੀਤਾ ਗਿਆ, ਤਾਂ ਅਦਾਲਤ ਨੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਰੈਡੈਕਸ਼ਨ (redactions) ਕਾਰਨ ਇਸ ਨੂੰ "ਅਣਉਪਯੋਗੀ" ਪਾਇਆ।

NYT ਨੇ ਇੱਥੋਂ ਤੱਕ ਦਾ ਦਾਅਵਾ ਕੀਤਾ ਹੈ ਕਿ OpenAI ਨੇ ਅਦਾਲਤ ਦੇ ਹੁਕਮ ਅਨੁਸਾਰ ਡੇਟਾ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖਣ ਦੇ ਆਦੇਸ਼ ਦੀ ਉਲੰਘਣਾ ਕਰਦੇ ਹੋਏ ਅਰਬਾਂ ChatGPT ਆਉਟਪੁੱਟ ਡਿਲੀਟ ਕਰ ਦਿੱਤੇ ਅਤੇ ਦਿੱਤੇ ਗਏ ਨਮੂਨੇ ਵਿੱਚ ਲੱਖਾਂ ਲੌਗਸ ਨੂੰ ਬਦਲ ਦਿੱਤਾ। ਜਵਾਬ ਵਿੱਚ, OpenAI ਦੇ ਬੁਲਾਰੇ Drew Pusateri ਨੇ ਸਾਰੇ ਦੋਸ਼ਾਂ ਤੋਂ ਇਨਕਾਰ ਕਰ ਦਿੱਤਾ ਹੈ ਅਤੇ Times 'ਤੇ ਦੋਸ਼ ਲਾਇਆ ਹੈ ਕਿ ਜਿਵੇਂ-ਜਿਵੇਂ ਉਹਨਾਂ ਦਾ ਕਾਨੂੰਨੀ ਕੇਸ ਕਮਜ਼ੋਰ ਹੋ ਰਿਹਾ ਹੈ, ਉਹ ਉਪਭੋਗਤਾ ਦੀ ਨਿੱਜਤਾ ਵਿੱਚ ਦਖਲ ਦੇਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰ ਰਹੇ ਹਨ।

ਇਹ AI ਉਦਯੋਗ ਲਈ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਇਹ ਕੇਸ ਜਨਰੇਟਿਵ AI ਵਿਕਾਸ ਦੇ ਭਵਿੱਖ ਅਤੇ "fair use" ਦੀਆਂ ਕਾਨੂੰਨੀ ਸੀਮਾਵਾਂ ਲਈ ਇੱਕ ਸੂਚਕ (bellwether) ਹੈ। ਜੇਕਰ ਅਦਾਲਤ ਇਹ ਪਾਉਂਦੀ ਹੈ ਕਿ OpenAI ਨੇ ਸਬੂਤ ਰੋਕੇ ਹਨ ਜਾਂ ਖੋਜ (discovery) ਵਿੱਚ ਹੇਰਾਫੇਰੀ ਕੀਤੀ ਹੈ, ਤਾਂ ਇਹ ਇੱਕ ਨਮੂਨਾ (precedent) ਸੈੱਟ ਕਰ ਸਕਦਾ ਹੈ ਕਿ AI ਕੰਪਨੀਆਂ ਨੂੰ ਆਪਣੀਆਂ ਟ੍ਰੇਨਿੰਗ ਵਿਧੀਆਂ ਅਤੇ ਡੇਟਾ ਲੀਨੇਜ (data lineage) ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਗਟ ਕਰਨਾ ਲਾਜ਼ਮੀ ਹੈ। ਡਿਵੈਲਪਰਾਂ ਅਤੇ AI ਸੰਸਥਾਪਕਾਂ ਲਈ, ਇਸ ਦਾ ਨਤੀਜਾ ਵਿਸ਼ਾਲ ਡੇਟਾ ਇੰਜੈਸਸ਼ਨ (data ingestion) ਅਤੇ ਬੌਧਿਕ ਸੰਪੱਤੀ ਅਧਿਕਾਰਾਂ ਦੇ ਸੁਮੇਲ ਨੂੰ ਸੰਭਾਲਣ ਵੇਲੇ ਲੋੜੀਂਦੀ ਪਾਰਦਰਸ਼ਤਾ ਦੇ ਪੱਧਰ ਨੂੰ ਸਪੱਸ਼ਟ ਕਰੇਗਾ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਅੰਦਰੂਨੀ ਨਿਗਰਾਨੀ ਟੂਲ: ਦੋਸ਼ਾਂ ਅਨੁਸਾਰ OpenAI ਨੇ ਕਾਪੀਰਾਈਟ ਕੀਤੇ ਗਏ ਕੰਟੈਂਟ ਦੀ ਦੁਹਰਾਅ (regurgitation) ਨੂੰ ਸਰਗਰਮੀ ਨਾਲ ਟ੍ਰੈਕ ਕਰਨ ਲਈ "Project Giraffe" ਅਤੇ "Bloom" ਫਿਲਟਰ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਸੀ।
  • ਵਿਰੋਧੀ ਗਵਾਹੀ: ਬਿਆਨ (deposition) ਦੇ ਸਬੂਤ ਸੁਝਾਉਂਦੇ ਹਨ ਕਿ OpenAI ਕੋਲ ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਨੂੰ ਸਰਚ ਕਰਨ ਦੀ ਤਕਨੀਕੀ ਸਮਰੱਥਾ ਸੀ, ਜੋ ਕਿ ਇਸਦੇ ਪਿਛਲੇ ਤਕਨੀਕੀ ਮੁਸ਼ਕਲ ਦੇ ਦਾਅਵਿਆਂ ਦੇ ਉਲਟ ਹੈ।
  • ਖੋਜ (Discovery) ਦੀ ਇਮਾਨਦਾਰੀ ਦਾ ਸਵਾਲ: ਮੁਕੱਦਮਾ ਹੁਣ ਇਸ ਗੱਲ 'ਤੇ ਟਿਕਿਆ ਹੋਇਆ ਹੈ ਕਿ ਕੀ OpenAI ਨੇ ਆਉਟਪੁੱਟ ਡਿਲੀਟ ਕਰਕੇ ਅਤੇ "ਅਣਉਪਯੋਗੀ" ਰੈਡੈਕਟਡ ਡੇਟਾ ਨਮੂਨੇ ਪ੍ਰਦਾਨ ਕਰਕੇ ਸੁਰੱਖਿਆ ਆਦੇਸ਼ਾਂ ਦੀ ਉਲੰਘਣਾ ਕੀਤੀ ਹੈ।