ਕੇਸ ਅਦਾਲਤ ਵਿੱਚ ਕਿਉਂ ਪਹੁੰਚਿਆ

ANI ਨੇ ਉਦੋਂ ਮੁਕੱਦਮਾ ਕੀਤਾ ਜਦੋਂ ਉਸਨੇ ਦੇਖਿਆ ਕਿ ਹਾਲੀਆ ਭਾਰਤੀ ਖ਼ਬਰਾਂ ਬਾਰੇ ਪੁੱਛੇ ਗਏ ਸਵਾਲਾਂ ਦੇ ChatGPT ਦੇ ਜਵਾਬ ਅਗਸਤ ਅਤੇ ਸਤੰਬਰ 2024 ਵਿੱਚ ਪ੍ਰਕਾਸ਼ਿਤ ਆਪਣੇ ਲੇਖਾਂ ਨਾਲ ਮਿਲਦੇ-ਜੁਲਦੇ ਸਨ। ਏਜੰਸੀ ਨੇ ਦਲੀਲ ਦਿੱਤੀ ਕਿ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLM) ਉਸਦੇ ਕਾਪੀਰਾਈਟ ਕੀਤੇ ਟੈਕਸਟ ਨੂੰ ਦੁਬਾਰਾ ਪੇਸ਼ ਕਰ ਰਿਹਾ ਸੀ, ਇੱਕ ਅਜਿਹਾ ਦਾਅਵਾ ਜਿਸ ਨੂੰ ਜੇਕਰ ਸਹੀ ਮੰਨ ਲਿਆ ਗਿਆ, ਤਾਂ OpenAI ਨੂੰ ਭਾਰਤ ਵਿੱਚ ਆਪਣੇ ਮਾਡਲਾਂ ਨੂੰ ਰੋਕਣ ਜਾਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸੀਮਤ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਨਾ ਪਵੇਗਾ।

OpenAI ਨੇ ਜਵਾਬ ਦਿੱਤਾ ਕਿ ਦੱਸੇ ਗਏ ਦੋਵੇਂ ਮਾਡਲ—GPT-4 ਅਤੇ ਨਵਾਂ GPT-4o—ਅਪ੍ਰੈਲ 2022 ਅਤੇ ਅਪ੍ਰੈਲ 2024 ਦੀਆਂ ਕੱਟ-ਆਫ ਤਾਰੀਖਾਂ ਵਾਲੇ ਡੇਟਾ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ANI ਦੇ ਲੇਖ ਉਹਨਾਂ ਤਾਰੀਖਾਂ ਤੋਂ ਬਾਅਦ ਆਏ ਸਨ, ਇਸ ਲਈ ਉਹ ਅਸਲ ਟ੍ਰੇਨਿੰਗ ਸੈੱਟ ਵਿੱਚ ਨਹੀਂ ਹੋ ਸਕਦੇ ਸਨ। ਜੱਜ ਅਮਿਤ ਬਾਂਸਲ ਨੇ ਕਿਹਾ ਕਿ ਇਹ ਸਮਾਨਤਾ (overlap) ਜ਼ਿਆਦਾਤਰ Retrieval-Augmented Generation (RAG) ਤੋਂ ਆਈ ਹੋ ਸਕਦੀ ਹੈ, ਜੋ ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਮੌਜੂਦਾ ਵੈੱਬ ਕੰਟੈਂਟ ਨੂੰ ਜਵਾਬ ਵਿੱਚ ਲਿਆਉਂਦਾ ਹੈ, ਨਾ ਕਿ ਮਾਡਲ ਦੁਆਰਾ ਲੇਖਾਂ ਨੂੰ "ਯਾਦ" ਰੱਖਣ ਕਾਰਨ।

ਕਾਨੂੰਨੀ ਮੋੜ: "ਖੋਜ" ਵਜੋਂ ਸਿਖਲਾਈ (training)

ਇਹ ਕੇਸ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਅਦਾਲਤ ਨੇ "ਨਿੱਜੀ ਜਾਂ ਵਿਅਕਤੀਗਤ ਵਰਤੋਂ, ਜਿਸ ਵਿੱਚ ਖੋਜ ਸ਼ਾਮਲ ਹੈ" ਲਈ ਭਾਰਤ ਦੇ ਕਾਪੀਰਾਈਟ ਛੋਟ ਦੇ ਨਿਯਮ ਨੂੰ ਵਿਆਪਕ ਰੂਪ ਵਿੱਚ ਲਿਆ। ਦੋਵੇਂ ਪੱਖ ਇਸ ਗੱਲ 'ਤੇ ਸਹਿਮਤ ਸਨ ਕਿ OpenAI ਨੇ ਸ਼ੁਰੂਆਤੀ ਸਿਖਲਾਈ ਪੜਾਅ ਦੌਰਾਨ ANI ਦੀ ਸਮੱਗਰੀ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਸੀ, ਪਰ ਜੱਜ ਨੇ ਉਸ ਵਰਤੋਂ ਨੂੰ "ਰੂਪਾਂਤਰਿਤ" (transformative) ਮੰਨਿਆ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਸਿਰਫ਼ ਵਿਆਕਰਣ, ਵਾਕ-ਰਚਨਾ ਅਤੇ ਅੰਕੜਾਤਮਕ ਪੈਟਰਨਾਂ ਨੂੰ ਕੱਢਿਆ, ਜਦਕਿ ਪ੍ਰਗਟਾਵੇਸ਼ਾਤਮਕ ਸਮੱਗਰੀ ਨੂੰ ਅਛੂਤਾ ਛੱਡ ਦਿੱਤਾ।

ਅਦਾਲਤ ਨੇ ਦੋ ਸਖ਼ਤ ਸ਼ਰਤਾਂ ਰੱਖੀਆਂ:

  • ਸਿਖਲਾਈ ਲਈ ਵਰਤੇ ਗਏ ਕਾਪੀਆਂ ਕਾਨੂੰਨੀ ਸਰੋਤਾਂ ਤੋਂ ਹੋਣੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ, ਨਾ ਕਿ ਪਾਇਰੇਟਡ ਆਰਕਾਈਵ ਜਾਂ ਪੇ-ਵਾਲ (paywalls) ਤੋਂ ਜਿਸ ਤੱਕ ਉਪਭੋਗਤਾ ਦੀ ਪਹੁੰਚ ਨਹੀਂ ਹੈ।
  • ਸਮੱਗਰੀ ਡਿਵੈਲਪਰ ਦੇ ਆਪਣੇ ਵਾਤਾਵਰਣ ਦੇ ਅੰਦਰ ਹੀ ਰਹਿਣੀ ਚਾਹੀਦੀ ਹੈ; ਇਸ ਨੂੰ ਪ੍ਰਕਾਸ਼ਿਤ ਜਾਂ ਵੰਡਿਆ ਨਹੀਂ ਜਾ ਸਕਦਾ।

ਤਿੰਨ-ਭਾਗ ਵਾਲੇ ਨਿਰਪੱਖਤਾ ਟੈਸਟ ਨੂੰ ਲਾਗੂ ਕਰਦੇ ਹੋਏ, ਜੱਜ ਨੇ ਪਾਇਆ ਕਿ OpenAI ਦੀ ਵਰਤੋਂ ਸਿਖਲਾਈ ਤੱਕ ਸੀਮਤ ਸੀ, ਮਾਡਲ ਦੁਆਰਾ ਸ਼ਬਦ-ਬ-ਸ਼ਬਦ ਪੈਰੇ ਯਾਦ ਕੀਤੇ ਜਾਣ ਦਾ ਕੋਈ ਸਬੂਤ ਨਹੀਂ ਮਿਲਿਆ, ਅਤੇ ਨੋਟ ਕੀਤਾ ਕਿ ANI ਨੂੰ ਕੋਈ ਸਿੱਧਾ ਆਰਥਿਕ ਨੁਕਸਾਨ ਨਹੀਂ ਹੋਇਆ ਕਿਉਂਕਿ ਦੋਵੇਂ ਫਰਮਾਂ ਵੱਖ-ਵੱਖ ਮਾਰਕੀਟ ਸੈਗਮੈਂਟਾਂ ਵਿੱਚ ਕੰਮ ਕਰਦੀਆਂ ਹਨ।

ਇਹ ਵਿਸ਼ਵਵਿਆਪੀ ਫੈਸਲਿਆਂ ਦੇ ਸਮੂਹ ਵਿੱਚ ਕਿਵੇਂ ਫਿੱਟ ਹੁੰਦਾ ਹੈ

ਭਾਰਤ ਦਾ ਰੁਖ ਹੁਣ ਕਈ ਅਮਰੀਕੀ ਮਾਮਲਿਆਂ ਦੀ ਤਰਜ਼ 'ਤੇ ਹੈ ਜੋ AI ਆਉਟਪੁੱਟ ਦੇ ਰੂਪਾਂਤਰਿਤ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ। Kadrey v. Meta ਵਿੱਚ, ਅਦਾਲਤ ਨੇ ਫੈਸਲਾ ਦਿੱਤਾ ਕਿ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਟੈਕਸਟ ਜੋ ਬਿਲਕੁਲ ਸ਼ਬਦਾਂ ਦੀ ਨਕਲ ਨਹੀਂ ਕਰਦਾ, ਉਹ ਉਲੰਘਣਾ ਨਹੀਂ ਹੈ, ਜਦੋਂ ਕਿ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਚੱਲ ਰਹੇ Google Books ਦੇ ਫੈਸਲੇ ਨੇ ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਪ੍ਰੋਜੈਕਟਾਂ ਲਈ ਇੱਕ ਸੀਮਤ "ਖੋਜ-ਅਤੇ-ਡਿਸਪਲੇਅ" ਛੋਟ ਨੂੰ ਮਾਨਤਾ ਦਿੱਤੀ। ਹੋਰ ਅਮਰੀਕੀ ਮੁਕੱਦਮੇ, ਜਿਵੇਂ ਕਿ Raw Story ਕੇਸ, ਸਾਬਤ ਹੋਣ ਯੋਗ ਨੁਕਸਾਨ ਦੀ ਘਾਟ ਕਾਰਨ ਖਾਰਜ ਕਰ ਦਿੱਤੇ ਗਏ ਸਨ, ਪਰ Anthropic ਵਿਵਾਦ ਨੇ ਜੱਜਾਂ ਨੂੰ ਯਾਦ ਦਿਵਾਇਆ ਕਿ ਪਾਇਰੇਟਡ ਡੇਟਾ ਦੀ ਵਰਤੋਂ ਕਰਨ ਨਾਲ ਅਜੇ ਵੀ ਜ਼ਿੰਮੇਵਾਰੀ ਆ ਸਕਦੀ ਹੈ।

ਯੂਰਪ ਵਿੱਚ, ਵਿਚਾਰ ਬਹੁਤ ਵੱਖਰੇ ਹਨ। ਮਿਊਨਿਕ ਦੀਆਂ ਅਦਾਲਤਾਂ ਨੇ ਫੈਸਲਾ ਦਿੱਤਾ ਹੈ ਕਿ ਮਾਡਲ ਵੇਟਸ (weights) ਵਿੱਚ ਦਰਜ ਗੀਤਾਂ ਦੇ ਬੋਲਾਂ ਨੂੰ ਦੁਬਾਰਾ ਪੇਸ਼ ਕਰਨਾ ਉਲੰਘਣਾ ਦੇ ਬਰਾਬਰ ਹੈ, ਜਦੋਂ ਕਿ ਲੰਡਨ ਟ੍ਰਿਬਿਊਨਲ ਨੇ ਹਾਲ ਹੀ ਵਿੱਚ ਸਮਾਨ ਆਧਾਰਾਂ 'ਤੇ Stability AI ਵਿਰੁੱਧ ਦਾਅਵੇ ਨੂੰ ਖਾਰਜ ਕਰ ਦਿੱਤਾ। ਦਿੱਲੀ ਹਾਈ ਕੋਰਟ ਦਾ ਫੈਸਲਾ ਇੱਕ ਹੋਰ ਨਵਾਂ ਪਹਿਲੂ ਜੋੜਦਾ ਹੈ: ਜੇਕਰ ਸਿਖਲਾਈ ਕਾਨੂੰਨੀ ਸਰੋਤਾਂ ਤੱਕ ਸੀਮਤ ਹੈ ਅਤੇ ਆਉਟਪੁੱਟ ਸ਼ਬਦ-ਬ-ਸ਼ਬਦ ਨਕਲ ਨਹੀਂ ਹੈ, ਤਾਂ ਇਹ ਗਤੀਵਿਧੀ ਖੋਜ ਛੋਟ ਦੇ ਅਧੀਨ ਆ ਸਕਦੀ ਹੈ।

ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕਿਸ ਚੀਜ਼ ਵੱਲ ਧਿਆਨ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ

  • RAG ਬਨਾਮ training – "ਯਾਦ ਰੱਖਣ" (training) ਅਤੇ ਰੀਅਲ-ਟਾਈਮ ਰਿਟ੍ਰੀਵਲ (RAG) ਵਿਚਕਾਰ ਅਦਾਲਤ ਦਾ ਅੰਤਰ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਭਵਿੱਖ ਦੇ ਵਿਵਾਦ ਇਸ ਗੱਲ 'ਤੇ ਕੇਂਦਰਿਤ ਹੋਣਗੇ ਕਿ ਜਵਾਬ ਇੱਕ ਸਥਿਰ ਗਿਆਨ ਦੇ ਅਧਾਰ (knowledge base) ਤੋਂ ਆਉਂਦਾ ਹੈ ਜਾਂ ਵੈੱਬ ਤੋਂ ਲਾਈਵ ਲਿਆਂਦਾ ਜਾਂਦਾ ਹੈ। ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਉਤਪਾਦ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਉਸ ਰੇਖਾ ਨੂੰ ਹੋਰ ਸਪਸ਼ਟ ਕਰਨ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ।
  • ਸਰੋਤ ਦੀ ਪ੍ਰਮਾਣਿਕਤਾ (Source provenance) – "ਕਾਨੂੰਨੀ ਸਰੋਤਾਂ" ਦੀ ਲੋੜ ਫਰਮਾਂ ਨੂੰ ਡੇਟਾ-ਕਿਊਰੇਸ਼ਨ ਪਾਈਪ

ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ ਨੂੰ ਇੱਕ ਪ੍ਰਵਾਨਯੋਗ ਖੋਜ ਗਤੀਵਿਧੀ ਵਜੋਂ ਸ਼੍ਰੇਣੀਬੱਧ ਕਰਕੇ, ਦਿੱਲੀ ਹਾਈ ਕੋਰਟ ਨੇ ਸੰਕੇਤ ਦਿੱਤਾ ਹੈ ਕਿ ਭਾਰਤ ਕਾਪੀਰਾਈਟ ਦੇ ਆਧਾਰ 'ਤੇ large language models ਦੇ ਵਿਕਾਸ ਨੂੰ ਆਪਣੇ ਆਪ ਨਹੀਂ ਰੋਕੇਗਾ, ਬਸ਼ਰਤੇ ਕਿ ਡਿਵੈਲਪਰ ਸਰੋਤ ਦੀ ਕਾਨੂੰਨੀਤਾ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਅਤੇ ਟ੍ਰੇਨਿੰਗ ਨੂੰ ਅੰਦਰੂਨੀ ਰੱਖਣ। ਇਹ ਵਿਆਖਿਆ ਕੰਪਨੀਆਂ ਨੂੰ ਆਪਣੇ ਭਾਰਤੀ ਕਾਰਜਾਂ ਦਾ ਵਿਸਥਾਰ ਕਰਨ ਲਈ ਉਤਸ਼ਾਹਿਤ ਕਰ ਸਕਦੀ ਹੈ, ਇਹ ਜਾਣਦੇ ਹੋਏ ਕਿ ਇੱਕ ਮੁੱਖ ਕਾਨੂੰਨੀ ਰੁਕਾਵਟ ਹੁਣ ਹਲਕੀ ਹੋ ਗਈ ਹੈ।

ਹੋਰ ਥਾਵਾਂ 'ਤੇ ਨਿਯਮਕਾਂ ਲਈ, ਇਹ ਫੈਸਲਾ ਇੱਕ ਨਮੂਨਾ ਪੇਸ਼ ਕਰਦਾ ਹੈ: ਇੱਕ ਸੀਮਤ, ਚੰਗੀ ਤਰ੍ਹਾਂ ਦਸਤਾਵੇਜ਼ੀ ਖੋਜ ਛੋਟ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਨਾ, ਸਪਸ਼ਟ ਸਰੋਤ ਮਿਆਰ ਲਾਗੂ ਕਰਨਾ, ਅਤੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਦੀ ਸਿਰਫ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਦੀ ਮੰਗ ਕਰਨਾ। ਉਹ ਦੇਸ਼ ਜੋ ਅਜਿਹੀ ਸਮਾਨ ਭਾਸ਼ਾ ਅਪਣਾਉਂਦੇ ਹਨ, ਉਹ ਆਪਣੇ ਘਰੇਲੂ AI ecosystems ਨੂੰ ਨਿਵੇਸ਼ ਨੂੰ ਆਕਰਸ਼ਿਤ ਕਰਨ ਲਈ ਲੋੜੀਂਦੀ ਨਿਸ਼ਚਿਤਤਾ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦੇ ਹਨ।

ਮੁੱਖ ਗੱਲ: ਦਿੱਲੀ ਹਾਈ ਕੋਰਟ ਦਾ ਫੈਸਲਾ AI ਟ੍ਰੇਨਿੰਗ ਲਈ ਕਿਸੇ ਵੀ ਟੈਕਸਟ ਨੂੰ ਸਕ੍ਰੈਪ ਕਰਨ ਦੀ ਪੂਰੀ ਛੋਟ ਨਹੀਂ ਦਿੰਦਾ, ਪਰ ਇਹ ਸਥਾਪਿਤ ਕਰਦਾ ਹੈ ਕਿ ਭਾਰਤੀ ਕਾਨੂੰਨ ਦੇ ਤਹਿਤ, ਅਨੁਸ਼ਾਸਿਤ ਅਤੇ ਕਾਨੂੰਨ ਦੀ ਪਾਲਣਾ ਕਰਨ ਵਾਲੀ ਟ੍ਰੇਨਿੰਗ ਖੋਜ ਵਜੋਂ ਗਿਣੀ ਜਾ ਸਕਦੀ ਹੈ। ਉਹ ਵਿਆਖਿਆ ਦੁਨੀਆ ਭਰ ਦੀਆਂ ਅਦਾਲਤਾਂ ਲਈ ਇੱਕ ਹਵਾਲਾ ਬਣ ਸਕਦੀ ਹੈ ਜਦੋਂ ਉਹ ਇਸ ਗੱਲ ਨਾਲ ਜੂਝ ਰਹੀਆਂ ਹਨ ਕਿ ਮਸ਼ੀਨਾਂ ਨੂੰ ਭਾਸ਼ਾ ਸਮਝਣਾ ਸਿਖਾਉਣਾ ਇੱਕ ਸੁਰੱਖਿਅਤ ਵਿਦਵਤਾਪੂਰਨ ਗਤੀਵਿਧੀ ਹੈ ਜਾਂ ਕਾਨੂੰਨੀ ਉਲੰਘਣਾ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ।