Anthropic ਦਾ $1.5B ਪਾਇਰੇਸੀ ਸਮਝੌਤਾ: ਇੱਕ ਰਿਕਾਰਡ ਹਾਨੀ ਅਤੇ ਰਣਨੀਤਕ ਜਿੱਤ
Anthropic ਨੇ ਆਪਣੇ ਮਾਡਲਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਪਾਇਰੇਟਡ (pirated) ਡੇਟਾਬੇਸਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੇ ਦੋਸ਼ਾਂ ਤੋਂ ਬਾਅਦ ਕਿਤਾਬਾਂ ਦੇ ਲੇਖਕਾਂ ਦੇ ਇੱਕ ਸਮੂਹ ਨਾਲ $1.5 ਬਿਲੀਅਨ ਦਾ ਇੱਕ ਇਤਿਹਾਸਕ ਸਮਝੌਤਾ ਕੀਤਾ ਹੈ। ਹਾਲਾਂਕਿ ਇਹ ਭਾਰੀ ਭੁਗਤਾਨ ਇੱਕ ਵਿੱਤੀ ਝਟਕਾ ਹੈ, ਪਰ ਇਸ ਕੇਸ ਦੀਆਂ ਕਾਨੂੰਨੀ ਬਾਰੀਕੀਆਂ ਅਸਲ ਵਿੱਚ 'fair use' (ਉਚਿਤ ਵਰਤੋਂ) ਦੇ ਸਬੰਧ ਵਿੱਚ ਵਿਆਪਕ AI ਉਦਯੋਗ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਜਿੱਤ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦੀਆਂ ਹਨ।
ਰਿਕਾਰਡ ਤੋੜ ਸਮਝੌਤੇ ਦੇ ਵੇਰਵੇ
ਸੈਨ ਫਰਾਂਸਿਸਕੋ ਦੀ ਇੱਕ ਫੈਡਰਲ ਅਦਾਲਤ ਨੇ ਇੱਕ ਇਤਿਹਾਸਕ ਸਮਝੌਤੇ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦਿੱਤੀ ਹੈ, ਜਦੋਂ ਸਬੂਤਾਂ ਤੋਂ ਪਤਾ ਲੱਗਾ ਕਿ Anthropic ਨੇ 2021 ਅਤੇ 2022 ਦੇ ਵਿਚਕਾਰ ਕੁਝ ਮਸ਼ਹੂਰ ਪਾਇਰੇਸੀ ਡੇਟਾਬੇਸਾਂ, ਖਾਸ ਕਰਕੇ LibGen ਅਤੇ PiLiMi ਤੋਂ ਕਿਤਾਬਾਂ ਡਾਊਨਲੋਡ ਕੀਤੀਆਂ ਸਨ। ਇਸ ਸਮਝੌਤੇ ਦਾ ਪੈਮਾਨਾ ਕਲਾਸ ਐਕਸ਼ਨ ਇਤਿਹਾਸ ਵਿੱਚ ਬੇਮਿਸਾਲ ਹੈ, ਜੋ ਲਗਭਗ 482,460 ਸੂਚੀਬੱਧ ਕਾਰਜਾਂ ਨੂੰ ਕਵਰ ਕਰਦਾ ਹੈ।
ਸ਼ਾਮਲ ਕੁੱਲ ਕਾਰਜਾਂ ਵਿੱਚੋਂ, 91.3 ਪ੍ਰਤੀਸ਼ਤ ਦਾ ਲੇਖਕਾਂ ਦੁਆਰਾ ਸਫਲਤਾਪੂਰਵਕ ਦਾਅਵਾ ਕੀਤਾ ਗਿਆ ਸੀ। ਹਰੇਕ ਦਾਅਵੇਦਾਰ ਨੂੰ ਲਗਭਗ $3,000 ਮਿਲਣਗੇ, ਜੋ ਕਿ ਕਾਨੂੰਨੀ ਘੱਟੋ-ਘੱਟ ਰਕਮ ਤੋਂ ਚਾਰ ਗੁਣਾ ਜ਼ਿਆਦਾ ਹੈ। ਕਾਨੂੰਨੀ ਹੱਲ ਦੇ ਹਿੱਸੇ ਵਜੋਂ, Anthropic ਨੂੰ ਇਸ ਮਿਆਦ ਦੌਰਾਨ ਵਰਤੀਆਂ ਗਈਆਂ ਪਾਇਰੇਟਡ ਫਾਈਲਾਂ ਨੂੰ ਨਸ਼ਟ ਕਰਨਾ ਲਾਜ਼ਮੀ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ ਇਹ ਸਮਝੌਤਾ ਕੰਪਨੀ ਨੂੰ ਪੂਰੀ ਛੋਟ ਨਹੀਂ ਦਿੰਦਾ; ਜੇਕਰ AI ਦੇ ਨਤੀਜੇ (outputs) ਅਸਲ ਕਾਰਜਾਂ ਦੀ ਨਕਲ ਕਰਦੇ ਹਨ ਜਾਂ ਜੇਕਰ Anthropic ਦੇ ਭਵਿੱਖ ਦੇ ਡੇਟਾ ਪ੍ਰਾਪਤੀ ਦੇ ਤਰੀਕੇ ਕਾਪੀਰਾਈਟ ਕਾਨੂੰਨਾਂ ਦੀ ਉਲੰਘਣਾ ਕਰਦੇ ਹਨ, ਤਾਂ ਲੇਖਕਾਂ ਕੋਲ ਦਾਅਵਾ ਕਰਨ ਦਾ ਅਧਿਕਾਰ ਰਹਿੰਦਾ ਹੈ।
ਇੱਕ ਤਕਨੀਕੀ ਪੱਖ ਜੋ AI ਵਿਕਾਸ ਦੇ ਪੱਖ ਵਿੱਚ ਹੈ
$1.5 ਬਿਲੀਅਨ ਦੀ ਭਾਰੀ ਰਕਮ ਦੇ ਬਾਵਜੂਦ, ਇਸ ਕੇਸ ਦੁਆਰਾ ਸਥਾਪਿਤ ਕਾਨੂੰਨੀ ਨਜ਼ੀਰ AI ਲੈਬਾਂ ਲਈ ਹੈਰਾਨੀਜਨਕ ਤੌਰ 'ਤੇ ਅਨੁਕੂਲ ਹੈ। ਇਹ ਸਮਝੌਤਾ ਪਾਇਰੇਟਡ ਸਰੋਤਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੇ ਵਿਸ਼ੇਸ਼ ਕਾਰਜ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ, ਪਰ ਇਹ AI ਸਿਖਲਾਈ ਦੀ ਕਾਨੂੰਨੀਤਾ 'ਤੇ ਕੋਈ ਫੈਸਲਾ ਨਹੀਂ ਸੁਣਾਉਂਦਾ।
ਜੱਜ Alsup ਨੇ ਪਹਿਲਾਂ ਹੀ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਅੰਤਰ ਸਥਾਪਿਤ ਕੀਤਾ ਸੀ: ਕਾਨੂੰਨੀ ਤੌਰ 'ਤੇ ਪ੍ਰਾਪਤ ਕੀਤੀਆਂ ਕਿਤਾਬਾਂ 'ਤੇ AI ਨੂੰ ਸਿਖਲਾਈ ਦੇਣਾ "ਰੂਪਾਂਤਰਿਤ (transformative)—ਬਹੁਤ ਹੀ ਸ਼ਾਨਦਾਰ ਤਰੀਕੇ ਨਾਲ"—ਹੈ ਅਤੇ ਇਹ ਸਿੱਧੇ ਤੌਰ 'ਤੇ 'fair use' ਦੇ ਸਿਧਾਂਤ ਦੇ ਅਧੀਨ ਆਉਂਦਾ ਹੈ। ਇਹ ਅੰਤਰ OpenAI, Google, ਅਤੇ Meta ਵਰਗੀਆਂ ਕੰਪਨੀਆਂ ਲਈ ਬਹੁਤ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਹਾਲਾਂਕਿ ਡੇਟਾ ਦਾ ਸਰੋਤ (ਪਾਇਰੇਸੀ ਬਨਾਮ ਕਾਨੂੰਨੀ ਪ੍ਰਾਪਤੀ) ਇੱਕ ਜ਼ਿੰਮੇਵਾਰੀ ਹੈ, ਪਰ ਭਾਸ਼ਾ ਅਤੇ ਪੈਟਰਨਾਂ ਨੂੰ ਸਮਝਣ ਲਈ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਾਨੂੰਨੀ ਤੌਰ 'ਤੇ ਸਹੀ ਮੰਨੀ ਜਾ ਸਕਦੀ ਹੈ।
ਮਾਸ ਸਕ੍ਰੇਪਿੰਗ (Mass Scraping) ਦਾ ਅਣਸੁਲਝਿਆ ਮੋੜ
ਹਾਲਾਂਕਿ ਇਹ ਫੈਸਲਾ ਉਨ੍ਹਾਂ ਲੈਬਾਂ ਲਈ ਇੱਕ ਉਮੀਦ ਦੀ ਕਿਰਨ ਹੈ ਜਿਨ੍ਹਾਂ ਨੇ ਵਿਸ਼ਾਲ ਡੇਟਾਸੈਟਾਂ 'ਤੇ ਸਿਖਲਾਈ ਲਈ ਹੈ, ਪਰ "ਕਾਨੂੰਨੀ ਪ੍ਰਾਪਤੀ" ਬਾਰੇ ਕਾਨੂੰਨੀ ਲੜਾਈ ਅਜੇ ਦੂਰ ਹੈ। ਮੁੱਖ ਸਵਾਲ ਅਜੇ ਵੀ ਉਹੀ ਹੈ: ਕੀ ਵੈੱਬਸਾਈਟ ਮਾਲਕਾਂ ਦੀ ਸਪੱਸ਼ਟ ਸਹਿਮਤੀ ਤੋਂ ਬਿਨਾਂ ਇੰਟਰਨੈਟ ਕੰਟੈਂਟ ਦੀ ਮਾਸ ਸਕ੍ਰੇਪਿੰਗ (mass scraping) ਕਾਨੂੰਨੀ ਪ੍ਰਾਪਤੀ ਹੈ ਜਾਂ ਕਾਪੀਰਾਈਟ ਦੀ ਉਲੰਘਣਾ?
ਇਹ ਸਮਝੌਤਾ AI ਉਦਯੋਗ ਲਈ ਇੱਕ ਦੋਹਰੀ ਕਾਨੂੰਨੀ ਹਕੀਕਤ ਨੂੰ ਉਜਾਗਰ ਕਰਦਾ ਹੈ। ਕੰਪਨੀਆਂ ਇਹ ਯਕੀਨੀ ਬਣਾ ਕੇ ਭਾਰੀ ਜੁਰਮਾਨਿਆਂ ਤੋਂ ਬਚ ਸਕਦੀਆਂ ਹਨ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਡੇਟਾ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚੋਂ ਜਾਣੇ-ਪਛਾਣੇ ਪਾਇਰੇਟਡ ਰਿਪੋਜ਼ਟਰੀਆਂ ਨੂੰ ਸਾਫ਼ ਕਰ ਦਿੱਤਾ ਗਿਆ ਹੈ, ਪਰ ਵੈੱਬ ਪ੍ਰਕਾਸ਼ਕਾਂ ਅਤੇ ਕੰਟੈਂਟ ਬਣਾਉਣ ਵਾਲਿਆਂ ਦੇ ਅਧਿਕਾਰਾਂ ਦੇ ਸਬੰਧ ਵਿੱਚ ਉਹ ਅਜੇ ਵੀ ਇੱਕ ਅਨਿਸ਼ਚਿਤ ਸਥਿਤੀ ਦਾ ਸਾਹਮਣਾ ਕਰ ਰਹੇ ਹਨ। ਜਿਵੇਂ-ਜਿਵੇਂ AI ਲੈਬਾਂ ਦਾ ਪੈਮਾਨਾ ਵਧਦਾ ਜਾ ਰਿਹਾ ਹੈ, ਰੂਪਾਂਤਰਕਾਰੀ ਤਕਨੀਕੀ ਤਰੱਕੀ ਅਤੇ ਬੌਧਿਕ ਸੰਪੱਤੀ ਅਧਿਕਾਰਾਂ (intellectual property rights) ਵਿਚਕਾਰ ਤਣਾਅ ਉਦਯੋਗ ਦੀ ਸਭ ਤੋਂ ਵੱਡੀ ਕਾਨੂੰਨੀ ਰੁਕਾਵਟ ਬਣਿਆ ਰਹੇਗਾ।
ਮੁੱਖ ਗੱਲਾਂ
- ਰਿਕਾਰਡ ਤੋੜ ਭੁਗਤਾਨ: LibGen ਵਰਗੇ ਪਾਇਰੇਟਡ ਡੇਟਾਬੇਸਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਤੋਂ ਬਾਅਦ Anthropic ਲੇਖਕਾਂ ਨੂੰ $1.5 ਬਿਲੀਅਨ ਦਾ ਭੁਗਤਾਨ ਕਰੇਗਾ, ਜੋ ਕਿ ਕਲਾਸ ਐਕਸ਼ਨ ਇਤਿਹਾਸ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਡਾ ਕਾਪੀਰਾਈਟ ਸਮਝੌਤਾ ਹੈ।
- Fair Use ਦੀ ਨਜ਼ੀਰ: ਅਦਾਲਤ ਨੇ ਪੁਸ਼ਟੀ ਕੀਤੀ ਕਿ ਕਾਨੂੰਨੀ ਤੌਰ 'ਤੇ ਪ੍ਰਾਪਤ ਕੀਤੇ ਗਏ ਡੇਟਾ 'ਤੇ AI ਨੂੰ ਸਿਖਲਾਈ ਦੇਣਾ "ਬਹੁਤ ਹੀ ਰੂਪਾਂਤਰਕਾਰੀ" (spectacularly transformative) ਹੈ, ਜੋ ਜਾਇਜ਼ AI ਸਿਖਲਾਈ ਲਈ ਇੱਕ ਵੱਡਾ ਕਾਨੂੰਨੀ ਢਾਲ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- ਡੇਟਾ ਦੀ ਸ਼ੁੱਧਤਾ ਮਹੱਤਵਪੂਰਨ ਹੈ: ਇਹ ਫੈਸਲਾ ਇਸ ਗੱਲ 'ਤੇ ਜ਼ੋਰ ਦਿੰਦਾ ਹੈ ਕਿ AI ਸਿਖਲਾਈ ਦੀ ਕਾਨੂੰਨੀਤਾ ਅਕਸਰ ਸਿਖਲਾਈ ਦੀ ਪ੍ਰਕਿਰਿਆ ਦੀ ਬਜਾਏ ਸਿਖਲਾਈ ਡੇਟਾ ਦੇ ਸਰੋਤ (provenance) 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ।
