ಈ ಪ್ರಕರಣ ನ್ಯಾಯಾಲಯಕ್ಕೆ ಬಂದಿದ್ದೇಕೆ
ಆಗಸ್ಟ್ ಮತ್ತು ಸೆಪ್ಟೆಂಬರ್ 2024 ರಲ್ಲಿ ಪ್ರಕಟವಾದ ತನ್ನದೇ ಆದ ಲೇಖನಗಳಂತೆಯೇ ಇತ್ತೀಚಿನ ಭಾರತೀಯ ಸುದ್ದಿಗಳ ಕುರಿತಾದ ChatGPT ನ ಉತ್ತರಗಳು ಇವೆ ಎಂದು ಗಮನಿಸಿದ ನಂತರ ANI ದೂರು ನೀಡಿತು. ಈ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ (LLM) ತನ್ನ ಕಾಪಿರೈಟ್ ಹೊಂದಿರುವ ಪಠ್ಯವನ್ನು ಮರುಸೃಷ್ಟಿಸುತ್ತಿದೆ ಎಂದು ಏಜೆನ್ಸಿ ವಾದಿಸಿತು. ಒಂದು ವೇಳೆ ಈ ವಾದವನ್ನು ಒಪ್ಪಿಕೊಂಡರೆ, OpenAI ತನ್ನ ಮಾಡೆಲ್ಗಳನ್ನು ಭಾರತದಲ್ಲಿ ನಿಲ್ಲಿಸಬೇಕಾಗುತ್ತದೆ ಅಥವಾ ಕಟ್ಟುನಿಟ್ಟಾಗಿ ನಿರ್ಬಂಧಿಸಬೇಕಾಗುತ್ತದೆ.
ಉಲ್ಲೇಖಿಸಲಾದ ಎರಡು ಮಾಡೆಲ್ಗಳಾದ GPT-4 ಮತ್ತು ಹೊಸದಾದ GPT-4o, ಏಪ್ರಿಲ್ 2022 ಮತ್ತು ಏಪ್ರಿಲ್ 2024 ರ ಕಟ್-ಆಫ್ ದಿನಾಂಕಗಳ ಡೇಟಾದ ಮೇಲೆ ತರಬೇತಿ ಪಡೆದಿವೆ ಎಂದು OpenAI ಪ್ರತಿಕ್ರಿಯಿಸಿತು. ANI ನ ಲೇಖನಗಳು ಆ ದಿನಾಂಕಗಳ ನಂತರ ಬಂದಿದ್ದರಿಂದ, ಅವು ಮೂಲ ತರಬೇತಿ ಸೆಟ್ನಲ್ಲಿ ಇರಲು ಸಾಧ್ಯವಿಲ್ಲ. ಈ ಸಾಮ್ಯತೆಯು ಬಹುಶಃ Retrieval-Augmented Generation (RAG) ನಿಂದ ಬಂದಿರಬಹುದು ಎಂದು ನ್ಯಾಯಾಧೀಶ ಅಮಿತ್ ಬನ್ಸಲ್ ಹೇಳಿದರು; ಇದು ಮಾಡೆಲ್ ಲೇಖನಗಳನ್ನು "ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವ" ಬದಲು, ನೈಜ ಸಮಯದಲ್ಲಿ ಪ್ರಸ್ತುತ ವೆಬ್ ವಿಷಯವನ್ನು ಪ್ರತಿಕ್ರಿಯೆಗೆ ತರುತ್ತದೆ.
ಕಾನೂನು ತಿರುವು: ತರಬೇತಿಯನ್ನು "ಸಂಶೋಧನೆ" ಎಂದು ಪರಿಗಣಿಸುವುದು
"ಖಾಸಗಿ ಅಥವಾ ವೈಯಕ್ತಿಕ ಬಳಕೆ, ಸಂಶೋಧನೆ ಸೇರಿದಂತೆ" ಎಂಬ ಭಾರತದ ಕಾಪಿರೈಟ್ ವಿನಾಯಿತಿಯನ್ನು ನ್ಯಾಯಾಲಯವು ವಿಶಾಲವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸಿರುವುದರಿಂದ ಈ ಪ್ರಕರಣವು ಮಹತ್ವದ್ದಾಗಿದೆ. ಆರಂಭಿಕ ತರಬೇತಿ ಹಂತದಲ್ಲಿ OpenAI, ANI ಸಾಮಗ್ರಿಗಳನ್ನು ಬಳಸಿಕೊಂಡಿತು ಎಂಬುದನ್ನು ಎರಡೂ ಕಡೆಯವರು ಒಪ್ಪಿಕೊಂಡರು, ಆದರೆ ನ್ಯಾಯಾಧೀಶರು ಆ ಬಳಕೆಯನ್ನು "ಪರಿವರ್ತನಾತ್ಮಕ" (transformative) ಎಂದು ಪರಿಗಣಿಸಿದರು. ಅಂದರೆ, ಮಾಡೆಲ್ ಕೇವಲ ವ್ಯಾಕರಣ, ಸಂಯೋಜನೆ (syntax) ಮತ್ತು ಸಾಂಖ್ಯಿಕ ಮಾದರಿಗಳನ್ನು ಮಾತ್ರ ಹೊರತೆಗೆಯಿತು ಮತ್ತು ಅಭಿವ್ಯಕ್ತಿಶೀಲ ವಿಷಯವನ್ನು ಹಾಗೆಯೇ ಬಿಟ್ಟಿತು.
ನ್ಯಾಯಾಲಯವು ಎರಡು ಕಟ್ಟುನಿಟ್ಟಿನ ಷರತ್ತುಗಳನ್ನು ವಿಧಿಸಿತು:
- ತರಬೇತಿಗಾಗಿ ಬಳಸುವ ಪ್ರತಿಗಳು ಕಾನೂನುಬದ್ಧ ಮೂಲಗಳಿಂದ ಬರಬೇಕು, ಪೈರೇಟೆಡ್ ಆರ್ಕೈವ್ಗಳು ಅಥವಾ ಬಳಕೆದಾರರು ಪ್ರವೇಶಿಸಲು ಸಾಧ್ಯವಾಗದ ಪೇವಾಲ್ಗಳಿಂದ (paywalls) ಬರಬಾರದು.
- ಸಾಮಗ್ರಿಗಳನ್ನು ಡೆವಲಪರ್ನ ಸ್ವಂತ ಪರಿಸರದಲ್ಲಿಯೇ ಇರಿಸಬೇಕು; ಅವುಗಳನ್ನು ಪ್ರಕಟಿಸುವಂತಿಲ್ಲ ಅಥವಾ ವಿತರಿಸುವಂತಿಲ್ಲ.
ಮೂರು ಹಂತದ ನ್ಯಾಯಸಮ್ಮತತೆಯ ಪರೀಕ್ಷೆಯನ್ನು ಅನ್ವಯಿಸಿದ ನ್ಯಾಯಾಧೀಶರು, OpenAI ನ ಬಳಕೆ ತರಬೇತಿಗೆ ಮಾತ್ರ ಸೀಮಿತವಾಗಿದೆ ಎಂದು ಕಂಡುಕೊಂಡರು, ಮಾಡೆಲ್ ಅಕ್ಷರಶಃ ವಾಕ್ಯಗಳನ್ನು ನೆನಪಿಟ್ಟುಕೊಂಡಿದೆ ಎಂಬುದಕ್ಕೆ ಯಾವುದೇ ಪುರಾವೆ ಕಂಡುಬರಲಿಲ್ಲ ಮತ್ತು ಎರಡು ಸಂಸ್ಥೆಗಳು ವಿಭಿನ್ನ ಮಾರುಕಟ್ಟೆ ವಿಭಾಗಗಳಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವುದರಿಂದ ANI ಯಾವುದೇ ನೇರ ಆರ್ಥಿಕ ನಷ್ಟವನ್ನು ಅನುಭವಿಸಿಲ್ಲ ಎಂದು ಗಮನಿಸಿದರು.
ಜಾಗತಿಕ ತೀರ್ಪುಗಳ ಸರಣಿಯಲ್ಲಿ ಇದು ಹೇಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ
ಭಾರತದ ನಿಲುವು ಈಗ AI ಫಲಿತಾಂಶಗಳ ಪರಿವರ್ತನಾತ್ಮಕ ದೃಷ್ಟಿಕೋನವನ್ನು ಬೆಂಬಲಿಸುವ ಹಲವಾರು ಅಮೆರಿಕದ ಪ್ರಕರಣಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ. Kadrey v. Meta ಪ್ರಕರಣದಲ್ಲಿ, ನಿಖರವಾದ ಪದಗಳನ್ನು ನಕಲಿಸದ ಜನರೇಟೆಡ್ ಪಠ್ಯವು ಉಲ್ಲಂಘನೆಯಲ್ಲ ಎಂದು ನ್ಯಾಯಾಲಯವು ತೀರ್ಪು ನೀಡಿತು, ಹಾಗೆಯೇ ದೀರ್ಘಕಾಲದ Google Books ನಿರ್ಧಾರವು ಡಿಜಿಟಲೀಕರಣ ಯೋಜನೆಗಳಿಗಾಗಿ ಸೀಮಿತ "search-and-display" ವಿನಾಯಿತಿಯನ್ನು ಗುರುತಿಸಿತು. Raw Story ಪ್ರಕರಣದಂತಹ ಇತರ ಅಮೆರಿಕದ ಮೊಕದ್ದಮೆಗಳನ್ನು ಸಾಬೀತುಪಡಿಸಬಹುದಾದ ಹಾನಿಯ ಕೊರತೆಯಿಂದಾಗಿ ವಜಾಗೊಳಿಸಲಾಯಿತು, ಆದರೆ Anthropic ವಿವಾದವು ಪೈರೇಟೆಡ್ ಡೇಟಾವನ್ನು ಬಳಸುವುದು ಹೊಣೆಗಾರಿಕೆಯನ್ನು ತರಬಹುದು ಎಂದು ನ್ಯಾಯಾಧೀಶರಿಗೆ ನೆನಪಿಸಿತು.
ಯುರೋಪಿನಾದ್ಯಂತ ಅಭಿಪ್ರಾಯಗಳು ತೀವ್ರವಾಗಿ ಭಿನ್ನವಾಗಿವೆ. ಮಾಡೆಲ್ ತೂಕಗಳಲ್ಲಿ (model weights) ಅಡಕವಾಗಿರುವ ಸಾಹಿತ್ಯವನ್ನು ಮರುಸೃಷ್ಟಿಸುವುದು ಉಲ್ಲಂಘನೆ ಎಂದು ಮ್ಯೂನಿಕ್ ನ್ಯಾಯಾಲಯಗಳು ತೀರ್ಪು ನೀಡಿದೆ, ಆದರೆ ಲಂಡನ್ ಟ್ರಿಬ್ಯೂನಲ್ ಇತ್ತೀಚೆಗೆ Stability AI ವಿರುದ್ಧದ ಸಮಾನವಾದ ದೂರವನ್ನು ವಜಾಗೊಳಿಸಿತು. ದೆಹಲಿ ಹೈಕೋರ್ಟ್ನ ತೀರ್ಪು ಮತ್ತೊಂದು ಅಂಶವನ್ನು ಸೇರಿಸುತ್ತದೆ: ತರಬೇತಿಯು ಕಾನೂನುಬದ್ಧ ಮೂಲಗಳಿಗೆ ಸೀಮಿತವಾಗಿದ್ದರೆ ಮತ್ತು ಫಲಿತಾಂಶವು ಅಕ್ಷರಶಃ ಪ್ರತಿ (verbatim copy) ಆಗಿಲ್ಲದಿದ್ದರೆ, ಆ ಚಟುವಟಿಕೆಯು ಸಂಶೋಧನಾ ವಿನಾಯಿತಿಯ ಅಡಿಯಲ್ಲಿ ಬರಬಹುದು.
ಡೆವಲಪರ್ಗಳು ಯಾವುದನ್ನು ಗಮನಿಸಬೇಕು
- RAG vs. training – "ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದು" (ತರಬೇತಿ) ಮತ್ತು ನೈಜ-ಸಮಯದ ಮಾಹಿತಿ ಪಡೆಯುವಿಕೆ (RAG) ನಡುವಿನ ನ್ಯಾಯಾಲಯದ ವ್ಯತ್ಯಾಸವು, ಭವಿಷ್ಯದ ವಿವಾದಗಳು ಉತ್ತರವು ಸ್ಥಿರ ಜ್ಞಾನದ ತಳಪಾಯದಿಂದ (static knowledge base) ಬರುತ್ತದೆಯೇ ಅಥವಾ ವೆಬ್ನಿಂದ ನೇರವಾಗಿ ಪಡೆಯಲಾಗುತ್ತದೆಯೇ ಎಂಬುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುತ್ತವೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ. ಡೆವಲಪರ್ಗಳು ತಮ್ಮ ಉತ್ಪನ್ನದ ದಾಖಲಾತಿಗಳಲ್ಲಿ (product documentation) ಆ ವ್ಯತ್ಯಾಸವನ್ನು ಇನ್ನಷ್ಟು ಸ್ಪಷ್ಟಪಡಿಸುವ ಅಗತ್ಯವಿರಬಹುದು.
- Source provenance – "ಕಾನೂನುಬದ್ಧ ಮೂಲಗಳು" ಎಂಬ ಅವಶ್ಯಕತೆಯು ಪ್ರತಿ ಪಠ್ಯದ ತುಣುಕನ್ನು ಕಾನೂನುಬದ್ಧ ಎಂದು ಸಾಬೀತುಪಡಿಸುವ ಒಪ್ಪಂದಗಳು ಅಥವಾ ಪರವಾನಗಿಗಳನ್ನು ಬಳಸುವ ಮೂಲಕ ಡೇಟಾ-ಕ್ಯೂರೇಶನ್ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಬಿಗಿಗೊಳಿಸಲು ಕಂಪನಿಗಳನ್ನು ಪ್ರೇರೇಪಿಸಬಹುದು.
- Internal-only use – ಮಾಡೆಲ್ ಫಲಿತಾಂಶಗಳನ್ನು ವಾಣಿಜ್ಯೀಕರಿಸಲು ಯೋಜಿಸುತ್ತಿರುವ ಕಂಪನಿಗಳು ತರಬೇತಿ ಡೇಟಾವನ್ನು ಕಟ್ಟುನಿಟ್ಟಾಗಿ ಆಂತರಿಕವಾಗಿರಿಸಬೇಕು. ಪಾಲುದಾರರೊಂದಿಗೆ ಅಥವಾ ಸಾರ್ವಜನಿಕರೊಂದಿಗೆ ಕಚ್ಚಾ ದತ್ತಾಂಶ ಸಂಗ್ರಹಗಳನ್ನು (raw corpora) ಹಂಚಿಕೊಳ್ಳುವುದು ಸಂಶೋಧನಾ ರಕ್ಷಣೆಯನ್ನು ಕುಗ್ಗಿಸಬಹುದು.
- Economic-harm test – ನೇರ ಆರ್ಥಿಕ ಹಾನಿಯ ಅನುಪಸ್ಥಿತಿಯನ್ನು ನ್ಯಾಯಾಲಯವು ಒತ್ತಿಹೇಳಿರುವುದರಿಂದ, ದೂರುದಾರರು ಕೇವಲ ಬ್ರ್ಯಾಂಡ್ನ ಮೌಲ್ಯ ಕುಸಿತವನ್ನು ತೋರಿಸಿದರೆ ಸಾಲದು, ಬದಲಾಗಿ ನಿರ್ದಿಷ್ಟ ನಷ್ಟವನ್ನು ತೋರಿಸಬೇಕಾಗುತ್ತದೆ.
- Legislative response – ಭಾರತೀಯ ಶಾಸಕರು AI ಸಂಬಂಧಿತ ಕಾಪಿರೈಟ್ ಚರ್ಚೆಗಳನ್ನು ಗಮನಿಸುತ್ತಿದ್ದಾರೆ. ಸಂಶೋಧನಾ ವಿನಾಯಿತಿಯನ್ನು ಕುಗ್ಗಿಸುವ ಯಾವುದೇ ತಿದ್ದುಪಡಿ ಈಗಾಗಲೇ ನಿಯೋಜಿಸಲಾದ ಮಾಡೆಲ್ಗಳ ಮೇಲೆ ಹಿನ್ನಡೆ ಪರಿಣಾಮ ಬೀರಬಹುದು, ಇದು ಅನುಸರಣಾ ಆಡಿಟ್ಗಳ (compliance audits) ಅಲೆಗೆ ಕಾರಣವಾಗಬಹುದು.
AI ಅನ್ನು ಇನ್ನೂ ಕಾಡುತ್ತಿರುವ ವಿರೋಧಾತ್ಮಕ ವಾದ
ANI ದೂರು ಒಂದು ನೈಜ ಕಳವಳವನ್ನು ಎತ್ತಿ ತೋರಿಸಿದೆ: LLMಗಳು ನಿರ್ದಿಷ್ಟ ಪದಬಳಕೆಯನ್ನು ಪ್ರತಿಧ್ವನಿಸುವಲ್ಲಿ ಹೆಚ್ಚು ಪರಿಣಿತರಾಗುತ್ತಿದ್ದಂತೆ, "ಪರಿವರ್ತನಾತ್ಮಕ" ಬಳಕೆ ಮತ್ತು "ನಕಲು" ನಡುವಿನ ಗೆರೆ ಮಸುಕಾಗಬಹುದು. RAG ತಾಂತ್ರಿಕವಾಗಿ ಸರ್ಚ್ ಫಂಕ್ಷನ್ ಆಗಿದ್ದರೂ ಸಹ, ಅನುಮತಿಯಿಲ್ಲದೆ ಕಾಪಿರೈಟ್ ಹೊಂದಿರುವ ವಿಷಯವನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆ ಮತ್ತು ಇದು "ಸಾರ್ವಜನಿಕರಿಗೆ ಸಂವಹನ" (communication to the public) ಹಕ್ಕನ್ನು ಉಲ್ಲಂಘಿಸಬಹುದು ಎಂದು ವಿಮರ್ಶಕರು ವಾದಿಸುತ್ತಾರೆ.
ಜಾಗತಿಕ ಮಟ್ಟದಲ್ಲಿ ಪರಿಣಾಮ ಬೀರುವ ಒಂದು ಪೂರ್ವನಿದರ್ಶನ
ಮೋಡಲ್ ತರಬೇತಿಯನ್ನು ಅನುಮತಿಸಬಹುದಾದ ಸಂಶೋಧನಾ ಚಟುವಟಿಕೆಯೆಂದು ವರ್ಗೀಕರಿಸುವ ಮೂಲಕ, ಮೂಲದ ಕಾನೂನುಬದ್ಧತೆಯನ್ನು ಗೌರವಿಸಿ ಮತ್ತು ತರಬೇತಿಯನ್ನು ಆಂತರಿಕವಾಗಿ ಇಟ್ಟುಕೊಂಡರೆ, ಕಾಪಿರೈಟ್ ಆಧಾರದ ಮೇಲೆ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ಗಳ (large language models) ಅಭಿವೃದ್ಧಿಯನ್ನು ಭಾರತವು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ತಡೆಯುವುದಿಲ್ಲ ಎಂದು ದೆಹಲಿ ಹೈಕೋರ್ಟ್ ಸೂಚಿಸಿದೆ. ಪ್ರಮುಖ ಕಾನೂನು ಅಡೆತಡೆ ಸಡಿಲಗೊಂಡಿದೆ ಎಂಬ ಅರಿವು ಕಂಪನಿಗಳಿಗೆ ತಮ್ಮ ಭಾರತೀಯ ಕಾರ್ಯಾಚರಣೆಗಳನ್ನು ವಿಸ್ತರಿಸಲು ಪ್ರೇರೇಪಿಸಬಹುದು.
ಇತರ ದೇಶಗಳ ನಿಯಂತ್ರಕರಿಗೆ, ಈ ತೀರ್ಪು ಒಂದು ಮಾದರಿಯನ್ನು ನೀಡುತ್ತದೆ: ಸಂಕುಚಿತವಾದ ಮತ್ತು ಸರಿಯಾಗಿ ದಾಖಲಿಸಲಾದ ಸಂಶೋಧನಾ ವಿನಾಯಿತಿಯನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು, ಸ್ಪಷ್ಟವಾದ ಮೂಲದ ಮಾನದಂಡಗಳನ್ನು ಹೇರುವುದು ಮತ್ತು ತರಬೇತಿ ಡೇಟಾವನ್ನು ಕೇವಲ ಆಂತರಿಕವಾಗಿ ನಿರ್ವಹಿಸುವುದನ್ನು ಕಡ್ಡಾಯಗೊಳಿಸುವುದು. ಇಂತಹದೇ ಭಾಷೆಯನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವ ರಾಷ್ಟ್ರಗಳು ತಮ್ಮ ದೇಶೀಯ AI ಪರಿಸರ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಹೂಡಿಕೆಯನ್ನು ಆಕರ್ಷಿಸಲು ಅಗತ್ಯವಿರುವ ಖಚಿತತೆಯನ್ನು ನೀಡಬಹುದು.
ಸಾರಾಂಶ: ದೆಹಲಿ ಹೈಕೋರ್ಟ್ನ ನಿರ್ಧಾರವು AI ತರಬೇತಿಗಾಗಿ ಯಾವುದೇ ಪಠ್ಯವನ್ನು ಸ್ಕ್ರೇಪ್ ಮಾಡಲು ಮುಕ್ತ ಅವಕಾಶವನ್ನು ನೀಡುವುದಿಲ್ಲ, ಆದರೆ ಭಾರತೀಯ ಕಾನೂನಿನ ಅಡಿಯಲ್ಲಿ, ಶಿಸ್ತುಬದ್ಧ ಮತ್ತು ಕಾನೂನುಬದ್ಧ ತರಬೇತಿಯು ಸಂಶೋಧನೆ ಎಂದು ಪರಿಗಣಿಸಬಹುದು ಎಂದು ಸ್ಥಾಪಿಸುತ್ತದೆ. ಯಂತ್ರಗಳಿಗೆ ಭಾಷೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಕಲಿಸುವುದು ರಕ್ಷಿತ ಶೈಕ್ಷಣಿಕ ಚಟುವಟಿಕೆಯೋ ಅಥವಾ ಉಲ್ಲಂಘನೆಯಾಗುವ ಸಾಧ್ಯತೆಯೋ ಎಂಬ ವಿಷಯದಲ್ಲಿ ಜಗತ್ತಿನಾದ್ಯಂತದ ನ್ಯಾಯಾಲಯಗಳು ಹೋರಾಡುತ್ತಿರುವಾಗ, ಈ ವ್ಯಾಖ್ಯಾನವು ಒಂದು ಉಲ್ಲೇಖದ ಅಂಶವಾಗಬಹುದು.
