ಪ್ರಮುಖ ಕಾಪಿರೈಟ್ ವಿಚಾರಣೆಯಲ್ಲಿ ಸಾಕ್ಷ್ಯಗಳನ್ನು ಮರೆಮಾಚಿದ್ದಕ್ಕಾಗಿ NYT, OpenAI ಅನ್ನು ಆರೋಪಿಸಿದೆ
The New York Times ಮತ್ತು OpenAI ನಡುವಿನ ನಡೆಯುತ್ತಿರುವ ಕಾನೂನು ಹೋರಾಟವು ಒಂದು ನಾಟಕೀಯ ತಿರುವು ಪಡೆದಿದೆ. AI ದೈತ್ಯ ಸಂಸ್ಥೆಯು ತನ್ನ ತರಬೇತಿ ಡೇಟಾಸೆಟ್ಗಳಿಗೆ (training datasets) ಸಂಬಂಧಿಸಿದ ಸಾಕ್ಷ್ಯಗಳನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಮರೆಮಾಚಿದೆ ಎಂಬ ಆರೋಪಗಳು ಕೇಳಿಬಂದಿವೆ. ಈ ಬೆಳವಣಿಗೆಯು ಈ ಮೊಕದ್ದಮೆಯ ಗಮನವನ್ನು ಕಾಪಿರೈಟ್ ಉಲ್ಲಂಘನೆಯಿಂದ ನ್ಯಾಯಾಂಗದ ಶೋಧನಾ ಪ್ರಕ್ರಿಯೆಯ (judicial discovery process) ಸಮಗ್ರತೆಯತ್ತ ತಿರುಗಿಸುವ ಅಪಾಯವನ್ನು ಎದುರಿಸುತ್ತಿದೆ.
ವಂಚನೆಯ ದತ್ತಾಂಶ ಪದ್ಧತಿಗಳ ಆರೋಪಗಳು
ತನ್ನ ತರಬೇತಿ ಕೋಪಸ್ (training corpus) ಮತ್ತು ಗ್ರಾಹಕರ ಚಾಟ್ ಲಾಗ್ಗಳನ್ನು ಹುಡುಕುವ ತಾಂತ್ರಿಕ ಸಾಮರ್ಥ್ಯದ ಬಗ್ಗೆ OpenAI ಸುಳ್ಳು ಹೇಳುತ್ತಿದೆ ಎಂದು The New York Times ಮತ್ತು The Daily News ಆರೋಪಿಸಿವೆ. ಕಳೆದ ಎರಡು ವರ್ಷಗಳ ಕಾನೂನು ಹೋರಾಟದ ಅವಧಿಯಲ್ಲಿ, ತನ್ನ ಬೃಹತ್ ಡೇಟಾಸೆಟ್ಗಳನ್ನು ಹುಡುಕುವುದು ತಾಂತ್ರಿಕವಾಗಿ ಕಷ್ಟಕರ ಮತ್ತು ಇದು ಬಳಕೆದಾರರ ಗೌಪ್ಯತೆಗೆ ಧಕ್ಕೆ ತರುತ್ತದೆ ಎಂದು OpenAI ವಾದಿಸುತ್ತಾ ಬಂದಿದೆ.
ಆದಾಗ್ಯೂ, OpenAI ಡೇಟಾ ಪ್ರೈವೆಸಿ ಇಂಜಿನಿಯರ್ ವಿನ್ನಿ ಮೊನಾಕೊ ಅವರ ಇತ್ತೀಚಿನ ಸಾಕ್ಷ್ಯವು (deposition) ಈ ವಾದವನ್ನು ಪ್ರಶ್ನಿಸಿದೆ. ಕಾಪಿರೈಟ್ ಹೊಂದಿರುವ ಪತ್ರಿಕೋದ್ಯಮದ ಕೃತಿಗಳನ್ನು ಗುರುತಿಸಲು OpenAI ಈಗಾಗಲೇ ತನ್ನ ತರಬೇತಿ ಕೋಪಸ್ನಲ್ಲಿ ಆಂತರಿಕ ಹುಡುಕಾಟಗಳನ್ನು ನಡೆಸಿದೆ ಎಂದು ಮೊನಾಕೊ ಬಹಿರಂಗಪಡಿಸಿದ್ದಾರೆ ಎಂದು ಹೇಳಲಾಗಿದೆ. ಇದಲ್ಲದೆ, ಸಂಭವನೀಯ ಕಾಪಿರೈಟ್ ಉಲ್ಲಂಘನೆಯ ವ್ಯಾಪ್ತಿಯನ್ನು ಆಂತರಿಕವಾಗಿ ಅಳೆಯಲು OpenAI ಸುಮಾರು 78 ಮಿಲಿಯನ್ ಡಿ-ಐಡೆಂಟಿಫೈಡ್ (de-identified) ChatGPT ಸಂಭಾಷಣೆಗಳ ಡೇಟಾಬೇಸ್ ಅನ್ನು ಸಂಗ್ರಹಿಸಿತ್ತು ಎಂದು ಈ ಸಾಕ್ಷ್ಯವು ಸೂಚಿಸುತ್ತದೆ.
Project Giraffe ಮತ್ತು "Bloom" ಫಿಲ್ಟರ್
ಬಹುಶಃ ಅತ್ಯಂತ ಮಹತ್ವದ ತಾಂತ್ರಿಕ ವಿಷಯವೆಂದರೆ OpenAI ಜಾರಿಗೆ ತಂದಿರುವ "Project Giraffe" ಎಂಬ ಪರಿಕರಗಳ ಸೆಟ್. ದೂರುದಾರರ ಪ್ರಕಾರ, ಮೊಕದ್ದಮೆ ದಾಖಲಾದ ತಕ್ಷಣವೇ, OpenAI ತನ್ನ ಔಟ್ಪುಟ್ಗಳಲ್ಲಿ ಕಾಪಿರೈಟ್ ಹೊಂದಿರುವ ವಿಷಯವನ್ನು ಅಕ್ಷರಶಃ ಪುನರಾವರ್ತಿಸುವ "regurgitation" ಘಟನೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ದಾಖಲಿಸಲು ಈ ಯೋಜನೆಯ ಭಾಗವಾಗಿ "Bloom" ಫಿಲ್ಟರ್ ಅನ್ನು ಬಳಸಿದೆ.
ತನ್ನ ಲಾಗ್ಗಳಲ್ಲಿ ವಿಷಯ ಪುನರಾವರ್ತನೆಯ ನಿರ್ದಿಷ್ಟ ಘಟನೆಗಳನ್ನು ಗುರುತಿಸುವುದು ಅಸಾಧ್ಯವಾದ ಕೆಲಸ ಎಂಬ OpenAI ನ ಹಿಂದಿನ ನಿಲುವನ್ನು Project Giraffe ನ ಅಸ್ತಿತ್ವವು ವಿರೋಧಿಸುತ್ತದೆ. ಕಾಪಿರೈಟ್ ಉಲ್ಲಂಘನೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲು OpenAI ಕೇವಲ ಸಮರ್ಥವಾಗಿರಲಿಲ್ಲ, ಬದಲಾಗಿ ಅದನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಸಕ್ರಿಯವಾಗಿ ಮೂಲಸೌಕರ್ಯವನ್ನು ನಿರ್ಮಿಸುತ್ತಿತ್ತು ಎಂದು ದೂರುದಾರರು ವಾದಿಸುತ್ತಾರೆ.
ದತ್ತಾಂಶ ಸಮಗ್ರತೆ ಮತ್ತು ಶೋಧನೆಯ ಮೇಲಿನ ವಿವಾದಗಳು
ಈ ಸಂಘರ್ಷವು ನ್ಯಾಯಾಲಯಕ್ಕೆ ಒದಗಿಸಲಾದ ದತ್ತಾಂಶದ ಗುಣಮಟ್ಟದ ಮೇಲೆಯೂ ಕೇಂದ್ರಿತವಾಗಿದೆ. ದೂರುದಾರರು ಮೂಲತಃ 120 ಮಿಲಿಯನ್ ಚಾಟ್ ಲಾಗ್ಗಳ ಮಾದರಿಯನ್ನು ಕೋರಿದ್ದರು, ಆದರೆ OpenAI ಅದನ್ನು 20 ಮಿಲಿಯನ್ಗೆ ಇಳಿಸಲು ಒಪ್ಪಿಗೆ ಪಡೆಯಿತು. ಡಿಸೆಂಬರ್ನಲ್ಲಿ ಅಂತಿಮವಾಗಿ ಮಾದರಿಯನ್ನು ಸಲ್ಲಿಸಿದಾಗ, ಅತಿಯಾದ ಮಾಹಿತಿಯ ಮರೆಮಾಚುವಿಕೆಯಿಂದಾಗಿ (redactions) ಅದು "ಬಳಸಲು ಅಸಾಧ್ಯವಾಗಿದೆ" ಎಂದು ನ್ಯಾಯಾಲಯವು ಕಂಡುಕೊಂಡಿದೆ ಎಂದು ವರದಿಯಾಗಿದೆ.
NYT ಇನ್ನೂ ಮುಂದೆ ಹೋಗಿದ್ದು, ನ್ಯಾಯಾಲಯದ ಆದೇಶದಂತೆ ದತ್ತಾಂಶವನ್ನು ಸಂರಕ್ಷಿಸುವ ಆದೇಶವನ್ನು ಉಲ್ಲಂಘಿಸಿ OpenAI ಶತಕೋಟಿ ChatGPT ಔಟ್ಪುಟ್ಗಳನ್ನು ಅಳಿಸಿಹಾಕಿದೆ ಮತ್ತು ಒದಗಿಸಲಾದ ಮಾದರಿಯಲ್ಲಿ ಲಕ್ಷಾಂತರ ಲಾಗ್ಗಳನ್ನು ಬದಲಾಯಿಸಿದೆ ಎಂದು ಆರೋಪಿಸಿದೆ. ಇದಕ್ಕೆ ಪ್ರತಿಕ್ರಿಯೆಯಾಗಿ, OpenAI ವಕ್ತಾರ ಡ್ರೂ ಪುಸೇಟರಿ ಎಲ್ಲಾ ಆರೋಪಗಳನ್ನು ನಿರಾಕರಿಸಿದ್ದಾರೆ ಮತ್ತು ತಮ್ಮ ಕಾನೂನು ಪ್ರಕರಣವು ದುರ್ಬಲಗೊಳ್ಳುತ್ತಿರುವಾಗ ಬಳಕೆದಾರರ ಗೌಪ್ಯತೆಯನ್ನು ಉಲ್ಲಂಘಿಸುವ ಪ್ರಯತ್ನ ಮಾಡುತ್ತಿದೆ ಎಂದು Times ಅನ್ನು ಆರೋಪಿಸಿದ್ದಾರೆ.
ಇದು AI ಉದ್ಯಮಕ್ಕೆ ಏಕೆ ಮುಖ್ಯ?
ಈ ಪ್ರಕರಣವು ಜನರೇಟಿವ್ AI (generative AI) ಅಭಿವೃದ್ಧಿ ಮತ್ತು "fair use" ನ ಕಾನೂನು ಮಿತಿಗಳ ಭವಿಷ್ಯಕ್ಕೆ ಒಂದು ಸೂಚಕವಾಗಿದೆ. OpenAI ಸಾಕ್ಷ್ಯಗಳನ್ನು ಮರೆಮಾಚಿದೆ ಅಥವಾ ಶೋಧನಾ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಕುಶಲತೆಯಿಂದ ನಿರ್ವಹಿಸಿದೆ ಎಂದು ನ್ಯಾಯಾಲಯವು ಕಂಡುಕೊಂಡರೆ, AI ಕಂಪನಿಗಳು ತಮ್ಮ ತರಬೇತಿ ವಿಧಾನಗಳು ಮತ್ತು ದತ್ತಾಂಶದ ಮೂಲವನ್ನು (data lineage) ಹೇಗೆ ಬಹಿರಂಗಪಡಿಸಬೇಕು ಎಂಬುದಕ್ಕೆ ಇದು ಒಂದು ಮಾದರಿಯಾಗುತ್ತದೆ. ಡೆವಲಪರ್ಗಳು ಮತ್ತು AI ಸಂಸ್ಥಾಪಕರಿಗೆ, ಬೃಹತ್ ದತ್ತಾಂಶ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಬೌದ್ಧಿಕ ಆಸ್ತಿ ಹಕ್ಕುಗಳ ನಡುವಿನ ಸಂಘರ್ಷವನ್ನು ನಿಭಾಯಿಸುವಾಗ ಎಂತಹ ಪಾರದರ್ಶಕತೆ ಅಗತ್ಯ ಎಂಬುದನ್ನು ಈ ಫಲಿತಾಂಶವು ಸ್ಪಷ್ಟಪಡಿಸುತ್ತದೆ.
ಪ್ರಮುಖ ಅಂಶಗಳು
- ಆಂತರಿಕ ಮೇಲ್ವಿಚಾರಣಾ ಪರಿಕರಗಳು: ಕಾಪಿರೈಟ್ ಹೊಂದಿರುವ ವಿಷಯದ ಪುನರಾವರ್ತನೆಯನ್ನು ಸಕ್ರಿಯವಾಗಿ ಪತ್ತೆಹಚ್ಚಲು OpenAI "Project Giraffe" ಮತ್ತು "Bloom" ಫಿಲ್ಟರ್ ಅನ್ನು ಬಳಸಿದೆ ಎಂದು ಆರೋಪಿಸಲಾಗಿದೆ.
- ವಿರೋಧಾಭಾಸದ ಸಾಕ್ಷ್ಯ: ತನ್ನ ತರಬೇತಿ ಡೇಟಾವನ್ನು ಹುಡುಕುವ ತಾಂತ್ರಿಕ ಸಾಮರ್ಥ್ಯ OpenAI ಹೊಂದಿತ್ತು ಎಂದು ಸಾಕ್ಷ್ಯವು ಸೂಚಿಸುತ್ತದೆ, ಇದು ತಾಂತ್ರಿಕವಾಗಿ ಕಷ್ಟಕರ ಎಂಬ ಅದರ ಹಿಂದಿನ ವಾದಕ್ಕೆ ವಿರುದ್ಧವಾಗಿದೆ.
- ಶೋಧನಾ ಸಮಗ್ರತೆಯ ಮೇಲೆ ಸಂಕಷ್ಟ: ಔಟ್ಪುಟ್ಗಳನ್ನು ಅಳಿಸುವ ಮೂಲಕ ಮತ್ತು "ಬಳಸಲು ಅಸಾಧ್ಯವಾದ" ಮಾಹಿತಿಯನ್ನು ಒದಗಿಸುವ ಮೂಲಕ OpenAI ಸಂರಕ್ಷಣಾ ಆದೇಶಗಳನ್ನು ಉಲ್ಲಂಘಿಸಿದೆಯೇ ಎಂಬ ಅಂಶದ ಮೇಲೆ ಈಗ ಈ ಮೊಕದ್ದಮೆ ಅವಲಂಬಿತವಾಗಿದೆ.
