NYT กล่าวหา OpenAI ว่าปกปิดหลักฐานในการพิจารณาคดีลิขสิทธิ์ครั้งสำคัญ
การต่อสู้ทางกฎหมายที่กำลังดำเนินอยู่ระหว่าง The New York Times และ OpenAI ได้ดำเนินมาถึงจุดเปลี่ยนสำคัญ เมื่อมีการกล่าวหาว่ายักษ์ใหญ่ด้าน AI จงใจปกปิดหลักฐานเกี่ยวกับชุดข้อมูลที่ใช้ในการฝึกฝน (training datasets) การยกระดับความขัดแย้งในครั้งนี้อาจทำให้จุดสนใจของคดีเปลี่ยนจากการละเมิดลิขสิทธิ์ ไปสู่เรื่องความโปร่งใสในกระบวนการเปิดเผยพยานหลักฐาน (discovery process) ของศาล
ข้อกล่าวหาเรื่องการใช้ข้อมูลอย่างไม่โปร่งใส
The New York Times และ The Daily News อ้างว่า OpenAI ไม่ได้พูดความจริงเกี่ยวกับขีดความสามารถทางเทคนิคในการค้นหาทั้งคลังข้อมูลที่ใช้ฝึกฝน (training corpus) และบันทึกการแชทของลูกค้า ตลอดระยะเวลาการฟ้องร้องสองปีที่ผ่านมา OpenAI ยืนยันมาตลอดว่าการค้นหาชุดข้อมูลมหาศาลนั้นเป็นภาระทางเทคนิคที่หนักหน่วงและจะกระทบต่อความเป็นส่วนตัวของผู้ใช้
อย่างไรก็ตาม คำให้การ (deposition) ล่าสุดจาก Vinnie Monaco วิศวกรด้านความเป็นส่วนตัวของข้อมูลของ OpenAI ได้โต้แย้งเรื่องเล่านี้ โดยมีรายงานว่า Monaco เปิดเผยว่า OpenAI ได้ดำเนินการค้นหาภายในคลังข้อมูลที่ใช้ฝึกฝนเพื่อระบุผลงานทางวารสารศาสตร์ที่มีลิขสิทธิ์โดยเฉพาะ นอกจากนี้ คำให้การยังระบุอีกว่า OpenAI ได้รวบรวมฐานข้อมูลการสนทนาของ ChatGPT ที่ไม่ระบุตัวตน (de-identified) ประมาณ 78 ล้านรายการ เพื่อประเมินขอบเขตของการละเมิดลิขสิทธิ์ที่อาจเกิดขึ้นภายในองค์กร
Project Giraffe และฟิลเตอร์ "Bloom"
การเปิดเผยข้อมูลทางเทคนิคที่สำคัญที่สุดอาจเกี่ยวข้องกับ "Project Giraffe" ซึ่งเป็นชุดเครื่องมือที่ OpenAI นำมาใช้ ตามคำกล่าวอ้างของโจทก์ หลังจากมีการยื่นฟ้องได้ไม่นาน OpenAI ได้ใช้ฟิลเตอร์ "Bloom" ซึ่งเป็นส่วนหนึ่งของโปรเจกต์นี้เพื่อตรวจจับและบันทึกกรณีการ "คายข้อมูล" (regurgitation) ซึ่งเป็นสภาวะที่โมเดลผลิตเนื้อหาที่มีลิขสิทธิ์ออกมาแบบคำต่อคำในผลลัพธ์ของตน
การมีอยู่ของ Project Giraffe ขัดแย้งกับจุดยืนก่อนหน้านี้ของ OpenAI ที่ว่าการระบุกรณีการผลิตเนื้อหาซ้ำเฉพาะเจาะจงภายในบันทึกข้อมูลนั้นเป็นงานที่ทำได้ยากจนเกินไป โจทก์โต้แย้งว่าเครื่องมือเหล่านี้พิสูจน์ให้เห็นว่า OpenAI ไม่เพียงแต่มีความสามารถในการตรวจสอบการละเมิดลิขสิทธิ์เท่านั้น แต่ยังกำลังสร้างโครงสร้างพื้นฐานเพื่อติดตามเรื่องนี้อย่างจริงจังอีกด้วย
ข้อพิพาทเรื่องความถูกต้องของข้อมูลและกระบวนการเปิดเผยพยานหลักฐาน
ความขัดแย้งยังมุ่งเน้นไปที่คุณภาพของข้อมูลที่ส่งมอบให้แก่ศาล ในขณะที่โจทก์ขอตัวอย่างบันทึกการแชทจำนวน 120 ล้านรายการในตอนแรก OpenAI ได้เจรจาต่อรองจนเหลือเพียง 20 ล้านรายการ และเมื่อมีการส่งมอบตัวอย่างในเดือนธันวาคม มีรายงานว่าศาลพบว่าข้อมูลดังกล่าว "ไม่สามารถใช้งานได้" เนื่องจากการปกปิดข้อมูล (redactions) ที่มากเกินไป
NYT ยังกล่าวหาไปไกลกว่านั้นว่า OpenAI ได้ลบผลลัพธ์ของ ChatGPT ไปหลายพันล้านรายการ ซึ่งเป็นการละเมิดคำสั่งคุ้มครองพยานหลักฐานของศาล (preservation order) และได้นำบันทึกอื่นมาแทนที่หลายล้านรายการในตัวอย่างที่ส่งมอบ ในการตอบโต้ Drew Pusateri โฆษกของ OpenAI ได้ปฏิเสธทุกข้อกล่าวหา โดยกล่าวหาว่า Times กำลังพยายามละเมิดความเป็นส่วนตัวของผู้ใช้ในขณะที่คดีความของพวกเขากำลังอ่อนแอลง
ทำไมเรื่องนี้จึงสำคัญต่ออุตสาหกรรม AI
คดีนี้เป็นดัชนีชี้วัดอนาคตของการพัฒนา Generative AI และขอบเขตทางกฎหมายของ "การใช้งานโดยชอบธรรม" (fair use) หากศาลพบว่า OpenAI ปกปิดหลักฐานหรือบิดเบือนกระบวนการเปิดเผยพยานหลักฐาน อาจเป็นการสร้างบรรทัดฐานว่าบริษัท AI จะต้องเปิดเผยวิธีการฝึกฝนและที่มาของข้อมูล (data lineage) อย่างไร สำหรับนักพัฒนาและผู้ก่อตั้งบริษัท AI ผลลัพธ์ของคดีนี้จะช่วยสร้างความชัดเจนเกี่ยวกับระดับความโปร่งใสที่จำเป็น เมื่อต้องจัดการกับจุดตัดระหว่างการนำเข้าข้อมูลมหาศาลและสิทธิในทรัพย์สินทางปัญญา
สรุปประเด็นสำคัญ
- เครื่องมือตรวจสอบภายใน: ข้อกล่าวหาชี้ว่า OpenAI ใช้ "Project Giraffe" และฟิลเตอร์ "Bloom" เพื่อติดตามการคายข้อมูล (regurgitation) ของเนื้อหาที่มีลิขสิทธิ์อย่างจริงจัง
- คำให้การที่ขัดแย้งกัน: หลักฐานจากคำให้การบ่งชี้ว่า OpenAI มีความสามารถทางเทคนิคในการค้นหาข้อมูลที่ใช้ฝึกฝน ซึ่งขัดแย้งกับคำกล่าวอ้างก่อนหน้านี้เรื่องภาระทางเทคนิค
- ความโปร่งใสของกระบวนการเปิดเผยพยานหลักฐานกำลังตกอยู่ในความเสี่ยง: คดีความนี้ขึ้นอยู่กับว่า OpenAI ละเมิดคำสั่งคุ้มครองพยานหลักฐานโดยการลบผลลัพธ์และส่งมอบตัวอย่างข้อมูลที่ถูกปกปิดจน "ไม่สามารถใช้งานได้" หรือไม่
