กระทรวงยุติธรรมสหรัฐฯ (DOJ) ได้ออกมาแทรกแซงทางกฎหมายครั้งสำคัญในสงครามลิขสิทธิ์ที่กำลังดำเนินอยู่ระหว่างยักษ์ใหญ่สื่อและผู้พัฒนา AI โดยการโต้แย้งว่าการฝึกฝนโมเดลภาษาขนาดใหญ่ (LLMs) ด้วยข้อมูลที่มีลิขสิทธิ์ถือเป็น "การใช้งานโดยชอบธรรม" (fair use) ซึ่งทำให้ DOJ ได้สร้างเกราะคุ้มกันทางกฎหมายครั้งใหญ่ให้กับบริษัทอย่าง OpenAI และ Microsoft
ข้อโต้แย้งของ DOJ: การฝึกฝน vs. ผลลัพธ์
หัวใจสำคัญของคดีความรวมที่เกี่ยวข้องกับ The New York Times คือความแตกต่างพื้นฐานระหว่างวิธีที่ AI เรียนรู้และสิ่งที่มันผลิตออกมา The New York Times กล่าวหาว่าบทความหลายล้านบทความของตนถูกนำไปใช้โดยไม่ได้รับอนุญาตเพื่อฝึกฝนโมเดลอย่าง GPT-4 ซึ่งก่อให้เกิดความเสียหายมูลค่าหลายพันล้านดอลลาร์ และสร้างผลิตภัณฑ์ที่แข่งขันโดยตรงกับหนังสือพิมพ์
อย่างไรก็ตาม คำฟ้องล่าสุดของ DOJ โต้แย้งว่าการละเมิดลิขสิทธิ์เกิดขึ้นที่จุดของผลลัพธ์ (output) ไม่ใช่ที่จุดของการนำข้อมูลเข้า (ingestion) กระทรวงฯ ยืนยันว่าแม้จะมีการคัดลอกผลงานทั้งชิ้นในระหว่างขั้นตอนการฝึกฝน แต่สำเนาเหล่านี้ไม่เคยถูกนำออกมาเผยแพร่ต่อสาธารณะ นอกจากนี้ DOJ ยังยืนยันว่าผลลัพธ์ของโมเดลอย่าง GPT-4 "มักจะ—หากไม่ใช่เสมอไป—ขาดความคล้ายคลึงกันอย่างมีนัยสำคัญ" กับเนื้อหาต้นฉบับ การแยกกระบวนการฝึกฝนออกจากเนื้อหาที่ถูกสร้างขึ้นนี้ DOJ กำลังพยายามแยกการเรียนรู้ของเครื่อง (machine learning) ออกจากแนวคิดทางกฎหมายเรื่องการทดแทนตลาด (market substitution)
"การเปรียบเทียบกับเฮมิงเวย์" และความคิดสร้างสรรค์ของมนุษย์
เพื่อให้แนวคิดเรื่องการเรียนรู้ของเครื่องเข้าใจง่ายขึ้น DOJ ได้ยกการเปรียบเทียบทางวรรณกรรมที่เกี่ยวข้องกับนักเขียน Joan Didion โดยระบุในคำฟ้องว่า ในช่วงวัยรุ่น Didion มักจะคัดลอกเรื่องสั้นของ Ernest Hemingway เพื่อวิเคราะห์โครงสร้างประโยคและเรียนรู้ทักษะการเขียน DOJ โต้แย้งว่าหากกฎหมายปฏิบัติกับการฝึกฝนของเครื่องจักรเป็นการละเมิดลิขสิทธิ์ นักเขียนอย่าง Didion อาจต้องเผชิญกับความรับผิดทางกฎหมายทุกครั้งที่เธอตีพิมพ์ผลงานใหม่ เนื่องจากกระบวนการเรียนรู้ของเธอจะเชื่อมโยงอย่างแยกไม่ออกกับการเขียนในเวลาต่อมา
กระทรวงฯ ยังโต้แย้งต่อไปว่า การกำหนดความรับผิดอย่างเคร่งครัดสำหรับการฝึกฝน AI จะเป็นการยับยั้งความคิดสร้างสรรค์ที่กฎหมายลิขสิทธิ์ตั้งใจจะปกป้องเสียเอง ในขณะที่มนุษย์เริ่มใช้ LLMs ในการร่างและแก้ไขผลงานต้นฉบับมากขึ้น DOJ จึงเสนอว่าการทำให้การฝึกฝนเป็นสิ่งที่ไม่สามารถทำได้หากไม่มีระบบการขออนุญาตใช้สิทธิ์ (licensing) ขนาดใหญ่ จะเป็นการทำลายการนวัตกรรมที่ขับเคลื่อนด้วย AI
การท้าทายสำนักงานลิขสิทธิ์แห่งสหรัฐอเมริกา
จุดยืนของ DOJ ขัดแย้งโดยตรงกับข้อค้นพบล่าสุดจากสำนักงานลิขสิทธิ์แห่งสหรัฐอเมริกา โดยอดีตนายทะเบียน Shira Perlmutter เคยโต้แย้งคัดค้านการใช้ข้อต่อสู้เรื่อง "การใช้งานโดยชอบธรรม" แบบเหมารวม โดยระบุว่า AI ทำงานด้วยขนาดและความเร็วที่เกินความสามารถของมนุษย์ไปมาก และมักจะสร้างผลิตภัณฑ์เชิงพาณิชย์ที่แข่งขันโดยตรงกับผู้สร้างเนื้อหาต้นฉบับ
DOJ ได้รุกกลับการประเมินนี้ โดยระบุว่ารายงานของ Perlmutter ไม่มีอำนาจผูกพันทางกฎหมาย และไม่ได้คำนึงถึงบรรทัดฐานทางกฎหมาย (case law) ที่เกี่ยวข้องกับการวิเคราะห์เป็นรายกรณี กระทรวงฯ เตือนว่าการกำหนดความรับผิดในวงกว้างจะส่งผลให้เกิดการบังคับใช้ระบบการขออนุญาตใช้สิทธิ์ ซึ่งจะทำให้การพัฒนาโมเดล AI ขั้นสูงเป็นไปไม่ได้ทั้งในทางกฎหมายและทางการเงิน
ประเด็นสำคัญ
- การแยกการฝึกฝนออกจากผลลัพธ์: DOJ โต้แย้งว่าการคัดลอกข้อความเพื่อการฝึกฝนไม่ถือเป็นการละเมิด หากผลลัพธ์ของโมเดลที่ได้ไม่แสดง "ความคล้ายคลึงกันอย่างมีนัยสำคัญ" กับผลงานต้นฉบับ
- การปกป้องนวัตกรรม: กระทรวงฯ เตือนว่าการกำหนดให้ต้องมีใบอนุญาตสำหรับข้อมูลการฝึกฝนทั้งหมดจะยับยั้งความคิดสร้างสรรค์ และขัดขวางการพัฒนา LLMs ที่ช่วยในการสร้างสรรค์เนื้อหาของมนุษย์
- ตัวบ่งชี้ทางกฎหมายที่สำคัญ: การแทรกแซงครั้งนี้สร้างความขัดแย้งที่มีเดิมพันสูงระหว่าง DOJ และสำนักงานลิขสิทธิ์แห่งสหรัฐอเมริกา ซึ่งเป็นการปูทางไปสู่คำตัดสินของศาลที่จะกำหนดอนาคตของ Generative AI
ARTICLE: กระทรวงยุติธรรมสหรัฐฯ ได้ยื่นคำให้การในฐานะเพื่อนแห่งศาล (amicus brief) ในคดีละเมิดลิขสิทธิ์ของ New York Times โดยโต้แย้งว่าการคัดลอกข้อความที่มีการคุ้มครองเพื่อฝึกฝนโมเดลภาษาขนาดใหญ่ (LLMs) ถือเป็นการใช้งานโดยชอบธรรม การยื่นคำฟ้องนี้ช่วยให้บริษัทอย่าง OpenAI และ Microsoft มีเกราะคุ้มกันทางกฎหมาย ซึ่งอาจช่วยให้พวกเขาไม่ต้องเผชิญกับค่าเสียหายที่ทางหนังสือพิมพ์ประเมินไว้ว่าสูงถึงหลายพันล้านดอลลาร์
ทำไมคดีนี้จึงสำคัญในตอนนี้
คดีความนี้เป็นการรวมข้อเรียกร้องหลายประการที่ว่า ผู้พัฒนา AI ได้นำบทความหนังสือพิมพ์หลายล้านบทความเข้าสู่โมเดลของตนโดยไม่ได้รับอนุญาต จากนั้นจึงปล่อยผลิตภัณฑ์ที่แข่งขันโดยตรงกับการรายงานข่าวของ Times เอง หากศาลปฏิเสธข้อโต้แย้งเรื่องการใช้งานโดยชอบธรรมของ DOJ บริษัท AI อาจต้องเผชิญกับค่าธรรมเนียมการขออนุญาตใช้สิทธิ์จำนวนมหาศาล หรืออาจถูกบังคับให้หยุดการพัฒนาเอเจนต์สนทนา (conversational agents) รุ่นต่อไป
ข้อโต้แย้งหลักของ DOJ
เอกสารทางกฎหมายฉบับนี้แบ่งขั้นตอนการทำงานของ AI ออกเป็นสองระยะที่ชัดเจน ระยะแรกคือโมเดลจะนำคลังข้อมูลข้อความขนาดใหญ่เข้าสู่ระบบ และระยะที่สองคือการสร้างคำตอบตามคำสั่งของผู้ใช้ กระทรวงยุติธรรม (DOJ) ระบุว่าการละเมิดลิขสิทธิ์จะเกิดขึ้นก็ต่อเมื่อมีการทำซ้ำงานที่มีลิขสิทธิ์ในลักษณะที่สาธารณชนสามารถเข้าถึงได้เท่านั้น เนื่องจากข้อมูลที่ใช้ในการฝึกฝนไม่เคยหลุดออกจากเซิร์ฟเวอร์ของผู้พัฒนา การนำข้อมูลเข้าสู่ระบบจึงยังไม่ถึงเกณฑ์ดังกล่าว
นอกจากนี้ DOJ ยังอาศัยการทดสอบ "ความคล้ายคลึงกันอย่างมีนัยสำคัญ" (substantial similarity) ซึ่งเป็นมาตรฐานลิขสิทธิ์ที่มีมาอย่างยาวนาน โดยโต้แย้งว่าข้อความที่ผลิตโดยโมเดลอย่าง GPT-4 นั้น "มักจะ หรือเกือบจะเสมอไป" มีความแตกต่างจากแหล่งข้อมูลใดแหล่งข้อมูลหนึ่งมากพอ จนโจทก์ไม่สามารถพิสูจน์ความคล้ายคลึงตามที่กฎหมายกำหนดได้ กล่าวโดยสรุป เอกสารฉบับนี้โต้แย้งว่าจุดเน้นทางกฎหมายควรอยู่ที่ผลลัพธ์สุดท้าย ไม่ใช่กระบวนการเรียนรู้ภายใน
การเปรียบเทียบเชิงวรรณกรรมเพื่อประกอบความเข้าใจ
เพื่อให้ข้อโต้แย้งทางเทคนิคเข้าใจได้ง่ายขึ้น เอกสารดังกล่าวได้ยกตัวอย่างเรื่องราวของนักเขียนวัยรุ่นคนหนึ่งที่คัดลอกเรื่องสั้นของ Ernest Hemingway เพื่อศึกษาลีลาการเขียน DOJ กล่าวว่า หากกฎหมายถือว่าการฝึกฝนดังกล่าวเป็นการละเมิดลิขสิทธิ์ นักเขียนคนนั้นอาจถูกฟ้องร้องทุกครั้งที่เธอตีพิมพ์ผลงานชิ้นใหม่ แม้ว่างานของเธอจะเป็นงานต้นฉบับก็ตาม กระทรวงฯ เตือนว่าการนำตรรกะเดียวกันนี้มาใช้กับ AI จะ "ทำให้ความคิดสร้างสรรค์ที่กฎหมายลิขสิทธิ์ถูกออกแบบมาเพื่อปกป้องต้องเป็นอัมพาต"
ผลกระทบสำคัญต่อผู้พัฒนา AI และผู้สร้างสรรค์เนื้อหา
- ความเสี่ยงด้านนวัตกรรม: การกำหนดให้ต้องมีใบอนุญาตสำหรับข้อความทุกชิ้นที่ใช้ในการฝึกฝนอาจทำให้ต้นทุนสูงขึ้นจนการสร้างโมเดลที่ล้ำสมัยกลายเป็นเรื่องที่เป็นไปไม่ได้ในทางเศรษฐกิจ
- กระบวนการทำงานเชิงสร้างสรรค์: นักเขียนที่เป็นมนุษย์ต้องพึ่งพา LLMs มากขึ้นเรื่อยๆ ในการร่างเนื้อหา การแก้ไข และการระดมสมอง หากกระบวนการฝึกฝนถูกตัดสินว่าผิดกฎหมาย เครื่องมือเหล่านี้อาจหายไป และจะเปลี่ยนรูปแบบการผลิตเนื้อหาในทุกอุตสาหกรรม
- ผลกระทบต่อตลาด: อุตสาหกรรมหนังสือพิมพ์โต้แย้งว่า โมเดล AI ที่สามารถตอบคำถามหรือสร้างข้อความที่คล้ายกับข่าวจะทำลายคุณค่าของการรายงานข่าวต้นฉบับ ซึ่งอาจส่งผลให้รายได้จากโฆษณาและการสมัครสมาชิกถูกดึงออกไป
ข้อโต้แย้งจากสำนักงานลิขสิทธิ์
รายงานฉบับล่าสุดจากสำนักงานลิขสิทธิ์แห่งสหรัฐอเมริกา (U.S. Copyright Office) ซึ่งเขียนขึ้นภายใต้การนำของอดีตนายทะเบียน Shira Perlmutter ได้คัดค้านการอ้างสิทธิ์การใช้งานที่เป็นธรรม (fair-use) แบบเหมารวม โดยสำนักงานฯ ได้เน้นย้ำถึงปัจจัยสามประการที่ทำให้ AI แตกต่างจากการเรียนรู้ของมนุษย์ ได้แก่ ปริมาณมหาศาลของวัสดุที่ถูกคัดลอก ความเร็วในการประมวลผล และข้อเท็จจริงที่ว่าโมเดลที่ได้สามารถนำมาบรรจุหีบห่อและขายเป็นผลิตภัณฑ์เชิงพาณิชย์ที่แข่งขันกับผู้สร้างสรรค์ต้นฉบับโดยตรง
DOJ ได้โต้แย้งประเด็นเหล่านั้น โดยระบุว่ารายงานดังกล่าวไม่มีอำนาจทางกฎหมายที่มีผลผูกพัน และกฎหมายที่มีอยู่เดิมกำหนดให้ต้องมีการวิเคราะห์การใช้งานที่เป็นธรรมตามข้อเท็จจริงเป็นรายกรณีไป นอกจากนี้ยังเตือนว่าการกำหนด "ความรับผิดที่กว้างเกินไป" จะเป็นการบีบบังคับให้อุตสาหกรรมเข้าสู่ระบบการอนุญาตให้ใช้สิทธิ์ ซึ่ง "จะทำให้การพัฒนาโมเดล AI ขั้นสูงเป็นไปไม่ได้ทั้งในทางกฎหมายและทางการเงิน"
สิ่งที่อาจเกิดขึ้นต่อไป
ศาลชั้นต้นที่พิจารณาคดีของ Times จะต้องชั่งน้ำหนักระหว่างจุดยืนเรื่องการใช้งานที่เป็นธรรมของ DOJ กับข้อค้นพบของสำนักงานลิขสิทธิ์ หากคำตัดสินเป็นคุณต่อ DOJ จะเป็นการสร้างบรรทัดฐานว่าข้อมูลการฝึกฝนสามารถถูกรวบรวมได้โดยไม่ต้องได้รับอนุญาตอย่างชัดเจน ตราบใดที่ผลลัพธ์ของโมเดลไม่มีความคล้ายคลึงกันอย่างมีนัยสำคัญ แต่หากคำตัดสินเข้าข้างหนังสือพิมพ์ อาจกระตุ้นให้เกิดคลื่นการเจรจาขอใบอนุญาต ซึ่งอาจเปลี่ยนโครงสร้างทางเศรษฐกิจของการวิจัย AI ไปโดยสิ้นเชิง
บทสรุป
การยื่นฟ้องของ DOJ เปลี่ยนคำถามที่ว่าการฝึกฝน AI เป็นการใช้งานที่เป็นธรรมหรือไม่ ให้กลายเป็นการต่อสู้ในชั้นศาลที่มีเดิมพันสูง ผลลัพธ์ที่ออกมาจะเป็นตัวกำหนดว่าผู้พัฒนาจะสามารถสร้างโมเดลภาษาที่ทรงพลังจากข้อความที่มีอยู่ต่อไปได้ หรือจะต้องแสวงหาใบอนุญาตที่มีราคาแพงสำหรับวัสดุทุกชิ้นที่นำเข้าสู่ระบบ คำตัดสินนี้จะส่งผลกระทบต่อเนื่องไปยังภาคเทคโนโลยี อุตสาหกรรมสื่อ และระบบเศรษฐกิจสร้างสรรค์ในวงกว้าง
