ชุมชนนักสร้างสรรค์ไม่ได้เป็นเพียงผู้เฝ้ามองอย่างนิ่งเฉยอีกต่อไป ในขณะที่ผลงานทั้งชีวิตของพวกเขากำลังถูกนำไปใช้เป็นชุดข้อมูลขนาดใหญ่เพื่อการฝึกฝน ตั้งแต่นักเขียนชื่อดังไปจนถึงนักวาดภาพประกอบดิจิทัล คลื่นการดำเนินการทางกฎหมายที่กำลังเติบโตขึ้นกำลังท้าทายข้อต่อสู้เรื่อง "fair use" (การใช้งานโดยชอบธรรม) ที่ยักษ์ใหญ่ด้าน AI ใช้เพื่อสร้างความชอบธรรมในการดึงข้อมูลทรัพย์สินทางปัญญาโดยไม่ได้รับอนุญาต

การค้นพบชุดข้อมูลการฝึกฝนที่ไม่ได้รับอนุญาต

ความตึงเครียดระหว่างผู้สร้างสรรค์และนักพัฒนา AI มาถึงจุดเดือดภายหลังรายงานจาก The Atlantic ซึ่งได้ตีพิมพ์ชุดข้อมูลที่สามารถค้นหาได้ โดยระบุรายละเอียดของผลงานที่ใช้ในการฝึกฝนโมเดลภาษาขนาดใหญ่ สำหรับนักเขียนอย่าง Kirk Wallace Johnson การค้นพบนี้เป็นเรื่องส่วนตัวและส่งผลกระทบอย่างลึกซึ้ง Johnson ซึ่งเป็นที่รู้จักจากผลงานสารคดีที่ผ่านการค้นคว้าอย่างหนัก เช่น The Feather Thief และ The Fishermen and the Dragon พบว่าการสืบสวนและการเขียนที่ใช้ความพยายามอย่างหนักหลายปีของเขาถูกละเมิดลิขสิทธิ์และถูกป้อนเข้าสู่แชทบอทโดยไม่ได้รับความยินยอมหรือค่าตอบแทน

ปรากฏการณ์นี้ไม่ใช่เหตุการณ์ที่เกิดขึ้นเพียงลำพัง แต่เป็นแนวปฏิบัติเชิงระบบ มืออาชีพสายสร้างสรรค์กำลังพบว่าผลงานอันเป็นกรรมสิทธิ์ของพวกเขา ซึ่งมักเป็นผลมาจากแรงงานหลายปี กำลังถูกนำไปใช้เพื่อสร้างบริษัทที่ "ร่ำรวยมหาศาลระดับกาแล็กซี" การตระหนักรู้นี้ได้เปลี่ยนความรู้สึกจากการเป็นเพียงความกังวลไปสู่การฟ้องร้องอย่างจริงจัง เนื่องจากศิลปินพยายามที่จะทวงคืนการควบคุมทรัพย์สินทางปัญญาของตนเอง

การดำเนินคดีเชิงกลยุทธ์: การมุ่งเป้าไปที่ยักษ์ใหญ่ด้านเทคโนโลยี

การรุกทางกฎหมายมีหลายแง่มุม โดยมุ่งเป้าไปที่กลไกหลักของวิธีการสร้างโมเดล Generative AI ศิลปินไม่ได้พึ่งพาเพียงแค่การฟ้องร้องเรื่องการละเมิดลิขสิทธิ์เท่านั้น แต่ยังกำลังสำรวจช่องทางอื่นๆ เช่น การละเมิดข้อกำหนดการให้บริการ (terms of service) เพื่อให้บริษัทต่างๆ ต้องรับผิดชอบ

การต่อสู้ทางกฎหมายครั้งสำคัญกำลังดำเนินอยู่ ผู้สร้างสรรค์จำนวนมากได้รวมตัวกับทีมกฎหมายเฉพาะทาง เช่น Susman Godfrey ซึ่งปัจจุบันกำลังนำคดีสำคัญในการฟ้องร้อง Anthropic ในนามของนักเขียนหลายท่าน ผู้บุกเบิกคนอื่นๆ ในความเคลื่อนไหวนี้รวมถึงนักวาดภาพประกอบและนักเขียนการ์ตูน Sarah Andersen ซึ่งเป็นหนึ่งในกลุ่มแรกๆ ที่ท้าทายยักษ์ใหญ่ด้าน AI โดยตรง การฟ้องร้องเหล่านี้มีเป้าหมายเพื่อทำลายการพึ่งพาการดึงข้อมูลโดยไม่มีค่าตอบแทนของอุตสาหกรรม และบีบให้เกิดมาตรฐานใหม่ในการคัดสรรชุดข้อมูลการฝึกฝน

สมรภูมิ "Fair Use"

ประเด็นความตึงเครียดหลักในชั้นศาลเหล่านี้อยู่ที่นิยามทางกฎหมายของ "fair use" บริษัท AI โต้แย้งว่าการฝึกฝนโมเดลด้วยข้อมูลที่มีอยู่นั้นเป็นการสร้างสรรค์สิ่งใหม่ (transformative) และอยู่ภายใต้การคุ้มครองทางกฎหมาย อย่างไรก็ตาม ผู้สร้างสรรค์โต้แย้งว่าเมื่อ AI สามารถเลียนแบบสไตล์เฉพาะตัวของศิลปินหรือน้ำเสียงที่เป็นเอกลักษณ์ของนักเขียนได้ สิ่งนั้นจะไม่ใช่การสร้างสรรค์สิ่งใหม่ แต่จะกลายเป็นการทดแทนตลาดโดยตรงซึ่งทำให้คุณค่าของผลงานต้นฉบับลดลง

เมื่อคดีเหล่านี้ดำเนินต่อไป พวกเขาจะเป็นผู้กำหนดอนาคตของภูมิทัศน์ AI ผลลัพธ์จะตัดสินว่าแนวโน้มปัจจุบันของ "AI slop" (การผลิตเนื้อหาคุณภาพต่ำที่ลอกเลียนแบบมาจำนวนมาก) นั้นจะสามารถดำเนินต่อไปได้ทางกฎหมายหรือไม่ หรือยุคใหม่ของการจัดหาข้อมูลอย่างมีจริยธรรมและได้รับอนุญาตจะต้องเกิดขึ้นเพื่อปกป้องผู้สร้างสรรค์ที่เป็นหัวใจสำคัญของเศรษฐกิจข้อมูล

สรุปประเด็นสำคัญ

  • การดึงข้อมูลเชิงระบบ: พบว่าโมเดล AI รายใหญ่ใช้ชุดข้อมูลที่ละเมิดลิขสิทธิ์ ซึ่งประกอบด้วยหนังสือที่ผ่านการค้นคว้าอย่างลึกซึ้งและผลงานศิลปะที่เป็นกรรมสิทธิ์โดยไม่ได้รับความยินยอมจากผู้สร้างสรรค์
  • กลยุทธ์ทางกฎหมายที่หลากหลาย: การฟ้องร้องมุ่งเป้าไปที่บริษัท AI ผ่านการละเมิดลิขสิทธิ์ การละเมิดข้อกำหนดการให้บริการ และการท้าทายหลักการ "fair use"
  • ช่วงเวลาสำคัญสำหรับ IP: ผลลัพธ์ของคดีที่กำลังดำเนินอยู่ต่อบริษัทอย่าง Anthropic จะกลายเป็นบรรทัดฐานทางกฎหมายว่าทรัพย์สินทางปัญญาจะมีมูลค่าอย่างไรในยุคของ Generative AI

ข้อพิพาทนี้ปะทุขึ้นได้อย่างไร

จุดชนวนเกิดขึ้นเมื่อนิตยสารชื่อดังฉบับหนึ่งตีพิมพ์รายชื่อหนังสือ บทความ และผลงานศิลปะที่โมเดลภาษาขนาดใหญ่ใช้ในการฝึกฝน ซึ่งสามารถค้นหาได้ สำหรับนักเขียน Kirk Wallace Johnson ผู้ซึ่งหนังสือสารคดีของเขาต้องใช้เวลาหลายปีในการค้นคว้าและเดินทาง การเปิดเผยนี้เป็นเรื่องส่วนตัว เขาพบว่าถ้อยคำที่เขาใช้เวลาทศวรรษในการขัดเกลาให้สมบูรณ์แบบนั้น เป็นส่วนหนึ่งของข้อมูลที่ขับเคลื่อนแชทบอทซึ่งสามารถผลิตสไตล์ของเขาออกมาได้ตามสั่ง โดยไม่มีค่าลิขสิทธิ์หรือการให้เครดิตใดๆ

ประสบการณ์ของ Johnson ไม่ใช่เหตุการณ์ที่เกิดขึ้นเพียงลำพัง ผู้สร้างสรรค์ในวงการวรรณกรรม ภาพประกอบ ดนตรี และภาพยนตร์ ต่างรายงานว่าผลงานที่มีลิขสิทธิ์ของพวกเขาถูกเก็บเกี่ยวไปเป็นจำนวนมาก แนวปฏิบัตินี้ ซึ่งคนในอุตสาหกรรมอธิบายว่าเป็น "การดึงชุดข้อมูลที่ละเมิดลิขสิทธิ์" (pirated datasets) อย่างเป็นระบบ ได้เปลี่ยนความกังวลให้เป็นการดำเนินการทางกฎหมายที่มีการประสานงานกัน ศิลปินโต้แย้งในขณะนี้ว่ามูลค่าที่พวกเขาสร้างขึ้นกำลังถูกสูบเข้าไปยังกลุ่มบริษัทเทคโนโลยีที่ "ร่ำรวยมหาศาลระดับกาแล็กซี" ซึ่งทำกำไรจากแรงงานของพวกเขา ในขณะที่ผู้สร้างสรรค์ไม่ได้รับอะไรเลย

คดีความต่างๆ ที่กำลังกำหนดทิศทางการต่อสู้

การรุกคืบทางกฎหมายมุ่งเป้าไปที่หัวใจสำคัญของกระบวนการสร้างโมเดล Generative AI โจทก์ไม่ได้ยื่นฟ้องเพียงแค่เรื่องการละเมิดลิขสิทธิ์เท่านั้น แต่ยังรวมถึงการละเมิดข้อกำหนดการให้บริการของแพลตฟอร์มเองด้วย Sarah Andersen นักวาดภาพประกอบและนักเขียนการ์ตูน ซึ่งผลงานของเธอได้กลายเป็นส่วนสำคัญของวัฒนธรรมอินเทอร์เน็ต เป็นหนึ่งในศิลปินทัศนศิลป์กลุ่มแรกๆ ที่ยื่นฟ้องบริษัท AI โดยตรง คำฟ้องของเธอยืนยันว่าความสามารถของโมเดลในการเลียนแบบลายเส้นและอารมณ์ขันอันเป็นเอกลักษณ์ของเธอนั้น ทำลายตลาดการ์ตูนต้นฉบับของเธอ และเปลี่ยนแบรนด์ของเธอให้กลายเป็นทรัพยากรที่ใครจะนำไปใช้ก็ได้โดยไม่มีค่าใช้จ่าย

คดีเหล่านี้ถูกดูแลโดยทนายความผู้เชี่ยวชาญด้านข้อพิพาททรัพย์สินทางปัญญาและมีประวัติในการท้าทายยักษ์ใหญ่ด้านเทคโนโลยี กลยุทธ์ของพวกเขาคือการบังคับให้มีการเปิดเผยข้อมูล (discovery) เกี่ยวกับชุดข้อมูล (datasets) ที่ใช้จริง บังคับให้บริษัทต่างๆ หยุดใช้เนื้อหาที่มีข้อพิพาท และเรียกร้องค่าเสียหายที่สะท้อนถึงมูลค่าเชิงพาณิชย์ของเนื้อหาที่ถูกขโมยไป

ข้อโต้แย้งเรื่อง "การใช้งานโดยชอบธรรม" (fair use) ที่กำลังถูกโจมตี

ผู้พัฒนา AI ยืนยันว่าการฝึกฝนโมเดลด้วยข้อมูลที่เปิดเผยต่อสาธารณะเป็นการใช้งานในเชิงสร้างสรรค์ใหม่ (transformative use) ซึ่งกฎหมายให้การคุ้มครอง พวกเขาโต้แย้งว่าโมเดลไม่ได้ทำซ้ำผลงานชิ้นใดชิ้นหนึ่งแบบคำต่อคำ แต่เป็นการเรียนรู้รูปแบบที่ช่วยให้สามารถสร้างข้อความหรือรูปภาพใหม่ๆ ขึ้นมาได้ ในมุมมองนั้น กระบวนการนี้จึงคล้ายกับการที่นักวิจัยอ่านหนังสือหลายเล่มเพื่อสร้างความเข้าใจ มากกว่าที่จะเป็นการคัดลอกหนังสือเหล่านั้น

ฝ่ายผู้สร้างสรรค์โต้กลับว่า "การสร้างสรรค์ใหม่" เป็นเพียงข้ออ้างที่ฟังไม่ขึ้น เมื่อผลลัพธ์ที่ได้สามารถเลียนแบบน้ำเสียงของผู้เขียนหรือสไตล์ของศิลปินได้อย่างใกล้เคียง เมื่อแชทบอทสามารถตอบคำถามด้วยจังหวะและสำนวนภาษาที่เป็นเอกลักษณ์ของนักเขียนนิยาย หรือเมื่อเครื่องมือสร้างรูปภาพสามารถผลิตภาพที่แยกไม่ออกจากผลงานในพอร์ตโฟลิโอของนักวาดภาพประกอบที่มีชีวิตอยู่ ผลลัพธ์ที่ได้จึงทำหน้าที่เป็นสิ่งทดแทนในตลาด โจทก์โต้แย้งว่าการทดแทนนี้ทำลายความสามารถในการขายหนังสือ การรับจ้างวาดภาพ และการทำสัญญาอนุญาตให้ใช้สิทธิ์ และข้อต่อสู้เรื่อง "การใช้งานโดยชอบธรรม" นั้นไม่อาจฟังขึ้นได้เมื่อพิจารณาจากผลกระทบเชิงพาณิชย์ที่เกิดขึ้น

สิ่งที่เป็นเดิมพัน

  • แรงกดดันทางเศรษฐกิจต่อบริษัท AI – หากศาลตัดสินว่าการดึงข้อมูล (scraping) ขนาดใหญ่เป็นการละเมิดลิขสิทธิ์ บริษัทต่างๆ อาจต้องเผชิญกับผลกระทบทางการเงินอย่างมหาศาล ซึ่งอาจนำไปสู่การเปลี่ยนแปลงในกระบวนการจัดการข้อมูล (data pipelines)

  • การยื่นคำร้องต่อศาลและการเปิดเผยข้อมูล – เอกสารระลอกถัดไปจะเปิดเผยให้เห็นแน่ชัดว่ามีการใช้ชื่อผลงานและรูปภาพใดบ้าง ซึ่งจะทำให้เห็นภาพที่ชัดเจนขึ้นเกี่ยวกับขนาดของการเก็บเกี่ยวข้อมูล (data harvesting)