ה-NYT מאשימה את OpenAI בהסתרת ראיות במשפט זכויות יוצרים מרכזי
המאבק המשפטי המתמשך בין The New York Times לבין OpenAI קיבל תפנית דרמטית, עם טענות כי ענקית ה-AI הסתירה במכוון ראיות בנוגע למאגרי הנתונים המשמשים לאימון המודלים שלה. הסלמה זו מאיימת להסיט את מוקד התביעה מעבירה על זכויות יוצרים לשאלת היושרה של תהליך הגילוי המשפטי (discovery).
טענות לפרקטיקות נתונים מטעות
The New York Times ו-The Daily News טוענים כי OpenAI לא אמרה את האמת בנוגע ליכולתה הטכנית לחפש הן בקורפוס האימון שלה והן ביומני הצ'אט של הלקוחות. לאורך ההתדיינות המשפטית שנמשכת שנתיים, OpenAI טענה כי חיפוש במאגרי הנתונים העצומים שלה יהיה מכביד מבחינה טכנית ויפגע בפרטיות המשתמשים.
עם זאת, עדות (deposition) שנמסרה לאחרונה על ידי מהנדס פרטיות הנתונים של OpenAI, ויני מונאקו (Vinnie Monaco), קוראת תיגר על הנרטיב הזה. מונאקו חשד שחשף כי OpenAI כבר ביצעה חיפושים פנימיים בקורפוס האימון שלה במטרה ספציפית לזהות יצירות עיתונאיות המוגנות בזכויות יוצרים. יתרה מכך, העדות מרמזת כי OpenAI צברה מאגר נתונים של כ-78 מיליון שיחות ChatGPT ללא פרטים מזהים, כדי להעריך באופן פנימי את היקף הפרת זכויות היוצרים הפוטנציאלית.
Project Giraffe ומסנן ה-"Bloom"
אולי התגלית הטכנית המשמעותית ביותר נוגעת ל-"Project Giraffe", סט של כלים שהטמיעה OpenAI. על פי התובעים, זמן קצר לאחר הגשת התביעה, OpenAI השתמשה במסנן "Bloom" כחלק מפרויקט זה כדי לזהות ולתעד מקרים של "regurgitation" (שחזור) – מצב שבו המודל משחזר תוכן המוגן בזכויות יוצרים מילה במילה בתוצריו.
קיומו של Project Giraffe סותר את עמדתה הקודמת של OpenAI, לפיה זיהוי מקרים ספציפיים של שחזור תוכן ביומני הנתונים שלה היה משימה בלתי אפשרית. התובעים טוענים כי כלים אלו מוכיחים ש-OpenAI לא רק הייתה מסוגלת לנטר הפרות זכויות יוצרים, אלא אף בנתה באופן פעיל תשתית כדי לעקוב אחריהן.
מחלוקות על יושרה של נתונים ותהליך הגילוי
העימות התמקד גם באיכות הנתונים שהוגשו לבית המשפט. בעוד שהתובעים ביקשו במקור מדגם של 120 מיליון יומני צ'אט, OpenAI הצליחה להוריד את המספר ל-20 מיליון. כאשר המדגם הוגש לבסוף בדצמבר, בית המשפט מצא אותו לכאורה "בלתי שמיש" בשל מחיקות (redactions) מוגזמות של מידע.
ה-NYT הלכה צעד נוסף וטענה כי OpenAI מחקה מיליארדי תוצרים של ChatGPT תוך הפרה של צו שימור ראיות שהוצא על ידי בית המשפט, והחליפה מיליוני יומנים במדגם שהוגש. בתגובה, דובר OpenAI, דרו פוסאטרי (Drew Pusateri), הכחיש את כל ההאשמות והאשים את ה-Times בניסיון לפגוע בפרטיות המשתמשים ככל שתיק המשפט שלה נחלש.
מדוע זה חשוב לתעשיית ה-AI
מקרה זה מהווה סימן הי הי היסטורי לעתיד הפיתוח של AI גנרטיבי ולגבולות המשפטיים של "שימוש הוגן" (fair use). אם בית המשפט יקבע כי OpenAI הסתירה ראיות או תמרנה את תהליך הגילוי, הדבר עשוי לקבוע תקדים לאופן שבו חברות AI נדרשות לחשוף את מתודולוגיות האימון שלהן ואת מקור הנתונים (data lineage). עבור מפתחים ומייסדי חברות AI, התוצאה תבהיר את רמת השקיפות הנדרשת בעת ניווט בנקודת המפגש שבין איסוף נתונים מאסיבי לבין זכויות קניין רוחני.
נקודות מרכזיות
- כלי ניטור פנימיים: הטענות מצביעות על כך ש-OpenAI השתמשה ב-"Project Giraffe" ובמסנן "Bloom" כדי לעקוב באופן פעיל אחר שחזור (regurgitation) של תוכן המוגן בזכויות יוצרים.
- עדות סותרת: ראיות מהעדות (deposition) מצביעות על כך ש-OpenAI החזיקה ביכולת הטכנית לחפש בנתוני האימון שלה, מה שסותר את טענותיה הקודמות
