משרד המשפטים של ארה"ב (DOJ) הוציא התערבות משפטית משמעותית במלחמה המתמשכת על זכויות יוצרים בין ענקיות מדיה לבין מפתחי בינה מלאכותית (AI). באמצעות הטענה כי אימון מודלי שפה גדולים (LLMs) על נתונים המוגנים בזכויות יוצרים מהווה "שימוש הוגן" (fair use), ה-DOJ סיפק מעטפת משפטית רחבה לחברות כמו OpenAI ו-Microsoft.

הטיעון של ה-DOJ: אימון מול תוצר

בלב התביעה המאוחדת הכוללת את The New York Times עומדת הבחנה יסודית בין האופן שבו בינה מלאכותית לומדת לבין מה שהיא מייצרת. The New York Times טוען כי מיליוני מאמריו שימשו ללא רשות לאימון מודלים כמו GPT-4, מה שגרם לנזקים של מיליארדי דולרים ויצר מוצרים המתחרים ישירות בעיתון.

עם זאת, ההגשה האחרונה של ה-DOJ טוענת כי הפרת זכויות יוצרים מתרחשת בנקודת התוצר, ולא בנקודת ההזנה. המחלקה טוענת כי למרות שכל היצירות מועתקות במהלך שלב האימון, העתקים אלו לעולם אינם הופכים לזמינים לציבור. יתרה מכך, ה-DOJ טוען כי התוצרים של מודלים כמו GPT-4 "לעתים קרובות, אם לא תמיד, חסרים דמיון מהותי" לחומר המקור המקורי. על ידי הפרדה בין תהליך האימון לבין התוכן שנוצר, ה-DOJ מנסה לנתק את פעולת הלמידה המכונה מהמושג המשפטי של תחליף שוקי.

"אנלוגיית המינגווי" והיצירתיות האנושית

כדי להפוך את המושג של למידת מכונה לנגיש יותר, ה-DOJ השתמש באנלוגיה ספרותית הכוללת את הסופרת ג'ואן דידיון. במסמך צוין כי כנערה, דידיון הייתה מעתיקה את סיפוריו של ארנסט המינגווי כדי לנתח את מבנה המשפטים שלו וללמוד את מלאכתה. ה-DOJ טוען כי אם החוק היה מתייחס לאימון מכונה כהפרה, סופרת כמו דידיון הייתה עלולה תיאורטית להתמודד עם אחריות משפטית בכל פעם שהייתה מפרסמת עבודה חדשה, שכן תהליך הלמידה שלה היה קשור קשר בלתי ניתן להפרדה לכתיבתה שבאה לאחר מכן.

המחלקה טוענת עוד כי הטלת אחריות מחמירה על אימון בינה מלאכותית תחסום באופן פרדוקסלי דווקא את אותה יצירתיות שחוק זכויות היוצרים נועד להגן עליה. לאור העובדה שבני אדם משתמשים יותר ויותר ב-LLMs כדי לנסח ולערוך יצירות מקוריות, ה-DOJ מציע כי הפיכת האימון לבלתי מורשה ללא מנגנוני רישוי מאסיביים תשתק את החדשנות המונעת על ידי בינה מלאכותית.

קריאת תיגר על משרד זכויות היוצרים של ארה"ב

עמדת ה-DOJ עומדת בסתירה ישירה לממצאים האחרונים של משרד זכויות היוצרים של ארה"ב. הרשמית לשעבר, שירה פרלמוטר, טענה בעבר נגד הגנת "שימוש הוגן" גורפת, וציינה כי בינה מלאכותית פועלת בקנה מידה ובמהירות החורגים בהרבה מיכולת אנושית, ולעתים קרובות יוצרת מוצרים מסחריים המתחרים ישירות ביוצרי התוכן המקוריים.

ה-DOJ עבר למתקפה נגד הערכה זו, וקבע כי הדו"ח של פרלמוטר אינו נושא סמכות משפטית מחייבת ואינו לוקח בחשבון פסיקה מבוססת הנוגעת לניתוח מקרה לגופו. המחלקה מזהירה כי הטלת אחריות רחבה תכפה למעשה משטר רישוי שיהפוך את הפיתוח של מודלי בינה מלאכותית מתקדמים לבלתי אפשרי מבחינה משפטית וכלכלית.

נקודות מרכזיות

  • הפרדה בין אימון לתוצר: ה-DOJ טוען כי העתקת טקסט לצורך אימון אינה מהווה הפרה אם תוצרי המודל שנוצר אינם מראים "דמיון מהותי" ליצירות המקוריות.
  • הגנה על החדשנות: המחלקה מזהירה כי דרישה לרישיונות עבור כל נתוני האימון תחסום יצירתיות ותמנע פיתוח של LLMs המסייעים ביצירת תוכן אנושי.
  • סמן משפטי: התערבות זו יוצרת קונפליקט בעל סיכון גבוה בין ה-DOJ לבין משרד זכויות היוצרים של ארה"ב, ומכינה את הקרקע לפסיקה מכרעת של בית המשפט לגבי עתיד הבינה המלאכותית הגנרטיבית.

ARTICLE: משרד המשפטים של ארה"ב הגיש חוות דעת ידידותית (amicus brief) בתביעת זכויות היוצרים של הניו יורק טיימס, בטענה כי העתקת טקסט מוגן לצורך אימון מודלי שפה גדולים (LLMs) עונה על ההגדרה של שימוש הוגן. ההגשה מעניקה לחברות כמו OpenAI ו-Microsoft מעטפת משפטית שעשויה להגן עליהן מפני מאגר פיצויים שהעיתון מעריך בכמה מיליארדי דולרים.

מדוע המקרה חשוב כעת

התביעה מאחדת מספר טענות לפיהן מפתחי בינה מלאכותית הזרימו מיליוני מאמרים עיתונאיים למודלים שלהם ללא רשות, ולאחר מכן שחררו מוצרים המתחרים ישירות בדיווחים של הניו יורק טיימס עצמו. אם בית המשפט ידחה את טענת השימוש ההוגן של ה-DOJ, חברות בינה מלאכותית עלולות להתמודד עם חשבונות רישוי עצומים או להיאלץ להפסיק את הפיתוח של הדור הבא של סוכנים שיחתיים.

הטיעון המרכזי של ה-DOJ

כתב הטענות מחלק את תהליך העבודה של ה-AI לשני שלבים נפרדים. ראשית, המודל קולט מאגרי טקסט גדולים; שנית, הוא מייצר תגובות להנחיות (prompts) של משתמשים. המחלקה טוענת כי הפרה מתרחשת רק כאשר יצירה המוגנת בזכויות יוצרים משוכפלת באופן שמאפשר לציבור גישה אליה. מכיוון שהעותקים המשמשים לאימון לעולם אינם עוזבים את השרתים של המפתח, פעולת הקליטה אינה עומדת בסף זה.

משרד המשפטים (DOJ) נשען גם על מבחן ה"דמיון המהותי", תקן ותיק בתחום זכויות היוצרים. הוא טוען כי הטקסט המופק על ידי מודלים כמו GPT-4 "לעיתים קרובות, אם לא תמיד", שונה מספיק מכל מקור בודד כך שנתבע לא יוכל להוכיח את הדמיון הנדרש. בקיצור, כתב הטענות טוען כי המוקד המשפטי צריך להיות בפלט הסופי, ולא בתהליך הלמידה הפנימי.

אנלוגיה ספרותית להמחשת הנקודה

כדי להפוך את הטיעון הטכני לנגיש יותר, כתב הטענות מביא סיפור על כותבת נערה שהעתיקה סיפורים של ארנסט המינגווי כדי ללמוד את סגנונו. משרד המשפטים טוען שאילו החוק היה מתייחס לתרגיל למידה זה כהפרה, ניתן היה לתבוע את הכותבת בכל פעם שפרסמה יצירה חדשה, למרות שעבודתה הייתה מקורית. המחלקה מזהירה כי הרחבת אותו היגיון גם ל-AI "תשתק את אותה יצירתיות שחוק זכויות היוצרים נועד להגן עליה".

הסיכונים עבור מפתחי AI ויוצרי תוכן

  • סיכון חדשנות: דרישה לרישיונות עבור כל קטע טקסט המשמש לאימון עלולה להעלות את העלויות לרמה כזו שבניית מודלים מתקדמים (state-of-the-art) תהפוך לבלתי אפשרית מבחינה כלכלית.
  • תהליך עבודה יצירתי: כותבים אנושיים מסתמכים יותר ויותר על LLMs לצורך טיוטה, עריכה וסיעור מוחות. אם תהליך האימון ייחשב כבלתי חוקי, הכלים הללו עלולים להיעלם, מה שיעצב מחדש את האופן שבו תוכן מופק בתעשיות שונות.
  • השפעה על השוק: תעשיית העיתונות טוענת כי מודלים של AI שיכולים לענות על שאלות או לייצר טקסט דמוי חדשות שוחקים את ערכו של הדיווח המקורי, ועלולים לשאוב מהם הכנסות מפרסום וממנויים.

הטיעון הנגדי של לשכת זכויות היוצרים

דו"ח שנערך לאחרונה על ידי לשכת זכויות היוצרים של ארה"ב, תחת הנהגתה של הרשמית לשעבר שירה פרלמוטר, התנגד להגנת "שימוש הוגן" (fair-use) גורפת. הלשכה הדגישה שלושה גורמים המבדילים בין AI לבין למידה אנושית: הנפח העצום של החומר המועתק, המהירות שבה הוא מעובד, והעובדה שהמודלים שנוצרים יכולים להיארז ולהימכר כמוצרים מסחריים המתחרים ישירות ביוצרי המקור.

משרד המשפטים מפריך נקודות אלו, ומציין כי לדו"ח אין סמכות משפטית מחייבת וכי הפסיקה הקיימת כבר דורשת ניתוח של כל עובדה ועובדה במסגרת בדיקת השימוש ההוגן. הוא מזהיר כי הטלת "אחריות רחבה" תכריח למעשה את התעשייה לעבור למשטר רישוי ש"יהפוך את הפיתוח של מודלי AI מתקדמים לבלתי אפשרי מבחינה משפטית וכלכלית".

מה יכול לקרות בהמשך

בית המשפט המחוזי הדן בתיק ה-Times יצטרך לשקול את עמדת ה-DOJ בנוגע לשימוש הוגן מול ממצאי לשכת זכויות היוצרים. פסיקה לטובת ה-DOJ תכונן תקדים לפיו ניתן לאסוף נתוני אימון ללא אישור מפורש, בתנאי שהפלט של המודל נשאר רחוק מ"דמיון מהותי". החלטה לצד העיתון עלולה לעורר גל של משא ומתן על רישיונות, מה שעשוי לעצב מחדש את הכלכלה של מחקר ה-AI.

שורה תחתונה

כתב הטענות של משרד המשפטים הופך את השאלה האם אימון AI מהווה שימוש הוגן למאבק משפטי גורלי. התוצאה תקבע האם מפתחים יוכלו להמשיך ולבנות מודלי שפה עוצמתיים על טקסט קיים, או שמא יצטרכו לחפש רישיונות יקרים עבור כל פיסת חומר שהם קולטים. ההחלטה תדהד במגזר הטכנולוגי, בתעשיית המדיה ובכלכלה היצירתית הרחבה יותר.