ה-Gemini AI של Google עומד בפני תביעה ייצוגית שהוגשה בבית משפט פדרלי בניו יורק, המאשימה את החברה באימון המודלים שלה על ספרים ומאמרים המוגנים בזכויות יוצרים ללא רשות. התלונה, שהוגשה על ידי קואליציה הכוללת הוצאות לאור גדולות ואת הסופר Scott Turow, טוענת כי Google הסירה במכוון מידע על זכויות יוצרים כדי להסתיר את השימוש ב"חומרים גנובים" במערכת ה-generative-AI שלה.
התביעה והטענות המרכזיות שלה
התביעה בבית המשפט המחוזי של ארה"ב למחוז הדרומי של ניו יורק מציינת את Hachette, Cencage, Elsevier, קולקטיב S.C.R.I.B.E. ו-Turow כתובתעים. הם טוענים כי Google חרגה מההסדר של "snippet-only" שקבע את כללי Google Books, ושימשה יצירות בטקסט מלא מתוך הארכיון הזה ומתוך כותרים שהועלו ל-Google Play כדי לאמן את Gemini. על פי התלונה, Google לא רק אספה (scraped) את התוכן, אלא גם שינתה או הסירה מטא-דאטה של זכויות יוצרים, צעד שלטענת התובעים נועד להסתיר את ההפרה.
מזכר פנימי של Google המוזכר בתביעה מזהיר כי שימוש בספרים המוגנים בזכויות יוצרים לאימון AI עלול להיות "בעייתי ביותר" ולחשוף את החברה לקנסות שנעים בין 10 מיליארד ל-100 מיליארד דולר. התובעים מצביעים על קנס של 1.5 מיליארד דולר שהוטל לאחרונה על חברת AI אחרת בגין שימוש לא מורשה בנתונים כנקודת ייחוס להיקף האחריות הפוטנציאלית.
איך הגענו למצב הזה
מערכת היחסים של Google עם הוצאות ספרים החלה עם Google Books, אינדקס הניתן לחיפוש שהציג קטעים קצרים ופרטים ביבליוגרפיים תוך השארת הטקסט המלא מאחורי חומת תשלום (paywall). מודל זה התבסס על הסכמי רישוי שהגבילו את Google להצגת קטעים (snippets) בלבד. במהלך השנים, Google הרחיבה את אחזקותיה באמצעות חנות Google Play, שבה הוצאות ספרים וסופרים מעלים ספרים דיגיטליים בטקסט מלא למכירה.
התובעים טוענים כי המעבר של Google משירות אינדוקס "מוגבל היקף" למקור נתונים לאימון מודלי שפה גדולים (LLMs) מהווה הפרה של ההסכמים המקוריים. הם אומרים שהחברה מעולם לא השיגה את האישורים הרחבים הדרושים כדי להזין יצירות שלמות לתוך תהליך האימון (training pipeline) של Gemini.
מה עומד על הפרק עבור Google ותעשיית ה-AI
אם בית משפט יקבע כי שימוש בחומר המוגן בזכויות יוצרים ללא רישיון מהווה הפרה של חוק זכויות היוצרים, ההחלטה עשויה לעצב מחדש את האופן שבו מפתחי AI אוספים נתוני אימון.
הגנות וטיעוני נגד אפשריים
Google תסתמך ככל הנראה על דוקטרינת ה-"fair use", המתירה שימוש מוגבל בחומר המוגן בזכויות יוצרים לצורך פרשנות, ביקורת או שינוי (transformation). פסיקות אחרונות בקליפורניה התייחסו לאימון AI כפעילות טרנספורמטיבית, מה שהעניק לו הגנה תחת "fair use". התובעים בניו יורק הגישו את התביעה מחוץ לתחום השיפוט הזה כדי להימנע מהתקדימים הללו.
התובעים טוענים בתגובה כי הסרת מטא-דאטה של זכויות יוצרים מעידה על כוונה להסתיר את המקור, דבר שערער כל טענה לשינוי (transformation) בתום לב. הם גם מציינים את המזכר הפנימי כהוכחה לכך ש-Google הכירה בסיכון המשפטי.
מה לעקוב בהמשך
התיק יעבור דרך בקשות טרום-משפטיות (pre-trial motions) שעשויות לעצב את הטיעונים העומדים לרשות שני הצדדים, כולל השאלה האם בית המשפט יחיל את ניתוח ה-"fair use" המשמש בקליפורניה או יאמץ סטנדרט אחר. החלטה בנוגע לסמכות השיפוט עשויה לקבוע האם בתי המשפט בניו יורק יהפכו לזירה העיקרית לסכסוכי זכויות יוצרים הקשורים ל-AI.
בשורה התחתונה: התביעה בניו יורק נגד Gemini של Google עשויה לצייר מחדש את הגבול בין שימוש מותר בנתונים לבין הפרת זכויות יוצרים, מה שיאלץ מפתחי AI לחשוב מחדש על האופן שבו הם רוכשים את חומר הגלם המניע את המודלים שלהם ויעצב מחדש את הכלכלה של התעשייה כולה.
