גוגל שינתה את כללי המשחק. אם צילמתם תמונה באמצעות Google Lens בשבוע שעבר, תרגלתם ביטוי בספרדית בקול רם ב-Google Translate, או ביקשתם מ-Maps למצוא מקום לארוחת צהריים, ייתכן שהתוכן הזה יושב כעת בתור לאימון מודלי ה-AI הגנרטיבי של החברה. גוגל ארגנה לאחרונה מחדש את ארכיטקטורת הפרטיות שלה כך שניתן יהיה לשמור ולהשתמש בתמונות, קטעי אודיו וסרטוני וידאו שמשתמשים מעלים לאורך המערכת האקולוגית שלה כדי לבנות מערכות למידת מכונה. זהו שינוי כוונתי משימוש בגירוד (scraping) של דפי אינטרנט ציבוריים לעבר איסוף האינטראקציות הישירות ובעלות הכוונה הגבוהה (high-intent) שאנשים מבצעים עם מוצרי גוגל מדי יום.

שינוי המדיניות השקט

זהו אינו עדכון שגרתי של תנאי השימוש. במשך שנים, שיטת הפעולה הסטנדרטית לאימון מודלי AI גדולים כללה סריקה (crawling) של מיליארדי דפי אינטרנט ציבוריים, ואיסוף טקסטים, תמונות וקישורים שכבר היו גלויים לעולם. לגישה זו יש מגבלות. הרשת הפתוחה היא סופית, ובתחומים רבים הנתונים הציבוריים בעלי הערך הרב כבר הופקו והוזנו למערכות קיימות. מתחרים כמו Meta דחפו לאחרונה לעבר ניצול תוכן שנוצר על ידי משתמשים, וגוגל נעה כעת באותו כיוון.

העדכון הגיע למשתמשים באמצעות אימייל שבו הוצגו שתי בקרות פרטיות חדשות: Search Services History ו-Personalized Recommendations. על פני השטח, אלו נשמעים כמו כלי התאמה אישית סטנדרטיים שנועדו להאיץ את השאילתה הבאה שלכם או לשפר את ההמלצות שלכם. אך אם תקראו את הכתב הקטן, ההיקף הופך לברור. גוגל מציינת כי ניתן להשתמש במדיה שנשמרה כדי "לפתח ולשפר את שירותי וטכנולוגיות Google, כולל מודלי AI ואמצעי בטיחות". הניסוח רחב, הגדרת ברירת המחדל היא "פעיל", והסרת ההסכמה (opting out) דורשת מכם לדעת איפה לחפש.

מה גוגל באמת רוצה מכם

מעטפת איסוף הנתונים מכסה כמעט כל שירות מרכזי של גוגל שאתם נוגעים בו. כשסטודנט משתמש ב-Google Translate כדי לתרגל דיבור בקול רם, הקלטות האודיו שנלכדו במהלך אותם סשנים עשויות להישמר. שאילתות קוליות הנשלחות דרך Search Live או חיפוש קולי סטנדרטי נכללות תחת אותה מדיניות. אפילו אינטראקציות שגרתיות עם Maps, Shopping, Flights, Hotels ו-News יכולות לייצר מדיה שגוגל מסווגת כעת כחומר אימון.

בעבר, משתמשים שהתייחסו ברצינות לפרטיות היו יכולים להסתמך על מתג ה-Web & App Activity כדי להגביל את כמות נתוני האינטראקציה שגוגל שומרת. האסטרטגיה הזו כבר לא עובדת. גוגל ניתקה במפורש את ההגדרות החדשות הללו מ-Web & App Activity. Search Services History הוא בקר עצמאי. הוא מופעל כברירת מחדל, ושום בחירה שלא עשיתם בלוח הבקרה של הפרטיות שלכם לפני שנתיים או שלוש לא תמנע מהמדיה הקשורה לחיפושים שלכם להישמר לצורך אימון AI. מתג ה"כיבוי" הישן כבר לא שולט במעגל הספציפי הזה.

איך באמת לבטל את ההסכמה (Opt Out)

גוגל אכן מספקת אפשרות לביטול ידני, אך הנטל הוא עליכם בלבד. אין מתג כלל-חשבון שמבטל את איסוף נתוני אימון ה-AI בלחיצה אחת. עליכם לבקר בשני דפים ספציפיים בתוך לוח הבקרה של חשבון Google שלכם: דף ה-Search Services History ודף ה-Search Services Personalization.

ברגע שאתם בתוך Search Services History, גללו עד שתמצאו את תיבת הסימון "Save Media". בטלו את הסימון שלה. פעולה בודדת זו היא שמונעת מתמונות, אודיו ווידאו עתידיים להישמר וייתכן שיוזנו לאימון המודלים. אל תניחו שביטול Web & App Activity יטפל בכך עבורכם. הוא לא יעשה זאת. הניתוק הוא מפורש וקל לפספס, מה שאומר שמשתמשים רבים יאמינו שהם ביטלו את ההסכמה כשבפועל לא עשו זאת.

לאחר שתבטלו את שמירת המדיה, הגדירו את העדפות המחיקה האוטומטית שלכם בזמן שאתם עדיין באותו לוח בקרה. גוגל מציעה שלוש אפשרויות: מחיקת נתונים לאחר 3 חודשים, 18 חודשים או 36 חודשים. אם אתם רוצים את השליטה ההדוקה ביותר, בחרו בחלון של שלושה חודשים. זהו מחזור הניקוי הקצר ביותר שגוגל מאפשרת דרך בקר זה, והוא מגביל את הצטברות האינטראקציות ההיסטוריות שלכם. קחו בחשבון שכיבוי Save Media עוצר את האיסוף העתידי. כל מה שגוגל כבר רשמה תחת ההגדרות הקודמות עשוי להישאר באחסון, אלא אם תמחקו ידנית את ההיסטוריה הקיימת שלכם באמצעות כלי החשבון עצמם.

אם אתם מנהלים חשבון משפחתי משותף או סביבת עבודה שבה מספר אנשים מתקשרים עם שירותי Google, כל מי שיש לו גישה צריך לבדוק את ההגדרות הללו באופן אישי. בקרות ההתאמה האישית קשורות לחשבון, לא למכשיר, והבחירה המוגדרת מראש (opt-in) חלה על כולם.

מה זה אומר לנו על השלב הבא של ה-AI

שינוי מדיניות זה הוא אות ברור לגבי הכיוון אליו התעשייה צועדת. הרשת הציבורית כבר נכרה ביסודיות עבור חומרי אימון. החזית הבאה לשיפור מודלי שפה גדולים ומערכות מולטי-מודאליות היא נתונים קנייניים שנוצרו על ידי אנשים אמיתיים בתוך פלטפורמות סגורות. החיפושים הוויזואליים שלכם מכילים הקשר מרחבי. מפגשי תרגול התרגום שלכם מכילים דפוסי הגייה וכוונות שיחתיות. שאילתות הקול שלכם מכילות טון, ניסוח ודחיפות שטקסט סטטי מהרשת אינו יכול לשחזר.

עבור מפתחים, מייסדים וכל מי שעוקב אחר הנוף התחרותי, המשמעות היא פשוטה. ה-"data moat" שמפריד בין מודל שפה גדול אחד למשנהו נחפר יותר ויותר מתוך האינטראקציות וההעלאות הפרטיות של בסיס המשתמשים של הפלטפורמה עצמה. סריקות רשת בקוד פתוח עדיין מועילות, אך הנתונים בעלי הערך הגבוה ביותר הם כעת מה שאתם יוצרים בזמן שאתם מחוברים לשירות ומנסים באופן פעיל לבצע משימה כלשהי.

השורה התחתונה

ספר החוקים הישן שלכם בנושא פרטיות כבר אינו רלוונטי. מערך נתוני האימון החדש של Google דורש ביצוע opt-out ספציפי ומכוון בתוך Search Services History על ידי ביטול הסימון בתיבת Save Media. פעולה זו, בשילוב עם חלון מחיקה אוטומטית קצר, היא הדרך האמינה היחידה להשאיר את התמונות, האודיו והווידאו שהעליתם מחוץ למסלול (pipeline) אימון ה-AI של Google. העבירו את זה הלאה. ברירת המחדל כבר לא עומדת לטובתכם.