Google змінив правила гри. Якщо минулого тижня ви зробили фото через Google Lens, вголос тренували іспанську фразу в Google Translate або просили Maps знайти місце для обіду, цей контент тепер може перебувати в черзі на навчання генеративних моделей ШІ компанії. Google нещодавно реструктуризував свою архітектуру конфіденційності так, щоб зображення, аудіокліпи та відео, які користувачі завантажують у межах його екосистеми, могли зберігатися та використовуватися для створення систем машинного навчання. Це свідомий перехід від збору даних із публічних вебсторінок до збору прямих, цілеспрямованих взаємодій, які люди щодня здійснюють із продуктами Google.

Тиха зміна політики

Це не чергове оновлення умов використання. Протягом багатьох років стандартний сценарій навчання великих моделей ШІ передбачав сканування мільярдів публічних вебсторінок, збір тексту, зображень і посилань, які вже були доступні всьому світу. Цей підхід має межі. Відкритий веб є обмеженим, і в багатьох сферах найцінніші публічні дані вже були вилучені та використані в існуючих системах. Конкуренти, такі як Meta, нещодавно почали орієнтуватися на використання контенту, створеного користувачами, і Google тепер рухається в тому ж напрямку.

Оновлення дійшло до користувачів через електронний лист, у якому було представлено два нові елементи керування конфіденційністю: Search Services History та Personalized Recommendations. На перший погляд, вони здаються стандартними інструментами персоналізації, призначеними для прискорення вашого наступного запиту або вдосконалення рекомендацій. Однак, якщо прочитати дрібний шрифт, масштаби стають зрозумілими. Google заявляє, що збережені медіафайли можуть використовуватися для «розробки та вдосконалення сервісів і технологій Google, включаючи моделі ШІ та заходи безпеки». Формулювання є розмитим, налаштування за замовчуванням увімкнені, а щоб відмовитися від цього, потрібно знати, де саме шукати.

Що Google насправді хоче від вас

«Парасолька» збору даних охоплює майже кожен основний сервіс Google, з яким ви взаємодієте. Коли турист наводить Google Lens на іноземний вуличний знак або меню в ресторані, візуальні дані не зникають просто так після появи результатів. Коли студент використовує Google Translate для тренування розмовної мови, аудіозаписи, зроблені під час цих сесій, можуть бути збережені. Голосові запити, надіслані через Search Live або стандартний голосовий пошук, підпадають під ту саму політику. Навіть звичні взаємодії з Maps, Shopping, Flights, Hotels та News можуть створювати медіафайли, які Google тепер класифікує як навчальний матеріал.

Раніше користувачі, які серйозно ставилися до конфіденційності, могли покладатися на перемикач Web & App Activity, щоб обмежити обсяг даних про взаємодію, які Google зберігає. Ця стратегія більше не працює. Google чітко відокремив ці нові налаштування від Web & App Activity. Search Services History є окремим елементом керування. Він увімкнений за замовчуванням, і які б вибори ви не робили у своєму панелі керування конфіденційністю два чи три роки тому, це не завадить збереженню ваших медіафайлів, пов'язаних із пошуком, для навчання ШІ. Старий вимикач більше не керує цим конкретним контуром.

Як насправді відмовитися від цього

Google надає можливість ручного керування, але весь тягар лежить на вас. Немає єдиного перемикача для всього облікового запису, який би одним кліком вимкнув збір даних для навчання ШІ. Вам потрібно відвідати дві конкретні сторінки в панелі керування вашим обліковим записом Google: сторінку Search Services History та сторінку Search Services Personalization.

Перебуваючи на сторінці Search Services History, прокрутіть вниз, доки не знайдете прапорець "Save Media". Зніміть із нього позначку. Саме ця одна дія запобігає збереженню майбутніх зображень, аудіо та відео та їх потенційному використанню для навчання моделей. Не сподівайтеся, що вимкнення Web & App Activity вирішить цю проблему за вас. Це не так. Відокремлення налаштувань є явним, але його легко пропустити, а це означає, що багато користувачів думатимуть, ніби вони відмовилися від збору даних, хоча насправді це не так.

Після того, як ви вимкнете збереження медіафайлів, налаштуйте параметри автоматичного видалення, поки ви все ще перебуваєте в тій самій панелі керування. Google пропонує три варіанти: видаляти дані через 3 місяці, 18 місяців або 36 місяців. Якщо ви хочете мати максимальний контроль, оберіть тримісячний період. Це найкоротший цикл очищення, який Google дозволяє через цей інструмент, і він обмежує накопичення ваших попередніх взаємодій. Майте на увазі, що вимкнення Save Media зупиняє збір даних у майбутньому. Усе, що Google вже зафіксував за попередніми налаштуваннями, може залишатися в сховищі, якщо ви не видалите свою історію вручну за допомогою тих самих інструментів облікового запису.

Якщо ви керуєте спільним сімейним акаунтом або робочим простором, де декілька людей взаємодіють із сервісами Google, кожен, хто має доступ, має перевірити ці налаштування індивідуально. Керування персоналізацією прив'язане до акаунту, а не до пристрою, і стандартне налаштування «увімкнено за замовчуванням» діє для всіх.

Що це говорить нам про наступний етап розвитку ШІ

Ця зміна політики є чітким сигналом того, куди рухається індустрія. Відкритого вебу вже повністю вичерпано для збору навчальних матеріалів. Наступним рубежем для вдосконалення великих мовних моделей та мультимодальних систем є пропрієтарні дані, що створюються реальними людьми всередині закритих платформ. Ваші візуальні пошуки містять просторовий контекст. Ваші сесії з практики перекладу містять особливості вимови та розмовні наміри. Ваші голосові запити містять тон, фразеологію та терміновість, які неможливо відтворити за допомогою статичного тексту з вебу.

Для розробників, засновників та всіх, хто стежить за конкурентним середовищем, висновок очевидний. «Ров із даних» (data moat), що відрізняє одну велику мовну модель від іншої, дедалі частіше копається за рахунок приватних взаємодій та завантажень власної бази користувачів платформи. Пошукові роботи у відкритому вебі все ще корисні, але найціннішими даними тепер є ті, які ви створюєте, будучи авторизованими в сервісі та активно намагаючись щось зробити.

Підсумок

Ваша стара стратегія захисту конфіденційності застаріла. Новий режим навчальних даних Google вимагає конкретної, свідомої відмови (opt-out) у розділі Search Services History шляхом зняття прапорця в полі Save Media. Ця дія в поєднанні з коротким вікном автоматичного видалення є єдиним надійним способом не допустити ваші завантажені зображення, аудіо та відео до конвеєра навчання ШІ Google. Поширте це. Налаштування за замовчуванням більше не працюють на вашу користь.