Google a changé les règles du jeu. Si vous avez pris une photo via Google Lens la semaine dernière, pratiqué une phrase en espagnol à voix haute dans Google Translate, ou demandé à Maps de localiser un endroit pour déjeuner, ce contenu pourrait désormais se trouver dans une file d'attente pour entraîner les modèles d'IA générative de l'entreprise. Google a récemment restructuré son architecture de confidentialité de sorte que les images, les clips audio et les vidéos téléchargés par les utilisateurs à travers son écosystème puissent être conservés et utilisés pour construire des systèmes d'apprentissage automatique. Il s'agit d'un pivot délibéré : passer du scraping de pages web publiques à la collecte des interactions directes et à forte intention que les gens ont chaque jour avec les produits Google.

Le changement de politique silencieux

Il ne s'agit pas d'une mise à jour de routine des conditions d'utilisation. Pendant des années, la stratégie standard pour entraîner de grands modèles d'IA consistait à explorer des milliards de pages web publiques, en rassemblant du texte, des images et des liens qui étaient déjà visibles par le monde entier. Cette approche a ses limites. Le web ouvert est fini, et dans de nombreux domaines, les données publiques les plus précieuses ont déjà été extraites et injectées dans les systèmes existants. Des concurrents comme Meta se sont récemment tournés vers l'exploitation du contenu généré par les utilisateurs, et Google suit désormais la même direction.

La mise à jour est parvenue aux utilisateurs via un e-mail client qui présentait deux nouveaux contrôles de confidentialité : Search Services History et Personalized Recommendations. En surface, ces outils ressemblent à des outils de personnalisation standards destinés à accélérer votre prochaine requête ou à affiner vos recommandations. Lisez toutefois les petits caractères, et la portée devient claire. Google déclare que les médias enregistrés peuvent être utilisés pour « développer et améliorer les services et technologies de Google, y compris les modèles d'IA et les mesures de sécurité ». La formulation est large, le paramètre par défaut est activé, et se désinscrire nécessite de savoir où chercher.

Ce que Google veut réellement de vous

Le parapluie de la collecte de données couvre presque tous les services Google majeurs que vous utilisez. Lorsqu'un touriste pointe Google Lens vers un panneau de signalisation étranger ou un menu de restaurant, l'entrée visuelle ne disparaît pas simplement après l'apparition des résultats. Lorsqu'un étudiant utilise Google Translate pour s'exercer à parler à voix haute, les enregistrements audio capturés pendant ces sessions sont éligibles à la conservation. Les requêtes vocales envoyées via Search Live ou la recherche vocale standard tombent sous la même politique. Même les interactions de routine avec Maps, Shopping, Flights, Hotels et News peuvent générer des médias que Google classe désormais comme matériel d'entraînement.

Auparavant, les utilisateurs soucieux de leur vie privée pouvaient s'appuyer sur l'interrupteur Web & App Activity pour limiter la quantité de ces données d'interaction conservées par Google. Cette stratégie ne fonctionne plus. Google a explicitement dissocié ces nouveaux paramètres de Web & App Activity. Search Services History est un contrôle autonome. Il est activé par défaut, et les choix que vous avez faits dans votre tableau de bord de confidentialité il y a deux ou trois ans n'empêcheront pas le stockage de vos médias liés à la recherche pour l'entraînement de l'IA. L'ancien interrupteur de désactivation ne contrôle plus ce circuit particulier.

Comment réellement se désinscrire

Google propose bien une commande manuelle, mais la responsabilité vous incombe entièrement. Il n'existe pas de bouton unique pour l'ensemble du compte qui désactive la collecte de données d'entraînement de l'IA en un clic. Vous devez vous rendre sur deux pages spécifiques dans le tableau de bord de votre compte Google : la page Search Services History et la page Search Services Personalization.

Une fois dans Search Services History, faites défiler jusqu'à trouver la case à cocher « Save Media ». Décochez-la. Cette action unique est ce qui empêche les futures images, les audios et les vidéos d'être stockés et potentiellement injectés dans l'entraînement des modèles. Ne supposez pas que la désactivation de Web & App Activity s'en chargera pour vous. Ce ne sera pas le cas. La dissociation est explicite et facile à manquer, ce qui signifie que de nombreux utilisateurs croiront s'être désinscrits alors qu'ils ne l'ont pas fait.

Après avoir désactivé l'enregistrement des médias, configurez vos préférences de suppression automatique pendant que vous êtes toujours dans le même tableau de bord. Google propose trois choix : supprimer les données après 3 mois, 18 mois ou 36 mois. Si vous voulez le contrôle le plus strict, choisissez la fenêtre de trois mois. C'est le cycle de nettoyage le plus court que Google autorise via ce contrôle, et cela limite l'accumulation de vos interactions historiques. Gardez à l'esprit que la désactivation de Save Media arrête la collecte future. Tout ce que Google a déjà enregistré selon les paramètres précédents peut rester en stockage, à moins que vous ne supprimiez manuellement votre historique existant via les mêmes outils de compte.

Si vous gérez un compte familial partagé ou un espace de travail où plusieurs personnes interagissent avec les services Google, chaque personne disposant d'un accès devrait vérifier ces paramètres individuellement. Les contrôles de personnalisation sont liés au compte, et non à l'appareil, et l'option d'adhésion par défaut s'applique à l'ensemble.

Ce que cela nous révèle sur la prochaine phase de l'IA

Ce changement de politique est un signal clair de la direction que prend l'industrie. Le web public a été exploité de fond en comble pour servir de matériel d'entraînement. La prochaine frontière pour l'amélioration des grands modèles de langage et des systèmes multimodaux réside dans les données propriétaires générées par de vraies personnes au sein de plateformes fermées. Vos recherches visuelles contiennent un contexte spatial. Vos sessions d'entraînement à la traduction contiennent des modèles de prononciation et une intention conversationnelle. Vos requêtes vocales contiennent un ton, une formulation et une urgence que le texte statique du web ne peut reproduire.

Pour les développeurs, les fondateurs et tous ceux qui observent le paysage concurrentiel, l'implication est directe. Le « fossé de données » (data moat) qui sépare un grand modèle de langage d'un autre est de plus en plus creusé à partir des interactions privées et des fichiers téléchargés par la propre base d'utilisateurs d'une plateforme. Les explorations du web en open-source restent utiles, mais les données de la plus haute valeur sont désormais celles que vous créez lorsque vous êtes connecté à un service et que vous essayez activement d'accomplir une tâche.

L'essentiel

Votre ancienne stratégie de protection de la vie privée est obsolète. Le nouveau régime de données d'entraînement de Google nécessite un désengagement (opt-out) spécifique et délibéré dans l'historique des services de recherche (Search Services History) en décochant la case « Enregistrer les médias » (Save Media). Cette action, combinée à une fenêtre de suppression automatique courte, est le seul moyen fiable d'empêcher vos images, audios et vidéos téléchargés d'intégrer le pipeline d'entraînement de l'IA de Google. Passez le mot. Par défaut, les réglages ne sont plus en votre faveur.