Google ने खेळाचे नियम बदलले आहेत. जर तुम्ही गेल्या आठवड्यात Google Lens द्वारे एखादा फोटो काढला असेल, Google Translate मध्ये एखादे स्पॅनिश वाक्य मोठ्याने बोलण्याचा सराव केला असेल, किंवा दुपारच्या जेवणासाठी एखादी जागा शोधण्यासाठी Maps ला विचारले असेल, तर तो मजकूर आता कंपनीच्या जनरेटिव्ह AI मॉडेल्सना प्रशिक्षित करण्यासाठी रांगेत असू शकतो. Google ने अलीकडेच आपल्या गोपनीयता संरचनेची (privacy architecture) पुनर्रचना केली आहे, जेणेकरून वापरकर्ते त्यांच्या संपूर्ण इकोसिस्टममध्ये अपलोड केलेले फोटो, ऑडिओ क्लिप्स आणि व्हिडिओ साठवून ठेवले जाऊ शकतात आणि मशीन लर्निंग सिस्टम तयार करण्यासाठी वापरले जाऊ शकतात. सार्वजनिक वेब पेजेस स्क्रॅप करण्याऐवजी, लोक दररोज Google उत्पादनांशी ज्या थेट आणि उच्च-हेतूच्या (high-intent) संवादातून जोडले जातात, त्यातून माहिती गोळा करण्याकडे हा एक जाणीवपूर्वक वळण आहे.
शांत धोरणात्मक बदल
हा सेवा अटींचा (terms-of-service) कोणताही नियमित अपडेट नाही. अनेक वर्षांपासून, मोठ्या AI मॉडेल्सना प्रशिक्षित करण्यासाठी सार्वजनिक वेबपेजेस क्रॉल करणे, मजकूर, प्रतिमा आणि लिंक्स गोळा करणे ही एक मानक पद्धत होती, ज्या आधीच जगाला दिसत होत्या. त्या पद्धतीला मर्यादा आहेत. ओपन वेब मर्यादित आहे आणि अनेक क्षेत्रांमध्ये सर्वात मौल्यवान सार्वजनिक डेटा आधीच काढून घेण्यात आला आहे आणि विद्यमान सिस्टममध्ये फीड केला गेला आहे. Meta सारखे स्पर्धक अलीकडे वापरकर्त्यांनी तयार केलेल्या मजकुराचा (user-generated content) वापर करण्याकडे वळले आहेत आणि Google देखील आता त्याच दिशेने पाऊल टाकत आहे.
हा अपडेट वापरकर्त्यांपर्यंत एका ईमेलद्वारे पोहोचला, ज्यामध्ये दोन नवीन गोपनीयता नियंत्रणे (privacy controls) सादर केली गेली: Search Services History आणि Personalized Recommendations. वरवर पाहता, हे तुमच्या पुढील क्वेरीचा वेग वाढवण्यासाठी किंवा तुमच्या शिफारसी सुधारण्यासाठी वापरली जाणारी मानक वैयक्तिकीकरण साधने (personalization tools) वाटतात. तथापि, बारीक अक्षरातील मजकूर वाचला तर व्याप्ती स्पष्ट होते. Google नमूद करते की साठवलेले मीडिया "AI मॉडेल्स आणि सुरक्षा उपायांसह Google सेवा आणि तंत्रज्ञान विकसित आणि सुधारण्यासाठी" वापरले जाऊ शकतात. या शब्दावलीची व्याप्ती मोठी आहे, डीफॉल्ट सेटिंग 'ऑन' आहे आणि ऑप्ट-आउट करण्यासाठी तुम्हाला नेमके कुठे पाहायचे आहे हे माहित असणे आवश्यक आहे.
Google ला तुमच्याकडून नेमके काय हवे आहे
डेटा संकलनाचा हा विस्तार तुम्ही वापरत असलेल्या जवळजवळ प्रत्येक प्रमुख Google सेवेवर लागू होतो. जेव्हा एखादा पर्यटक परदेशी रस्त्यावरील फलक किंवा जेवणाच्या मेनूवर Google Lens दाखवतो, तेव्हा निकाल दिसल्यानंतर तो व्हिज्युअल इनपुट केवळ नाहीसा होत नाही. जेव्हा एखादा विद्यार्थी मोठ्याने बोलण्याचा सराव करण्यासाठी Google Translate वापरतो, तेव्हा त्या सत्रादरम्यान रेकॉर्ड केलेले ऑडिओ रेकॉर्डिंग साठवण्यासाठी पात्र ठरतात. Search Live किंवा मानक व्हॉइस सर्चद्वारे पाठवलेले व्हॉइस क्वेरी देखील याच धोरणांतर्गत येतात. Maps, Shopping, Flights, Hotels आणि News वरील नियमित संवाद देखील असे मीडिया तयार करू शकतात ज्यांना Google आता प्रशिक्षण साहित्य (training material) म्हणून वर्गीकृत करते.
पूर्वी, गोपनीयतेबाबत गंभीर असलेल्या वापरकर्त्यांना Google कडे किती संवाद डेटा आहे हे मर्यादित करण्यासाठी Web & App Activity स्विचचा आधार घेता येत असे. ती रणनीती आता काम करत नाही. Google ने ही नवीन सेटिंग्ज Web & App Activity पासून स्पष्टपणे वेगळी केली आहे. Search Services History हे एक स्वतंत्र नियंत्रण आहे. हे डीफॉल्टनुसार सुरू असते आणि तुम्ही दोन किंवा तीन वर्षांपूर्वी तुमच्या गोपनीयता डॅशबोर्डमध्ये कोणतेही निर्णय घेतले असले तरी, ते तुमच्या शोध-संबंधित मीडियाला AI प्रशिक्षणासाठी साठवण्यापासून रोखणार नाहीत. जुना 'ऑफ' स्विच आता या विशिष्ट सर्किटवर नियंत्रण ठेवत नाही.
प्रत्यक्षात ऑप्ट-आउट कसे करावे
Google मॅन्युअल ओव्हरराइडची सुविधा देते, परंतु सर्व जबाबदारी तुमच्यावर आहे. एका क्लिकमध्ये AI प्रशिक्षण डेटा संकलन बंद करणारे कोणतेही खाते-व्यापी (account-wide) टोगल नाही. तुम्हाला तुमच्या Google खाते डॅशबोर्डमधील दोन विशिष्ट पृष्ठांना भेट द्यावी लागेल: Search Services History पृष्ठ आणि Search Services Personalization पृष्ठ.
एकदा तुम्ही Search Services History मध्ये पोहोचलात की, "Save Media" चेकबॉक्स मिळेपर्यंत खाली स्क्रोल करा. तो अनचेक करा. या एका कृतीमुळे भविष्यातील प्रतिमा, ऑडिओ आणि व्हिडिओ साठवले जाण्यापासून आणि संभाव्यतः मॉडेल प्रशिक्षणात वापरण्यापासून रोखले जातात. Web & App Activity बंद केल्याने हे काम होईल असे समजू नका. ते होणार नाही. हे वेगळेपण स्पष्ट आहे परंतु ते लक्षात न येणे सोपे आहे, याचा अर्थ असा की अनेक वापरकर्त्यांना वाटेल की त्यांनी ऑप्ट-आउट केले आहे, परंतु प्रत्यक्षात त्यांनी केलेले नसते.
मीडिया सेव्हिंग बंद केल्यानंतर, तुम्ही त्याच डॅशबोर्डमध्ये असतानाच तुमच्या ऑटो-डिलीट पसंती (auto-delete preferences) कॉन्फिगर करा. Google तीन पर्याय देते: ३ महिने, १८ महिने किंवा ३६ महिन्यांनंतर डेटा हटवा. जर तुम्हाला सर्वात कडक नियंत्रण हवे असेल, तर तीन महिन्यांचा कालावधी निवडा. या नियंत्रणाद्वारे Google परवानगी देणारा हा सर्वात लहान क्लिनअप सायकल आहे आणि यामुळे तुमच्या ऐतिहासिक संवादांचा बॅकलॉग मर्यादित होतो. लक्षात ठेवा की 'Save Media' बंद केल्याने भविष्यातील संकलन थांबते. Google ने मागील सेटिंग्ज अंतर्गत आधीच नोंदवलेली कोणतीही माहिती साठवलेली राहू शकते, जोपर्यंत तुम्ही त्याच खाते साधनांद्वारे तुमचा विद्यमान इतिहास मॅन्युअली हटवत नाही.
जर तुम्ही एखादे सामायिक कौटुंबिक खाते (shared family account) किंवा वर्कस्पेस व्यवस्थापित करत असाल जिथे अनेक लोक Google सेवांचा वापर करतात, तर ज्यांच्याकडे प्रवेश आहे प्रत्येकाने ही सेटिंग्ज वैयक्तिकरित्या तपासली पाहिजेत. पर्सनलायझेशन कंट्रोल्स (Personalization controls) हे डिव्हाइसला नाही तर खात्याला जोडलेले असतात आणि डिफॉल्ट 'ऑप्ट-इन' (opt-in) सर्वत्र लागू होते.
हे आपल्याला AI च्या पुढील टप्प्याबद्दल काय सांगते
धोरणातील हा बदल उद्योग कोणत्या दिशेने जात आहे याचे स्पष्ट संकेत आहे. प्रशिक्षणासाठी लागणारे साहित्य मिळवण्यासाठी सार्वजनिक वेबचा (public web) पूर्णपणे वापर करून घेतला गेला आहे. लार्ज लँग्वेज मॉडेल्स (large language models) आणि मल्टिमॉडल सिस्टम्स (multimodal systems) सुधारण्यासाठी पुढचा टप्पा म्हणजे बंद प्लॅटफॉर्म्समधील (closed platforms) खऱ्या लोकांद्वारे तयार केलेला मालकीचा डेटा (proprietary data) हा आहे. तुमच्या व्हिज्युअल सर्चमध्ये (visual searches) अवकाशीय संदर्भ (spatial context) असतो. तुमच्या भाषांतराच्या सराव सत्रांमध्ये उच्चार पद्धती आणि संवादाचा हेतू असतो. तुमच्या व्हॉइस क्वेरीजमध्ये (voice queries) असा टोन, शब्दरचना आणि तातडी असते जी स्थिर वेब मजकूर (static web text) देऊ शकत नाही.
डेव्हलपर्स, संस्थापक आणि स्पर्धात्मक परिस्थितीवर लक्ष ठेवून असलेल्या प्रत्येकासाठी, याचा अर्थ स्पष्ट आहे. एका लार्ज लँग्वेज मॉडेलला दुसऱ्यापासून वेगळे करणारा "डेटा मोट" (data moat) आता प्लॅटफॉर्मच्या स्वतःच्या वापरकर्त्यांच्या खाजगी संवाद आणि अपलोड केलेल्या माहितीमधून अधिक प्रमाणात तयार केला जात आहे. ओपन-सोर्स वेब क्रॉल्स (Open-source web crawls) अजूनही उपयुक्त आहेत, परंतु आता सर्वात मौल्यवान डेटा तो आहे जो तुम्ही एखाद्या सेवेमध्ये लॉग-इन असताना आणि एखादे काम सक्रियपणे करण्याचा प्रयत्न करताना तयार करता.
थोडक्यात सांगायचे तर
तुमची जुनी गोपनीयता नियमावली (privacy playbook) आता कालबाह्य झाली आहे. Google च्या नवीन ट्रेनिंग डेटा नियमांनुसार, Search Services History मध्ये 'Save Media' बॉक्स अनचेक करून विशिष्ट आणि जाणीवपूर्वक 'ऑप्ट-आउट' (opt-out) करणे आवश्यक आहे. ही कृती आणि त्यासोबतच ऑटो-डिलीटची (auto-delete) कमी कालावधीची मर्यादा, हे तुमचे अपलोड केलेले फोटो, ऑडिओ आणि व्हिडिओ Google च्या AI ट्रेनिंग पाइपलाइनपासून दूर ठेवण्याचे एकमेव विश्वसनीय मार्ग आहेत. ही माहिती इतरांपर्यंत पोहोचवा. आता डिफॉल्ट सेटिंग्ज तुमच्या फायद्याच्या राहिलेल्या नाहीत.