GPTBot ब्लॉक केल्याने तुमची साइट ChatGPT च्या उत्तर पॅनेल मधून पुसली जात नाही. ज्या साइट मालकांनी रोबोट्स.txt (robots.txt) मध्ये बॉटविरुद्ध नियम जोडले होते, त्यांना हे पाहून आश्चर्य वाटले की वापरकर्ते ChatGPT ला एखाद्या विषयाबद्दल विचारतात तेव्हा त्यांचे लेख लिंक्स आणि सारांशासह (excerpts) अजूनही दिसत आहेत. ब्लॉक यशस्वी झाला होता – फक्त चुकीचा क्रॉलर (crawler) थांबवला गेला होता.
ट्रेनिंग बॉट्स विरुद्ध सायटेशन बॉट्स (Training bots vs. citation bots)
AI प्रदाते दोन वेगळ्या प्रकारचे क्रॉलर्स चालवतात:
- ट्रेनिंग बॉट्स (Training bots) सार्वजनिकरित्या उपलब्ध असलेल्या पेजेसचा डेटा गोळा करतात (scrape), मजकूर ग्रहण करतात आणि मोठ्या लँग्वेज मॉडेल्सना (LLMs) अधिक अचूक बनवण्यासाठी (fine-tune) त्याचा वापर करतात. ते कधीही मूळ स्त्रोताची लिंक परत करत नाहीत आणि तुमच्या साइटसाठी कोणताही ट्रॅफिक निर्माण करत नाहीत.
- सायटेशन बॉट्स (Citation bots) क्वेरीच्या वेळी (query time) काम करतात. जेव्हा वापरकर्ता एखादा प्रश्न विचारतो, तेव्हा बॉट वेबवर शोध घेतो, संबंधित उतारा (snippet) काढतो, स्त्रोताचे नाव आणि URL जोडतो आणि ते चॅट विंडोमध्ये सादर करतो. या हिट्समुळे खऱ्या व्हिजिटर्सची संख्या वाढू शकते.
जर तुम्ही ट्रेनिंग बॉट ब्लॉक केला, तर मॉडेल तुमच्या पेजेसवरून अधिक शिकू शकणार नाही. जर तुम्ही सायटेशन बॉट ब्लॉक केला, तर तुमचे पेज ChatGPT च्या थेट उत्तरांमधून गायब होईल. गोंधळ या कारणामुळे निर्माण होतो कारण अनेक साइट्स "GPTBot" ब्लॉक करतात, परंतु त्यांना हे माहित नसते की सायटेशन वर्कफ्लोमध्ये (workflow) तेच नाव वापरले जात नाही.
मोठे खेळाडू त्यांचे क्रॉलर्स कसे विभागतात
| प्रदाता (Provider) | ट्रेनिंग-बॉटचे नाव (Training-bot name) | सायटेशन-बॉटची नावे (Citation-bot names) |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (दोन्ही सायटेशनसाठी वापरले जातात) | PerplexityBot, Perplexity-User |
जर तुम्हाला तुमचे कंटेंट भविष्यातील मॉडेल ट्रेनिंगपासून दूर ठेवायचे असेल, तर फक्त “Training-bot name” अंतर्गत असलेल्या नोंदी नाकारणे (deny) आवश्यक आहे. जर तुम्हाला ChatGPT च्या रिअल-टाइम उत्तरांमध्ये दिसायचे असेल, तर सायटेशन बॉट्सना परवानगी (allow) देणे आवश्यक आहे.
robots.txt योग्य पद्धतीने कॉन्फिगर करणे
"GPTBot" ला लक्ष्य करणारी एक सामान्य Disallow: / ओळ ट्रेनिंग क्रॉलरला ब्लॉक करते परंतु सायटेशन बॉट्सना तसा कोणताही परिणाम होत नाही. स्पष्टपणे सांगायचे तर, प्रत्येक ट्रेनिंग बॉटला नाकारणारे आणि सायटेशन बॉट्सना परवानगी देणारे नियम जोडा:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
केवळ सामान्य "*" ब्लॉक करणाऱ्या डीफॉल्ट robots.txt वर अवलंबून राहू नका. हा फरक महत्त्वाचा आहे कारण सर्वसमावेशक ब्लॉक (blanket block) मुळे ट्रेनिंग आणि सायटेशन दोन्ही बॉट्स बाहेर राहतील, ज्यामुळे AI-चालित सर्चद्वारे मिळणारा ट्रॅफिक थांबेल.
Cloudflare वापरकर्ते: AI Crawl Control पॅनेल वापरा
जर तुमचे डोमेन Cloudflare च्या मागे असेल, तर तुम्हाला robots.txt फाईलमध्ये "Cloudflare management marker" दिसू शकतो. फाईल मॅन्युअली एडिट केल्यास पुढच्या Cloudflare अपडेटमध्ये बदल ओव्हरराईट (overwrite) होऊ शकतात. त्याऐवजी, Cloudflare AI Crawl Control इंटरफेसवर जा आणि संबंधित बॉट्ससाठी स्विचेस (switches) टॉगल करा. हे पॅनेल पडद्यामागे योग्य निर्देश (directives) लिहिते आणि ते कायमस्वरूपी ठेवते.
हा सूक्ष्म फरक का महत्त्वाचा आहे
- बौद्धिक संपदा संरक्षण (Intellectual-property protection) – ट्रेनिंग बॉट्स ब्लॉक केल्यामुळे तुमचा मजकूर मोफत गोळा केला जाण्यापासून आणि भविष्यातील मॉडेल्समध्ये समाविष्ट करण्यापासून वाचतो.
- रेफरल ट्रॅफिक (Referral traffic) – सायटेशन बॉट्सना परवानगी देण्याचा अर्थ असा की, ChatGPT मध्ये उतारा पाहणारे वापरकर्ते तुमच्या साइटवर क्लिक करू शकतात, ज्यामुळे खऱ्या व्हिजिट्स वाढतात.
- ब्रँड व्हिजिबिलिटी (Brand visibility) – AI-वर्धित सर्चमध्ये (AI-augmented search) उपस्थित राहिल्यामुळे तुमचे कंटेंट शोधण्यायोग्य राहते, कारण AI असिस्टंट अनेक वापरकर्त्यांसाठी माहितीचा प्राथमिक स्रोत बनत आहेत.
प्रतिवाद (The counter-argument)
काही प्रकाशक असा युक्तिवाद करतात की त्यांच्या मजकुराचा कोणताही वापर, अगदी सायटेशनसाठी देखील, व्यापक AI इकोसिस्टममध्ये योगदान देतो आणि सायटेशन बॉट्स नाकारल्यामुळे त्यांची पोहोच (reach) कमी होऊ शकते. यामध्ये एक स्पष्ट तडजोड आहे: एकतर तुम्ही मॉडेलला श्रेय न देता तुमच्या कामातून शिकू देता, किंवा तुम्ही त्यांना तुमचा मजकूर उद्धृत (quote) करू देता आणि त्यातून ट्रॅफिक मिळवू देता. हा निर्णय तुम्ही तुमच्या शब्दांचा पुनर्वापर कसा व्हावा यावरील दीर्घकालीन नियंत्रणापेक्षा तात्काळ क्लिक्सना किती महत्त्व देता यावर अवलंबून आहे.
पुढे काय पाहावे
AI कंपन्या अजूनही त्यांच्या क्रॉलर्सना नावे देण्याच्या आणि त्यांना दिशा देण्याच्या पद्धतींवर काम करत आहेत. त्यांच्या डेव्हलपर डॉक्युमेंटेशनमधील user-agent स्ट्रिंग्समधील अपडेट्सवर लक्ष ठेवा. एक नवीन सायटेशन बॉट वेगळ्या नावाने येऊ शकतो आणि पूर्वी ब्लॉक केलेला ट्रेनिंग बॉट पुन्हा नाव बदलू शकतो. क्रॉलरच्या नवीनतम यादीशी सुसंगत राहण्यासाठी तुमच्या robots.txt आणि Cloudflare सेटिंग्जचे नियमितपणे ऑडिट करा.
महत्त्वाचा मुद्दा (Takeaway): तुमचे कंटेंट भविष्यातील मॉडेल ट्रेनिंगपासून दूर ठेवण्यासाठी फक्त ट्रेनिंग-बॉट युजर एजंट्स (user agents) ब्लॉक करा, परंतु सायटेशन बॉट्स सुरू ठेवा जेणेकरून ChatGPT अजूनही वापरकर्त्यांना तुमच्याकडे निर्देशित करू शकेल. योग्य robots.txt नियम, आवश्यकतेनुसार Cloudflare च्या AI Crawl Control द्वारे लागू केल्यास, तुम्ही तुमचे IP सुरक्षित ठेवून AI-चालित ट्रॅफिक मिळवू शकता.
