GPTBot-ஐத் தடுப்பது உங்கள் இணையதளத்தை ChatGPT-ன் பதில் பகுதியில் இருந்து நீக்கிவிடாது. robots.txt விதியைப் பயன்படுத்தித் தடுத்தும், பயனர்கள் ChatGPT-யிடம் ஒரு தலைப்பைப் பற்றி கேட்கும்போது தங்களின் கட்டுரைகள் இன்னும் இணைப்புகள் மற்றும் சுருக்கங்களுடன் வருவதைக் கண்டு இணையதள உரிமையாளர்கள் ஆச்சரியமடைந்தனர். அந்தத் தடுப்புச் செயல்முறை வேலை செய்ததுதான் – ஆனால் அது தவறான க்ராலரை (crawler) நிறுத்திவிட்டது.
பயிற்சி பாட்கள் (Training bots) vs. மேற்கோள் பாட்கள் (Citation bots)
AI வழங்குநர்கள் இரண்டு வேறுபட்ட வகையான க்ராலர்களை இயக்குகின்றனர்:
- பயிற்சி பாட்கள் (Training bots) பொதுவில் கிடைக்கும் பக்கங்களை ஸ்கிராப் (scrape) செய்து, உரையைப் பெற்று, பெரிய மொழி மாதிரிகளை (large language models) நுணுக்கமாகச் செம்மைப்படுத்த (fine-tune) பயன்படுத்துகின்றன. இவை மூலத் தளத்திற்கு ஒரு இணைப்பையும் திருப்பி அனுப்பாது, மேலும் தளத்திற்கு எந்தப் போக்குவரத்தையும் (traffic) கொண்டு வராது.
- மேற்கோள் பாட்கள் (Citation bots) தேடல் நேரத்தின் போது (query time) செயல்படுகின்றன. ஒரு பயனர் கேள்வி கேட்கும்போது, இந்த பாட் இணையத்தைத் தேடி, பொருத்தமான ஒரு பகுதியை எடுத்து, மூலத் தளத்தின் பெயர் மற்றும் URL-ஐச் சேர்த்து, அதை சாட் விண்டோவில் (chat window) காண்பிக்கும். இந்தத் தொடர்புகள் உண்மையான பார்வையாளர்களை உங்கள் தளத்திற்கு வரவழைக்கக்கூடும்.
நீங்கள் பயிற்சி பாட்டைத் தடுத்தால், அந்த மாடல் (model) உங்கள் பக்கங்களிலிருந்து இனி கற்றுக்கொள்ள முடியாது. நீங்கள் மேற்கோள் பாட்டைத் தடுத்தால், ChatGPT-ன் நேரடிப் பதில்களில் இருந்து அந்தப் பக்கம் மறைந்துவிடும். பல தளங்கள் “GPTBot”-ஐத் தடையின்றித் தடையிடும்போது, அதே பெயர் மேற்கோள் செயல்முறையில் (citation workflow) இடம்பெறவில்லை என்பதை உணராமல் இருப்பதால் இந்தத் குழப்பம் ஏற்படுகிறது.
பெரிய நிறுவனங்கள் தங்கள் க்ராலர்களை எவ்வாறு பிரிக்கின்றன
| Provider | Training-bot name | Citation-bot names |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (both used for citations) | PerplexityBot, Perplexity-User |
உங்கள் உள்ளடக்கத்தை எதிர்கால மாடல் பயிற்சியில் இருந்து விலக்க விரும்பினால், “Training-bot name” என்பதன் கீழ் உள்ள பதிவுகளை மட்டும் மறுக்க வேண்டும். நீங்கள் ChatGPT-ன் நிகழ்நேரப் பதில்களில் (real-time answers) தோன்ற விரும்பினால், மேற்கோள் பாட்களுக்கு அனுமதி அளிக்க வேண்டும்.
robots.txt-ஐச் சரியான முறையில் அமைத்தல்
“GPTBot”-ஐ இலக்காகக் கொண்ட ஒரு பொதுவான Disallow: / வரி, பயிற்சி க்ராலரைத் தடுக்கும் ஆனால் மேற்கோள் பாட்களைத் தொடாது. துல்லியமாகச் செயல்பட, ஒவ்வொரு பயிற்சி பாட்டையும் மறுக்கும் அதே வேளையில், மேற்கோள் பாட்களுக்கு அனுமதி அளிக்கும் விதிகளைச் சேர்க்கவும்:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
பொதுவான “*”-ஐ மட்டும் தடுக்கும் இயல்புநிலை (default) robots.txt-ஐ மட்டும் நம்பியிருக்க வேண்டாம். ஒரு முழுமையானத் தடுப்பு (blanket block) பயிற்சி மற்றும் மேற்கோள் பாட்கள் இரண்டையுமே தடுத்துவிடும், இதனால் AI சார்ந்த தேடல்கள் மூலம் கிடைக்கக்கூடிய போக்குவரத்தை (traffic) நீங்கள் இழக்க நேரிடும். எனவே இந்த வேறுபாடு முக்கியமானது.
Cloudflare பயனர்கள்: AI Crawl Control பேனலைப் பயன்படுத்தவும்
உங்கள் டொமைன் (domain) Cloudflare-ன் பின்னால் இருந்தால், robots.txt கோப்பிற்குள் “Cloudflare management marker”-ஐ நீங்கள் காணலாம். கோப்பை நேரடியாகத் திருத்துவது, அடுத்த Cloudflare புதுப்பிப்பின் போது மாற்றங்கள் மீண்டும் பழைய நிலைக்குத் திரும்பக் காரணமாகலாம். அதற்குப் பதிலாக, Cloudflare AI Crawl Control இடைமுகத்திற்குச் சென்று, தொடர்புடைய பாட்களுக்கான ஸ்விட்சுகளை (switches) மாற்றவும். இந்த பேனல் பின்னணியில் சரியான வழிமுறைகளை (directives) எழுதும் மற்றும் அவற்றை நிலையாக வைத்திருக்கும்.
இந்த நுணுக்கம் ஏன் முக்கியமானது
- அறிவுசார் சொத்து பாதுகாப்பு (Intellectual-property protection) – பயிற்சி பாட்களைத் தடுப்பதன் மூலம் உங்கள் எழுத்துக்கள் இலவசமாகச் சேகரிக்கப்படுவதையும், எதிர்கால மாடல்களில் சேர்க்கப்படுவதையும் தடுக்கலாம்.
- பரிந்துரைப் போக்குவரத்து (Referral traffic) – மேற்கோள் பாட்களுக்கு அனுமதி அளிப்பது, ChatGPT-ல் ஒரு பகுதியைத் பார்க்கும் பயனர்கள் உங்கள் தளத்திற்குச் செல்ல வழிவகை செய்யும், இதன் மூலம் உண்மையான பார்வையாளர்களைப் பெறலாம்.
- பிராண்ட் தெரிவுத்திறன் (Brand visibility) – AI உதவியாளர்கள் பல பயனர்களுக்கு முதன்மைத் தகவல் ஆதாரமாக மாறிவரும் நிலையில், AI-ஆல் மேம்படுத்தப்பட்ட தேடலில் உங்கள் உள்ளடக்கம் இருப்பதை உறுதி செய்வது உங்கள் பிராண்டின் இருப்பை நிலைநிறுத்தும்.
மாற்று வாதம்
சில வெளியீட்டாளர்கள், மேற்கோளுக்காகத் தங்களின் உரையைப் பயன்படுத்துவது கூட பரந்த AI சூழலுக்குப் பங்களிக்கிறது என்றும், மேற்கோள் பாட்களை மறுப்பது அவர்களின் சென்றடையும் திறனை (reach) பாதிக்கக்கூடும் என்றும் வாதிடுகின்றனர். இதில் உள்ள சவால் தெளிவானது: உங்கள் படைப்பிலிருந்து மாடல் அங்கீகாரம் இன்றி கற்றுக்கொள்ள அனுமதிக்கலாம், அல்லது அது உங்களைக் மேற்கோள் காட்டி உங்கள் தளத்திற்குப் போக்குவரத்தைக் கொண்டு வர அனுமதிக்கலாம். உடனடி கிளிக்குகளுக்கு (clicks) நீங்கள் எவ்வளவு முக்கியத்துவம் அளிக்கிறீர்கள் மற்றும் உங்கள் சொற்கள் எவ்வாறு மறுபயன்பாடு செய்யப்படுகின்றன என்பதன் மீதான நீண்டகாலக் கட்டுப்பாட்டிற்கு எவ்வளவு முக்கியத்துவம் அளிக்கிறீர்கள் என்பதைப் பொறுத்தே இந்தத் தேர்வு அமையும்.
அடுத்து கவனிக்க வேண்டியவை
AI நிறுவனங்கள் தங்களின் க்ராலர்களுக்குப் பெயரிடும் மற்றும் வழிநடத்தும் முறையைத் தொடர்ந்து மேம்படுத்தி வருகின்றன. அவற்றின் டெவலப்பர் ஆவணங்களில் (developer documentation) உள்ள user-agent சரங்களைக் (strings) கவனித்துக் கொண்டே இருங்கள். ஒரு புதிய மேற்கோள் பாட் வேறு பெயரில் தோன்றலாம், அல்லது முன்பு தடுக்கப்பட்ட ஒரு பயிற்சி பாட் பெயர் மாற்றப்படலாம். சமீபத்திய க்ராலர் பட்டியலுடன் ஒத்துப்போக உங்கள் robots.txt மற்றும் Cloudflare அமைப்புகளைத் தொடர்ந்து ஆய்வு செய்யவும்.
சுருக்கம்: உங்கள் உள்ளடக்கத்தை எதிர்கால மாடல் பயிற்சியில் இருந்து விலக்க பயிற்சி-பாட் user agents-களை மட்டும் Block செய்யவும், ஆனால் ChatGPT பயனர்களை மீண்டும் உங்கள் தளத்திற்கு வழிநடத்த மேற்கோள் பாட்களை (citation bots) Enable நிலையில் வைத்திருக்கவும். தேவைப்படும்போது Cloudflare-ன் AI Crawl Control மூலம் சரியான robots.txt விதிகளைப் பயன்படுத்துவதன் மூலம், உங்கள் அறிவுசார் சொத்தைப் பாதுகாப்பதோடு AI மூலம் வரும் போக்குவரத்தையும் நீங்கள் பெற முடியும்.
