GPTBot ബ്ലോക്ക് ചെയ്യുന്നത് നിങ്ങളുടെ സൈറ്റിനെ ChatGPT-യുടെ ഉത്തരങ്ങളിൽ നിന്ന് നീക്കം ചെയ്യില്ല. robots.txt-ൽ ഈ ബോട്ടിനെതിരെ നിയമങ്ങൾ ചേർത്ത സൈറ്റ് ഉടമകൾ, ഉപയോക്താക്കൾ ChatGPT-യോട് ഒരു വിഷയത്തെക്കുറിച്ച് ചോദിക്കുമ്പോൾ തങ്ങളുടെ ലേഖനങ്ങൾ ലിങ്കുകളും സംഗ്രഹങ്ങളും (excerpts) സഹിതം ഇപ്പോഴും കാണുന്നത് കണ്ട് അത്ഭുതപ്പെട്ടു. ബ്ലോക്ക് പ്രവർത്തിച്ചിരുന്നു – പക്ഷേ അത് തെറ്റായ ക്രോളറെയാണ് തടഞ്ഞത്.

ട്രെയിനിംഗ് ബോട്ടുകളും സൈറ്റേഷൻ ബോട്ടുകളും (Training bots vs. citation bots)

AI പ്രൊവൈഡർമാർ രണ്ട് വ്യത്യസ്ത തരം ക്രോളറുകളാണ് പ്രവർത്തിപ്പിക്കുന്നത്:

  • ട്രെയിനിംഗ് ബോട്ടുകൾ (Training bots) പരസ്യമായി ലഭ്യമായ പേജുകൾ സ്ക്രാപ്പ് ചെയ്യുകയും, അവയിലെ ടെക്സ്റ്റ് ശേഖരിക്കുകയും, ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (large language models) മെച്ചപ്പെടുത്താൻ ഉപയോഗിക്കുകയും ചെയ്യുന്നു. ഇവ ഒരിക്കലും സ്രോതസ്സിന്റെ (source) ലിങ്ക് നൽകുന്നില്ല, കൂടാതെ സൈറ്റിലേക്ക് ട്രാഫിക് എത്തിക്കുന്നുമില്ല.
  • സൈറ്റേഷൻ ബോട്ടുകൾ (Citation bots) ക്വറി സമയത്താണ് പ്രവർത്തിക്കുന്നത്. ഒരു ഉപയോക്താവ് ചോദ്യം ചോദിക്കുമ്പോൾ, ഈ ബോട്ട് വെബ് സെർച്ച് ചെയ്ത് പ്രസക്തമായ ഭാഗങ്ങൾ എടുക്കുകയും, സ്രോതസ്സിന്റെ പേരും URL-ഉം ചേർത്ത് ചാറ്റ് വിൻഡോയിൽ അവതരിപ്പിക്കുകയും ചെയ്യുന്നു. ഇത്തരം സന്ദർശനങ്ങൾ സൈറ്റിലേക്ക് യഥാർത്ഥ സന്ദർശകരെ എത്തിക്കാൻ സഹായിക്കും.

നിങ്ങൾ ട്രെയിനിംഗ് ബോട്ടിനെ ബ്ലോക്ക് ചെയ്താൽ, മോഡലിന് നിങ്ങളുടെ പേജുകളിൽ നിന്ന് പഠിക്കാൻ കഴിയില്ല. എന്നാൽ സൈറ്റേഷൻ ബോട്ടിനെ ബ്ലോക്ക് ചെയ്താൽ, ChatGPT-യുടെ തത്സമയ ഉത്തരങ്ങളിൽ നിന്ന് ആ പേജ് അപ്രത്യക്ഷമാകും. പല സൈറ്റുകളും “GPTBot” ബ്ലോക്ക് ചെയ്യുമ്പോൾ, അതേ പേര് സൈറ്റേഷൻ പ്രക്രിയയിൽ (citation workflow) ഉപയോഗിക്കുന്നില്ല എന്ന കാര്യം തിരിച്ചറിയാത്തതിനാലാണ് ഈ ആശയക്കുഴപ്പം ഉണ്ടാകുന്നത്.

പ്രമുഖ കമ്പനികൾ അവരുടെ ക്രോളറുകളെ എങ്ങനെ തിരിച്ചിരിക്കുന്നു

Provider Training-bot name Citation-bot names
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (both used for citations) PerplexityBot, Perplexity-User

നിങ്ങളുടെ ഉള്ളടക്കം ഭാവിയിലെ മോഡൽ പരിശീലനത്തിൽ (model training) ഉൾപ്പെടാതിരിക്കാൻ ആഗ്രഹിക്കുന്നുവെങ്കിൽ “Training-bot name” എന്നതിന് കീഴിലുള്ളവ മാത്രം നിഷേധിച്ചാൽ മതിയാകും. ChatGPT-യുടെ തത്സമയ ഉത്തരങ്ങളിൽ നിങ്ങളുടെ സൈറ്റ് വരണമെന്നുണ്ടെങ്കിൽ സൈറ്റേഷൻ ബോട്ടുകളെ അനുവദിച്ചまま (keep allowed) വെക്കണം.

robots.txt ശരിയായ രീതിയിൽ കോൺഫിഗർ ചെയ്യുക

“GPTBot”-നെ ലക്ഷ്യം വെച്ചുള്ള ഒരു സാധാരണ Disallow: / വരി ട്രെയിനിംഗ് ക്രോളറെ ബ്ലോക്ക് ചെയ്യുമെങ്കിലും സൈറ്റേഷൻ ബോട്ടുകളെ ബാധിക്കില്ല. കൃത്യതയ്ക്കായി, ഓരോ ട്രെയിനിംഗ് ബോട്ടിനെയും നിഷേധിക്കുന്നതിനൊപ്പം സൈറ്റേഷൻ ബോട്ടുകളെ അനുവദിക്കുന്ന തരത്തിലുള്ള നിയമങ്ങൾ ചേർക്കുക:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

വെറും “*” മാത്രം ബ്ലോക്ക് ചെയ്യുന്ന ഒരു ഡിഫോൾട്ട് robots.txt-നെ മാത്രം ആശ്രയിക്കരുത്. ഒരു ബ്ലാങ്കറ്റ് ബ്ലോക്ക് (blanket block) ട്രെയിനിംഗ് ബോട്ടുകളെയും സൈറ്റേഷൻ ബോട്ടുകളെയും ഒരുപോലെ പുറത്താക്കും, ഇത് AI അധിഷ്ഠിത സെർച്ച് വഴി ലഭിക്കാവുന്ന ട്രാഫിക്കിനെ ഇല്ലാതാക്കും. അതിനാൽ ഈ വ്യത്യാസം വളരെ പ്രധാനമാണ്.

Cloudflare ഉപയോക്താക്കൾ: AI Crawl Control പാനൽ ഉപയോഗിക്കുക

നിങ്ങളുടെ ഡൊമൈൻ Cloudflare-ന് പിന്നിലാണെങ്കിൽ, robots.txt ഫയലിനുള്ളിൽ ഒരു “Cloudflare management marker” കാണാൻ സാധ്യതയുണ്ട്. ഫയൽ നേരിട്ട് എഡിറ്റ് ചെയ്യുന്നത് അടുത്ത Cloudflare അപ്‌ഡേറ്റിനൊപ്പം മാറ്റങ്ങൾ ഇല്ലാതാക്കാൻ കാരണമായേക്കാം. അതിനുപകരം, Cloudflare AI Crawl Control ഇന്റർഫേസിലേക്ക് പോയി ബന്ധപ്പെട്ട ബോട്ടുകളുടെ സ്വിച്ചുകൾ ടോഗിൾ ചെയ്യുക. ഈ പാനൽ ശരിയായ നിർദ്ദേശങ്ങൾ (directives) പശ്ചാത്തലത്തിൽ എഴുതുകയും അവ സ്ഥിരമായി നിലനിർത്തുകയും ചെയ്യുന്നു.

ഈ സൂക്ഷ്മതയുടെ പ്രാധാന്യം എന്തുകൊണ്ട്?

  • ബൗദ്ധിക സ്വത്തവകാശ സംരക്ഷണം (Intellectual-property protection) – ട്രെയിനിംഗ് ബോട്ടുകളെ ബ്ലോക്ക് ചെയ്യുന്നത് നിങ്ങളുടെ എഴുത്തുകൾ സൗജന്യമായി ശേഖരിക്കപ്പെടുന്നതും ഭാവിയിലെ മോഡലുകളിൽ ഉൾപ്പെടുത്തപ്പെടുന്നതും തടയുന്നു.
  • റെഫറൽ ട്രാഫിക് (Referral traffic) – സൈറ്റേഷൻ ബോട്ടുകളെ അനുവദിക്കുന്നത് വഴി ChatGPT-യിൽ ഒരു ഭാഗം കാണുന്ന ഉപയോക്താക്കൾക്ക് നിങ്ങളുടെ സൈറ്റിലേക്ക് ക്ലിക്ക് ചെയ്ത് വരാൻ സാധിക്കും, ഇത് യഥാർത്ഥ സന്ദർശകരെ വർദ്ധിപ്പിക്കുന്നു.
  • ബ്രാൻഡ് വിസിബിലിറ്റി (Brand visibility) – AI അസിസ്റ്റന്റുകൾ പല ഉപയോക്താക്കളുടെയും പ്രധാന വിവര സ്രോതസ്സായി മാറിക്കൊണ്ടിരിക്കുന്ന സാഹചര്യത്തിൽ, AI അധിഷ്ഠിത സെർച്ചിൽ നിങ്ങളുടെ ഉള്ളടക്കം ലഭ്യമാകുന്നത് ബ്രാൻഡ് വിസിബിലിറ്റി വർദ്ധിപ്പിക്കുന്നു.

വിപരീത വാദം

സൈറ്റേഷന് വേണ്ടി പോലും അവരുടെ ടെക്സ്റ്റ് ഉപയോഗിക്കുന്നത് AI ഇക്കോസിസ്റ്റത്തിന് ഗുണകരമാണെന്നും സൈറ്റേഷൻ ബോട്ടുകളെ നിരസിക്കുന്നത് അവരുടെ വ്യാപ്തിയെ ബാധിക്കുമെന്നും ചില പ്രസാധകർ വാദിക്കുന്നു. ഇവിടെ ഒരു വിട്ടുവീഴ്ച (trade-off) ഉണ്ട്: മോഡലിന് ക്രെഡിറ്റ് നൽകാതെ തന്നെ നിങ്ങളുടെ വർക്കുകളിൽ നിന്ന് പഠിക്കാൻ അനുവദിക്കുക, അല്ലെങ്കിൽ അവരെ ഉദ്ധരിക്കാൻ (quote) അനുവദിക്കുകയും അതുവഴി ട്രാഫിക് നേടുകയും ചെയ്യുക. നിങ്ങളുടെ വാക്കുകൾ എങ്ങനെ വീണ്ടും ഉപയോഗിക്കപ്പെടുന്നു എന്നതിനെക്കുറിച്ചുള്ള ദീർഘകാല നിയന്ത്രണമാണോ അതോ പെട്ടെന്നുള്ള ക്ലിക്കുകളാണോ നിങ്ങൾക്ക് പ്രധാനം എന്നതിനെ ആശ്രയിച്ചിരിക്കും നിങ്ങളുടെ തീരുമാനം.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

ക്രോളറുകൾക്ക് പേര് നൽകുന്നതിലും അവയെ നിയന്ത്രിക്കുന്നതിലും AI കമ്പനികൾ ഇപ്പോഴും മാറ്റങ്ങൾ വരുത്തിക്കൊണ്ടിരിക്കുകയാണ്. അവരുടെ ഡെവലപ്പർ ഡോക്യുമെന്റേഷനിലെ user-agent സ്ട്രിംഗുകളിലെ (user-agent strings) മാറ്റങ്ങൾ ശ്രദ്ധിക്കുക. പുതിയൊരു സൈറ്റേഷൻ ബോട്ട് മറ്റൊരു പേരിൽ വന്നേക്കാം, അല്ലെങ്കിൽ നേരത്തെ ബ്ലോക്ക് ചെയ്ത ഒരു ട്രെയിനിംഗ് ബോട്ടിന് പുതിയ പേര് വന്നേക്കാം. ഏറ്റവും പുതിയ ക്രോളർ പട്ടികയുമായി പൊരുത്തപ്പെടാൻ നിങ്ങളുടെ robots.txt, Cloudflare സെറ്റിംഗുകൾ എന്നിവ കൃത്യസമയത്ത് പരിശോധിക്കുക.

ചുരുക്കത്തിൽ: നിങ്ങളുടെ ഉള്ളടക്കം ഭാവിയിലെ മോഡൽ പരിശീലനത്തിൽ ഉൾപ്പെടാതിരിക്കാൻ ട്രെയിനിംഗ്-ബോട്ട് (training-bot) യൂസർ ഏജന്റുകളെ മാത്രം ബ്ലോക്ക് ചെയ്യുക, എന്നാൽ ChatGPT-ക്ക് ഉപയോക്താക്കളെ നിങ്ങളുടെ സൈറ്റിലേക്ക് തിരികെ എത്തിക്കാൻ സൈറ്റേഷൻ ബോട്ടുകളെ (citation bots) പ്രവർത്തനസജ്ജമായി നിലനിർത്തുക. ആവശ്യമായപ്പോൾ Cloudflare-ന്റെ AI Crawl Control ഉപയോഗിച്ച് ശരിയായ robots.txt നിയമങ്ങൾ നടപ്പിലാക്കുന്നതിലൂടെ നിങ്ങളുടെ ബൗദ്ധിക സ്വത്തവകാശം സംരക്ഷിക്കുന്നതോടൊപ്പം AI അധിഷ്ഠിത ട്രാഫിക്കും നേടാൻ നിങ്ങൾക്ക് സാധിക്കും.