GPTBot ને બ્લોક કરવાથી તમારી સાઇટ ChatGPT ના જવાબના પેનલમાંથી ભૂંસાઈ જતી નથી. જે સાઇટ માલિકોએ બોટ સામે robots.txt નિયમ ઉમેર્યો હતો તેઓ તેમના લેખો હજુ પણ લિંક્સ અને અંશ (excerpts) સાથે દેખાય છે તે જોઈને આશ્ચર્યચકિત થયા હતા જ્યારે વપરાશકર્તાઓ ChatGPT ને તે વિષય વિશે પૂછે છે. બ્લોક કામ કરી રહ્યો હતો – તે ફક્ત ખોટા ક્રોલરને રોકી રહ્યો હતો.

ટ્રેનિંગ બોટ્સ વિરુદ્ધ સાઇટેશન બોટ્સ (Training bots vs. citation bots)

AI પ્રદાતાઓ બે અલગ પ્રકારના ક્રોલર ચલાવે છે:

  • Training bots સાર્વજનિક રીતે ઉપલબ્ધ પેજ સ્કેપ કરે છે, ટેક્સ્ટ મેળવે છે અને તેનો ઉપયોગ લાર્જ લેંગ્વેજ મોડલ્સને ફાઇન-ટ્યુન કરવા માટે કરે છે. તેઓ ક્યારેય સ્ત્રોતની લિંક પરત કરતા નથી, અને તેઓ સાઇટ માટે કોઈ ટ્રાફિક જનરેટ કરતા નથી.
  • Citation bots ક્વેરી સમયે કાર્ય કરે છે. જ્યારે વપરાશકર્તા પ્રશ્ન પૂછે છે, ત્યારે બોટ વેબ પર શોધ કરે છે, સંબંધિત સ્નિપેટ (snippet) ખેંચે છે, સ્ત્રોતનું નામ અને URL ઉમેરે છે, અને તેને ચેટ વિન્ડોમાં રજૂ કરે છે. આ હિટ્સ વાસ્તવિક મુલાકાતીઓને લાવી શકે છે.

જો તમે ટ્રેનિંગ બોટને બ્લોક કરો છો, તો મોડલ હવે તમારા પેજમાંથી શીખી શકશે નહીં. જો તમે સાઇટેશન બોટને બ્લોક કરો છો, તો પેજ ChatGPT ના લાઈવ જવાબોમાંથી અદૃશ્ય થઈ જશે. મૂંઝવણ એટલા માટે ઊભી થાય છે કારણ કે ઘણી સાઇટ્સ "GPTBot" ને બ્લોક કરે છે, પરંતુ એ વાતનું ધ્યાન નથી રાખતી કે સાઇટેશન વર્કફ્લોમાં તે જ નામ દેખાતું નથી.

મોટા પ્લેયર્સ તેમના ક્રોલર્સને કેવી રીતે વિભાજિત કરે છે

Provider Training-bot name Citation-bot names
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (both used for citations) PerplexityBot, Perplexity-User

જો તમે તમારા કન્ટેન્ટને ભવિષ્યના મોડલ ટ્રેનિંગમાંથી દૂર રાખવા માંગતા હોવ, તો ફક્ત “Training-bot name” હેઠળની એન્ટ્રીઓને જ નકારવાની (deny) જરૂર છે. જો તમે ChatGPT ના રિયલ-ટાઇમ જવાબોમાં દેખાવા માંગતા હોવ, તો સાઇટેશન બોટ્સને મંજૂરી આપવી જોઈએ.

robots.txt ને યોગ્ય રીતે કોન્ફિગર કરવું

"GPTBot" ને લક્ષ્ય બનાવતી સામાન્ય Disallow: / લાઇન ટ્રેનિંગ ક્રોલરને બ્લોક કરે છે પરંતુ સાઇટેશન બોટ્સને અસ્પૃશ્ય રાખે છે. સ્પષ્ટ હોવા માટે, એવા નિયમો ઉમેરો જે દરેક ટ્રેનિંગ બોટને નકારે છે જ્યારે સાઇટેશન બોટ્સને મંજૂરી આપે છે:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

માત્ર સામાન્ય "*" ને બ્લોક કરતા ડિફોલ્ટ robots.txt પર આધાર રાખશો નહીં. તફાવત મહત્વનો છે કારણ કે બ્લેન્કેટ બ્લોક (blanket block) ટ્રેનિંગ અને સાઇટેશન બંને બોટ્સને બહાર રાખશે, જેનાથી AI-સંચાલિત સર્ચ દ્વારા મળી શકતા ટ્રાફિકમાં ઘટાડો થશે.

Cloudflare વપરાશકર્તાઓ: AI Crawl Control પેનલનો ઉપયોગ કરો

જો તમારું ડોમેન Cloudflare ની પાછળ હોય, તો તમે robots.txt ફાઇલમાં "Cloudflare management marker" જોઈ શકો છો. ફાઇલને મેન્યુઅલી એડિટ કરવાથી આગામી Cloudflare અપડેટ વખતે ફેરફારો ઓવરરાઈટ થઈ શકે છે. તેના બદલે, Cloudflare AI Crawl Control ઇન્ટરફેસ પર જાઓ અને સંબંધિત બોટ્સ માટે સ્વિચ ચાલુ/બંધ કરો. પેનલ પડદા પાછળ સાચી સૂચનાઓ (directives) લખે છે અને તેને કાયમી રાખે છે.

આ સૂક્ષ્મ તફાવત શા માટે મહત્વનો છે

  • Intellectual-property protection – ટ્રેનિંગ બોટ્સને બ્લોક કરવાથી તમારા લખાણને મફતમાં હાર્વેસ્ટ થતું અને ભવિષ્યના મોડલ્સમાં સમાવિષ્ટ થતું અટકાવે છે.
  • Referral traffic – સાઇટેશન બોટ્સને મંજૂરી આપવાનો અર્થ એ છે કે ChatGPT માં સ્નિપેટ જોતા વપરાશકર્તાઓ તમારી સાઇટ પર ક્લિક કરી શકે છે, જેનાથી વાસ્તવિક મુલાકાતો જનરેટ થાય છે.
  • Brand visibility – AI-વધારેલા સર્ચમાં હાજરી રાખવાથી તમારું કન્ટેન્ટ શોધવા યોગ્ય રહે છે, કારણ કે AI આસિસ્ટન્ટ્સ ઘણા વપરાશકર્તાઓ માટે માહિતીનો પ્રાથમિક સ્ત્રોત બની રહ્યા છે.

વિરોધી દલીલ

કેટલાક પ્રકાશકો દલીલ કરે છે કે તેમના ટેક્સ્ટનો કોઈપણ ઉપયોગ, સાઇટેશન માટે પણ હોય, તે વ્યાપક AI ઇકોસિસ્ટમમાં યોગદાન આપે છે અને સાઇટેશન બોટ્સનો ઇનકાર કરવાથી તેમની પહોંચને નુકસાન થઈ શકે છે. વળતર (trade-off) સ્પષ્ટ છે: કાં તો તમે મોડલને તમારા કામમાંથી ક્રેડિટ વગર શીખવા દો છો, અથવા તમે તેને તમને અવતરણ (quote) આપવા અને ટ્રાફિક લાવવા દો છો. પસંદગી એ વાત પર નિર્ભર છે કે તમે તમારા શબ્દોનો ફરીથી ઉપયોગ કેવી રીતે કરવામાં આવે તેના પર લાંબા ગાળાના નિયંત્રણ વિરુદ્ધ તાત્કાલિક ક્લિક્સને કેટલી કિંમત આપો છો.

આગળ શું જોવું

AI કંપનીઓ હજુ પણ તેમના ક્રોલર્સને કેવી રીતે નામ આપવું અને રૂટ કરવા તે બાબતે સતત સુધારા કરી રહી છે. તેમના ડેવલપર ડોક્યુમેન્ટેશનમાં user-agent સ્ટ્રિંગ્સના અપડેટ્સ પર નજર રાખો. એક નવો સાઇટેશન બોટ અલગ નામ હેઠળ દેખાઈ શકે છે, અને અગાઉ બ્લોક કરેલ ટ્રેનિંગ બોટનું નામ બદલાઈ શકે છે. લેટેસ્ટ ક્રોલર રોસ્ટર સાથે સુસંગત રહેવા માટે નિયમિતપણે તમારા robots.txt અને Cloudflare સેટિંગ્સનું ઓડિટ કરો.

Takeaway: તમારા કન્ટેન્ટને ભવિષ્યના મોડલ ટ્રેનિંગમાંથી દૂર રાખવા માટે ફક્ત ટ્રેનિંગ-બોટ user agents ને બ્લોક કરો, પરંતુ સાઇટેશન બોટ્સને સક્ષમ રાખો જેથી ChatGPT હજુ પણ વપરાશકર્તાઓને તમારી પાસે પાછા મોકલી શકે. યોગ્ય robots.txt નિયમો, જ્યારે જરૂર હોય ત્યારે Cloudflare ના AI Crawl Control દ્વારા લાગુ કરવામાં આવે, તો તે તમને તમારા IP ને સુરક્ષિત રાખવાની સાથે AI-સંચાલિત ટ્રાફિક મેળવવાની પણ તક આપે છે.