GPTBot ব্লক করা মানেই আপনার সাইটকে ChatGPT-এর উত্তর প্যানেল থেকে মুছে ফেলা নয়। যেসব সাইট মালিকরা বটটির বিরুদ্ধে একটি robots.txt নিয়ম যোগ করেছিলেন, তারা অবাক হয়ে দেখলেন যে ব্যবহারকারীরা ChatGPT-তে কোনো বিষয়ে প্রশ্ন করলে তাদের নিবন্ধগুলো এখনও লিঙ্ক এবং স্নিপেটসহ দেখাচ্ছে। ব্লকটি কাজ করেছে – এটি কেবল ভুল ক্রলারটিকে থামিয়ে দিয়েছে।
ট্রেনিং বট বনাম সাইটেশন বট
AI প্রদানকারীরা দুই ধরনের ভিন্ন ক্রলার পরিচালনা করে:
- ট্রেনিং বট (Training bots) জনসমক্ষে উপলব্ধ পেজগুলো স্ক্র্যাপ করে, টেক্সট গ্রহণ করে এবং লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে ফাইন-টিউন করতে ব্যবহার করে। তারা কখনোই উৎসের কোনো লিঙ্ক প্রদান করে না এবং সাইটের জন্য কোনো ট্রাফিক তৈরি করে না।
- সাইটেশন বট (Citation bots) কুয়েরি করার সময় কাজ করে। যখন কোনো ব্যবহারকারী প্রশ্ন করেন, বটটি ওয়েব অনুসন্ধান করে, একটি প্রাসঙ্গিক স্নিপেট সংগ্রহ করে, উৎসের নাম এবং URL যোগ করে এবং চ্যাট উইন্ডোতে তা উপস্থাপন করে। এই হিটগুলো প্রকৃত ভিজিটর নিয়ে আসতে পারে।
আপনি যদি ট্রেনিং বট ব্লক করেন, তবে মডেলটি আর আপনার পেজ থেকে শিখতে পারবে না। আপনি যদি সাইটেশন বট ব্লক করেন, তবে পেজটি ChatGPT-এর লাইভ উত্তর থেকে অদৃশ্য হয়ে যাবে। বিভ্রান্তিটি তৈরি হয় কারণ অনেক সাইট "GPTBot" ব্লক করে ফেলে, কিন্তু তারা বুঝতে পারে না যে সাইটেশন ওয়ার্কফ্লোতে একই নামটি ব্যবহৃত হয় না।
বড় কোম্পানিগুলো কীভাবে তাদের ক্রলারগুলোকে ভাগ করে
| প্রোভাইডার | ট্রেনিং-বট নাম | সাইটেশন-বট নাম |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (উভয়ই সাইটেশনের জন্য ব্যবহৃত হয়) | PerplexityBot, Perplexity-User |
আপনি যদি আপনার কন্টেন্টকে ভবিষ্যৎ মডেল ট্রেনিং থেকে দূরে রাখতে চান, তবে শুধুমাত্র “Training-bot name”-এর অধীনে থাকা এন্ট্রিগুলো ব্লক করার প্রয়োজন। আপনি যদি ChatGPT-এর রিয়েল-টাইম উত্তরে উপস্থিত থাকতে চান, তবে সাইটেশন বটগুলোকে অনুমতি দেওয়া উচিত।
সঠিকভাবে robots.txt কনফিগার করা
“GPTBot”-কে লক্ষ্য করে একটি সাধারণ Disallow: / লাইন ট্রেনিং ক্রলারকে ব্লক করে কিন্তু সাইটেশন বটগুলোকে অক্ষত রাখে। সুনির্দিষ্টভাবে করার জন্য, এমন নিয়ম যোগ করুন যা প্রতিটি ট্রেনিং বটকে বাধা দেয় কিন্তু সাইটেশন বটগুলোকে অনুমতি দেয়:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
শুধুমাত্র সাধারণ "*" ব্লক করে এমন ডিফল্ট robots.txt-এর ওপর নির্ভর করবেন না। এই পার্থক্যটি গুরুত্বপূর্ণ কারণ একটি ঢালাও ব্লক করলে ট্রেনিং এবং সাইটেশন উভয় বটকেই বাইরে রাখা হবে, যা AI-চালিত সার্চ থেকে আসা ট্রাফিককে বন্ধ করে দেবে।
Cloudflare ব্যবহারকারী: AI Crawl Control প্যানেল ব্যবহার করুন
আপনার ডোমেইন যদি Cloudflare-এর পেছনে থাকে, তবে আপনি robots.txt ফাইলের ভেতরে একটি “Cloudflare management marker” দেখতে পারেন। ফাইলটি ম্যানুয়ালি এডিট করলে পরবর্তী Cloudflare আপডেটে পরিবর্তনগুলো মুছে যেতে পারে। পরিবর্তে, Cloudflare AI Crawl Control ইন্টারফেসে যান এবং প্রাসঙ্গিক বটগুলোর জন্য সুইচগুলো টগল করুন। এই প্যানেলটি পর্দার আড়ালে সঠিক নির্দেশাবলী লিখে রাখে এবং সেগুলোকে স্থায়ী করে।
কেন এই সূক্ষ্ম পার্থক্যটি গুরুত্বপূর্ণ
- Intellectual-property protection (বুদ্ধিবৃত্তিক সম্পদ সুরক্ষা) – ট্রেনিং বট ব্লক করলে আপনার লেখা বিনামূল্যে সংগ্রহ করা এবং ভবিষ্যৎ মডেলে অন্তর্ভুক্ত করা রোধ করা যায়।
- Referral traffic (রেফারেল ট্রাফিক) – সাইটেশন বটকে অনুমতি দেওয়ার অর্থ হলো ChatGPT-তে স্নিপেট দেখা ব্যবহারকারীরা আপনার সাইটে ক্লিক করতে পারবেন, যা প্রকৃত ভিজিটর তৈরি করবে।
- Brand visibility (ব্র্যান্ড ভিজিবিলিটি) – AI অ্যাসিস্ট্যান্টগুলো অনেক ব্যবহারকারীর জন্য প্রাথমিক তথ্য উৎস হয়ে উঠায়, AI-বর্ধিত সার্চে উপস্থিতি আপনার কন্টেন্টকে খুঁজে পেতে সাহায্য করে।
পাল্টা যুক্তি
কিছু প্রকাশক যুক্তি দেন যে তাদের টেক্সটের যেকোনো ব্যবহার, এমনকি সাইটেশনের জন্যও হলেও, তা বৃহত্তর AI ইকোসিস্টেমে অবদান রাখে এবং সাইটেশন বট প্রত্যাখ্যান করা তাদের রিচ বা প্রচার কমিয়ে দিতে পারে। এখানে একটি স্পষ্ট বিনিময় (trade-off) রয়েছে: হয় আপনি ক্রেডিট ছাড়াই মডেলটিকে আপনার কাজ থেকে শিখতে দেবেন, অথবা আপনি তাকে আপনার উদ্ধৃতি দিতে দেবেন এবং এর মাধ্যমে ট্রাফিক পাবেন। পছন্দটি নির্ভর করে আপনি তাৎক্ষণিক ক্লিক নাকি আপনার শব্দ কীভাবে পুনরায় ব্যবহার করা হবে তার ওপর দীর্ঘমেয়াদী নিয়ন্ত্রণের মধ্যে কোনটিকে বেশি গুরুত্ব দেন তার ওপর।
পরবর্তীতে কী খেয়াল রাখবেন
AI কোম্পানিগুলো তাদের ক্রলারগুলোর নাম এবং রাউটিং পদ্ধতি নিয়ে এখনও কাজ করছে। তাদের ডেভেলপার ডকুমেন্টেশনে user-agent স্ট্রিংগুলোর আপডেটের দিকে নজর রাখুন। একটি নতুন সাইটেশন বট ভিন্ন নামে আসতে পারে, এবং আগে ব্লক করা কোনো ট্রেনিং বট নতুন নামে আসতে পারে। ক্রলারের তালিকার সাথে তাল মিলিয়ে চলতে নিয়মিত আপনার robots.txt এবং Cloudflare সেটিংস অডিট করুন।
সারকথা: আপনার কন্টেন্টকে ভবিষ্যৎ মডেল ট্রেনিং থেকে দূরে রাখতে শুধুমাত্র ট্রেনিং-বট user agent-গুলো ব্লক করুন, তবে সাইটেশন বটগুলোকে চালু রাখুন যাতে ChatGPT ব্যবহারকারীদের আপনার কাছে ফিরিয়ে নিয়ে যেতে পারে। সঠিক robots.txt নিয়মগুলো, প্রয়োজনে Cloudflare-এর AI Crawl Control-এর মাধ্যমে প্রয়োগ করলে, আপনি আপনার IP রক্ষা করার পাশাপাশি AI-চালিত ট্রাফিকও সংগ্রহ করতে পারবেন।
