مسدود کردن GPTBot باعث حذف سایت شما از بخش پاسخهای ChatGPT نمیشود. صاحبان سایتهایی که قانونی در robots.txt برای جلوگیری از این ربات اضافه کرده بودند، از اینکه دیدند مقالاتشان همچنان همراه با لینک و گزیدهها در پاسخهای ChatGPT ظاهر میشود، متعجب شدند. مسدودسازی کار کرد – اما فقط ربات اشتباهی را متوقف کرد.
رباتهای آموزشی در مقابل رباتهای ارجاع
ارائهدهندگان هوش مصنوعی دو نوع متمایز از خزنده (crawler) را اجرا میکنند:
- رباتهای آموزشی (Training bots): صفحات در دسترس عمومی را خراشیده (scrape)، متن را جذب کرده و از آن برای تنظیم دقیق (fine-tune) مدلهای زبانی بزرگ استفاده میکنند. آنها هرگز لینکی به منبع باز نمیگردانند و هیچ ترافیکی برای سایت ایجاد نمیکنند.
- رباتهای ارجاع (Citation bots): در زمان پرسوجو (query time) عمل میکنند. وقتی کاربر سوالی میپرسد، ربات در وب جستجو میکند، یک قطعه متن مرتبط را استخراج کرده، نام و URL منبع را اضافه میکند و آن را در پنجره چت نمایش میدهد. این بازدیدها میتوانند بازدیدکنندگان واقعی را هدایت کنند.
اگر ربات آموزشی را مسدود کنید، مدل دیگر نمیتواند از صفحات شما یاد بگیرد. اگر ربات ارجاع را مسدود کنید، صفحه از پاسخهای زنده ChatGPT حذف میشود. سردرگمی از اینجا ناشی میشود که بسیاری از سایتها "GPTBot" را مسدود میکنند، بدون اینکه بدانند همین نام در فرآیند ارجاع (citation workflow) ظاهر نمیشود.
نحوه تقسیمبندی خزندهها توسط بازیگران بزرگ
| ارائهدهنده | نام ربات آموزشی | نامهای ربات ارجاع |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (هر دو برای ارجاع استفاده میشوند) | PerplexityBot, Perplexity-User |
اگر میخواهید محتوای خود را از آموزش مدلهای آینده دور نگه دارید، تنها موارد زیر در ستون "Training-bot name" نیاز به مسدودسازی دارند. رباتهای ارجاع باید مجاز بمانند اگر میخواهید در پاسخهای بلادرنگ ChatGPT ظاهر شوید.
پیکربندی صحیح robots.txt
یک خط کلی Disallow: / که "GPTBot" را هدف قرار میدهد، خزنده آموزشی را مسدود میکند اما رباتهای ارجاع را بدون تغییر باقی میگذارد. برای صراحت بیشتر، قوانینی اضافه کنید که هر ربات آموزشی را ممنوع کرده اما رباتهای ارجاع را مجاز میدارد:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
به یک robots.txt پیشفرض که فقط "*" را مسدود میکند تکیه نکنید. این تمایز اهمیت دارد زیرا یک مسدودسازی کلی، هم رباتهای آموزشی و هم رباتهای ارجاع را بیرون نگه میدارد و ترافیکی را که جستجوی مبتنی بر هوش مصنوعی میتواند فراهم کند، قطع میکند.
کاربران Cloudflare: از پنل AI Crawl Control استفاده کنید
اگر دامنه شما پشت Cloudflare قرار دارد، ممکن است یک "Cloudflare management marker" را در فایل robots.txt ببینید. ویرایش دستی فایل میتواند باعث شود تغییرات در بهروزرسانی بعدی Cloudflare بازنویسی شوند. در عوض، به رابط کاربری AI Crawl Control در Cloudflare بروید و سوئیچهای مربوط به رباتهای مرتبط را تنظیم کنید. این پنل دستورالعملهای صحیح را در پسزمینه مینویسد و آنها را پایدار نگه میدارد.
چرا این جزئیات اهمیت دارند
- حفاظت از مالکیت معنوی – مسدود کردن رباتهای آموزشی از برداشت رایگان نوشتههای شما و ادغام آنها در مدلهای آینده جلوگیری میکند.
- ترافیک ارجاعی (Referral traffic) – اجازه دادن به رباتهای ارجاع به این معنی است که کاربرانی که یک قطعه متن را در ChatGPT میبینند، میتوانند با کلیک بر روی آن به سایت شما هدایت شوند و بازدیدهای واقعی ایجاد کنند.
- دیده شدن برند – حضور در جستجوهای تقویتشده با هوش مصنوعی باعث میشود محتوای شما قابل کشف باقی بماند، چرا که دستیاران هوش مصنوعی در حال تبدیل شدن به منبع اصلی اطلاعات برای بسیاری از کاربران هستند.
استدلال مخالف
برخی ناشران استدلال میکنند که هرگونه استفاده از متن آنها، حتی برای ارجاع، به اکوسیستم گستردهتر هوش مصنوعی کمک میکند و رد کردن رباتهای ارجاع میتواند به میزان دسترسی آنها آسیب برساند. معامله مشخص است: یا اجازه میدهید مدل بدون ذکر منبع از کار شما یاد بگیرد، یا اجازه میدهید از شما نقلقول کند و ترافیک ایجاد کند. انتخاب به این بستگی دارد که شما کلیکهای فوری را در مقابل کنترل طولانیمدت بر نحوه استفاده مجدد از کلماتتان، چقدر ارزشمند میدانید.
آنچه باید در آینده زیر نظر داشته باشید
شرکتهای هوش مصنوعی همچنان در حال تغییر نام و مسیردهی خزندههای خود هستند. تغییرات در رشتههای user-agent در مستندات توسعهدهندگان آنها را زیر نظر داشته باشید. یک ربات ارجاع جدید ممکن است با نامی متفاوت ظاهر شود و یک ربات آموزشی که قبلاً مسدود شده بود، ممکن است تغییر نام دهد. بهطور منظم robots.txt و تنظیمات Cloudflare خود را بازبینی کنید تا با آخرین فهرست خزندهها همسو بمانید.
نکته کلیدی: تنها user-agentهای رباتهای آموزشی را مسدود کنید تا محتوای شما از آموزش مدلهای آینده خارج بماند، اما رباتهای ارجاع را فعال بگذارید تا ChatGPT همچنان بتواند کاربران را به سمت شما هدایت کند. قوانین صحیح robots.txt، که در صورت نیاز از طریق AI Crawl Control در Cloudflare اعمال میشوند، به شما اجازه میدهند از مالکیت معنوی خود محافظت کنید و در عین حال از ترافیک ناشی از هوش مصنوعی بهرهمند شوید.
