مسدود کردن GPTBot باعث حذف سایت شما از بخش پاسخ‌های ChatGPT نمی‌شود. صاحبان سایت‌هایی که قانونی در robots.txt برای جلوگیری از این ربات اضافه کرده بودند، از اینکه دیدند مقالاتشان همچنان همراه با لینک و گزیده‌ها در پاسخ‌های ChatGPT ظاهر می‌شود، متعجب شدند. مسدودسازی کار کرد – اما فقط ربات اشتباهی را متوقف کرد.

ربات‌های آموزشی در مقابل ربات‌های ارجاع

ارائه‌دهندگان هوش مصنوعی دو نوع متمایز از خزنده (crawler) را اجرا می‌کنند:

  • ربات‌های آموزشی (Training bots): صفحات در دسترس عمومی را خراشیده (scrape)، متن را جذب کرده و از آن برای تنظیم دقیق (fine-tune) مدل‌های زبانی بزرگ استفاده می‌کنند. آن‌ها هرگز لینکی به منبع باز نمی‌گردانند و هیچ ترافیکی برای سایت ایجاد نمی‌کنند.
  • ربات‌های ارجاع (Citation bots): در زمان پرس‌وجو (query time) عمل می‌کنند. وقتی کاربر سوالی می‌پرسد، ربات در وب جستجو می‌کند، یک قطعه متن مرتبط را استخراج کرده، نام و URL منبع را اضافه می‌کند و آن را در پنجره چت نمایش می‌دهد. این بازدیدها می‌توانند بازدیدکنندگان واقعی را هدایت کنند.

اگر ربات آموزشی را مسدود کنید، مدل دیگر نمی‌تواند از صفحات شما یاد بگیرد. اگر ربات ارجاع را مسدود کنید، صفحه از پاسخ‌های زنده ChatGPT حذف می‌شود. سردرگمی از اینجا ناشی می‌شود که بسیاری از سایت‌ها "GPTBot" را مسدود می‌کنند، بدون اینکه بدانند همین نام در فرآیند ارجاع (citation workflow) ظاهر نمی‌شود.

نحوه تقسیم‌بندی خزنده‌ها توسط بازیگران بزرگ

ارائه‌دهنده نام ربات آموزشی نام‌های ربات ارجاع
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (هر دو برای ارجاع استفاده می‌شوند) PerplexityBot, Perplexity-User

اگر می‌خواهید محتوای خود را از آموزش مدل‌های آینده دور نگه دارید، تنها موارد زیر در ستون "Training-bot name" نیاز به مسدودسازی دارند. ربات‌های ارجاع باید مجاز بمانند اگر می‌خواهید در پاسخ‌های بلادرنگ ChatGPT ظاهر شوید.

پیکربندی صحیح robots.txt

یک خط کلی Disallow: / که "GPTBot" را هدف قرار می‌دهد، خزنده آموزشی را مسدود می‌کند اما ربات‌های ارجاع را بدون تغییر باقی می‌گذارد. برای صراحت بیشتر، قوانینی اضافه کنید که هر ربات آموزشی را ممنوع کرده اما ربات‌های ارجاع را مجاز می‌دارد:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

به یک robots.txt پیش‌فرض که فقط "*" را مسدود می‌کند تکیه نکنید. این تمایز اهمیت دارد زیرا یک مسدودسازی کلی، هم ربات‌های آموزشی و هم ربات‌های ارجاع را بیرون نگه می‌دارد و ترافیکی را که جستجوی مبتنی بر هوش مصنوعی می‌تواند فراهم کند، قطع می‌کند.

کاربران Cloudflare: از پنل AI Crawl Control استفاده کنید

اگر دامنه شما پشت Cloudflare قرار دارد، ممکن است یک "Cloudflare management marker" را در فایل robots.txt ببینید. ویرایش دستی فایل می‌تواند باعث شود تغییرات در به‌روزرسانی بعدی Cloudflare بازنویسی شوند. در عوض، به رابط کاربری AI Crawl Control در Cloudflare بروید و سوئیچ‌های مربوط به ربات‌های مرتبط را تنظیم کنید. این پنل دستورالعمل‌های صحیح را در پس‌زمینه می‌نویسد و آن‌ها را پایدار نگه می‌دارد.

چرا این جزئیات اهمیت دارند

  • حفاظت از مالکیت معنوی – مسدود کردن ربات‌های آموزشی از برداشت رایگان نوشته‌های شما و ادغام آن‌ها در مدل‌های آینده جلوگیری می‌کند.
  • ترافیک ارجاعی (Referral traffic) – اجازه دادن به ربات‌های ارجاع به این معنی است که کاربرانی که یک قطعه متن را در ChatGPT می‌بینند، می‌توانند با کلیک بر روی آن به سایت شما هدایت شوند و بازدیدهای واقعی ایجاد کنند.
  • دیده شدن برند – حضور در جستجوهای تقویت‌شده با هوش مصنوعی باعث می‌شود محتوای شما قابل کشف باقی بماند، چرا که دستیاران هوش مصنوعی در حال تبدیل شدن به منبع اصلی اطلاعات برای بسیاری از کاربران هستند.

استدلال مخالف

برخی ناشران استدلال می‌کنند که هرگونه استفاده از متن آن‌ها، حتی برای ارجاع، به اکوسیستم گسترده‌تر هوش مصنوعی کمک می‌کند و رد کردن ربات‌های ارجاع می‌تواند به میزان دسترسی آن‌ها آسیب برساند. معامله مشخص است: یا اجازه می‌دهید مدل بدون ذکر منبع از کار شما یاد بگیرد، یا اجازه می‌دهید از شما نقل‌قول کند و ترافیک ایجاد کند. انتخاب به این بستگی دارد که شما کلیک‌های فوری را در مقابل کنترل طولانی‌مدت بر نحوه استفاده مجدد از کلماتتان، چقدر ارزشمند می‌دانید.

آنچه باید در آینده زیر نظر داشته باشید

شرکت‌های هوش مصنوعی همچنان در حال تغییر نام و مسیردهی خزنده‌های خود هستند. تغییرات در رشته‌های user-agent در مستندات توسعه‌دهندگان آن‌ها را زیر نظر داشته باشید. یک ربات ارجاع جدید ممکن است با نامی متفاوت ظاهر شود و یک ربات آموزشی که قبلاً مسدود شده بود، ممکن است تغییر نام دهد. به‌طور منظم robots.txt و تنظیمات Cloudflare خود را بازبینی کنید تا با آخرین فهرست خزنده‌ها همسو بمانید.

نکته کلیدی: تنها user-agentهای ربات‌های آموزشی را مسدود کنید تا محتوای شما از آموزش مدل‌های آینده خارج بماند، اما ربات‌های ارجاع را فعال بگذارید تا ChatGPT همچنان بتواند کاربران را به سمت شما هدایت کند. قوانین صحیح robots.txt، که در صورت نیاز از طریق AI Crawl Control در Cloudflare اعمال می‌شوند، به شما اجازه می‌دهند از مالکیت معنوی خود محافظت کنید و در عین حال از ترافیک ناشی از هوش مصنوعی بهره‌مند شوید.