حظر GPTBot لا يمحو موقعك من نافذة إجابات ChatGPT. فقد فوجئ أصحاب المواقع الذين أضافوا قاعدة في ملف robots.txt ضد هذا البوت برؤية مقالاتهم لا تزال تظهر مع روابط ومقتطفات عندما يسأل المستخدمون ChatGPT عن الموضوع. لقد نجح الحظر – لكنه أوقف الزاحف الخطأ فقط.
بوتات التدريب مقابل بوتات الاستشهاد
تشغل شركات الذكاء الاصطناعي نوعين متميزين من الزواحف (crawlers):
- بوتات التدريب (Training bots) تقوم بكشط الصفحات المتاحة علنًا، وتستوعب النصوص، وتستخدمها لضبط نماذج اللغات الكبيرة. وهي لا تعيد أبدًا رابطًا للمصدر، ولا تولد أي حركة مرور للموقع.
- بوتات الاستشهاد (Citation bots) تعمل وقت الاستعلام. عندما يطرح المستخدم سؤالاً، يبحث البوت في الويب، ويجلب مقتطفاً ذا صلة، ويضيف اسم المصدر ورابطه (URL)، ويعرضه في نافذة الدردشة. هذه الزيارات يمكن أن تجذب زواراً حقيقيين.
إذا قمت بحظر بوت التدريب، فلن يتمكن النموذج من التعلم من صفحاتك بعد الآن. أما إذا حظرت بوت الاستشهاد، فستختفي الصفحة من إجابات ChatGPT المباشرة. ينشأ الارتباك لأن العديد من المواقع تحظر "GPTBot" دون إدراك أن الاسم نفسه لا يظهر في سير عمل الاستشهاد.
كيف يقسم اللاعبون الكبار زواحفهم
| المزود | اسم بوت التدريب | أسماء بوتات الاستشهاد |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (كلاهما للاستشهاد) | PerplexityBot, Perplexity-User |
تحتاج فقط إلى منع المدخلات الموجودة تحت "اسم بوت التدريب" إذا كنت ترغب في إبقاء محتواك بعيداً عن تدريب النماذج المستقبلية. يجب السماح ببوتات الاستشهاد إذا كنت ترغب في الظهور في إجابات ChatGPT في الوقت الفعلي.
تهيئة robots.txt بالطريقة الصحيحة
إن سطر Disallow: / العام الذي يستهدف "GPTBot" يحظر زاحف التدريب ولكنه يترك بوتات الاستشهاد دون مساس. لتكون صريحاً، أضف قواعد تمنع كل بوت تدريب مع السماح ببوتات الاستشهاد:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
لا تعتمد على ملف robots.txt افتراضي يحظر فقط الرمز العام "*". التمييز مهم لأن الحظر الشامل سيمنع كلاً من بوتات التدريب والاستشهاد، مما يقطع حركة المرور التي يمكن أن يوفرها البحث المدعوم بالذكاء الاصطناعي.
لمستخدمي Cloudflare: استخدم لوحة تحكم AI Crawl Control
إذا كان نطاقك (domain) خلف Cloudflare، فقد ترى "علامة إدارة Cloudflare" داخل ملف robots.txt. قد يؤدي تعديل الملف يدوياً إلى الكتابة فوق التغييرات في التحديث التالي لـ Cloudflare. بدلاً من ذلك، انتقل إلى واجهة Cloudflare AI Crawl Control وقم بتبديل المفاتيح للبوتات ذات الصلة. تقوم اللوحة بكتابة التوجيهات الصحيحة في الخلفية وتحافظ على استمراريتها.
لماذا يهم هذا التفصيل الدقيق
- حماية الملكية الفكرية – منع بوتات التدريب يحمي نصوصك من أن تُجمع مجاناً وتُدمج في النماذج المستقبلية.
- حركة المرور المحالة (Referral traffic) – السماح ببوتات الاستشهاد يعني أن المستخدمين الذين يرون مقتطفاً في ChatGPT يمكنهم النقر للانتقال إلى موقعك، مما يولد زيارات حقيقية.
- ظهور العلامة التجارية – التواجد في البحث المعزز بالذكاء الاصطناعي يبقي محتواك قابلاً للاكتشاف مع تحول المساعدين الذكيين إلى مصدر أساسي للمعلومات للعديد من المستخدمين.
الحجة المضادة
يجادل بعض الناشرين بأن أي استخدام لنصوصهم، حتى لو كان للاستشهاد، يساهم في منظومة الذكاء الاصطناعي الأوسع، وأن رفض بوتات الاستشهاد قد يضر بانتشارهم. المقايضة واضحة: إما أن تترك النموذج يتعلم من عملك دون ذكر المصدر، أو تتركه يقتبس منك ويوجه حركة المرور إليك. يعتمد الخيار على كيفية تقييمك للنقرات الفورية مقابل التحكم طويل الأمد في كيفية إعادة استخدام كلماتك.
ما الذي يجب مراقبته لاحقاً
لا تزال شركات الذكاء الاصطناعي تعمل على تطوير كيفية تسمية وتوجيه زواحفها. راقب التحديثات في سلاسل user-agent في وثائق المطورين الخاصة بها. قد يظهر بوت استشهاد جديد تحت اسم مختلف، وقد يتم تغيير اسم بوت تدريب تم حظره سابقاً. قم بمراجعة ملف robots.txt وإعدادات Cloudflare بانتظام لتبقى متوافقاً مع أحدث قائمة للزواحف.
الخلاصة: احظر فقط وكلاء المستخدم (user agents) الخاصين ببوتات التدريب لإبقاء محتواك بعيداً عن تدريب النماذج المستقبلية، ولكن اترك بوتات الاستشهاد مفعلة حتى يتمكن ChatGPT من توجيه المستخدمين إليك. قواعد robots.txt الصحيحة، المطبقة من خلال Cloudflare AI Crawl Control عند الحاجة، تتيح لك حماية ملكيتك الفكرية مع الاستفادة من حركة المرور المدفوعة بالذكاء الاصطناعي.
