การบล็อก GPTBot ไม่ได้ทำให้เว็บไซต์ของคุณหายไปจากช่องคำตอบของ ChatGPT เจ้าของเว็บไซต์ที่เพิ่มกฎใน robots.txt เพื่อบล็อกบอทต่างก็ประหลาดใจที่เห็นบทความของตนยังคงปรากฏขึ้นพร้อมลิงก์และข้อความสรุปเมื่อผู้ใช้ถาม ChatGPT เกี่ยวกับหัวข้อนั้นๆ การบล็อกนั้นได้ผล—แต่มันไปหยุดตัวรวบรวมข้อมูล (crawler) ผิดตัว
บอทสำหรับฝึกฝน (Training bots) เทียบกับ บอทสำหรับอ้างอิง (Citation bots)
ผู้ให้บริการ AI รัน crawler สองประเภทที่แตกต่างกัน:
- Training bots จะดึงข้อมูลจากหน้าเว็บที่เปิดเป็นสาธารณะ นำข้อความไปประมวลผล และใช้เพื่อปรับจูนโมเดลภาษาขนาดใหญ่ (large language models) บอทเหล่านี้จะไม่ส่งลิงก์กลับไปยังแหล่งที่มา และไม่สร้างทราฟฟิกให้กับเว็บไซต์เลย
- Citation bots จะทำงานเมื่อมีการสอบถาม (query time) เมื่อผู้ใช้ถามคำถาม บอทจะค้นหาเว็บ ดึงข้อความส่วนที่เกี่ยวข้องมา พร้อมระบุชื่อแหล่งที่มาและ URL แล้วแสดงผลในหน้าต่างแชท การเข้าชมจากบอทเหล่านี้สามารถดึงผู้เข้าชมเว็บไซต์จริงๆ เข้ามาได้
หากคุณบล็อก training bot โมเดลจะไม่สามารถเรียนรู้จากหน้าเว็บของคุณได้อีกต่อไป แต่หากคุณบล็อก citation bot หน้าเว็บของคุณก็จะหายไปจากคำตอบแบบเรียลไทม์ของ ChatGPT ความสับสนเกิดขึ้นเพราะหลายเว็บไซต์บล็อก “GPTBot” โดยไม่รู้ว่าชื่อเดียวกันนี้ไม่ได้ถูกใช้ในขั้นตอนการอ้างอิง (citation workflow)
วิธีที่ผู้เล่นรายใหญ่แบ่งประเภท crawler ของพวกเขา
| ผู้ให้บริการ | ชื่อ Training-bot | ชื่อ Citation-bot |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (ทั้งคู่ใช้สำหรับการอ้างอิง) | PerplexityBot, Perplexity-User |
หากคุณต้องการไม่ให้เนื้อหาของคุณถูกนำไปใช้ในการฝึกฝนโมเดลในอนาคต คุณจำเป็นต้องปฏิเสธ (deny) เฉพาะรายการภายใต้ “Training-bot name” เท่านั้น ส่วน citation bots ควรอนุญาตไว้หากคุณต้องการให้เนื้อหาปรากฏในคำตอบแบบเรียลไทม์ของ ChatGPT
การตั้งค่า robots.txt อย่างถูกวิธี
การใช้บรรทัด Disallow: / แบบทั่วไปที่มุ่งเป้าไปที่ “GPTBot” จะบล็อก training crawler แต่จะไม่ส่งผลต่อ citation bots เพื่อความชัดเจน ให้เพิ่มกฎที่ปฏิเสธ training bot แต่ละตัวในขณะที่อนุญาต citation bots:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
อย่าพึ่งพา robots.txt แบบเริ่มต้นที่บล็อกเพียงแค่เครื่องหมาย “*” เท่านั้น ความแตกต่างนี้มีความสำคัญ เพราะการบล็อกแบบเหมาเข่งจะทำให้ทั้ง training bot และ citation bot เข้าไม่ได้ ซึ่งจะตัดทราฟฟิกที่การค้นหาด้วย AI สามารถมอบให้ได้
สำหรับผู้ใช้ Cloudflare: ให้ใช้แผงควบคุม AI Crawl Control
หากโดเมนของคุณใช้งานผ่าน Cloudflare คุณอาจเห็น “Cloudflare management marker” ภายในไฟล์ robots.txt การแก้ไขไฟล์ด้วยตนเองอาจทำให้การเปลี่ยนแปลงถูกเขียนทับในการอัปเดต Cloudflare ครั้งถัดไป แทนที่จะทำเช่นนั้น ให้ไปที่อินเทอร์เฟซ Cloudflare AI Crawl Control และสลับสวิตช์สำหรับบอทที่เกี่ยวข้อง แผงควบคุมนี้จะเขียนคำสั่ง (directives) ที่ถูกต้องให้เบื้องหลังและทำให้การตั้งค่าคงอยู่ถาวร
ทำไมความละเอียดอ่อนนี้ถึงสำคัญ
- การปกป้องทรัพย์สินทางปัญญา – การบล็อก training bots ช่วยป้องกันไม่ให้งานเขียนของคุณถูกเก็บเกี่ยวไปใช้ฟรีๆ และนำไปรวมเข้ากับโมเดลในอนาคต
- ทราฟฟิกจากการอ้างอิง (Referral traffic) – การอนุญาต citation bots หมายความว่าผู้ใช้ที่เห็นข้อความสรุปใน ChatGPT สามารถคลิกต่อไปยังเว็บไซต์ของคุณ ซึ่งจะสร้างยอดผู้เข้าชมจริงได้
- การมองเห็นของแบรนด์ – การปรากฏตัวในการค้นหาที่เสริมด้วย AI ช่วยให้เนื้อหาของคุณถูกค้นพบได้ง่ายขึ้น ในขณะที่ AI assistant กำลังกลายเป็นแหล่งข้อมูลหลักสำหรับผู้ใช้จำนวนมาก
ข้อโต้แย้งในอีกมุมหนึ่ง
สำนักพิมพ์บางแห่งแย้งว่าการใช้ข้อความของพวกเขาไม่ว่าจะเพื่อการอ้างอิงก็ตาม ถือเป็นการสนับสนุนระบบนิเวศ AI ในวงกว้าง และการปฏิเสธ citation bots อาจส่งผลเสียต่อการเข้าถึงของพวกเขา ทางเลือกนี้ชัดเจนมาก: คุณจะปล่อยให้โมเดลเรียนรู้จากงานของคุณโดยไม่มีการให้เครดิต หรือคุณจะปล่อยให้มันอ้างอิงคุณและดึงทราฟฟิกเข้ามา การตัดสินใจขึ้นอยู่กับว่าคุณให้คุณค่ากับยอดคลิกในทันที หรือการควบคุมการนำคำพูดของคุณไปใช้ซ้ำในระยะยาวมากกว่ากัน
สิ่งที่ควรติดตามต่อไป
บริษัท AI ยังคงพัฒนาวิธีการตั้งชื่อและกำหนดเส้นทาง crawler ของพวกเขาอย่างต่อเนื่อง โปรดคอยติดตามการอัปเดต user-agent strings ในเอกสารสำหรับนักพัฒนา Citation bot ตัวใหม่อาจปรากฏขึ้นภายใต้ชื่ออื่น และ training bot ที่เคยถูกบล็อกไปแล้วอาจถูกเปลี่ยนชื่อ ควรตรวจสอบ robots.txt และการตั้งค่า Cloudflare ของคุณเป็นประจำเพื่อให้สอดคล้องกับรายชื่อ crawler ล่าสุด
สรุป: บล็อกเฉพาะ user agents ของ training-bot เพื่อไม่ให้เนื้อหาของคุณถูกนำไปใช้ในการฝึกฝนโมเดลในอนาคต แต่ให้เปิดใช้งาน citation bots ไว้ เพื่อให้ ChatGPT ยังสามารถส่งผู้ใช้กลับมายังเว็บไซต์ของคุณได้ การใช้กฎ robots.txt ที่ถูกต้อง ซึ่งสามารถใช้ผ่าน Cloudflare’s AI Crawl Control เมื่อจำเป็น จะช่วยให้คุณปกป้องทรัพย์สินทางปัญญา (IP) ของคุณไปพร้อมๆ กับการเก็บเกี่ยวทราฟฟิกที่ขับเคลื่อนด้วย AI
