Cloudflare จะเริ่มบล็อก AI Agent Crawlers โดยค่าเริ่มต้นในเดือนกันยายนนี้
ยุคสมัยของการทำ web scraping โดยปัญญาประดิษฐ์แบบไร้ขีดจำกัดกำลังจะสิ้นสุดลง ตั้งแต่วันที่ 15 กันยายนเป็นต้นไป Cloudflare จะเริ่มใช้การเปลี่ยนแปลงนโยบายครั้งสำคัญ โดยจะบล็อก AI agent crawlers โดยค่าเริ่มต้น ซึ่งจะนำไปสู่ยุคใหม่ของการเข้าถึงข้อมูลที่ต้องได้รับอนุญาตก่อน
การเปลี่ยนผ่านจากการ Scraping แบบตั้งรับ สู่การขออนุญาตแบบเชิงรุก
เป็นเวลาหลายปีที่โมเดล AI และ autonomous agents ทำงานโดยการท่องไปในเว็บสาธารณะ เพื่อทำ web scraping ข้อมูลสำหรับนำมาตอบคำถามผู้ใช้แบบเรียลไทม์ อย่างไรก็ตาม การประกาศล่าสุดของ Cloudflare ถือเป็นจุดเปลี่ยนสำคัญในการจัดการกับบอทประเภท "agentic" เหล่านี้ผ่านโครงสร้างพื้นฐานของเว็บ ซึ่งแตกต่างจาก search engine crawlers แบบดั้งเดิมที่ทำหน้าที่ทำดัชนี (index) หน้าเว็บเพื่อการค้นหา แต่ AI agent crawlers จะดึงเนื้อหาแบบเรียลไทม์เพื่อปฏิบัติงานเฉพาะอย่างหรือตอบคำถามที่ซับซ้อนแทนผู้ใช้งาน
ตั้งแต่วันที่ 15 กันยายนเป็นต้นไป เว็บไซต์จำนวนมากที่ได้รับการคุ้มครองโดย Cloudflare จะจำกัดการเข้าถึงเอเจนต์เหล่านี้โดยอัตโนมัติ ความเคลื่อนไหวนี้ได้รับการออกแบบมาเพื่อให้เจ้าของเว็บไซต์และผู้เผยแพร่เนื้อหา (publishers) มีอำนาจควบคุมมากขึ้นว่าข้อมูลที่เป็นกรรมสิทธิ์และเนื้อหาเชิงสร้างสรรค์ของตนจะถูกนำไปใช้โดย Large Language Models (LLMs) และ autonomous agents อย่างไร แทนที่จะเป็นรูปแบบ "ใครจะทำอะไรก็ได้" (free-for-all) เว็บไซต์กำลังเปลี่ยนผ่านไปสู่โมเดลที่มีการควบคุม (gated model) ซึ่งบอทจะต้องทำการขออนุญาตเข้าถึงอย่างชัดเจน
วิธีที่นักพัฒนาและเจ้าของเว็บไซต์สามารถอนุญาตการเข้าถึงได้
แม้ว่าการตั้งค่าเริ่มต้นจะเป็นการจำกัดการเข้าถึง แต่ Cloudflare ไม่ได้มีเป้าหมายที่จะทำลายฟังก์ชันการทำงานของเครื่องมือ AI ที่มีประโยชน์ ในทางกลับกัน เป้าหมายคือการสร้างกระบวนการ "handshake" ที่เป็นระบบระหว่าง crawler และ host สำหรับนักพัฒนาและผู้ดูแลเว็บไซต์ นี่หมายถึงการเปลี่ยนจากแนวคิด "scrape ทุกอย่าง" ไปสู่แนวทางการจัดการที่เป็นระบบมากขึ้น
เพื่อให้มั่นใจว่า AI agents ที่มีความน่าเชื่อถือและมีมูลค่าสูงยังคงสามารถเข้าถึงส่วนเฉพาะของเว็บไซต์ได้ เจ้าของเว็บไซต์จำเป็นต้องกำหนดสิทธิ์การเข้าถึงที่เฉพาะเจาะจง สิ่งนี้ช่วยให้ธุรกิจสามารถคัดเลือกได้ว่า AI agents ใด—เช่น ตัวที่ขับเคลื่อนโดย OpenAI, Anthropic หรือ Google—จะสามารถอ่านเนื้อหาของตนได้ และอาจรวมถึงเงื่อนไขในการเข้าถึงด้วย สำหรับภาพรวมของระบบนิเวศ AI สิ่งนี้ทำให้เหล่านักพัฒนาเอเจนต์จำเป็นต้องมีวิธีการที่ซับซ้อนยิ่งขึ้นในการระบุตัวตนและพิสูจน์ความถูกต้องของตนต่อเว็บเซิร์ฟเวอร์
ทำไมเรื่องนี้จึงสำคัญต่อระบบนิเวศ AI
การพัฒนานี้ถือเป็นจุดเปลี่ยนสำคัญสำหรับทั้งผู้สร้างเนื้อหาและบริษัท AI สำหรับผู้เผยแพร่เนื้อหา (publishers) นี่คือกลไกการป้องกันที่จำเป็นอย่างยิ่งต่อ "ภาวะเหนื่อยล้าจากการถูกดูดข้อมูล" (data scraping fatigue) ซึ่งเนื้อหาถูกนำไปใช้ฝึกฝนโมเดลที่อาจกลายมาเป็นคู่แข่งกับผู้สร้างต้นฉบับในท้ายที่สุด การกลับมาควบคุมข้อมูลได้อีกครั้งจะช่วยให้ผู้เผยแพร่สามารถปกป้องทรัพย์สินทางปัญญา และอาจเปิดโอกาสในการสำรวจโมเดลการสร้างรายได้รูปแบบใหม่จากการอนุญาตให้ AI เข้าถึงข้อมูล
สำหรับนักพัฒนา AI และผู้ก่อตั้งที่กำลังสร้าง agentic workflows การเปลี่ยนแปลงนี้จะเพิ่มความซับซ้อนขึ้นอีกระดับ เอเจนต์ไม่สามารถตั้งสมมติฐานได้อีกต่อไปว่า HTML ที่เปิดสู่สาธารณะทั้งหมดจะสามารถเข้าถึงได้ การเตรียมความพร้อมสำหรับ AI agents ในอนาคตจะกำหนดให้พวกมันต้อง "ตระหนักถึงการปฏิบัติตามกฎ" (compliance-aware) โดยต้องสามารถจัดการกับชั้นของการขออนุญาตและเคารพโปรโตคอลใหม่ๆ ที่กำหนดโดยผู้ให้บริการโครงสร้างพื้นฐานรายใหญ่อย่าง Cloudflare
สรุปประเด็นสำคัญ
- การบล็อกโดยค่าเริ่มต้น: ตั้งแต่วันที่ 15 กันยายน Cloudflare จะบล็อก AI agent crawlers บนเว็บไซต์ที่ได้รับการคุ้มครองโดยอัตโนมัติ เว้นแต่จะมีการอนุญาตอย่างชัดเจน
- อำนาจการควบคุมสำหรับผู้เผยแพร่: ความเคลื่อนไหวนี้เป็นการคืนอำนาจให้แก่เจ้าของเว็บไซต์ ช่วยให้พวกเขาสามารถตัดสินใจได้ว่าเอนทิตี AI ใดบ้างที่สามารถนำข้อมูลแบบเรียลไทม์ของตนไปใช้ได้
- มาตรฐานใหม่สำหรับเอเจนต์: นักพัฒนา AI ต้องปรับปรุงเอเจนต์ของตนให้เคารพการขออนุญาตบนเว็บมากขึ้น โดยเปลี่ยนไปสู่โมเดลการทำ crawling ที่มีโครงสร้างและอิงตามการขออนุญาต
