Cloudflare sẽ mặc định chặn các trình thu thập dữ liệu AI Agent vào tháng 9 này
Kỷ nguyên thu thập dữ liệu web (web scraping) không giới hạn bởi trí tuệ nhân tạo đang dần khép lại. Bắt đầu từ ngày 15 tháng 9, Cloudflare sẽ thực hiện một thay đổi chính sách lớn: mặc định chặn các trình thu thập dữ liệu của AI agent, mở ra một kỷ nguyên mới về truy cập dữ liệu dựa trên sự cho phép.
Sự chuyển dịch từ thu thập dữ liệu thụ động sang cấp quyền chủ động
Trong nhiều năm qua, các mô hình AI và các tác nhân tự hành (autonomous agents) đã hoạt động bằng cách duyệt qua web mở, thu thập dữ liệu để cung cấp câu trả lời theo thời gian thực cho người dùng. Tuy nhiên, thông báo gần đây của Cloudflare đánh dấu một bước ngoặt quan trọng trong cách hạ tầng web xử lý các bot "agentic" này. Khác với các trình thu thập dữ liệu của công cụ tìm kiếm truyền thống vốn lập chỉ mục các trang để truy xuất, các trình thu thập dữ liệu của AI agent sẽ lấy nội dung theo thời gian thực để thực hiện các tác vụ cụ thể hoặc trả lời các truy vấn phức tạp thay mặt cho người dùng.
Từ ngày 15 tháng 9 trở đi, một phần đáng kể của mạng internet được bảo vệ bởi Cloudflare sẽ tự động hạn chế các tác nhân này. Động thái này được thiết kế để trao cho chủ sở hữu trang web và các nhà xuất bản nhiều quyền kiểm soát hơn đối với cách dữ liệu độc quyền và nội dung sáng tạo của họ được nạp vào các Mô hình Ngôn ngữ Lớn (LLMs) và các tác nhân tự hành. Thay vì là một môi trường "tự do khai thác", web đang chuyển dịch sang một mô hình có kiểm soát, nơi các bot phải yêu cầu quyền truy cập một cách rõ ràng.
Cách các nhà phát triển và chủ sở hữu trang web có thể cấp quyền truy cập
Mặc dù cài đặt mặc định là hạn chế, Cloudflare không nhằm mục đích làm gián đoạn chức năng của các công cụ AI hữu ích. Thay vào đó, mục tiêu là thiết lập một quy trình "bắt tay" (handshake) có cấu trúc giữa trình thu thập dữ liệu và máy chủ lưu trữ. Đối với các nhà phát triển và quản trị viên trang web, điều này có nghĩa là cần từ bỏ tư duy "thu thập mọi thứ" để chuyển sang một phương pháp tiếp cận có quản lý.
Để đảm bảo rằng các AI agent hợp pháp và có giá trị cao vẫn có thể truy cập vào các phần cụ thể của một trang web, các chủ sở hữu sẽ cần triển khai các quyền truy cập cụ thể. Điều này cho phép các doanh nghiệp lựa chọn các AI agent nào—chẳng hạn như những agent được vận hành bởi OpenAI, Anthropic hoặc Google—có thể đọc nội dung của họ, và có thể là theo những điều khoản nhất định. Đối với bức tranh AI rộng lớn hơn, điều này đòi hỏi các nhà phát triển agent phải có một cách thức tinh vi hơn để tự định danh và chứng minh tính hợp pháp của mình với các máy chủ web.
Tại sao điều này lại quan trọng đối với hệ sinh thái AI
Sự phát triển này đại diện cho một bước ngoặt quan trọng cho cả những người sáng tạo nội dung và các công ty AI. Đối với các nhà xuất bản, nó cung cấp một cơ chế phòng thủ rất cần thiết chống lại tình trạng "kiệt sức vì thu thập dữ liệu" (data scraping fatigue), nơi nội dung bị sử dụng để huấn luyện các mô hình mà cuối cùng có thể cạnh tranh với chính những người sáng tạo gốc. Bằng cách giành lại quyền kiểm soát, các nhà xuất bản có thể bảo vệ sở hữu trí tuệ của mình và có khả năng khám phá các mô hình kiếm tiền mới thông qua việc cấp quyền truy cập cho AI.
Đối với các nhà phát triển AI và những người sáng lập đang xây dựng các quy trình làm việc dạng agent (agentic workflows), sự thay đổi này mang đến một lớp phức tạp mới. Các agent không còn có thể dựa vào giả định rằng tất cả HTML công khai đều có thể truy cập được. Để chuẩn bị cho tương lai, các AI agent sẽ cần phải "có ý thức tuân thủ" (compliance-aware), có khả năng điều hướng qua các lớp phân quyền và tôn trọng các giao thức mới được thiết lập bởi các nhà cung cấp hạ tầng lớn như Cloudflare.
Các điểm chính cần lưu ý
- Chặn mặc định: Bắt đầu từ ngày 15 tháng 9, Cloudflare sẽ tự động chặn các trình thu thập dữ liệu của AI agent trên các trang web được bảo vệ trừ khi được cấp quyền rõ ràng.
- Quyền kiểm soát cho nhà xuất bản: Động thái này chuyển giao quyền lực trở lại cho chủ sở hữu trang web, cho phép họ quyết định thực thể AI cụ thể nào có thể nạp dữ liệu thời gian thực của họ.
- Tiêu chuẩn mới cho các Agent: Các nhà phát triển AI phải điều chỉnh các agent của mình để tôn trọng hơn các quyền truy cập web, hướng tới một mô hình thu thập dữ liệu có cấu trúc dựa trên sự cho phép.
