Việc chặn GPTBot không xóa bỏ trang web của bạn khỏi khung trả lời của ChatGPT. Những chủ sở hữu trang web đã thêm quy tắc robots.txt để chống lại bot này đã rất ngạc nhiên khi thấy các bài viết của họ vẫn hiển thị kèm liên kết và đoạn trích khi người dùng hỏi ChatGPT về chủ đề đó. Việc chặn đã có hiệu quả – chỉ là nó đã chặn nhầm trình thu thập dữ liệu (crawler).

Bot huấn luyện so với bot trích dẫn

Các nhà cung cấp AI vận hành hai loại crawler riêng biệt:

  • Bot huấn luyện (Training bots) thu thập các trang web công khai, nạp văn bản và sử dụng chúng để tinh chỉnh các mô hình ngôn ngữ lớn. Chúng không bao giờ trả về liên kết nguồn và không tạo ra lưu lượng truy cập cho trang web.
  • Bot trích dẫn (Citation bots) hoạt động tại thời điểm truy vấn. Khi người dùng đặt câu hỏi, bot sẽ tìm kiếm trên web, lấy một đoạn trích phù hợp, thêm tên và URL của nguồn, rồi hiển thị trong cửa sổ chat. Những lượt truy cập này có thể mang lại khách truy cập thực sự.

Nếu bạn chặn bot huấn luyện, mô hình sẽ không thể học từ các trang của bạn nữa. Nếu bạn chặn bot trích dẫn, trang web sẽ biến mất khỏi các câu trả lời trực tiếp của ChatGPT. Sự nhầm lẫn nảy sinh vì nhiều trang web chặn “GPTBot” mà không nhận ra rằng cái tên đó không xuất hiện trong quy trình trích dẫn.

Cách các ông lớn phân chia crawler của họ

Nhà cung cấp Tên bot huấn luyện Tên các bot trích dẫn
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (cả hai đều dùng để trích dẫn) PerplexityBot, Perplexity-User

Chỉ cần từ chối các mục trong cột “Tên bot huấn luyện” nếu bạn muốn giữ nội dung của mình không bị đưa vào quá trình huấn luyện mô hình trong tương lai. Các bot trích dẫn nên được phép hoạt động nếu bạn muốn xuất hiện trong các câu trả lời thời gian thực của ChatGPT.

Cấu hình robots.txt đúng cách

Một dòng Disallow: / chung chung nhắm vào “GPTBot” sẽ chặn crawler huấn luyện nhưng lại để nguyên các bot trích dẫn. Để cụ thể hơn, hãy thêm các quy tắc từ chối từng bot huấn luyện trong khi vẫn cho phép các bot trích dẫn:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

Đừng dựa vào một tệp robots.txt mặc định chỉ chặn ký tự đại diện “*”. Sự phân biệt này rất quan trọng vì việc chặn toàn bộ sẽ ngăn cả bot huấn luyện lẫn bot trích dẫn, làm mất đi lưu lượng truy cập mà tìm kiếm bằng AI có thể mang lại.

Người dùng Cloudflare: hãy sử dụng bảng điều khiển AI Crawl Control

Nếu tên miền của bạn nằm sau Cloudflare, bạn có thể thấy một “dấu quản lý của Cloudflare” (Cloudflare management marker) bên trong tệp robots.txt. Việc chỉnh sửa tệp thủ công có thể khiến các thay đổi bị ghi đè trong lần cập nhật Cloudflare tiếp theo. Thay vào đó, hãy truy cập giao diện Cloudflare AI Crawl Control và bật/tắt các công tắc cho các bot liên quan. Bảng điều khiển này sẽ tự động viết các chỉ thị chính xác ở phía sau và giữ chúng cố định.

Tại sao sự khác biệt tinh tế này lại quan trọng

  • Bảo vệ sở hữu trí tuệ – Chặn các bot huấn luyện giúp ngăn chặn việc nội dung của bạn bị thu thập miễn phí và đưa vào các mô hình trong tương lai.
  • Lưu lượng truy cập giới thiệu (Referral traffic) – Cho phép các bot trích dẫn có nghĩa là những người dùng nhìn thấy một đoạn trích trong ChatGPT có thể nhấp vào để đến trang web của bạn, tạo ra lượt truy cập thực tế.
  • Khả năng hiển thị thương hiệu – Sự hiện diện trong tìm kiếm tăng cường bằng AI giúp nội dung của bạn luôn dễ dàng được tìm thấy khi các trợ lý AI trở thành nguồn thông tin chính cho nhiều người dùng.

Lập luận ngược lại

Một số nhà xuất bản lập luận rằng bất kỳ việc sử dụng văn bản nào của họ, ngay cả để trích dẫn, đều đóng góp vào hệ sinh thái AI rộng lớn hơn và việc từ chối các bot trích dẫn có thể làm giảm phạm vi tiếp cận của họ. Sự đánh đổi là rất rõ ràng: hoặc bạn để mô hình học từ tác phẩm của mình mà không có sự ghi nhận, hoặc bạn cho phép nó trích dẫn bạn và dẫn lưu lượng truy cập về. Lựa chọn tùy thuộc vào việc bạn coi trọng lượt nhấp chuột tức thì hay sự kiểm soát lâu dài đối với cách các từ ngữ của mình được tái sử dụng.

Những điều cần theo dõi tiếp theo

Các công ty AI vẫn đang liên tục cải tiến cách họ đặt tên và điều hướng các crawler của mình. Hãy chú ý đến các bản cập nhật về chuỗi user-agent trong tài liệu dành cho nhà phát triển của họ. Một bot trích dẫn mới có thể xuất hiện dưới một cái tên khác, và một bot huấn luyện đã bị chặn trước đó có thể được đổi tên. Hãy thường xuyên kiểm tra lại tệp robots.txt và cài đặt Cloudflare của bạn để luôn cập nhật danh sách crawler mới nhất.

Bài học rút ra: Chỉ chặn các user agent của bot huấn luyện để giữ nội dung của bạn không bị đưa vào quá trình huấn luyện mô hình trong tương lai, nhưng hãy để các bot trích dẫn hoạt động để ChatGPT vẫn có thể dẫn người dùng quay lại trang của bạn. Các quy tắc robots.txt đúng đắn, được áp dụng thông qua Cloudflare AI Crawl Control khi cần thiết, sẽ giúp bạn bảo vệ sở hữu trí tuệ trong khi vẫn thu hoạch được lưu lượng truy cập từ AI.