Tôi đã xây dựng một trang web với mong muốn được các trợ lý AI trích dẫn, và thay vì đoán mò, tôi đã áp dụng ba tín hiệu được khuyến nghị rộng rãi: một mục trong robots.txt cho phép các trình thu thập dữ liệu kiểu GPT truy cập, một tệp llms.txt liệt kê mọi trang, và schema JSON-LD để mô tả nội dung. Sau khi thử nghiệm từng loại, tôi nhận thấy chỉ có một thứ có thể thất bại mà không có cảnh báo, và những thứ còn lại không hoạt động như hầu hết mọi người vẫn tuyên bố.

Tại sao ba tín hiệu này lại quan trọng

Các quản trị viên web thường được bảo rằng các trình thu thập dữ liệu tập trung vào AI cần sự cho phép rõ ràng, rằng một chỉ mục văn bản thuần túy "llms.txt" sẽ giúp các mô hình ngôn ngữ lớn (LLM) định vị các đoạn văn bản liên quan, và rằng dữ liệu cấu trúc JSON-LD sẽ làm tăng khả năng được trích dẫn. Lời hứa rất đơn giản: chỉ cần thêm các tệp này, trang web của bạn sẽ bắt đầu xuất hiện trong các câu trả lời do AI tạo ra, từ đó thúc đẩy lưu lượng truy cập và khả năng nhận diện thương hiệu.

1. Cho phép các trình thu thập dữ liệu AI truy cập qua robots.txt

Dòng robots.txt đề cập đến GPTBot (hoặc bất kỳ bot AI nào khác) chỉ là một yêu cầu. Nếu một mạng phân phối nội dung (CDN) hoặc tường lửa chặn bot, yêu cầu đó sẽ không bao giờ đến được trang web, và trình thu thập dữ liệu sẽ không thể đọc được tệp đó. Cách duy nhất đáng tin cậy để biết liệu bot có thể truy cập bạn hay không là kiểm tra mã trạng thái HTTP cho từng loại bot chính. Phản hồi 403 (forbidden) hoặc 503 (service unavailable) có nghĩa là toàn bộ phần hạ tầng kỹ thuật còn lại đều vô nghĩa — không có bot, không có lập chỉ mục, không có trích dẫn.

2. Tệp llms.txt

Một tệp llms.txt chỉ là một danh sách các URL dưới dạng markdown, nhằm cung cấp cho các LLM một bản đồ sạch sẽ về trang web để chúng không phải tự suy luận điều hướng chỉ từ HTML. Trên thực tế, tài liệu của Google cho biết họ bỏ qua tệp này, và chưa có công cụ tìm kiếm lớn nào cam kết sử dụng nó cho mục đích trích dẫn. Việc duy trì nó hầu như không tốn kém gì và có thể hữu ích cho các tác nhân AI tùy chỉnh, nhưng không nên quảng cáo nó như một lối tắt để có được nhiều trích dẫn từ AI hơn.

3. Schema JSON-LD

JSON-LD nhúng dữ liệu có cấu trúc — tên tác giả, ngày xuất bản, ID sản phẩm — trực tiếp vào một trang. Nhiều nhà tiếp thị cho rằng việc thêm schema sẽ giúp trang của họ xuất hiện thường xuyên hơn trong các câu trả lời của AI, nhưng một nghiên cứu trên 1.885 trang đã không tìm thấy sự gia tăng đáng kể nào về số lượng trích dẫn chỉ nhờ vào đánh dấu schema. Giá trị thực sự của JSON-LD nằm ở việc giải quyết thực thể (entity resolution): nó cho máy tính biết rằng "Jane Doe" ở trang này chính là "Jane Doe" ở trang khác, giúp ngăn chặn sự nhầm lẫn giữa những người hoặc sản phẩm có tên tương tự nhau.

Nút thắt thực sự: lập chỉ mục (indexing)

Cả ba tín hiệu trên đều là phần hạ tầng kỹ thuật; chúng chỉ hoạt động nếu trang web được lập chỉ mục ngay từ đầu. Một trang không bao giờ xuất hiện trong chỉ mục thì không thể được truy xuất, bất kể bạn có thêm bao nhiêu quyền cho trình thu thập dữ liệu hay bao nhiêu thẻ schema. Chỉ số đáng tin cậy nhất về tình trạng lập chỉ mục là báo cáo phạm vi bao phủ (coverage report) trong Google Search Console (hoặc công cụ tương đương của các công cụ tìm kiếm khác). Nếu một trang hiển thị là "không được lập chỉ mục" (not indexed), bạn cần khắc phục điều đó trước khi lo lắng về bất kỳ tín hiệu đặc thù nào dành cho AI.

Danh sách kiểm tra thực tế

  1. Xác minh quyền truy cập của trình thu thập dữ liệu – Kiểm tra phản hồi HTTP cho GPTBot, ClaudeBot hoặc bất kỳ trình thu thập dữ liệu AI nào mà bạn quan tâm. Bước này có thể thất bại một cách âm thầm; một lệnh chặn sẽ không tạo ra cảnh báo trong phần phân tích của bạn.
  2. Xác nhận phạm vi lập chỉ mục – Sử dụng Search Console để xem trang nào đã được lập chỉ mục, trang nào bị loại trừ và lý do tại sao. Hãy giải quyết bất kỳ "lỗi thu thập dữ liệu" (crawl errors) hoặc chỉ thị "noindex" nào trước.
  3. Thiết lập hạ tầng kỹ thuật – Khi quyền truy cập và việc lập chỉ mục đã ổn định, hãy thêm llms.txt và JSON-LD. Hãy coi chúng là những công cụ hỗ trợ ít cần bảo trì thay vì là sự đảm bảo cho việc được trích dẫn.

Quan điểm ngược lại

Một số nhà cung cấp vẫn tiếp thị các công cụ tạo llms.txt và các plugin schema như những công cụ thúc đẩy SEO cho AI. Dữ liệu tôi thu thập được, cộng với lập trường chính thức từ các công cụ tìm kiếm lớn, cho thấy những tuyên bố đó là quá mức. Các công cụ này không gây hại, nhưng chúng không nên là trọng tâm trong chiến lược trích dẫn của AI.

Những điều cần theo dõi tiếp theo

Hãy theo dõi nhật ký trình thu thập dữ liệu (crawler logs), để mắt đến các cảnh báo trong Search Console và định kỳ kiểm tra JSON-LD của bạn bằng các công cụ xác thực để giữ cho luồng dữ liệu luôn thông suốt.

Bài học rút ra: Nếu bạn muốn trang web của mình được AI trích dẫn, hãy ngừng coi llms.txt và schema là những "tấm vé vạn năng". Hãy đảm bảo rằng các bot thực sự có thể tiếp cận bạn và các trang của bạn đã được lập chỉ mục; chỉ khi đó, các tệp bổ sung mới thực hiện được vai trò hỗ trợ khiêm tốn của chúng.

Nguồn: bài viết gốc trên dev.to