Một cuộc kiểm tra danh mục dụng cụ công nghiệp với 5.000 SKU cho thấy Googlebot thu thập dữ liệu các URL bộ lọc của trang web ba lần một ngày, trong khi các trang danh mục chính chỉ được truy cập một lần sau mỗi ba tuần. Kết quả là gì? Các sản phẩm mới phải mất một tháng mới xuất hiện trong kết quả tìm kiếm vì trình thu thập dữ liệu bị mắc kẹt ở các URL có giá trị thấp.

Tại sao tìm kiếm theo thuộc tính (faceted search) gây hại cho ngân sách crawl

Tìm kiếm theo thuộc tính cho phép người mua thu hẹp kết quả theo chất liệu, kích thước, lớp phủ và các thuộc tính khác. Mỗi thuộc tính thêm một tham số vào URL, và với năm chiều dữ liệu, các tổ hợp có thể bùng nổ lên tới hàng chục nghìn trang duy nhất. Hầu hết các trang đó đều chứa danh sách sản phẩm gần như giống hệt nhau, nhưng Google lại coi mỗi trang là một URL riêng biệt. Vì ngân sách crawl của Google – số lượng trang mà nó sẽ truy cập trên một trang web mỗi ngày – là có hạn, nó sẽ tiêu tốn các lượt truy cập quý giá vào những URL mang lại ít giá trị cho người dùng hoặc kết quả tìm kiếm.

Cấu trúc URL của trang web vô tình dẫn dụ bot vào một "bẫy crawl" (crawl trap), nơi nó liên tục đi theo các liên kết dẫn đến các trang gần như trùng lặp.

Những rủi ro tiềm ẩn

  • Tốc độ lập chỉ mục – việc phát hiện chậm trễ đồng nghĩa với việc hàng hóa mới sẽ không hiển thị trong nhiều tuần, gây ảnh hưởng đến doanh số.
  • Khả năng hiển thị tìm kiếm – nếu Google dành ngân sách cho các trang bộ lọc, các trang sản phẩm ưu tiên cao có thể không bao giờ được thu thập dữ liệu, làm hạn chế cơ hội xếp hạng của chúng.

Hướng dẫn từng bước để khôi phục ngân sách crawl

  1. Xác định các thuộc tính có giá trị cao
    Tìm các tổ hợp bộ lọc tạo ra lưu lượng tìm kiếm thực tế. Hãy cung cấp cho các URL đó một đường dẫn sạch và mang tính mô tả (ví dụ: /end-mill/coating-tialn/). Giữ cho các trang có giá trị cao có thể được thu thập dữ liệu và lập chỉ mục đầy đủ.

  2. Xử lý các thuộc tính giá trị trung bình bằng thẻ canonical
    Khi một bộ lọc hữu ích nhưng có ít lưu lượng tìm kiếm, hãy để URL đó có thể truy cập được nhưng thêm thẻ rel=canonical trỏ về trang danh mục chính. Điều này báo cho Google biết danh mục là phiên bản được ưu tiên.

  3. Chặn các thuộc tính giá trị thấp thông qua robots.txt
    Ngăn chặn các mẫu URL đó trong robots.txt để Googlebot không bao giờ yêu cầu chúng.

  4. Hiển thị các bộ lọc nâng cao dưới dạng nút (button), không phải liên kết (link)
    Bot sẽ đi theo các phần tử <a> nhưng bỏ qua các phần tử <button>. Hãy cung cấp các trình điều khiển bộ lọc dưới dạng nút để kích hoạt JavaScript mà không tạo ra các URL mới. Người dùng vẫn có giao diện họ cần, trong khi trình thu thập dữ liệu không thể phát hiện ra các URL vô ích.

  5. Tránh bẫy “noindex”
    Việc thêm noindex vào 30.000 URL bộ lọc vẫn buộc Google phải tải xuống từng trang trước, sau đó mới đọc chỉ thị để bỏ qua nó. Hãy sử dụng robots.txt để chặn hoàn toàn việc thu thập dữ liệu; chỉ những trang bạn dự định lập chỉ mục mới nên có thể truy cập được.

Đo lường thành công

Hãy chuyển trọng tâm từ thứ hạng sang tốc độ lập chỉ mục. Theo dõi thời gian một sản phẩm mới được thêm vào xuất hiện trong chỉ mục của Google trước và sau khi thực hiện các thay đổi. Việc giảm độ trễ từ 21 ngày xuống còn 3 ngày cho thấy chiến lược đang phát huy hiệu quả.

Quan điểm đối lập: tính khả dụng so với hiệu quả crawl

Hãy giữ nguyên giao diện người dùng (UI) — các nút bấm vẫn cho phép người dùng tinh chỉnh kết quả — trong khi giữ cho các URL bên dưới không hiển thị với trình thu thập dữ liệu. Nếu một bộ lọc cụ thể tỏ ra thiết yếu cho việc điều hướng, hãy nâng cấp nó thành một thuộc tính giá trị cao và cung cấp cho nó một URL sạch, có thể crawl được.

Những điều cần theo dõi tiếp theo

  • Thống kê crawl trong Search Console – theo dõi báo cáo “Crawl Stats” để xem sự sụt giảm trong mục “Requests blocked by robots.txt” và sự gia tăng trong “Crawl depth” đối với các trang sản phẩm.

Bài học rút ra: Phân loại các thuộc tính, sử dụng thẻ canonical, chặn các URL giá trị thấp và thay thế liên kết bằng các nút bấm. Các trang thương mại điện tử lớn có thể điều hướng Googlebot hướng tới các trang quan trọng, giúp cắt giảm thời gian lập chỉ mục từ hàng tuần xuống còn hàng ngày mà không làm ảnh hưởng đến trải nghiệm mua sắm.