จากการตรวจสอบแคตตาล็อกเครื่องมืออุตสาหกรรมที่มีสินค้า 5,000 SKU พบว่า Googlebot เข้าไต่ข้อมูล (crawl) URL ของตัวกรองสินค้าถึง 3 ครั้งต่อวัน ในขณะที่หน้าหมวดหมู่หลักถูกเข้าชมเพียงครั้งเดียวในทุกๆ 3 สัปดาห์ ผลลัพธ์ที่ได้คือ สินค้าใหม่ต้องใช้เวลาถึงหนึ่งเดือนกว่าจะปรากฏในผลการค้นหา เนื่องจากตัวไต่ข้อมูลติดอยู่กับ URL ที่มีมูลค่าต่ำ
ทำไมการค้นหาแบบ Faceted ถึงส่งผลเสียต่อ crawl budget
การค้นหาแบบ Faceted ช่วยให้ผู้ซื้อสามารถจำกัดผลลัพธ์ตามวัสดุ ขนาด การเคลือบผิว และคุณลักษณะอื่นๆ ได้ แต่ละ facet จะเพิ่มพารามิเตอร์เข้าไปใน URL และเมื่อมีมิติถึง 5 ด้าน จำนวนการผสมผสานที่เป็นไปได้จะพุ่งสูงขึ้นเป็นหลายหมื่นหน้า หน้าส่วนใหญ่เหล่านั้นมีรายการสินค้าที่เกือบจะเหมือนกัน แต่ Google กลับปฏิบัติกับแต่ละหน้าเหมือนเป็น URL ที่แยกจากกัน เนื่องจาก crawl budget ของ Google ซึ่งก็คือจำนวนหน้าที่ Google จะดึงข้อมูลในเว็บไซต์หนึ่งๆ ต่อวันนั้นมีจำกัด มันจึงใช้โควตาอันมีค่าไปกับ URL ที่แทบไม่ได้เพิ่มคุณค่าให้กับผู้ใช้หรือการค้นหาเลย
โครงสร้าง URL ของเว็บไซต์นี้เปรียบเสมือนการล่อให้บอทเข้าไปใน “crawl trap” ที่มันจะไล่ตามลิงก์ที่นำไปสู่หน้าที่มีเนื้อหาซ้ำกันไปเรื่อยๆ อย่างไม่สิ้นสุด
สิ่งที่ต้องเผชิญ
- ความเร็วในการทำดัชนี (Indexing speed) – การค้นพบที่ล่าช้าหมายความว่าสินค้าใหม่จะมองไม่เห็นในระบบเป็นเวลาหลายสัปดาห์ ซึ่งส่งผลเสียต่อยอดขาย
- การมองเห็นในการค้นหา (Search visibility) – หาก Google ใช้ crawl budget ไปกับหน้าตัวกรอง หน้าสินค้าที่มีความสำคัญสูงอาจไม่ถูกไต่ข้อมูลเลย ซึ่งเป็นการจำกัดโอกาสในการจัดอันดับ
คู่มือทีละขั้นตอนในการเรียกคืน crawl budget
ระบุ Facet ที่มีมูลค่าสูง
ค้นหาการผสมผสานของตัวกรองที่สร้างทราฟฟิกจากการค้นหาจริงๆ กำหนดเส้นทาง (path) ที่สะอาดและสื่อความหมายให้กับ URL เหล่านั้น (เช่น/end-mill/coating-tialn/) และรักษาหน้าที่มีมูลค่าสูงให้สามารถไต่ข้อมูลและทำดัชนีได้อย่างสมบูรณ์ใช้แท็ก canonical กับ Facet ที่มีมูลค่าปานกลาง
เมื่อตัวกรองมีประโยชน์แต่มีปริมาณการค้นหาน้อย ให้ปล่อย URL นั้นให้เข้าถึงได้ แต่เพิ่มrel=canonicalที่ชี้กลับไปยังหน้าหมวดหมู่หลัก วิธีนี้จะบอก Google ว่าหน้าหมวดหมู่คือเวอร์ชันที่ต้องการบล็อก Facet ที่มีมูลค่าต่ำผ่าน robots.txt
ใช้คำสั่ง Disallow สำหรับรูปแบบเหล่านั้นในrobots.txtเพื่อไม่ให้ Googlebot ส่งคำขอเข้ามายัง URL เหล่านั้นเลยแสดงตัวกรองขั้นสูงเป็นปุ่ม แทนที่จะเป็นลิงก์
บอทจะไล่ตามองค์ประกอบ<a>แต่จะมองข้ามองค์ประกอบ<button>ให้ใช้ปุ่มในการควบคุมตัวกรองซึ่งจะเรียกใช้งาน JavaScript โดยไม่สร้าง URL ใหม่ ผู้ใช้ยังคงได้รับ UI ที่ต้องการ ในขณะที่ตัวไต่ข้อมูลจะไม่สามารถค้นพบ URL ที่ไม่มีประโยชน์ได้หลีกเลี่ยงกับดัก “noindex”
การเพิ่มnoindexให้กับ URL ตัวกรอง 30,000 หน้า ยังคงบังคับให้ Google ต้องดาวน์โหลดแต่ละหน้าก่อน แล้วจึงอ่านคำสั่งเพื่อเพิกเฉยต่อหน้านั้น ให้ใช้robots.txtเพื่อหยุดการไต่ข้อมูลโดยสิ้นเชิง โดยควรให้เฉพาะหน้าที่คุณตั้งใจจะทำดัชนีเท่านั้นที่สามารถเข้าถึงได้
การวัดผลความสำเร็จ
เปลี่ยนจุดโฟกัสจากการจัดอันดับมาเป็นความเร็วในการทำดัชนี ติดตามระยะเวลาที่สินค้าที่เพิ่มใหม่ใช้ในการปรากฏในดัชนีของ Google ทั้งก่อนและหลังการเปลี่ยนแปลง การเปลี่ยนจากความล่าช้า 21 วัน เหลือเพียง 3 วัน แสดงให้เห็นว่ากลยุทธ์นี้ได้ผล
มุมมองต่าง: ความง่ายในการใช้งาน (Usability) เทียบกับ ประสิทธิภาพการไต่ข้อมูล (Crawl efficiency)
รักษา UI ไว้ให้เหมือนเดิม—ปุ่มยังคงช่วยให้ผู้ใช้ปรับแต่งผลลัพธ์ได้—ในขณะที่ทำให้ URL เบื้องหลังไม่ถูกมองเห็นโดยตัวไต่ข้อมูล หากตัวกรองใดตัวกรองหนึ่งพิสูจน์แล้วว่าจำเป็นต่อการนำทาง ให้ยกระดับมันเป็น facet ที่มีมูลค่าสูงและกำหนด URL ที่สะอาดและไต่ข้อมูลได้ง่าย
สิ่งที่ควรติดตามต่อไป
- สถิติการไต่ข้อมูลใน Search Console – ตรวจสอบรายงาน “Crawl Stats” เพื่อดูการลดลงของ “Requests blocked by robots.txt” และการเพิ่มขึ้นของ “Crawl depth” สำหรับหน้าสินค้า
บทสรุป: จัดกลุ่ม facet, ใช้แท็ก canonical, บล็อก URL ที่มีมูลค่าต่ำ และเปลี่ยนลิงก์เป็นปุ่ม เว็บไซต์อีคอมเมิร์ซขนาดใหญ่สามารถนำทาง Googlebot ไปยังหน้าที่สำคัญ ซึ่งจะช่วยลดเวลาในการทำดัชนีจากหลายสัปดาห์เหลือเพียงไม่กี่วัน โดยไม่สูญเสียฟังก์ชันการใช้งานสำหรับผู้ซื้อ
