5,000-SKU वाले एक इंडस्ट्रियल-टूल कैटलॉग के ऑडिट से पता चला कि Googlebot साइट के फ़िल्टर URLs को दिन में तीन बार क्रॉल कर रहा था, जबकि मुख्य कैटेगरी पेजों पर हर तीन हफ्ते में केवल एक बार जाया जाता था। परिणाम? नए उत्पादों को सर्च रिज़ल्ट में दिखने में एक महीना लग गया क्योंकि क्रॉलर कम-मूल्य वाले (low-value) URLs में फंसा हुआ था।

फ़ैसेटेड सर्च खरीदारों को मटेरियल, साइज, कोटिंग और अन्य विशेषताओं के आधार पर परिणामों को सीमित करने की सुविधा देता है। प्रत्येक फ़ैसेट URL में एक पैरामीटर जोड़ता है, और पाँच आयामों (dimensions) के साथ, संभावित संयोजनों की संख्या बढ़कर हज़ारों में पहुँच जाती है। इनमें से अधिकांश पेजों में लगभग एक ही उत्पाद सूची होती है, फिर भी Google प्रत्येक को एक अलग URL मानता है। चूँकि Google का क्रॉल बजट — वह संख्या जो वह हर दिन एक साइट से प्राप्त करेगा — सीमित है, इसलिए यह उन URLs पर कीमती स्लॉट खर्च करता है जो उपयोगकर्ताओं या सर्च के लिए बहुत कम मूल्य जोड़ते हैं।

साइट का URL स्ट्रक्चर बॉट को एक "क्रॉल ट्रैप" (crawl trap) में आमंत्रित करता है जहाँ वह अंतहीन रूप से उन लिंक्स का अनुसरण करता है जो लगभग डुप्लिकेट पेजों की ओर ले जाते हैं।

क्या दांव पर है

  • इंडेक्सिंग स्पीड (Indexing speed) – खोज में देरी का मतलब है कि नया इन्वेंट्री हफ्तों तक अदृश्य रहता है, जिससे बिक्री प्रभावित होती है।
  • सर्च विजिबिलिटी (Search visibility) – यदि Google अपना बजट फ़िल्टर पेजों पर खर्च करता है, तो उच्च-प्राथमिकता वाले प्रोडक्ट पेजों को शायद कभी क्रॉल ही न किया जाए, जिससे उनके रैंक करने की संभावना सीमित हो जाती है।

क्रॉल बजट को वापस पाने के लिए स्टेप-बाय-स्टेप गाइड

  1. हाई-वैल्यू फ़ैसेट्स की पहचान करें
    उन फ़िल्टर संयोजनों को खोजें जो वास्तविक सर्च ट्रैफिक जेनरेट करते हैं। उन URLs को एक साफ और वर्णनात्मक (descriptive) पाथ दें (जैसे, /end-mill/coating-tialn/)। हाई-वैल्यू पेजों को पूरी तरह से क्रॉलेबल और इंडेक्सेबल बनाए रखें।

  2. मीडियम-वैल्यू फ़ैसेट्स के लिए कैनोनिकल टैग्स (canonical tags) का उपयोग करें
    जब कोई फ़िल्टर उपयोगी हो लेकिन उसका सर्च वॉल्यूम कम हो, तो URL को सुलभ रहने दें लेकिन एक rel=canonical जोड़ें जो मुख्य कैटेगरी पेज की ओर इशारा करता हो। यह Google को बताता है कि कैटेगरी वाला पेज ही पसंदीदा वर्ज़न है।

  3. robots.txt के माध्यम से लो-वैल्यू फ़ैसेट्स को ब्लॉक करें
    robots.txt में उन पैटर्न्स को Disallow करें ताकि Googlebot उन्हें कभी रिक्वेस्ट न करे।

  4. एडवांस्ड फ़िल्टर्स को लिंक्स के बजाय बटन के रूप में रेंडर करें
    बॉट्स <a तत्वों का अनुसरण करते हैं लेकिन <button तत्वों को अनदेखा कर देते हैं। फ़िल्टर कंट्रोल को बटन के रूप में दें जो नए URL बनाए बिना JavaScript को ट्रिगर करें। उपयोगकर्ताओं को अभी भी वही UI मिलेगा जिसकी उन्हें आवश्यकता है, जबकि क्रॉलर बेकार URLs को नहीं खोज पाएगा।

  5. “noindex” ट्रैप से बचें
    30,000 फ़िल्टर URLs में noindex जोड़ने पर भी Google को पहले प्रत्येक पेज को डाउनलोड करना पड़ता है, और फिर उसे अनदेखा करने के निर्देश को पढ़ना पड़ता है। क्रॉल को पूरी तरह से रोकने के लिए robots.txt का उपयोग करें; केवल वही पेज सुलभ होने चाहिए जिन्हें आप इंडेक्स करना चाहते हैं।

सफलता को मापना

अपना ध्यान रैंकिंग से हटाकर इंडेक्सिंग स्पीड पर केंद्रित करें। बदलावों से पहले और बाद में यह ट्रैक करें कि एक नए जोड़े गए उत्पाद को Google के इंडेक्स में दिखने में कितना समय लगता है। 21 दिनों के अंतराल (lag) से घटकर 3 दिनों का अंतराल होना यह दर्शाता है कि रणनीति काम कर रही है।

काउंटर-पॉइंट: उपयोगिता बनाम क्रॉल दक्षता (usability versus crawl efficiency)

UI को बरकरार रखें—बटन उपयोगकर्ताओं को परिणामों को रिफाइन करने की अनुमति देते रहेंगे—जबकि अंतर्निहित (underlying) URLs को क्रॉलर के लिए अदृश्य रखें। यदि कोई विशेष फ़िल्टर नेविगेशन के लिए आवश्यक साबित होता है, तो उसे हाई-वैल्यू फ़ैसेट में बदल दें और उसे एक साफ, क्रॉलेबल URL दें।

आगे क्या देखें

  • Search Console क्रॉल स्टैट्स (crawl stats) – "Requests blocked by robots.txt" में कमी और प्रोडक्ट पेजों के लिए "Crawl depth" में वृद्धि देखने के लिए "Crawl Stats" रिपोर्ट की निगरानी करें।

मुख्य बात (Takeaway): फ़ैसेट्स को वर्गीकृत करें, कैनोनिकल टैग का उपयोग करें, लो-वैल्यू URLs को ब्लॉक करें, और लिंक्स को बटन से बदलें। बड़े ई-कॉमर्स साइट्स Googlebot को उन पेजों की ओर मोड़ सकते हैं जो महत्वपूर्ण हैं, जिससे खरीदार की कार्यक्षमता (functionality) से समझौता किए बिना इंडेक्सिंग के समय को हफ्तों से घटाकर दिनों में लाया जा सकता है।