بازبینی یک کاتالوگ ابزار صنعتی با ۵,۰۰۰ SKU نشان داد که Googlebot آدرس‌های URL فیلتر سایت را سه بار در روز خزش می‌کند، در حالی که صفحات اصلی دسته‌بندی تنها یک بار در هر سه هفته بازدید می‌شوند. نتیجه چه بود؟ یک ماه طول کشید تا محصولات جدید در نتایج جستجو ظاهر شوند، زیرا خزشگر در URLهای کم‌ارزش گیر کرده بود.

جستجوی مبتنی بر فیلتر به خریداران اجازه می‌دهد نتایج را بر اساس جنس، اندازه، پوشش و سایر ویژگی‌ها محدود کنند. هر فیلتر یک پارامتر به URL اضافه می‌کند و با پنج بُعد مختلف، ترکیبات ممکن به ده‌ها هزار صفحه منحصربه‌فرد تبدیل می‌شوند. اکثر این صفحات تقریباً لیست محصولات یکسانی دارند، اما گوگل با هر کدام به عنوان یک URL مجزا برخورد می‌کند. از آنجایی که بودجه خزش گوگل (تعداد صفحاتی که در هر روز از یک سایت دریافت می‌کند) محدود است، گوگل ظرفیت‌های ارزشمند خود را صرف URLهایی می‌کند که ارزش کمی برای کاربران یا جستجو دارند.

ساختار URL سایت، ربات را به یک «تله خزش» (crawl trap) می‌کشاند که در آن بی‌وقفه لینک‌هایی را دنبال می‌کند که به صفحات تقریباً تکراری ختم می‌شوند.

آنچه در خطر است

  • سرعت ایندکس شدن – تأخیر در شناسایی باعث می‌شود موجودی کالاهای جدید هفته‌ها نامرئی بماند و به فروش آسیب برساند.
  • رؤیت‌پذیری در جستجو – اگر گوگل بودجه خود را صرف صفحات فیلتر کند، ممکن است صفحات محصولات با اولویت بالا هرگز خزش نشوند و شانس رتبه گرفتن آن‌ها محدود شود.

راهنمای گام‌به‌گام برای بازپس‌گیری بودجه خزش

  1. شناسایی فیلترهای باارزش
    ترکیب‌های فیلتری را که ترافیک جستجوی واقعی ایجاد می‌کنند، پیدا کنید. به آن URLها یک مسیر تمیز و توصیفی بدهید (مثلاً /end-mill/coating-tialn/). صفحات باارزش را کاملاً قابل خزش و ایندکس شدن نگه دارید.

  2. استفاده از تگ‌های کانونیکال برای فیلترهای باارزش متوسط
    زمانی که یک فیلتر مفید است اما حجم جستجوی کمی دارد، URL را قابل دسترس بگذارید اما یک rel=canonical اضافه کنید که به صفحه اصلی دسته‌بندی اشاره می‌کند. این کار به گوگل می‌گوید که آن دسته، نسخه اصلی و ترجیحی است.

  3. مسدود کردن فیلترهای کم‌ارزش از طریق robots.txt
    آن الگوها را در robots.txt غیرمجاز (Disallow) کنید تا Googlebot هرگز آن‌ها را درخواست نکند.

  4. نمایش فیلترهای پیشرفته به صورت دکمه، نه لینک
    ربات‌ها عناصر <a> را دنبال می‌کنند اما عناصر <button> را نادیده می‌گیرند. کنترل‌های فیلتر را به صورت دکمه ارائه دهید که بدون ایجاد URLهای جدید، جاوااسکریپت را اجرا کنند. کاربران همچنان رابط کاربری مورد نیاز خود را دریافت می‌کنند، در حالی که خزشگر نمی‌تواند URLهای بی‌فایده را کشف کند.

  5. اجتناب از تله noindex
    اضافه کردن noindex به ۳۰,۰۰۰ URL فیلتر، همچنان گوگل را مجبور می‌کند ابتدا هر صفحه را دانلود کند و سپس دستورالعمل نادیده گرفتن آن را بخواند. از robots.txt استفاده کنید تا خزش را به‌طور کامل متوقف کنید؛ فقط صفحاتی که قصد ایندکس کردن آن‌ها را دارید باید قابل دسترسی باشند.

اندازه‌گیری موفقیت

تمرکز را از رتبه‌بندی به سمت سرعت ایندکس شدن تغییر دهید. مدت زمانی را که طول می‌کشد تا یک محصول جدید اضافه شده در ایندکس گوگل ظاهر شود، قبل و بعد از تغییرات ردیابی کنید. تغییر از ۲۱ روز تأخیر به ۳ روز تأخیر نشان می‌دهد که استراتژی شما در حال کار است.

دیدگاه مقابل: قابلیت استفاده در مقابل کارایی خزش

رابط کاربری (UI) را دست‌نخورده نگه دارید — دکمه‌ها همچنان به کاربران اجازه می‌دهند نتایج را اصلاح کنند — در حالی که URLهای زیربنایی را برای خزشگر نامرئی نگه می‌دارید. اگر یک فیلتر خاص برای ناوبری ضروری است، آن را به یک فیلتر باارزش ارتقا دهید و یک URL تمیز و قابل خزش به آن اختصاص دهید.

مواردی که باید در ادامه زیر نظر بگیرید

  • آمار خزش در Search Console – گزارش "Crawl Stats" را برای کاهش در "Requests blocked by robots.txt" و افزایش در "Crawl depth" برای صفحات محصول زیر نظر بگیرید.

نکته کلیدی: فیلترها را طبقه‌بندی کنید، از تگ‌های کانونیکال استفاده کنید، URLهای کم‌ارزش را مسدود کنید و لینک‌ها را با دکمه‌ها جایگزین کنید. سایت‌های بزرگ تجارت الکترونیک می‌توانند Googlebot را به سمت صفحاتی که اهمیت دارند هدایت کنند و زمان ایندکس شدن را بدون قربانی کردن عملکرد کاربران، از هفته‌ها به روزها کاهش دهند.