بازبینی یک کاتالوگ ابزار صنعتی با ۵,۰۰۰ SKU نشان داد که Googlebot آدرسهای URL فیلتر سایت را سه بار در روز خزش میکند، در حالی که صفحات اصلی دستهبندی تنها یک بار در هر سه هفته بازدید میشوند. نتیجه چه بود؟ یک ماه طول کشید تا محصولات جدید در نتایج جستجو ظاهر شوند، زیرا خزشگر در URLهای کمارزش گیر کرده بود.
چرا جستجوی مبتنی بر فیلتر (Faceted Search) به بودجه خزش آسیب میزند
جستجوی مبتنی بر فیلتر به خریداران اجازه میدهد نتایج را بر اساس جنس، اندازه، پوشش و سایر ویژگیها محدود کنند. هر فیلتر یک پارامتر به URL اضافه میکند و با پنج بُعد مختلف، ترکیبات ممکن به دهها هزار صفحه منحصربهفرد تبدیل میشوند. اکثر این صفحات تقریباً لیست محصولات یکسانی دارند، اما گوگل با هر کدام به عنوان یک URL مجزا برخورد میکند. از آنجایی که بودجه خزش گوگل (تعداد صفحاتی که در هر روز از یک سایت دریافت میکند) محدود است، گوگل ظرفیتهای ارزشمند خود را صرف URLهایی میکند که ارزش کمی برای کاربران یا جستجو دارند.
ساختار URL سایت، ربات را به یک «تله خزش» (crawl trap) میکشاند که در آن بیوقفه لینکهایی را دنبال میکند که به صفحات تقریباً تکراری ختم میشوند.
آنچه در خطر است
- سرعت ایندکس شدن – تأخیر در شناسایی باعث میشود موجودی کالاهای جدید هفتهها نامرئی بماند و به فروش آسیب برساند.
- رؤیتپذیری در جستجو – اگر گوگل بودجه خود را صرف صفحات فیلتر کند، ممکن است صفحات محصولات با اولویت بالا هرگز خزش نشوند و شانس رتبه گرفتن آنها محدود شود.
راهنمای گامبهگام برای بازپسگیری بودجه خزش
شناسایی فیلترهای باارزش
ترکیبهای فیلتری را که ترافیک جستجوی واقعی ایجاد میکنند، پیدا کنید. به آن URLها یک مسیر تمیز و توصیفی بدهید (مثلاً/end-mill/coating-tialn/). صفحات باارزش را کاملاً قابل خزش و ایندکس شدن نگه دارید.استفاده از تگهای کانونیکال برای فیلترهای باارزش متوسط
زمانی که یک فیلتر مفید است اما حجم جستجوی کمی دارد، URL را قابل دسترس بگذارید اما یکrel=canonicalاضافه کنید که به صفحه اصلی دستهبندی اشاره میکند. این کار به گوگل میگوید که آن دسته، نسخه اصلی و ترجیحی است.مسدود کردن فیلترهای کمارزش از طریق robots.txt
آن الگوها را درrobots.txtغیرمجاز (Disallow) کنید تا Googlebot هرگز آنها را درخواست نکند.نمایش فیلترهای پیشرفته به صورت دکمه، نه لینک
رباتها عناصر<a>را دنبال میکنند اما عناصر<button>را نادیده میگیرند. کنترلهای فیلتر را به صورت دکمه ارائه دهید که بدون ایجاد URLهای جدید، جاوااسکریپت را اجرا کنند. کاربران همچنان رابط کاربری مورد نیاز خود را دریافت میکنند، در حالی که خزشگر نمیتواند URLهای بیفایده را کشف کند.اجتناب از تله noindex
اضافه کردنnoindexبه ۳۰,۰۰۰ URL فیلتر، همچنان گوگل را مجبور میکند ابتدا هر صفحه را دانلود کند و سپس دستورالعمل نادیده گرفتن آن را بخواند. ازrobots.txtاستفاده کنید تا خزش را بهطور کامل متوقف کنید؛ فقط صفحاتی که قصد ایندکس کردن آنها را دارید باید قابل دسترسی باشند.
اندازهگیری موفقیت
تمرکز را از رتبهبندی به سمت سرعت ایندکس شدن تغییر دهید. مدت زمانی را که طول میکشد تا یک محصول جدید اضافه شده در ایندکس گوگل ظاهر شود، قبل و بعد از تغییرات ردیابی کنید. تغییر از ۲۱ روز تأخیر به ۳ روز تأخیر نشان میدهد که استراتژی شما در حال کار است.
دیدگاه مقابل: قابلیت استفاده در مقابل کارایی خزش
رابط کاربری (UI) را دستنخورده نگه دارید — دکمهها همچنان به کاربران اجازه میدهند نتایج را اصلاح کنند — در حالی که URLهای زیربنایی را برای خزشگر نامرئی نگه میدارید. اگر یک فیلتر خاص برای ناوبری ضروری است، آن را به یک فیلتر باارزش ارتقا دهید و یک URL تمیز و قابل خزش به آن اختصاص دهید.
مواردی که باید در ادامه زیر نظر بگیرید
- آمار خزش در Search Console – گزارش "Crawl Stats" را برای کاهش در "Requests blocked by robots.txt" و افزایش در "Crawl depth" برای صفحات محصول زیر نظر بگیرید.
نکته کلیدی: فیلترها را طبقهبندی کنید، از تگهای کانونیکال استفاده کنید، URLهای کمارزش را مسدود کنید و لینکها را با دکمهها جایگزین کنید. سایتهای بزرگ تجارت الکترونیک میتوانند Googlebot را به سمت صفحاتی که اهمیت دارند هدایت کنند و زمان ایندکس شدن را بدون قربانی کردن عملکرد کاربران، از هفتهها به روزها کاهش دهند.
