طبق تحلیل سال ۲۰۲۶، ۴۴.۹٪ از ۱۰۷ وب‌سایت برتر، حداقل یک خزنده (crawler) هوش مصنوعی را مسدود می‌کنند. خطر تنها از دست دادن ترافیک نیست؛ بلکه احتمال ناپدید شدن از کانال‌های جدیدی است که کاربران امروزه اطلاعات خود را از آن‌ها دریافت می‌کنند.

دامنه مشکل

فایل robots.txt همواره فایل اصلی برای اطلاع‌رسانی به Googlebot و سایر خزنده‌های سنتی جستجو بوده تا بدانند کدام صفحات باید ایندکس شوند. اکنون فایل مشابهی خزنده‌های هوش مصنوعی را کنترل می‌کند—عوامل نرم‌افزاری که محتوای وب را برای تولید پاسخ در ابزارهایی مانند ChatGPT، Claude و Perplexity می‌خوانند. این مطالعه نشان داد که ۴۴.۹٪ از سایت‌های بررسی‌شده، عمداً دسترسی حداقل یکی از این ربات‌ها را منع کرده‌اند. GPTBot، خزنده مورد استفاده مدل‌های OpenAI، در صدر لیست عوامل مسدودشده قرار دارد.

بخش غافلگیرکننده‌ای از این مسدودسازی‌ها ناشی از تنظیمات تک‌کلیکی در سرویس‌هایی مانند Cloudflare است، جایی که مالکان سایت ممکن است در تلاش برای افزایش امنیت، به‌طور ناخواسته دسترسی هوش مصنوعی را قطع کنند.

معنای واقعی «قابلیت خزیدن هوش مصنوعی» (AI crawlability) چیست

قابلیت خزیدن (Crawlability) به معنای توانایی یک ربات برای واکشی (fetch) یک صفحه است. برای هوش مصنوعی، این قابلیت تعیین می‌کند که آیا یک مدل می‌تواند هنگام پرسش کاربر، آخرین حقایق مربوط به یک برند، محصول یا خدمت را استخراج کند یا خیر. اگر سایتی قابلیت خزیدن نداشته باشد، هوش مصنوعی منبعی برای ارجاع دادن نخواهد داشت و برند از فید پاسخ‌ها ناپدید می‌شود.

استراتژی‌های قدیمی SEO بر خزیدن صفحات توسط Googlebot تمرکز داشتند تا بتوانند در فهرستی از لینک‌ها رتبه بگیرند. اما قابلیت خزیدن هوش مصنوعی هدف را تغییر می‌دهد: به جای رتبه‌بندی، نتیجه نهایی یک «پیشنهاد» در دل یک پاسخ گفتگومحور است.

ربات‌های آموزشی در مقابل ربات‌های پاسخ‌گو

همه خزنده‌های هوش مصنوعی هدف یکسانی ندارند.

  1. ربات‌های آموزشی (Training bots) – از جمله نمونه‌ها می‌توان به GPTBot، ClaudeBot و Google-Extended اشاره کرد. آن‌ها بخش‌های وسیعی از وب را برای تغذیه مجموعه‌داده‌های عظیمی که مدل‌های زبانی زیربنایی را قدرت می‌بخشند، استخراج (scrape) می‌کنند. مالکان سایت می‌توانند در صورت تمایل به دور نگه داشتن محتوای اختصاصی خود از آموزش مدل‌های آینده، این ربات‌ها را مسدود کنند.
  2. ربات‌های پاسخ‌گو (Answer bots) – از جمله نمونه‌ها می‌توان به OAI-SearchBot، Claude-SearchBot و PerplexityBot اشاره کرد. این ربات‌ها به‌صورت آنی (real time) عمل کرده و قطعات مشخصی از اطلاعات را برای پاسخ به پرسش کاربر استخراج می‌کنند. مسدود کردن یک ربات پاسخ‌گو به این معناست که محتوای سایت هرگز در یک پاسخ گفتگومحور ظاهر نخواهد شد، حتی اگر همان صفحه همچنان توسط موتورهای جستجوی سنتی ایندکس شده باشد.

این تحلیل نشان می‌دهد که بسیاری از سایت‌ها این دو را با هم اشتباه می‌گیرند و در نهایت به یک قانون کلی «مسدودسازی همه هوش مصنوعی‌ها» روی می‌آورند که بدون محافظت از مالکیت معنوی (IP) واقعی، باعث آسیب به دیده شدن (visibility) سایت می‌شود.

چرا ربات‌های اشتباه مسدود می‌شوند

چند عامل این پیکربندی اشتباه را توضیح می‌دهند:

  • تنظیمات پیش‌فرض امنیتی – پلتفرم‌هایی که یک گزینه تک‌کلیکی «مسدودسازی هوش مصنوعی» ارائه می‌دهند، اغلب آن را برای هر خزنده شناخته‌شده‌ای اعمال می‌کنند، از جمله ربات‌های پاسخ‌گویی که سایت در واقع تمایل دارد به آن‌ها دسترسی داشته باشد.
  • عدم آگاهی – اکثر مدیران وب با robots.txt برای Googlebot آشنا هستند، اما دستورالعمل‌های جدیدتر و مخصوص هوش مصنوعی کمتر شناخته شده‌اند.
  • ترس از سوءاستفاده از داده‌ها – مالکان نگران هستند که ربات‌های آموزشی محتوای آن‌ها را در مدل‌های آینده ادغام کنند؛ این یک نگرانی مشروع است، اما در مورد ربات‌های پاسخ‌گو که فقط داده‌ها را در صورت درخواست واکشی می‌کنند، صدق نمی‌کند.

چگونه تعادل مناسب را برقرار کنیم

  1. ویرایش robots.txt – به‌طور صریح به ربات‌های پاسخ‌گویی که می‌خواهید به آن‌ها دسترسی داشته باشید، اجازه دهید. خطی مانند User-agent: OAI-SearchBot\nAllow: / به ربات پاسخ‌گوی OpenAI اجازه می‌دهد کل سایت را بررسی کند، در حالی که سایر عوامل همچنان مسدود باقی می‌مانند.
  2. تصمیم‌گیری درباره داده‌های آموزشی – اگر محافظت از مطالب اختصاصی یک اولویت است، قانون Disallow را برای GPTBot، ClaudeBot و عوامل آموزشی مشابه حفظ کنید.
  3. به‌کارگیری llms.txt – این استاندارد نوظهور به ناشران اجازه می‌دهد مهم‌ترین صفحات را برای مصرف هوش مصنوعی مشخص کنند و فرآیند کشف توسط ربات‌های پاسخ‌گو را سرعت ببخشند.
  4. بازبینی تنظیمات شخص ثالث – هرگونه پیکربندی امنیتی یا CDN را که ممکن است خزنده‌های هوش مصنوعی را به‌طور خودکار مسدود کرده باشد، بررسی کرده و قوانین را به‌صورت دستی تنظیم کنید.

موازنه‌ای که باید در نظر بگیرید

اجازه دادن به ربات‌های پاسخ‌گو، میزان مواجهه با برند را در گفتگوهای مبتنی بر هوش مصنوعی بهبود می‌بخشد، اما این بدان معناست که محتوا می‌تواند عیناً در پاسخ‌های رو به کاربر بازتولید شود. مسدود کردن ربات‌های آموزشی از ورود داده‌ها به وزن‌های مدل‌های آینده جلوگیری می‌کند، اما مانع از آن نمی‌شود که ربات‌های پاسخ‌گو همان صفحات عمومی را استخراج کنند.

اگر ارزش اصلی یک شرکت، کنترل دقیق بر مالکیت معنوی (IP) خود باشد، مسدودسازی شدیدتر ممکن است توجیه‌پذیر باشد، اما هزینه آن کاهش حضور در کانال‌هایی است که امروزه بسیاری از کاربران تحقیقات خود را از آن‌ها شروع می‌کنند. برعکس، یک سایت تجارت الکترونیک که بر پایه کشف محصول شکوفا می‌شود، احتمالاً از قابلیت خزیدن هوش مصنوعی بیشتر از ریسک ناچیزِ نقل‌قول شدن چند قطعه از محتوای خود سود خواهد برد.

آنچه در آینده باید زیر نظر داشت

  • پذیرش llms.txt – با افزایش محبوبیت این استاندارد، ابزارهایی که آن را تجزیه می‌کنند، می‌توانند به روش اصلی بات‌های پاسخ‌دهنده هوش مصنوعی برای یافتن محتوای باارزش تبدیل شوند.
  • تغییر سیاست‌های ارائه‌دهندگان هوش مصنوعی – OpenAI، Anthropic و سایرین ممکن است سیاست‌های خزنده (crawler) خود را اصلاح کنند و احتمالاً مکانیسم‌های انتخاب (opt-in) دقیق‌تری را ارائه دهند.
  • راهنمایی‌های حقوقی در مورد داده‌های آموزشی هوش مصنوعی – بحث‌های جاری در مورد اینکه آیا محتوای عمومی استخراج‌شده (scraped) می‌تواند برای آموزش مدل‌ها استفاده شود یا خیر، می‌تواند بر تعداد سایت‌هایی که تصمیم می‌گیرند بات‌های آموزشی را به‌طور کامل مسدود کنند، تأثیر بگذارد.

خلاصه کلام: اگر برندی می‌خواهد در جایی که کاربران به‌جای تایپ کلمات کلیدی، به‌طور فزاینده‌ای سوال می‌پرسند، قابل مشاهده باقی بماند، باید سایت خود را برای خزش توسط هوش مصنوعی (AI-crawlable) آماده کند. اولین قدم، یک ویرایش ساده در robots.txt است؛ قدم دوم، تصمیم‌گیری شفاف در مورد داده‌هایی است که مایل است با نسل بعدی جستجو به اشتراک بگذارد. نادیده گرفتن تفاوت بین بات‌های آموزشی و بات‌های پاسخ‌دهنده می‌تواند یک شرکت را در همان فضایی که در حال بازتعریف نحوه یافتن اطلاعات است، نامرئی سازد.