کلودفلر (Cloudflare) از سپتامبر، خزنده‌های عامل هوش مصنوعی را به‌صورت پیش‌فرض مسدود می‌کند

عصر استخراج بی‌قید و شرط داده‌ها از وب توسط هوش مصنوعی رو به پایان است. از ۱۵ سپتامبر، Cloudflare تغییر سیاست بزرگی را اعمال خواهد کرد که بر اساس آن، خزنده‌های عامل هوش مصنوعی (AI agent crawlers) به‌صورت پیش‌فرض مسدود می‌شوند و این امر، عصر جدیدی از دسترسی به داده‌ها بر پایه اجازه (permission-based) را تحمیل می‌کند.

گذار از استخراج غیرفعال به اجازه فعال

سال‌هاست که مدل‌های هوش مصنوعی و عوامل خودگردان (autonomous agents) با پیمایش در وبِ آزاد و استخراج داده‌ها برای ارائه پاسخ‌های آنی به کاربران فعالیت می‌کنند. با این حال، اعلامیه اخیر Cloudflare نشان‌دهنده یک چرخش قابل‌توجه در نحوه برخورد زیرساخت‌های وب با این ربات‌های «عاملی» (agentic) است. برخلاف خزنده‌های سنتی موتورهای جستجو که صفحات را برای بازیابی ایندکس می‌کنند، خزنده‌های عامل هوش مصنوعی محتوا را به‌صورت آنی دریافت می‌کنند تا وظایف خاصی را انجام دهند یا به پرس‌وجوهای پیچیده از طرف کاربر پاسخ دهند.

از ۱۵ سپتامبر به بعد، بخش قابل‌توجهی از وب که توسط Cloudflare محافظت می‌شود، به‌طور خودکار این عوامل را محدود خواهد کرد. این اقدام با هدف دادن کنترل بیشتر به صاحبان وب‌سایت‌ها و ناشران بر نحوه جذب داده‌های اختصاصی و محتوای خلاقانه آن‌ها توسط مدل‌های زبانی بزرگ (LLMs) و عوامل خودگردان طراحی شده است. وب به‌جای اینکه یک فضای «بی‌قید و بند» باشد، در حال گذار به سمت یک مدل محدودشده (gated model) است که در آن ربات‌ها باید صراحتاً درخواست دسترسی کنند.

توسعه‌دهندگان و صاحبان سایت چگونه می‌توانند اجازه دسترسی صادر کنند

اگرچه تنظیمات پیش‌فرض محدودکننده است، اما هدف Cloudflare از کار کردن، از کار انداختن ابزارهای مفید هوش مصنوعی نیست. در عوض، هدف ایجاد یک تعامل ساختاریافته (handshake) بین خزنده و میزبان است. برای توسعه‌دهندگان و مدیران سایت، این به معنای فاصله گرفتن از ذهنیت «همه چیز را استخراج کن» و حرکت به سمت یک رویکرد مدیریت‌شده است.

برای اطمینان از اینکه عوامل هوش مصنوعی مشروع و باارزش همچنان می‌توانند به بخش‌های خاصی از یک وب‌سایت دسترسی داشته باشند، مالکان باید مجوزهای مشخصی را اعمال کنند. این امر به کسب‌وکارها اجازه می‌دهد تا تعیین کنند کدام عوامل هوش مصنوعی — مانند عوامل مبتنی بر OpenAI، Anthropic یا Google — می‌توانند محتوای آن‌ها را بخوانند و احتمالاً تحت چه شرایطی. برای چشم‌انداز گسترده‌تر هوش مصنوعی، این موضوع مستلزم روشی پیچیده‌تر برای توسعه‌دهندگان عوامل است تا خود را معرفی کرده و مشروعیت خود را به سرورهای وب ثابت کنند.

چرا این موضوع برای اکوسیستم هوش مصنوعی اهمیت دارد

این تحول نشان‌دهنده یک نقطه عطف حیاتی برای تولیدکنندگان محتوا و شرکت‌های هوش مصنوعی است. برای ناشران، این یک مکانیسم دفاعی بسیار مورد نیاز در برابر «خستگی از استخراج داده‌ها» (data scraping fatigue) فراهم می‌کند؛ وضعیتی که در آن از محتوا برای آموزش مدل‌هایی استفاده می‌شود که ممکن است در نهایت با تولیدکنندگان اصلی رقابت کنند. ناشران با بازپس‌گیری کنترل، می‌توانند از مالکیت معنوی خود محافظت کنند و به‌طور بالقوه مدل‌های درآمدزایی جدیدی را برای دسترسی هوش مصنوعی بررسی کنند.

برای توسعه‌دهندگان هوش مصنوعی و بنیان‌گذارانی که جریان‌های کاری عاملی (agentic workflows) می‌سازند، این تغییر لایه جدیدی از پیچیدگی را معرفی می‌کند. عوامل دیگر نمی‌توانند بر این فرض تکیه کنند که تمام HTMLهای عمومی در دسترس هستند. تضمین آینده برای عوامل هوش مصنوعی مستلزم آن است که آن‌ها «آگاه از انطباق» (compliance-aware) باشند، یعنی قادر به پیمایش لایه‌های مجوز و احترام به پروتکل‌های جدید ایجاد شده توسط ارائه‌دهندگان بزرگ زیرساخت مانند Cloudflare باشند.

نکات کلیدی

  • مسدودسازی پیش‌فرض: از ۱۵ سپتامبر، Cloudflare به‌طور خودکار خزنده‌های عامل هوش مصنوعی را در سایت‌های محافظت‌شده مسدود می‌کند، مگر اینکه اجازه صریح صادر شده باشد.
  • کنترل برای ناشران: این اقدام قدرت را به صاحبان وب‌سایت بازمی‌گرداند و به آن‌ها اجازه می‌دهد تصمیم بگیرند کدام موجودیت‌های هوش مصنوعی خاص می‌توانند داده‌های آنی آن‌ها را جذب کنند.
  • استاندارد جدید برای عوامل: توسعه‌دهندگان هوش مصنوعی باید عوامل خود را به‌گونه‌ای تطبیق دهند که نسبت به مجوزهای وب محترمانه‌تر عمل کنند و به سمت یک مدل خزیدن ساختاریافته و مبتنی بر اجازه حرکت کنند.