من وب‌سایتی ساختم که می‌خواهد توسط دستیاران هوش مصنوعی نقل‌قول شود و به جای حدس و گمان، سه سیگنال که به‌طور گسترده توصیه می‌شوند را به کار گرفتم: یک ورودی در robots.txt که به خزنده‌هایی از نوع GPT اجازه ورود می‌دهد، یک فایل llms.txt که تمام صفحات را لیست می‌کند، و اسکیما JSON-LD که محتوا را توصیف می‌کند. پس از آزمایش هر کدام، متوجه شدم که تنها یکی از آن‌ها می‌تواند بدون هشدار با شکست مواجه شود و بقیه آن‌طور که اکثر مردم ادعا می‌کنند عمل نمی‌کنند.

چرا این سه سیگنال اهمیت دارند

به وب‌مسترها گفته شده است که خزنده‌های متمرکز بر هوش مصنوعی به اجازه صریح نیاز دارند، یک ایندکس متنی ساده‌ی "llms.txt" به مدل‌های زبانی بزرگ (LLMs) کمک می‌کند تا بخش‌های مرتبط را پیدا کنند، و داده‌های ساختاریافته JSON-LD شانس نقل‌قول شدن را افزایش می‌دهد. وعده ساده است: این فایل‌ها را اضافه کنید و سایت شما شروع به نمایش در پاسخ‌های تولید شده توسط هوش مصنوعی می‌کند که باعث افزایش ترافیک و دیده شدن برند می‌شود.

۱. اجازه دادن به خزنده‌های هوش مصنوعی در robots.txt

خط robots.txt که به GPTBot (یا هر بات هوش مصنوعی دیگری) اشاره می‌کند، صرفاً یک درخواست است. اگر یک شبکه توزیع محتوا (CDN) یا فایروال، بات را مسدود کند، درخواست هرگز به سایت نمی‌رسد و خزنده‌ نمی‌تواند اصلاً فایل را بخواند. تنها راه قابل اعتماد برای اینکه بفهمید آیا بات می‌تواند به شما دسترسی داشته باشد، بررسی کد وضعیت HTTP برای هر بات اصلی است. پاسخ ۴0۳ (ممنوع) یا ۵۰۳ (سرویس در دسترس نیست) به این معنی است که بقیه زیرساخت‌ها بی‌اثر هستند؛ بدون بات، خبری از ایندکس شدن و نقل‌قول نیست.

۲. فایل llms.txt

یک فایل llms.txt صرفاً فهرستی از URLها با فرمت مارک‌داون است که هدف آن ارائه یک نقشه تمیز از سایت به LLMهاست تا مجبور نباشند ناوبری را تنها از طریق HTML استنباط کنند. در عمل، مستندات گوگل می‌گوید که این فایل را نادیده می‌گیرد و هیچ موتور جستجوی بزرگی متعهد نشده است که از آن برای اهداف نقل‌قول استفاده کند. نگه داشتن آن تقریباً هیچ هزینه‌ای ندارد و می‌تواند برای عامل‌های (agents) هوش مصنوعی سفارشی مفید باشد، اما نباید به عنوان میان‌بری برای دریافت نقل‌قول‌های بیشتر از هوش مصنوعی تبلیغ شود.

۳. اسکیما JSON-LD

JSON-LD داده‌های ساختاریافته — مانند نام نویسنده، تاریخ انتشار، شناسه‌های محصول — را مستقیماً در صفحه قرار می‌دهد. بسیاری از بازاریابان تصور می‌کنند که افزودن اسکیما باعث می‌شود صفحات آن‌ها بیشتر در پاسخ‌های هوش مصنوعی ظاهر شوند، اما مطالعه‌ای روی ۱۸۸۵ صفحه، هیچ افزایش قابل اندازه‌گیری در نقل‌قول‌ها تنها از طریق نشانه‌گذاری اسکیما پیدا نکرد. ارزش واقعی JSON-LD در «حل موجودیت» (entity resolution) نهفته است: این کار به ماشین می‌گوید که «Jane Doe» در یک صفحه، همان «Jane Doe» در صفحه‌ای دیگر است و از سردرگمی بین افراد یا محصولات با نام‌های مشابه جلوگیری می‌کند.

گلوگاه واقعی: ایندکس شدن

هر سه سیگنال صرفاً زیرساخت هستند؛ آن‌ها تنها زمانی کار می‌کنند که صفحه در وهله اول ایندکس شده باشد. صفحه‌ای که هرگز در یک ایندکس ظاهر نشود، مهم نیست چقدر اجازه خزیدن یا تگ‌های اسکیما به آن اضافه کنید، قابل بازیابی نیست. قابل اعتمادترین نشانگر سلامت ایندکس شدن، گزارش پوشش (coverage report) در Google Search Console (یا ابزار مشابه برای سایر موتورها) است. اگر صفحه‌ای به عنوان «نیاز به ایندکس» یا «ایندکس نشده» نشان داده شود، باید قبل از نگرانی در مورد سیگنال‌های خاص هوش مصنوعی، آن را اصلاح کنید.

یک چک‌لیست کاربردی

  1. دسترسی خزنده‌ها را تأیید کنید – پاسخ HTTP را برای GPTBot، ClaudeBot یا هر خزنده‌ی هوش مصنوعی دیگری که برایتان مهم است، تست کنید. این مرحله می‌تواند بی‌صدا شکست بخورد؛ یک مسدودسازی، هشداری در تحلیل‌های (analytics) شما ایجاد نمی‌کند.
  2. پوشش ایندکس را تأیید کنید – از Search Console استفاده کنید تا ببینید کدام صفحات ایندکس شده‌اند، کدام‌ها حذف شده‌اند و چرا. ابتدا هرگونه «خطای خزیدن» (crawl errors) یا دستورات noindex را حل کنید.
  3. زیرساخت‌ها را اضافه کنید – وقتی دسترسی و ایندکس شدن تثبیت شد، llms.txt و JSON-LD را اضافه کنید. با آن‌ها به عنوان کمک‌کننده‌های کم‌هزینه برخورد کنید، نه تضمین‌کننده‌ی نقل‌قول.

دیدگاه مخالف

برخی از فروشندگان همچنان تولیدکننده‌های llms.txt و پلاگین‌های اسکیما را به عنوان تقویت‌کننده‌های SEO برای هوش مصنوعی بازاریابی می‌کنند. داده‌هایی که من جمع‌آوری کردم، به همراه موضع رسمی موتورهای جستجوی بزرگ، نشان می‌دهد که این ادعاها اغراق‌آمیز هستند. این ابزارها مضر نیستند، اما نباید هسته‌ی اصلی استراتژی نقل‌قول هوش مصنوعی باشند.

قدم‌های بعدی برای نظارت

لاگ‌های خزنده‌ها را نظارت کنید، مراقب هشدارهای Search Console باشید و به‌طور دوره‌ای JSON-LD خود را با ابزارهای اعتبارسنجی تست کنید تا جریان داده‌ها حفظ شود.

نتیجه‌گیری: اگر می‌خواهید سایت شما توسط هوش مصنوعی نقل‌قول شود، از برخورد با llms.txt و اسکیما به عنوان بلیط‌های جادویی خودداری کنید. مطمئن شوید که بات‌ها واقعاً می‌توانند به شما دسترسی داشته باشند و صفحات شما ایندکس شده‌اند؛ تنها در این صورت است که فایل‌های اضافی نقش کمکی و ساده‌ی خود را ایفا خواهند کرد.

منبع: پست اصلی در dev.to