Я создал сайт, который хочет, чтобы его цитировали ИИ-ассистенты, и вместо того, чтобы гадать, я внедрил три широко рекомендуемых сигнала: запись в robots.txt, разрешающую доступ краулерам типа GPT, файл llms.txt со списком всех страниц и схему JSON-LD, описывающую контент. Протестировав каждый из них, я обнаружил, что только один может не сработать без предупреждения, а остальные делают не то, что заявляет большинство.

Почему эти три сигнала важны

Вебмастерам говорят, что ИИ-ориентированным краулерам нужно явное разрешение, что текстовый индекс «llms.txt» помогает большим языковым моделям (LLM) находить нужные фрагменты, а структурированные данные JSON-LD повышают шансы на цитирование. Обещание простое: добавьте эти файлы, и ваш сайт начнет появляться в ответах, генерируемых ИИ, привлекая трафик и повышая узнаваемость бренда.

1. Разрешение доступа ИИ-краулерам в robots.txt

Строка в robots.txt, упоминающая GPTBot (или любого другого ИИ-бота), — это всего лишь запрос. Если сеть доставки контента (CDN) или брандмауэр блокирует бота, запрос просто не доходит до сайта, и краулер вообще не может прочитать файл. Единственный надежный способ узнать, может ли бот получить к вам доступ, — проверить HTTP-код состояния для каждого крупного бота. Ответ 403 (forbidden) или 503 (service unavailable) означает, что вся остальная техническая настройка не имеет значения — нет бота, нет индексации, нет цитирования.

2. Файл llms.txt

Файл llms.txt — это просто список URL-адресов в формате Markdown, предназначенный для того, чтобы предоставить LLM чистую карту сайта, чтобы им не приходилось выводить навигацию только на основе HTML. На практике документация Google гласит, что этот файл игнорируется, и ни один крупный поисковик не обязался использовать его для целей цитирования. Его наличие почти ничего не стоит и может быть полезным для кастомных ИИ-агентов, но его не стоит рекламировать как кратчайший путь к увеличению цитирований ИИ.

3. Схема JSON-LD

JSON-LD внедряет структурированные данные — имена авторов, даты публикации, ID товаров — непосредственно в страницу. Многие маркетологи полагают, что добавление схемы заставит их страницы чаще появляться в ответах ИИ, но исследование 1885 страниц не выявило измеримого роста цитирований только за счет разметки схем. Настоящая ценность JSON-LD заключается в разрешении сущностей (entity resolution): она сообщает машине, что «Jane Doe» на одной странице — это та же самая «Jane Doe» на другой, предотвращая путаницу между людьми или продуктами с одинаковыми именами.

Реальное узкое место: индексация

Все три сигнала — это лишь техническая база; они работают только в том случае, если страница изначально проиндексирована. Страница, которая никогда не появляется в индексе, не может быть извлечена, сколько бы разрешений для краулеров или тегов схем вы ни добавили. Самый надежный индикатор здоровья индексации — отчет о покрытии (coverage report) в Google Search Console (или аналогичный инструмент для других поисковиков). Если страница отображается как «не проиндексирована», вам нужно исправить это, прежде чем беспокоиться о каких-либо специфических для ИИ сигналах.

Практический чек-лист

  1. Проверьте доступ краулеров — протестируйте HTTP-ответ для GPTBot, ClaudeBot или любого другого ИИ-краулера, который для вас важен. Этот шаг может завершиться ошибкой незаметно; блокировка не вызовет предупреждения в вашей аналитике.
  2. Подтвердите покрытие индекса — используйте Search Console, чтобы увидеть, какие страницы проиндексированы, какие исключены и почему. Сначала устраните любые «ошибки сканирования» или директивы «noindex».
  3. Настройте техническую базу — как только доступ и индексация будут в порядке, добавьте llms.txt и JSON-LD. Относитесь к ним как к помощникам, не требующим особого обслуживания, а не как к гарантиям цитирования.

Контраргумент

Некоторые вендоры по-прежнему продвигают генераторы llms.txt и плагины схем как инструменты для SEO-продвижения в эпоху ИИ. Собранные мною данные, а также официальная позиция крупнейших поисковых систем, позволяют предположить, что эти утверждения преувеличены. Эти инструменты не вредны, но они не должны быть центром стратегии получения цитат от ИИ.

На что обратить внимание дальше

Отслеживайте логи краулеров, следите за оповещениями в Search Console и периодически проверяйте свой JSON-LD с помощью инструментов валидации, чтобы поддерживать бесперебойную работу системы.

Вывод: Если вы хотите, чтобы ваш сайт цитировал ИИ, перестаньте относиться к llms.txt и схемам как к «волшебным билетам». Убедитесь, что боты действительно могут до вас достучаться и что ваши страницы проиндексированы; только тогда дополнительные файлы выполнят свою скромную вспомогательную роль.

Источник: оригинальный пост на dev.to