Исследователи ИИ обнаружили скоординированные усилия сети из примерно 150 малопосещаемых новостных сайтов по наполнению обучающих данных больших языковых моделей (LLM) прокремлевскими нарративами. Эти сайты, известные под общим названием «сеть Правда» (Pravda network), публикуют около трех миллионов статей в год, и их контент теперь появляется в наборе данных Common Crawl, на котором работают многие коммерческие системы ИИ.

Как работает конвейер дезинформации

Сеть «Правда» не стремится привлечь человеческую аудиторию. Вместо этого каждый сайт публикует однотипные статьи, повторяющие узкий набор тезисов. Наполняя текст ключевыми словами, которым отдают приоритет поисковые системы и веб-краулеры, сайты повышают вероятность того, что модель ИИ столкнется с ними в процессе сбора данных.

Задействованы два механизма «отравления»:

  • Отравление на этапе поиска (Retrieval-time poisoning) — когда ИИ-ассистент извлекает актуальную информацию из сети, он может выдать статью из сети «Правда» наряду с легитимными источниками. Блокировка известных вредоносных доменов может ограничить такое воздействие.
  • Отравление на этапе обучения (Training-time poisoning) — если статьи попадают в основные корпуса текстов, используемые для предварительного обучения модели, ложные утверждения становятся частью внутренних знаний модели. Удалить такой контент постфактум гораздо сложнее.

Исследователи уже обнаружили статьи сети «Правда» в Common Crawl — публичном архиве, используемом для обучения многих моделей ИИ. Это означает, что «отравление» не является гипотетическим; оно уже изменило базу знаний моделей, на которые сегодня полагаются многие пользователи.

Почему это важно

Не доверяйте ИИ только потому, что он говорит: «многие источники согласны». Если вы создаете инструменты ИИ, используйте черные списки известных сайтов дезинформации. Не используйте «количество упоминаний» как способ измерения истины. Количество не равно качеству. Проверяйте всё, что говорит вам ИИ, особенно если информация кажется предвзятой.

Интернет — это обучающая выборка для наших технологий будущего. Любой, у кого есть веб-сайт, может попытаться внести предвзятость в машины, на которые мы полагаемся.

Что разработчики могут сделать прямо сейчас

  • Поддерживайте черные списки — добавляйте известные домены дезинформации в фильтры краулеров; черный список предотвращает воздействие как на этапе поиска, так и на этапе обучения.
  • Пересмотрите эвристику частотности — перестаньте приравнивать количество упоминаний к достоверности. Утверждение, повторенное на десятках низкокачественных сайтов, может «перевесить» единственный авторитетный источник в наивной модели, основанной на частотности.
  • Применяйте проверку происхождения (provenance checks) — отслеживайте информацию до ее первоисточника. Если цепочка заканчивается сайтом с ничтожно малым трафиком и историей пропаганды, помечайте такой результат для проверки.
  • Внедряйте очистку после обучения (post-training sanitization) — проводите курируемые аудиты ответов модели, касающихся политически чувствительных тем. Человеческие рецензенты могут выявить систематическую предвзятость, которую пропускают автоматизированные фильтры.

Контраргументы и сложности

Баланс между безопасностью и инклюзивностью остается открытым вопросом.

Взгляд в будущее

Сеть «Правда» показывает, как государственные субъекты могут использовать открытый интернет в качестве оружия для формирования следующего поколения ИИ.

Итог: Целостность ИИ зависит от чистоты данных, на которых он обучается. Скоординированный поток малопосещаемых сайтов, наполненных пропагандой, уже способен внедрять ложь в модели, которым мы доверяем. Разработчики должны рассматривать репутацию источников как приоритетную задачу, а не как второстепенный вопрос, чтобы создаваемые нами машины не становились невольными рупорами дезинформации.