Дослідники ШІ виявили скоординовані зусилля мережі з приблизно 150 малотрафікових новинних сайтів з метою наповнення навчальних даних великих мовних моделей (LLM) прокремлівськими наративами. Ці сайти, відомі під спільною назвою Pravda network, публікують приблизно три мільйони статей на рік, і їхній контент тепер з'являється в наборі даних Common Crawl, на якому базуються багато комерційних систем ШІ.

Як працює конвеєр дезінформації

Pravda network не має на меті залучати людську аудиторію. Натомість кожен сайт публікує однотипні статті, що повторюють вузький набір тез. Наповнюючи текст ключовими словами, які надають пріоритет пошукові системи та веб-краулери, ці сайти підвищують шанси на те, що модель ШІ натрапить на них під час збору даних.

Діють два механізми «отруєння»:

  • Отруєння під час пошуку (Retrieval-time poisoning) – Коли ШІ-асистент отримує актуальну інформацію з вебу, він може видати статтю Pravda поряд із легітимними джерелами. Блокування відомих шкідливих доменів може обмежити таку появу.
  • Отруєння під час навчання (Training-time poisoning) – Якщо статті потрапляють до масивів даних, що використовуються для попереднього навчання моделі, неправдиві твердження стають частиною внутрішніх знань моделі. Видалити такий контент вже після завершення процесу набагато складніше.

Дослідники вже виявили статті Pravda в Common Crawl — публічному архіві, який використовується для навчання багатьох моделей ШІ. Це означає, що «отруєння» не є гіпотетичним; воно вже змінило базу знань моделей, на які сьогодні покладаються багато користувачів.

Чому це важливо

Не довіряйте ШІ лише тому, що він каже: «багато джерел погоджуються». Якщо ви розробляєте інструменти ШІ, використовуйте списки блокування (blocklists) для відомих сайтів дезінформації. Не використовуйте «кількість згадок» як спосіб визначення істини. Кількість не дорівнює якості. Перевіряйте все, що каже вам ШІ, особливо якщо це здається упередженим.

Інтернет є навчальним набором для наших технологій майбутнього. Будь-хто, хто має вебсайт, може спробувати внести упередженість у машини, на які ми покладаємося.

Що розробники можуть зробити вже зараз

  • Підтримуйте списки блокування – Додавайте відомі домени дезінформації до фільтрів сканування; список блокування запобігає впливу як під час пошуку, так і під час навчання.
  • Перегляньте евристику частотності – Припиніть прирівнювати кількість згадок до правдивості. Твердження, що повторюється на десятках низькоякісних сайтів, може «переголосувати» одне авторитетне джерело в наївній моделі, що базується на частотності.
  • Застосовуйте перевірку походження (provenance checks) – Відстежуйте інформацію до її першоджерела. Якщо ланцюжок закінчується сайтом із мізерним трафіком та історією пропаганди, позначте результат для перевірки.
  • Впроваджуйте очищення після навчання (post-training sanitization) – Проводьте спеціалізовані аудити результатів роботи моделі, що стосуються політично чутливих тем. Люди-рецензенти можуть виявити систематичну упередженість, яку пропускають автоматизовані фільтри.

Контраргументи та виклики

Балансування між безпекою та інклюзивністю залишається відкритим питанням.

Погляд у майбутнє

Мережа Pravda демонструє, як державні суб'єкти можуть перетворити відкритий веб на зброю для формування наступного покоління ШІ.

Висновок: Цілісність ШІ залежить від чистоти даних, на яких він навчається. Скоординований наплив малотрафікових сайтів, насичених пропагандою, вже може впроваджувати неправду в моделі, яким ми довіряємо. Розробники повинні ставитися до репутації джерел як до пріоритетного завдання, а не як до другорядного аспекту, щоб машини, які ми створюємо, не стали мимовільними рупорами дезінформації.