Badacze AI odkryli skoordynowane działania sieci około 150 stron informacyjnych o niskim ruchu, mające na celu zalanie danych treningowych dużych modeli językowych (LLM) narracjami prokremlńskimi. Strony te, znane zbiorczo jako sieć Pravda, publikują około trzech milionów artykułów rocznie, a ich treści pojawiają się obecnie w zbiorze danych Common Crawl, który zasila wiele komercyjnych systemów AI.

Jak działa mechanizm rozpowszechniania dezinformacji

Sieć Pravda nie dąży do przyciągnięcia ludzkich czytelników. Zamiast tego każda strona publikuje powtarzalne artykuły, które powielają wąski zestaw argumentów. Poprzez nasycanie tekstów słowami kluczowymi, które są priorytetyzowane przez wyszukiwarki i roboty indeksujące, strony zwiększają szansę, że model AI napotka je podczas zbierania danych.

Działają tu dwa mechanizmy zatruwania:

  • Zatruwanie podczas wyszukiwania (retrieval-time poisoning) – Gdy asystent AI pobiera informacje na żywo z sieci, może wyświetlić artykuł z sieci Pravda obok wiarygodnych źródeł. Blokowanie znanych złośliwych domen może ograniczyć to narażenie.
  • Zatruwanie podczas trenowania (training-time poisoning) – Jeśli artykuły przenikną do masowych korpusów używanych do wstępnego trenowania modelu, fałszywe twierdzenia stają się częścią wewnętrznej wiedzy modelu. Usunięcie takich treści po fakcie jest znacznie trudniejsze.

Badacze odnaleźli już artykuły Pravda w Common Crawl, publicznym archiwum wykorzystywanym do trenowania wielu modeli AI. Oznacza to, że zatruwanie nie jest jedynie hipotezą; zmieniło ono już bazę wiedzy modeli, na których wielu użytkowników polega dzisiaj.

Dlaczego to ma znaczenie

Nie ufaj AI tylko dlatego, że twierdzi, iż „wiele źródeł się zgadza”. Jeśli budujesz narzędzia AI, używaj list blokowanych (blocklists) znanych stron dezinformacyjnych. Nie traktuj „liczby wzmianek” jako sposobu na mierzenie prawdy. Ilość nie równa się jakości. Weryfikuj wszystko, co mówi Ci AI, zwłaszcza jeśli wydaje się stronnicze.

Internet jest zbiorem treningowym dla naszej przyszłej technologii. Każdy, kto posiada stronę internetową, może próbować wpływać na stronniczość maszyn, na których polegamy.

Co programiści mogą zrobić już teraz

  • Utrzymywanie list blokowanych – Dodawaj znane domeny dezinformacyjne do filtrów indeksowania; lista blokowana powstrzymuje zarówno ekspozycję podczas wyszukiwania, jak i podczas trenowania.
  • Zrewidowanie heurystyk częstotliwości – Przestań utożsamiać liczbę wzmianek z prawdziwością. Twierdzenie powtórzone na dziesiątkach niskiej jakości stron może przeważać nad pojedynczym, rzetelnym źródłem w naiwnym modelu opartym na częstotliwości.
  • Stosowanie weryfikacji pochodzenia (provenance checks) – Śledź informacje aż do ich pierwotnego źródła. Jeśli łańcuch kończy się na stronie o znikomym ruchu i historii propagandowej, oznacz wynik do weryfikacji.
  • Wdrażanie oczyszczania danych po trenowaniu – Przeprowadzaj starannie dobrane audyty wyników modelu dotyczące tematów wrażliwych politycznie. Ludzcy recenzenci mogą wykryć systematyczną stronniczość, którą pomijają automatyczne filtry.

Kontrargumenty i wyzwania

Balansowanie między bezpieczeństwem a inkluzywnością pozostaje otwartym problemem.

Perspektywy

Sieć Pravda pokazuje, jak aktorzy państwowi mogą wykorzystywać otwarty internet jako broń do kształtowania kolejnej generacji AI.

Kluczowy wniosek: Integralność AI zależy od czystości danych, na których się uczy. Skoordynowany zalew stron o niskim ruchu, przepełnionych propagandą, może już teraz wprowadzać fałszywe informacje do modeli, którym ufamy. Programiści muszą traktować reputację źródła jako kwestię priorytetową, a nie dodatek, aby maszyny, które budujemy, nie stały się nieświadomymi tubami dla dezinformacji.