AI araştırmacıları, yaklaşık 150 düşük trafikli haber sitesinden oluşan bir ağın, büyük dil modeli (LLM) eğitim verilerini Kremlin yanlısı anlatılarla doldurmak için koordineli bir çaba içinde olduğunu ortaya çıkardı. Topluca Pravda ağı olarak bilinen bu siteler, yılda yaklaşık üç milyon makale yayınlıyor ve içerikleri artık birçok ticari yapay zeka sistemine güç veren Common Crawl veri setinde yer alıyor.

Dezenformasyon boru hattı nasıl çalışır

Pravda ağı insan okuyucuları çekmeyi amaçlamıyor. Bunun yerine, her site belirli bir konu setini tekrarlayan yineleyici makaleler yayınlıyor. Siteler, metni arama motorlarının ve web tarayıcılarının önceliklendirdiği anahtar kelimelerle doldurarak, bir yapay zeka modelinin veri toplama sırasında bunlarla karşılaşma olasılığını artırıyor.

İki zehirleme mekanizması devrede:

  • Erişim zamanı zehirlemesi (Retrieval-time poisoning) – Bir yapay zeka asistanı web'den canlı bilgi çektiğinde, meşru kaynakların yanında bir Pravda makalesini de öne çıkarabilir. Bilinen kötü amaçlı alan adlarını engellemek bu maruziyeti azaltabilir.
  • Eğitim zamanı zehirlemesi (Training-time poisoning) – Eğer makaleler bir modeli önceden eğitmek için kullanılan ana veri kümesine (corpora) sızarsa, yanlış iddialar modelin dahili bilgisinin bir parçası haline gelir. Bu tür içerikleri olay gerçekleştikten sonra kaldırmak çok daha zordur.

Araştırmacılar, birçok yapay zeka modelini eğitmek için kullanılan halka açık bir arşiv olan Common Crawl içindeki Pravda makalelerini halihazırda takip ettiler. Bu, zehirlemenin varsayımsal olmadığı; bugün birçok kullanıcının güvendiği modellerin bilgi tabanını halihazırda değiştirdiği anlamına geliyor.

Neden önemli

Sırf "birçok kaynak hemfikir" dediği için yapay zekaya güvenmeyin. Yapay zeka araçları geliştiriyorsanız, bilinen dezenformasyon siteleri için engelleme listeleri kullanın. Doğruluğu ölçmek için "bahsedilme sayısı"nı bir yöntem olarak kullanmayın. Nicelik, nitelik demek değildir. Yapay zekanın size söylediği her şeyi, özellikle taraflı görünüyor ise doğrulayın.

İnternet, gelecekteki teknolojimizin eğitim setidir. Web sitesi olan herkes, güvendiğimiz makineleri manipüle etmeye çalışabilir.

Geliştiriciler şu an ne yapabilir

  • Engelleme listelerini güncel tutun – Bilinen dezenformasyon alan adlarını tarama filtrelerine ekleyin; bir engelleme listesi hem erişim zamanı hem de eğitim zamanı maruziyetini durdurur.
  • Frekans sezgisini (frequency heuristics) yeniden düşünün – Bahsedilme sayısını doğrulukla eşleştirmeyi bırakın. Onlarca düşük kaliteli site tarafından tekrarlanan bir iddia, saf bir frekans tabanlı modelde tek bir saygın kaynağın önüne geçebilir.
  • Menşei kontrolleri (provenance checks) uygulayın – Bilgiyi orijinal kaynağına kadar takip edin. Eğer zincir, ihmal edilebilir trafiğe ve propaganda geçmişine sahip bir sitede bitiyorsa, çıktıyı inceleme için işaretleyin.
  • Eğitim sonrası temizleme (post-training sanitization) uygulayın – Siyasi olarak hassas konulara değinen model çıktıları üzerinde küratörlü denetimler yapın. İnsan incelemeciler, otomatik filtrelerin gözden kaçırdığı sistematik yanlılıkları yakalayabilir.

Karşı görüşler ve zorluklar

Güvenlik ve kapsayıcılık arasında denge kurmak hala çözülmemiş bir sorundur.

Geleceğe bakış

Pravda ağı, devlet aktörlerinin yeni nesil yapay zekayı şekillendirmek için açık web'i nasıl silah olarak kullanabileceğini gösteriyor.

Özet: Yapay zekanın bütünlüğü, öğrendiği verilerin temizliğine bağlıdır. Düşük trafikli ve propaganda yüklü sitelerin koordineli bir şekilde akın etmesi, yanlış bilgileri halihazırda güvendiğimiz modellere yerleştirebilir. Geliştiriciler, inşa ettikleri makinelerin dezenformasyonun farkında olmayan sözcüleri haline gelmesini önlemek için kaynak itibarını bir sonradan akla gelen düşünce değil, birinci derecede bir öncelik olarak ele almalıdır.