Watafiti wa AI wamefichua jitihada zilizopangwa za mtandao wa takriban tovuti 150 za habari zenye trafiki ndogo ili kutosheleza data za mafunzo ya mifano mikubwa ya lugha (LLM) kwa simulizi zinazounga mkono Kremlin. Tovuti hizo, zinazojulikana kwa pamoja kama mtandao wa Pravda, hutoa takriban makala milioni tatu kwa mwaka, na maudhui yao sasa yanaonekana katika seti ya data ya Common Crawl inayowezesha mifumo mingi ya AI ya kibiashara.

Jinsi mfumo wa kusambaza habari za uongo unavyofanya kazi

Mtandao wa Pravda hauna lengo la kuvutia wasomaji wa binadamu. Badala yake, kila tovuti huchapisha makala zinazojirudia zinazojadili mada chache zilizopangwa. Kwa kujaza maandishi hayo kwa maneno muhimu (keywords) ambayo mitambo ya utafutaji na roboti za wavuti (web crawlers) huyaweka kipaumbele, tovuti hizo huongeza nafasi kwamba mfano wa AI utakutana nazo wakati wa ukusanyaji wa data.

Mbinu mbili za unajisi ziko kazini:

  • Unajisi wakati wa upatikanaji wa habari (Retrieval-time poisoning) – Wakati msaidizi wa AI unapata habari za hivi punde kutoka kwenye wavuti, unaweza kuonyesha makala ya Pravda pamoja na vyanzo halali. Kuzuia vikoa vinavyojulikana kuwa vya hatari kunaweza kupunguza uwezekano huu.
  • Unajisi wakati wa mafunzo (Training-time poisoning) – Ikiwa makala hizo zitaingia kwenye seti kubwa za maandishi (corpora) zinazotumiwa kufundisha mfano, madai ya uongo yanakuwa sehemu ya maarifa ya ndani ya mfano huo. Kuondoa maudhui kama hayo baada ya tukio ni vigumu zaidi.

Watafiti tayari wamebaini makala za Pravda ndani ya Common Crawl, kumbukumbu ya umma inayotumiwa kufundisha mifano mingi ya AI. Hiyo inamaanisha kuwa unajisi huo si wa kufikirika tu; tayari umebadilisha msingi wa maarifa wa mifano ambayo watumiaji wengi wanategemea leo.

Kwa nini ni muhimu

Usiamini AI kwa sababu tu inasema "vyanzo vingi vinakubaliana." Usipounda zana za AI, tumia orodha za kuzuia (blocklists) kwa tovuti zinazojulikana kwa kusambaza habari za uongo. Usitumie "idadi ya matamshi" kama njia ya kupima ukweli. Wingi haumaanishi ubora. Hakiki kila kitu ambacho AI inakuambia, hasa ikiwa inaonekana ina upendeleo.

Mtandao ni seti ya mafunzo kwa teknolojia yetu ya baadaye. Mtu yeyote mwenye tovuti anaweza kujaribu kuleta upendeleo kwenye mashine tunazozitegemea.

Hatua ambazo watengenezaji wanaweza kuchukua sasa

  • Dhibiti orodha za kuzuia (Maintain blocklists) – Ongeza vikoa vinavyojulikana kwa kusambaza habari za uongo kwenye vichujio vya ukusanyaji data; orodha ya kuzuia inazuia unajisi wakati wa upatikanaji na wakati wa mafunzo.
  • Fikiria upya kanuni za marudio (Rethink frequency heuristics) – Acha kulinganisha idadi ya matamishi na ukweli. Dai linalojirudia kwenye mamia ya tovuti zenye ubora mdogo linaweza kushinda chanzo kimoja kinachoaminika katika mfano wa kawaida unaotegemea marudio.
  • Tumia uhakiki wa asili ya habari (Apply provenance checks) – Fuatilia habari hadi kwenye chanzo chake cha asili. Ikiwa mnyororo unaishia kwenye tovuti yenye trafiki ndogo sana na historia ya propaganda, weka alama kwenye matokeo hayo kwa ajili ya uhakiki.
  • Tekeleza usafishaji baada ya mafunzo (Implement post-training sanitization) – Fanya ukaguzi wa makini kwenye matokeo ya modeli yanayohusu mada nyeti za kisiasa. Wakaguzi wa binadamu wanaweza kubaini upendeleo wa kimfumo ambao vichujio vya kiotomatiki vinashindwa kuupata.

Hoja za kinyume na changamoto

Kusawazisha usalama na ujumuishi bado ni tatizo ambalo halijatatuliwa.

Mtazamo wa baadaye

Mtandao wa Pravda unaonyesha jinsi wahusika wa serikali wanavyoweza kutumia mtandao wa wazi kama silaha ili kuunda kizazi kijacho cha AI.

Hitimisho: Uadilifu wa AI unategemea usafi wa data inayojifunza kutoka nayo. Mrundikano uliopangwa wa tovuti zenye propaganda na trafiki ndogo unaweza tayari kuingiza uongo kwenye mifano tunayoiamini. Watengenezaji lazima wachukulie sifa ya chanzo kama suala la kipaumbele, si jambo la ziada, ili kuzuia mashine tunazounda zisigeuke kuwa vyombo vya kusambaza habari za uongo bila kujijua.