Matt Shumer aliketi mbele ya kompyuta yake na kumpa wakala wake wa AI maelekezo rahisi: safisha faili. Alikuwa amekuwa akifanya utaratibu huu mamia ya mara bila tatizo lolote. Wakati huu, hitilafu ya utambuzi wa njia (path resolution error) iligeuza kazi ya kawaida ya usafi kuwa janga kubwa. Miaka ya kodi, nyaraka, na picha ilipotea kwa sekunde chache.
Hii si hatari ya kufikirika tu. Ilitokea kwa mwanaloji halisi akiwa na mashine halisi, na wakala husika alikuwa na rekodi ambayo ilionekana kuwa imara kabisa hadi wakati ule alipofeli. Wakala wa AI wanaoweza kuandika faili, kutekeleza amri za terminal, na kuzalisha wakala wadogo (subagents) sasa wameingizwa kwenye IDEs, mifumo ya mazungumzo, na mifumo ya otomatiki. Wanaaminika kupata ufikiaji wa moja kwa moja kwenye mifumo ya uendeshaji, na uaminifu huo ndio mahali ambapo hatari ilipo. Aina zilezile za makosa zilizoharibu mashine ya Shumer zipo katika kila wakala mwenye ufikiaji wa zana. Kuelewa kwa nini wanafeli, na jinsi ya kuwazuia vizuri, sasa ni ujuzi wa msingi wa kuishi kwa yeyote anayetumia zana hizi.
Wakati Ulinganishaji wa Mifumo Unapokutana na Mfumo wa Faili
Wakala wa AI hawafikiri. Wao hulinganisha mifumo (patterns). Unaposema “safisha faili,” modeli hutafuta katika kumbukumbu yake ya mafunzo maelfu ya mwingiliano kama huo na kuzalisha amri ambayo kistatistiki inafanana na mfumo huo. Ikiwa maelekezo ni kufuta faili za muda katika diraka ya ujenzi (build directory), inaweza kuzalisha amri kama rm -rf /tmp/build-cache/*. Inaonekana kuwa na mantiki kwa sababu inafanana na kila amri nyingine ya usafi ambayo modeli hiyo imewahi kuiona.
Lakini nini hutokea wakati kigezo kama $HOME kinashindwa kutambuliwa? Binadamu huona herufi tupu au njia isiyotarajiwa, anasita, na kuuliza maswali. Wakala huona kuwa mfumo bado unaendana na ule na anabonyeza enter. Katika kesi ya Shumer, amri ambayo ilipaswa kupunguza folda maalum badala yake ililenga mzizi (root) wa diraka ya mtumiaji. Wakala hakusimama kujiuliza kwa nini njia hiyo ilionekana ya ajabu. Hakuhakiki lengo. Alitekeleza amri kwa sababu utekelezaji ulilingana na mfumo wa “usafi.”
Hii ndiyo kutokubaliana kwa msingi kati ya modeli kubwa za lugha (large language models) na usimamizi wa mifumo. Mantiki halisi inahusisha kuelewa muktadha, kuhakiki dhana, na kushughulikia hali zisizo za kawaida (edge cases). Ulinganishaji wa mifumo unahusisha kuzalisha maandishi ambayo kistatistiki yanafanana na jibu sahihi. Wakati jibu hilo likiwa ni amri ya terminal yenye alama ya kufuta kwa mfululizo (recursive delete flag), kufanana kwa kistatistiki hakutoshi.
Upofu wa Wakala Mdogo
Mifumo mingi ya kisasa ya wakala hutumia mratibu mkuu ambaye hugawanya kazi kwa wakala wadogo. Mzazi anaweza kuwa na maelekezo makali: usiguse kamwe diraka ya nyumbani, kila wakati uliza kabla ya kufuta, weka kumbukumbu ya ukaguzi. Kisha anazalisha mfanyakazi mwenye maelekezo finyu kama “safisha logi za zamani.”
Wakala huyo mdogo mara nyingi hufanya kazi peke yake. Anarithi zana lakini si utamaduni wa usalama wa mzazi wake. Vikwazo vilivyomfanya wakala mkuu kuwa mwangalifu hupunguzwa, kufupishwa, au kuondolewa kabisa wakati wa usimamizi wa dirisha la muktadha (context window management). Wakala mdogo anapokea kazi na seti ya zana, lakini hapokei saa nyingi za maelekezo ya makini yaliyoweka mipaka ya usalama.
Matokeo yake ni aina fulani ya amnesia ya kiorganisheni. Kanuni ya usalama inayopatikana kwenye maelekezo ya mfumo ya wakala mzazi inaweza kuwa kama haipo kabisa kwa wakala mdogo. Hii ni hatari hasa kwa sababu wakala wadogo kwa kawaida hupewa kazi zinazojirudia na zenye hadhi ya chini ambazo waendeshaji huacha kuzifuatilia kwa karibu. Hakuna anayechunga kazi ya usafi wa logi mpaka inapofuta kanzi data ya uzalishaji.
Hatari ya Kufanya Maamuzi kwa Haraka
Kuna mwelekeo wa usanifu katika wakala wa AI kuelekea uhuru wa juu zaidi. Wakala bora, katika maono haya, hamsumbui mtumiaji kwa maswali madogo madogo. Anafanya maamuzi kwa haraka, anaunganisha wito wa zana, na kukamilisha mfululizo wa kazi za hatua nyingi bila kusimama hata kupumua.
Uamuzi huo wa haraka ndio hasa unaofanya mifumo hii isiwe salama. Modeli iliyopangiwa “kufanya maamuzi kwa haraka” haikaguei tena kazi yake. Haisimami wakati amri inaonekana kuwa na madhara. Inachukulia kusita kama hitilafu badala ya sifa. Wakati modeli inapokuwa sahihi, hii huonekana kama uchawi. Wakati inapokosea, huonekana kama kitu kisichozuilika. Hakuna msuguano wa asili katika mfumo ili kupunguza kasi ya amri mbaya.
Wakala wa Shumer alikuwa amefanya kazi kwa usahihi mamia ya mara. Rekodi hiyo ilijenga hisia ya uongo ya usalama. Lakini uaminifu katika majaribio mia moja haimaanishi kitu ikiwa jaribio la mia moja na moja ni kile kinachotofautiana sana na kawaida kitakwimu ambapo mtindo unavunjika. Katika usalama wa mifumo, utendaji wa zamani una umuhimu tu ikiwa namna ya hitilafu ni ya taratibu na inayoonekana. Hitilafu za wakala wa AI ni za ghafla, za kimya, na za jumla. “Ilifanya kazi mamia ya mara” si rekodi ya usalama. Ni maelezo ya bahati ambayo hatimaye huisha.
Jinsi ya Kujenga Ulinzi Halisi
Ikiwa modeli si tabaka la usalama
