OpenAI leo imezindua GPT-Red, modeli kubwa ya lugha inayofanya kazi kama mdukuzi wa timu nyekundu (red-team hacker) wa kiotomatiki. Mfumo huo tayari unaimarisha modeli mpya zaidi ya kampuni ya GPT-5.6, ukipunguza kiwango cha mafanikio ya mashambulizi ya majaribio kutoka zaidi ya 90% hadi chini ya 23%.

Jinsi GPT-Red inavyofanya kazi ya timu nyekundu kiotomatiki

Majaribio ya timu nyekundu—kujaribu kwa makusudi kuvunja au kuteka mfumo—kwa kawaida yamekuwa yakitegemea wataalamu wa usalama. Wakati LLM zinapojifunza kutafuta mtandaoni, kuendesha kodi na kuitumia huduma za watu wa tatu, njia ambazo zinaweza kutumiwa vibaya zinaongezeka kwa kasi zaidi kuliko timu ya binadamu inavyoweza kuchunguza.

OpenAI ilijibu kwa kutumia "self-play loop" inayowanisha nakala moja ya modeli dhidi ya nyingine ndani ya mazingira ya majaribio ambayo watafiti wanayaita dojo. Katika sandbox hii, GPT-Red inachukua nafasi ya mshambuliaji huku modeli moja au zaidi za mlinzi zikijaribu kuzuia. Pande hizo mbili hufanya mizunguko isiyohesabika; kila mzunguko unamlazimu mshambuliaji kugundua kasoro ndogo zaidi na mlinzi kujifunza ulinzi mpya. OpenAI iliingiza mchakato huu kwenye mchakato wa mafunzo (training pipeline) uliotengeneza GPT-5.6, ambayo kampuni inaitangaza kama toleo lake imara zaidi hadi sasa.

Aina mpya ya shambulio: fake chain of thought

Mizunguko ya self-play iligundua shambulio la kushangaza la "fake chain of thought". LLM mara nyingi hutoa mfuatano wa mantiki wa hatua kwa hatua—"chain of thought"—ambao huongoza jibu la mwisho. GPT-Red ilijifunza kuingiza maelezo ya uongo kwenye mfuatano huo, na kuifanya modeli kudhani kuwa tayari imethibitisha misingi ya uongo. Kwa mfano, mshambuliaji anaweza kuishawishi modeli kwamba “1 + 1 = 3” imekaguliwa, na hivyo kuifanya mifumo itoe majibu kulingana na matokeo hayo ya uongo.

Shambulio hilo halijazuiliwa kwenye zana za kutengeneza maandishi pekee. Katika jaribio dhidi ya “Vendy,” wakala wa aina ya mashine ya kuuzia bidhaa (vending-machine-style agent) aliyetengenezwa na maabara ya nje, GPT-Red ilichezea sehemu za bei na kufuta oda, ikithibitisha kuwa mbinu hiyo inafanya kazi dhidi ya wakala maalum wanaotenda kwa amri za mtumiaji.

Ongezeko la usalama linalopimika

OpenAI ilitoa takwimu zinazoonyesha athari ya mafunzo dhidi ya GPT-Red. Wakati mashambulizi yenye nguvu zaidi yaliyotengenezwa na modeli mpya yalipofanywa dhidi ya GPT-5 iliyotolewa mwezi Agosti, zaidi ya 90% yalifanikiwa. Mashambulizi yale yale dhidi ya GPT-5.6 yalifanikiwa chini ya 23% ya wakati.

Katika jaribio la mwaka 2025 lililowanisha GPT-Red dhidi ya wataalamu wa timu nyekundu wa kibinadamu, AI iligundua na kuboresha aina mbalimbali za mashambulizi kwa ufanisi zaidi kuliko binadamu, ikionyesha kuwa modeli ya mpinzani (adversarial model) inaweza kuchunguza sehemu pana zaidi ya nafasi ya udhaifu kwa muda mfupi zaidi.

Mipaka na hitaji la kuendelea kwa utaalamu wa kibinadamu

GPT-Red haichukui nafasi ya wachambuzi wa usalama wa kibinadamu. Bado inakwama kwenye mashambulizi ya mazungumzo ya pande nyingi (multi-turn conversational attacks), ambapo mshambuliaji anajenga simulizi kupitia mazungumzo kadhaa, na kwenye uingizaji wa maelekezo ya picha (visual prompt injections) ambayo huficha maandishi yenye nia mbaya ndani ya picha. OpenAI inapanga kutumia modeli hiyo kama chombo cha kwanza cha uchunguzi, ikitoa mawazo ya mashambulizi yenye matumaini ili wataalamu wa kibinadamu wachunguze na kuendeleza.

Chombo hiki kinabaki kuwa mali ya kampuni (proprietary), hivyo watafiti wa nje hawawezi kujaribu moja kwa moja uwezo wake au kuthibitisha mafanikio yaliyoripotiwa.