Watafiti wameonyesha kuwa nyayo za ufikiri zilizosimbwa (encrypted reasoning traces)—paketi ndogo ambazo mtoa huduma hutuma kwenye kifaa cha mtumiaji ili mazungumzo yaweze kuhama kati ya mifumo (models)—zinaweza kusomwa na mfumo dhaifu kutoka huduma hiyo hiyo, jambo linalovuja mamia ya siri (credentials) na maelezo ya kibinafsi. Ugunduzi huu, uliofafanuliwa kwa kina katika makala ya Stealing Reasoning Traces from Proprietary LLM APIs, unatishia kipengele cha urahisi ambacho Anthropic, OpenAI na Google wanategemea ili kuweka mazungumzo ya AI yawe na mtiririko mzuri.

Kwa nini vizuizi vilivyosimbwa vipo

Unapozungumza na mfumo mkubwa wa lugha (LLM), huduma hiyo hujenga "nyayo za ufikiri" (reasoning trace): mfululizo wa maelekezo ya ndani (internal prompts), wito wa zana (tool calls) na hatua za mfululizo wa mawazo (chain-of-thought steps) zilizopelekea jibu. Ili kukuwezesha kubadilisha kutoka kwenye mfumo mkubwa kwenda ule wa bei rahisi bila kupoteza mfululizo huo, watoa huduma husimba nyayo hizo, kuzituma kwenye kifaa chako, na kutarajia uzirudishe pamoja na ombi linalofuata. Usimbaji huo unalenga kuweka nyayo hizo kuwa za siri huku ukiwezesha mwendelezo wa mazungumzo kati ya vipindi na mifumo tofauti.

Jinsi shambulio linavyofanya kazi

Watafiti walionyesha mbinu ya uvunjaji wa usalama yenye hatua tatu ambayo haihitaji kuingilia mfumo wenye nguvu wenyewe:

  1. Kamata kizuizi cha ufikiri kilichosimbwa kilichozalishwa na mfumo wenye nguvu wakati wa mazungumzo ya kawaida.
  2. Sogeza kizuizi hicho kwa mfumo dhaifu kutoka kwa mtoa huduma huyo huyo, ukiiomba "isome".
  3. Kwa sababu mfumo dhaifu unatumia funguo zilezile za kusimbua (decryption keys), unatoa maudhui yaliyosimbuliwa katika maandishi ya kawaida (plain text).

Mfumo dhaifu hufanya kazi kama "decryption oracle". Washambuliaji hawakuingilia mfumo wa ndani wa ule wenye nguvu; walitumia tu API ya mtoa huduma dhidi yake yenyewe.

Vile watafiti walivyopata

  • Siri 182 – funguo za API, tokeni na siri nyinginezo zilizomo ndani ya nyayo hizo.
  • Taarifa 367 za kibinafsi – majina, barua pepe, na anwani ambazo watumiaji walitoa wakati wa mazungumzo.
  • Maudhui ya prompt-injection – maelekezo hasi yaliyofichwa kwenye kizuizi kilichosimbwa ambayo yanaweza kutekelezwa baadaye wakati nyayo hizo zinaporudiwa.
  • Uvunjaji wa vichujio vya usalama (safety-filter bypasses) – nyayo zilizosimbuliwa zilifichua hatua ambazo zingekuwa zimezuiliwa ikiwa zingekaguliwa katika maandishi ya kawaida, na kuruhusu maudhui hatari kupita.

Makala hiyo inasisitiza kuwa udhaifu huo si hitilafu katika algoriti ya usimbaji; usimbaji wenyewe una nguvu. Uvunjaji unatokana na uamuzi wa usanifu wa kuruhusu mfumo wowote katika mkusanyiko wa mtoa huduma kusimbua kizuizi hicho kwa ajili ya urahisi wa mtumiaji.

Msukosuko wa kutoa na kuchukua (trade-off) ulioko kwenye msingi wa suala hili

Watoa huduma walijenga uwezo huu wa "kubadilisha mifumo" (model-switching) kwenye API zao kwa sababu watengenezaji na watumiaji wanathamini mwendelezo. Ikiwa usimbaji ungeunganishwa na mfumo mmoja au kipindi kimoja tu, mchakato huo wa uhamishaji ungevunjika, na kuwalazimisha watengenezaji kujenga mifumo ya usimamizi wa hali (state management) wenyewe. Makala hiyo inadai kuwa usalama ulikubaliwa kudumaa ili kutoa nafasi ya urahisi zaidi.

Hatua ambazo watengenezaji wanapaswa kuchukua sasa

  • Chukulia nyayo zilizosimbwa kama maandishi ya kawaida (clear-text). Chukulia kuwa logi, cache, au mfumo wowote wa ufuatiliaji unaohifadhi nyayo hizo unaweza kusomwa na mshambuliaji.
  • Epuka kuweka nyayo kwenye hifadhi za umma (public repositories). Hata kizuizi kimoja tu kilichopotea kinaweza kufichua siri nyingi.
  • Jiandae kwa udhibiti mkali zaidi. Watoa huduma wanaweza kuimarisha usalama, jambo ambalo linaweza kubadilisha jinsi mawakala wa mifumo mingi (multi-model agents) yanavyojengwa.
  • Hamia kwenye uhamishaji wa hali wa wazi (explicit state hand-offs). Badala ya kutegemea ufikiri uliofichwa, sanifu mawakala ili watoe data iliyopangwa (JSON, XML, n.k.) ambayo inaweza kupelekwa salama kati ya mifumo bila usimbaji.
  • Kagua maelekezo yako (prompts). Angalia taarifa zozote nyeti zinazoweza kuingia kwenye mfululizo wa ufikiri na uziondoe kabla ya kutuma ombi.

Nini cha kufuatilia kutoka kwa watoa huduma wakubwa

Utoaji wa makala hii utawalazimu Anthropic, OpenAI na Google kutathmini upya sera ya usimbuzi (decryption policy) iliyojengwa ndani ya API zao.

Athari pana zaidi

Ugunduzi huu unasisitiza mtatizo wa kawaida wa usalama: urahisi mara nyingi hufungua mlango wa nyuma. Kwa kuruhusu mfumo wowote kusimbua kizuizi kinachomilikiwa na mtumiaji, watoa huduma wamewapa washambuliaji njia rahisi ya kupata taarifa nyeti. Suluhisho linaweza kufanya uunganishaji wa AI kuwa mgumu kidogo, lakini pia litarejesha matarajio kwamba data iliyosimbwa inapaswa kubaki ikiwa imesimbwa.

Muhtasari: Nyayo za ufikiri zilizosimbwa si kizuizi cha usalama; ni njia ya mkato ya urahisi inayoweza kutumiwa dhidi yako. Uzichukulie kama maandishi ya kawaida, uziondoe kwenye logi, na uundee upya mawakala wako ili waweze kuhimili wakati ujao ambapo ni mfumo uliopata wazo pekee ndio utakaoweza kusoma mawazo yake mwenyewe.