Opus 5 ya Anthropic Inafikia Kiwango cha Mafanikio cha Asilimia Sifuri katika Mashambulizi ya Prompt Injection kwenye Kivinjari

Anthropic imepata mafanikio makubwa katika usalama wa AI kwa kutoa Opus 5, jambo ambalo linaweza kutatua moja ya udhaifu wa kudumu zaidi katika mawakala huru (autonomous agents). Kwa kutumia mfumo wa ulinzi wa tabaka mbili, modeli hii imeonyesha kinga ya karibu kamilifu dhidi ya mashambulizi ya prompt injection yanayofanyika kwenye kivinjari.

Mgogoro wa Prompt Injection katika Mawakala wa AI

Prompt injection bado ni "Achilles' heel" (udhaifu mkubwa) wa enzi hii ya AI. Udhaifu huu hutokea wakati mshambuliaji anapoficha maelekezo yenye nia mbaya ndani ya ukurasa wa wavuti—mara nyingi kupitia maandishi yasiyoonekana—ambayo wakala wa AI husoma anapofanya utafiti (browsing). Baada ya kuchakatwa, maelekezo haya yanaweza kuiteka modeli, na kuilazimisha kupita itifaki za usalama au kutekeleza vitendo visivyoruhusiwa. Wakati viongozi wa tasnia kama OpenAI walikuwa wameshatoa maoni awali kwamba prompt injection inaweza kuwa kasoro ya asili isiyoweza kutatuliwa ya LLMs, data ya hivi karibuni ya Anthropic inapinga mtazamo huo wa kukata tamaa.

Kufikia Kiwango cha Asilimia Sifuri

Kulingana na kadi ya mfumo (system card) ya Anthropic, Opus 5 ilifikia kiwango cha kushangaza cha mafanikio ya shambulio ya 0% katika mazingira 129 tofauti ya majaribio yaliyoundwa mahususi kwa ajili ya mawakala wa kivinjari. Hili ni ongezeko kubwa la hatua ikilinganishwa na matoleo yaliyopita. Katika majaribio ya jumla ya prompt injection yaliyofanywa na kampuni ya usalama ya Gray Swan, Opus 5 ilionyesha maboresho makubwa ikilinganishwa na modeli yake ya awali; baada ya majaribio 15, kiwango cha mafanikio ya mshambuliaji kilishuka kutoka 5.5% (kilichozingatiwa katika Opus 4.8) hadi 2.0% pekee.

Utendaji huu unaiweka Opus 5 kileleni mwa kiwango cha Gray Swan IPI, ikizidi modeli nyingine za daraja la juu kama Mythos 5 (2.6%) na Fable 5 (2.8%).

Siri ya Mafanikio: Auto Mode na Ulinzi wa Tabaka Mbili

Mafanikio haya hayatokani tu na akili ya modeli, bali zaidi na muunganisho wake na programu maalum. Kiwango cha mafanikio cha "asilimia sifuri" kimeunganishwa mahususi na matumizi ya Auto Mode katika bidhaa kama Claude Cowork. Anthropic inatumia usanifu wa ulinzi wa tabaka mbili uliotandazwa ili kulinda wakala:

  1. Pre-processing Scan: Tabaka maalum huchunguza data zote zinazoingia ili kutafuta maelekezo yaliyofichwa au ya udanganyifu kabla ya LLM kuu kuchakata maandishi hayo.
  2. Execution Blocking: Tabaka la pili hufuatilia vitendo vilivyokusudiwa na wakala, likizuia amri zozote hatari kabla ya kutekelezwa katika mazingira ya kivinjari.

Inashangaza, data inaonyesha kuwa modeli pekee si suluhisho la kila kitu. Bila tabaka hizi za programu za ulinzi, udhaifu wa Opus 5 uko katika kiwango cha 3.7%. Kwa kweli, modeli maalum ya Sonnet 5 inafanya vizuri zaidi ikiwa peke yake ikiwa na kiwango cha mafanikio cha 0.93%. Ni ushirikiano kati ya modeli ya msingi na mfumo wa programu za ulinzi unaosukuma kiwango cha usalama hadi karibu na ukamilifu.

Kwa Nini Hili Ni Muhimu kwa Mustakabali wa AI

Kwa watengenezaji na waanzilishi wanaojenga mawakala huru wa AI, maendeleo haya ni mabadiliko makubwa ya mfumo (paradigm shift). Ikiwa prompt injection inaweza kudhibitiwa kupitia tabaka za usanifu badala ya mafunzo ya modeli pekee, njia kuelekea mifumo ya kazi ya "agentic" inayofahamika—ambapo AI inadhibiti barua pepe, vivinjari, na data nyeti—inakuwa salama zaidi. Anthropic imetoa mwongozo wa jinsi tasnia inavyoweza kuacha simulizi ya "isiyoweza kutatuliwa" na kuelekea kwenye uhuru wa AI thabiti unaoweza kutumika katika uzalishaji.

Mambo Muhimu ya Kuzingatia

  • Usalama Unaoongoza Katika Tasnia: Opus 5 ilifikia kiwango cha mafanikio cha 0% katika mazingira 129 ya prompt injection kwenye kivinjari wakati ikitumia Auto Mode.
  • Ulinzi wa Kina (Defense-in-Depth): Usalama huo hupatikana kupitia mbinu ya tabaka mbili inayohusisha uchunguzi wa data kabla ya kuchakatwa na kuzuia vitendo kwa njia ya makusudi.
  • Utawala wa Kiwango cha Jaribio: Opus 5 inaongoza katika kiwango cha Gray Swan IPI, ikipunguza kwa kiasi kikubwa kiwango cha mafanikio ya mshambuliaji ikilinganishwa na matoleo ya awali ya modeli.