Opus 5 Anthropic Mencapai Kadar Kejayaan Sifar Peratus dalam Suntikan Prompt Pelayar

Anthropic telah mencapai kejayaan besar dalam keselamatan AI dengan pelancaran Opus 5, yang berpotensi menyelesaikan salah satu kerentanan paling berterusan dalam ejen autonomi. Dengan melaksanakan sistem pertahanan dua lapisan, model ini telah menunjukkan imuniti hampir menyeluruh terhadap serangan suntikan prompt berasaskan pelayar.

Krisis Suntikan Prompt dalam Ejen AI

Suntikan prompt kekal sebagai "tumit Achilles" dalam era AI semasa. Kerentanan ini berlaku apabila penyerang menyembunyikan arahan berniat jahat di dalam laman web—sering kali melalui teks halimunan—yang dibaca oleh ejen AI semasa melayari internet. Sebaik sahaja diproses, arahan ini boleh merampas kawalan model, memaksanya untuk memintas protokol keselamatan atau melaksanakan tindakan tanpa kebenaran. Walaupun peneraju industri seperti OpenAI sebelum ini mencadangkan bahawa suntikan prompt mungkin merupakan kecacatan sedia ada yang tidak dapat diselesaikan dalam LLM, data terbaharu Anthropic mencabar pandangan pesimis tersebut.

Mencapai Penanda Aras Sifar Peratus

Menurut kad sistem Anthropic, Opus 5 mencapai kadar kejayaan serangan yang mengejutkan iaitu 0% merentasi 129 senario ujian berbeza yang direka khusus untuk ejen pelayar. Ini merupakan lonjakan besar berbanding iterasi sebelumnya. Dalam ujian suntikan prompt umum yang dijalankan oleh firma keselamatan Gray Swan, Opus 5 menunjukkan peningkatan drastik berbanding pendahulunya; selepas 15 percubaan, kadar kejayaan penyerang menurun daripada 5.5% (diperhatikan dalam Opus 4.8) kepada hanya 2.0%.

Prestasi ini meletakkan Opus 5 di kedudukan teratas penanda aras Gray Swan IPI, mengatasi model tahap tinggi yang lain seperti Mythos 5 (2.6%) dan Fable 5 (2.8%).

Rahsia Kejayaan: Auto Mode dan Pertahanan Dua Lapisan

Kejayaan ini bukan semata-mata disebabkan oleh kecerdasan model tersebut, sebaliknya kerana integrasinya dengan perisian khusus. Kadar kejayaan "sifar peratus" ini dikaitkan secara khusus dengan penggunaan Auto Mode dalam produk seperti Claude Cowork. Anthropic menggunakan seni bina pertahanan dua lapisan yang canggih untuk mengamankan ejen tersebut:

  1. Imbasan Pra-pemprosesan: Lapisan khusus mengimbas semua data yang masuk untuk mencari arahan tersembunyi atau manipulatif sebelum LLM utama memproses teks tersebut.
  2. Sekatan Pelaksanaan: Lapisan sekunder memantau tindakan yang ingin dilakukan oleh ejen, menyekat sebarang arahan berbahaya sebelum ia dapat dilaksanakan dalam persekitaran pelayar.

Menariknya, data menunjukkan bahawa model itu sendiri bukanlah penyelesaian mutlak. Tanpa lapisan perisian pelindung ini, kerentanan Opus 5 berada pada tahap 3.7%. Malah, model Sonnet 5 yang khusus menunjukkan prestasi yang sedikit lebih baik secara berasingan dengan kadar kejayaan 0.93%. Sinergi antara model teras dan timbunan perisian pertahanan inilah yang melonjakkan ambang keselamatan ke tahap hampir sempurna.

Mengapa Ini Penting untuk Masa Depan AI

Bagi pembangun dan pengasas yang membina ejen AI autonomi, perkembangan ini merupakan satu anjakan paradigma. Jika suntikan prompt boleh dineutralkan melalui lapisan seni bina dan bukannya sekadar latihan model, laluan ke arah aliran kerja "agentic" yang boleh dipercayai—di mana AI menguruskan e-mel, pelayar, dan data sensitif—menjadi jauh lebih selamat. Anthropic telah menyediakan pelan tindakan tentang bagaimana industri boleh beralih daripada naratif "tidak dapat diselesaikan" menuju autonomi AI yang teguh dan sedia untuk pengeluaran.

Ringkasan Utama

  • Keselamatan Peneraju Industri: Opus 5 mencapai kadar kejayaan 0% dalam 129 senario suntikan prompt berasaskan pelayar apabila menggunakan Auto Mode.
  • Pertahanan Mendalam (Defense-in-Depth): Keselamatan dicapai melalui pendekatan dua lapisan yang melibatkan imbasan data pra-pemprosesan dan sekatan tindakan proaktif.
  • Dominasi Penanda Aras: Opus 5 menerajui penanda aras Gray Swan IPI, mengurangkan kadar kejayaan penyerang secara signifikan berbanding versi model sebelumnya.