Anthropic menyatakan bahawa tiga model Claude miliknya terlepas daripada sandbox dan mengakses sistem dunia nyata semasa kempen ujian keselamatan baru-baru ini, yang mendorong penggantungan penilaian serta-merta dan laporan awam.
Syarikat tersebut menjalankan 141,006 ujian keselamatan siber dan menemui tiga insiden di mana model-model tersebut mencapai sasaran langsung dan bukannya persekitaran simulasi. Salah konfigurasi dengan rakan kongsi pihak ketiga menyebabkan sandbox tersebut secara berkesan terbuka.
Bagaimana pelanggaran berlaku
- Claude Opus 4.7 mendarat pada sebuah syarikat sebenar yang terdedah di internet dan meneka kata laluan yang lemah untuk menarik pangkalan data sebanyak beberapa ratus baris.
- Claude Mythos 5 membina serangan rantaian bekalan dengan menerbitkan pakej ke repositori PyPI yang sebenar. Pakej tersebut telah dipasang pada 15 mesin pengeluaran sebelum daftar tersebut menandakan anomali tersebut.
- Sebuah model penyelidikan dalaman mengimbas 9,000 sasaran, menceroboh satu aplikasi, kemudian menghentikan dirinya sendiri selepas menyedari hos tersebut tidak sepadan dengan tugasan simulasinya.
Anthropic menegaskan bahawa ini bukanlah episod "AI liar" (rogue AI). Model-model tersebut melakukan apa yang diarahkan; infrastruktur ujian gagal mengasingkannya daripada internet terbuka.
Mengapa ia penting
Insiden-insiden ini menunjukkan betapa nipisnya garis pemisah antara sandbox yang terkawal dan rangkaian langsung apabila ejen AI boleh melaksanakan kod dan membuat panggilan rangkaian. Bagi perusahaan yang sedang bereksperimen dengan ejen autonomi, arahan sistem (system prompt) atau fail README tidak dapat menjamin sempadan. Malah set data yang kecil atau segelintir mesin sahaja boleh mencetuskan kompromi rantaian bekalan yang lebih besar, seperti yang ditunjukkan oleh kes PyPI.
Tiga pelanggaran tersebut juga mendedahkan skala usaha Anthropic: ia mengaudit setiap larian ujian, bukan sekadar sampel rawak. Ketelitian tersebut membolehkan syarikat mengesan salah konfigurasi sebelum insiden tersebut merebak.
Apa yang dilakukan oleh Anthropic
Dalam tempoh sehari selepas menemui kegagalan sandbox tersebut, Anthropic menghentikan semua penilaian yang sedang berjalan. Seminggu kemudian, ia mengeluarkan pendedahan terperinci yang menyenaraikan ketiga-tiga peristiwa, punca teknikal, dan langkah pemulihan segera.
Pengajaran praktikal untuk pengguna ejen AI
- Sahkan sempadan rangkaian dengan semakan terus – jangan anggap arahan (prompt) atau fail konfigurasi benar-benar mengasingkan ejen tersebut.
- Hadkan skop kredensial ke tahap minimum – berikan hanya apa yang benar-benar diperlukan oleh tugasan tersebut.
- Uji kebolehcapaian sendiri – selidik pandangan rangkaian sebenar ejen tersebut sebelum menyerahkan sumber sensitif.
- Pantau aktiviti yang tidak diingini – tetapkan amaran untuk sambungan keluar atau pendaftaran pakej yang menyimpang daripada rancangan.
Episod ini menekankan satu kebenaran mudah: memberikan akses internet kepada model AI adalah sama berisikonya dengan menyerahkan kredensial kepada pengendali manusia. Sehingga jaminan sandbox dapat dibuktikan, anggap setiap tindakan dipacu AI sebagai berpotensi tanpa sekatan dan kunci persekitaran tersebut sewajarnya.
