Anthropic dan OpenAI masing-masing telah membuka laluan penyelidikan baharu yang membolehkan pasukan keselamatan yang telah disahkan bekerja dengan model AI yang telah dibuang kebanyakan penapis keselamatannya. “Cyber Verification Program” oleh Anthropic dan “Trusted Access for Cyber” oleh OpenAI memberikan akses terus kepada penyelidik yang diluluskan ke model bahasa berkuasa yang boleh menjana kod, prom, dan arahan tanpa sekatan. Langkah ini penting kerana ia mewujudkan percabangan yang jelas dalam rantaian bekalan AI: segelintir orang dalam boleh menyiasat versi yang paling lemah manakala selebihnya di dunia kekal di sebalik pagar keselamatan yang lebih kuat.
Mengapa program ini muncul
Kedua-dua firma menyatakan bahawa inisiatif tersebut bertujuan untuk mempercepatkan penemuan kerentanan yang boleh dijadikan senjata terhadap perkhidmatan mereka. Dengan memberikan kumpulan pakar yang terkawal sebuah persekitaran sandbox dengan lebih sedikit sekatan, mereka berharap dapat mendedahkan vektor serangan sebelum aktor berniat jahat menemuinya. Pendekatan ini menyerupai keselamatan perisian tradisional, di mana pembangun mengeluarkan binaan “bug-bounty” kepada audiens terpilih.
Kalkulus risiko baharu untuk pertahanan
Sisi sebaliknya ialah model akses dua peringkat yang memaksa setiap organisasi untuk membuat garis pemisah antara “penyelidik” dan “penggodam.” Garis tersebut kini menjadi permukaan serangan yang berpotensi. Jika penyerang mencuri kredensial, mengeksploitasi akses orang dalam, atau memperdaya proses penapisan, mereka boleh melepasi pagar keselamatan yang melindungi kebanyakan pengguna. Sebaik sahaja berada di dalam, model tanpa sekatan tersebut boleh digunakan untuk:
- Menjana skrip pancingan data (phishing) yang mengelak pengesanan
- Mencipta eksploitasi zero-day dengan petikan kod yang terperinci
- Menghasilkan prom kejuruteraan sosial yang meyakinkan dan disesuaikan untuk sasaran tertentu
Pasukan keselamatan yang membina pertahanan berdasarkan andaian bahawa output AI sentiasa ditapis mesti memikirkan semula premis tersebut.
Bagaimana pihak pertahanan boleh bertindak balas
- Anggap program tersebut sebagai vektor ancaman. Andaikan musuh akan cuba menyusup masuk ke dalam saluran penapisan dan pantau corak log masuk yang luar biasa pada platform AI.
- Luaskan pengesanan melampaui awan (cloud). Cari kod atau teks yang dijana AI dalam trafik keluar, terutamanya daripada akaun yang mempunyai keistimewaan (privileged accounts).
- Tetapkan kawalan polisi secara tetap. Kuatkuasakan peraturan “keistimewaan minimum” (least-privilege) yang ketat untuk sebarang penggunaan dalaman perkhidmatan AI luaran, dan segmenkan persekitaran yang boleh dicapai oleh kredensial yang telah dikompromi.
- Bekerjasama dengan vendor. Kekal berhubung dengan saluran perhubungan keselamatan Anthropic dan OpenAI untuk menerima amaran tentang perubahan pada kriteria akses atau penyalahgunaan yang ditemui.
Hujah balas
Penyokong berhujah bahawa tanpa saluran yang selamat untuk penyiasatan mendalam, kerentanan akan kekal tersembunyi sehingga ia dieksploitasi secara meluas. Oleh itu, program ini boleh mengurangkan keseluruhan permukaan serangan dengan mendedahkan kelemahan lebih awal. Komprominya ialah peringkat yang “kurang dijaga” mengundang penyalahgunaan oportunistik.
Apa yang perlu diperhatikan
- Kemas kini kepada proses penapisan daripada mana-mana syarikat
- Laporan penyalahgunaan yang berpunca daripada program tersebut
- Peralihan dalam industri tentang cara permukaan serangan berkaitan AI dikatalogkan
Kesimpulannya: laluan penyelidikan baharu ini memberikan alat yang berkuasa kepada penyelidik keselamatan, tetapi ia juga menyerahkan alat yang sama kepada sesiapa sahaja yang boleh melepasi pintu gerbang. Pasukan pertahanan mesti menganggap program tersebut sebagai sumber wawasan dan juga saluran baharu untuk serangan.
