Bayangkan Anda adalah seorang insinyur keamanan aplikasi senior di sebuah perusahaan jasa keuangan. Anda memasukkan potongan kode autentikasi yang dikembangkan secara internal ke dalam model AI mutakhir dan memintanya untuk mengidentifikasi celah logika. Bukannya melakukan analisis, Anda justru menerima ceramah. Model tersebut menolak dengan alasan bahwa Anda mungkin menggunakan informasi tersebut untuk “mengeksploitasi sistem.” Anda bukan seorang kriminal. Anda adalah orang yang disewa untuk menghentikan kriminal. Namun, guardrail tersebut memperlakukan kedua peran tersebut sebagai hal yang tidak dapat dibedakan.

Skenario ini menjadi hal yang rutin. Saat laboratorium AI besar memperketat protokol keselamatan untuk mencegah penyalahgunaan yang berbahaya, mereka berbenturan langsung dengan alur kerja para profesional keamanan siber yang sah. Hasilnya adalah sebuah paradoks yang berkembang: alat-alat yang dipromosikan sebagai pengganda kekuatan bagi rekayasa perangkat lunak justru ditahan dari para spesialis yang melindungi infrastruktur kritis.

Gesekan Antara Keselamatan (Safety) dan Keamanan (Security)

Pengembang AI utama tidak sepenuhnya mengabaikan komunitas keamanan siber. OpenAI menjalankan program bernama Trusted Access for Cyber. Anthropic mengoperasikan Cyber Verification Program. Keduanya dirancang untuk membiarkan pengguna yang telah diverifikasi melewati mekanisme penolakan tertentu sehingga mereka dapat melakukan penelitian yang sah. Secara teori, gerbang ini memisahkan aktor baik dari aktor jahat.

Dalam praktiknya, banyak peneliti keamanan ofensif dan pembela jaringan merasakannya sebagai hambatan birokrasi. Proses verifikasinya bisa jadi tidak transparan. Lini masa persetujuan tidak jelas. Bahkan setelah diterima, para peneliti melaporkan bahwa akses tingkat tinggi tersebut tidak selalu berfungsi secara andal di berbagai versi model atau utas percakapan yang berbeda. Bagi tim yang berlomba-lomba menambal kerentanan di bawah eksploitasi aktif, gesekan tersebut sangatlah berarti.

Ketegangan antara Washington dan Silicon Valley mencapai titik didih yang nyata ketika pemerintah AS memberlakukan kontrol ekspor pada model Mythos dan Fable milik Anthropic. Pembatasan tersebut menyusul laporan bahwa individu telah mengakali guardrail keamanan model untuk memfasilitasi serangan siber. Regulator bergerak cepat untuk memperlakukan sistem ini sebagai komoditas ekspor yang unik bahayanya. Kontrol tersebut sejak saat itu telah dicabut atau dimodifikasi, tetapi episode tersebut mengirimkan sinyal yang jelas: model AI berkemampuan tinggi semakin dipandang sebagai perangkat kiamat (doomsday devices) daripada instrumen teknis serbaguna. Bagi para pembela yang mengandalkan model tersebut, persepsi itu diterjemahkan menjadi pengawasan yang lebih ketat, akses yang lebih lambat, dan kecurigaan mendasar bahwa penelitian keamanan hanyalah peretasan dengan nama lain.

Mengapa Pertahanan dan Serangan Tidak Terpisahkan

Inti dari konflik ini bukanlah masalah administratif. Melainkan masalah teknis. Kemampuan yang sama yang diperlukan untuk mempertahankan jaringan hampir identik dengan kemampuan yang diperlukan untuk menyerangnya.

Chris Anley, Chief Scientist di NCC Group, menggunakan analogi sederhana: AI adalah sebuah palu. Anda dapat menggunakannya untuk membangun rumah atau untuk memecahkan jendela. Alat itu sendiri tidak tahu perbedaannya. Dalam keamanan siber, dualitas ini tidak dapat dihindari. Ketika seorang praktisi meminta model untuk “memperbaiki kode ini,” permintaan tersebut memicu tindakan defensif. Namun, proses penalaran yang menghasilkan perbaikan tersebut—mengidentifikasi fungsi yang tidak aman, melacak input yang tidak tepercaya, memetakan alur eksekusi—secara tak terelakkan mengungkapkan bagaimana kerentanan tersebut dapat dipicu. Penjelasan tersebut berfungsi sebagai peta jalan untuk eksploitasi.

Karena tim keselamatan AI sering melatih model untuk menolak perintah apa pun yang terindikasi sebagai eksploitasi, sistem tersebut sering kali melakukan koreksi berlebih (overcorrect). Seorang peneliti yang bertanya cara menyanitasi input pengguna akan mendapatkan jawaban. Seorang peneliti yang bertanya bagaimana sebuah