Anthropic dan OpenAI masing-masing membuka jalur penelitian baru yang memungkinkan tim keamanan terverifikasi untuk bekerja dengan model AI yang telah dilepas sebagian besar filter keamanannya. “Cyber Verification Program” milik Anthropic dan “Trusted Access for Cyber” milik OpenAI memberikan akses langsung kepada peneliti terpilih ke model bahasa canggih yang dapat menghasilkan kode, perintah (prompt), dan instruksi tanpa batasan. Langkah ini penting karena menciptakan percabangan yang jelas dalam rantai pasokan AI: segelintir orang dalam dapat menguji versi yang paling lemah, sementara seluruh dunia tetap berada di balik pagar pengaman yang lebih kuat.

Mengapa program-program ini muncul

Kedua perusahaan menyatakan bahwa inisiatif ini bertujuan untuk mempercepat penemuan kerentanan yang dapat disalahgunakan sebagai senjata terhadap layanan mereka. Dengan memberikan kelompok ahli yang terkendali sebuah sandbox dengan lebih sedikit batasan, mereka berharap dapat mengungkap vektor serangan sebelum aktor jahat menemukannya. Pendekatan ini meniru keamanan perangkat lunak tradisional, di mana pengembang merilis build “bug-bounty” kepada audiens terpilih.

Kalkulasi risiko baru bagi tim pertahanan

Sisi lainnya adalah model akses dua tingkat yang memaksa setiap organisasi untuk menarik garis pemisah antara “peneliti” dan “peretas.” Garis tersebut kini menjadi permukaan serangan (attack surface) yang potensial. Jika penyerang mencuri kredensial, mengeksploitasi akses orang dalam, atau mengelabui proses verifikasi, mereka dapat melewati pagar pengaman yang melindungi sebagian besar pengguna. Begitu berada di dalam, model tanpa batasan tersebut dapat dipancing untuk:

  • Menghasilkan skrip phishing yang menghindari deteksi
  • Membuat eksploitasi zero-day dengan potongan kode yang mendetail
  • Menghasilkan perintah rekayasa sosial yang meyakinkan dan disesuaikan untuk target tertentu

Tim keamanan yang membangun pertahanan dengan asumsi bahwa output AI selalu difilter harus memikirkan kembali premis tersebut.

Bagaimana tim pertahanan dapat merespons

  • Perlakukan program tersebut sebagai vektor ancaman. Asumsikan penyerang akan mencoba menyusup ke dalam jalur verifikasi dan pantau pola login yang tidak normal pada platform AI.
  • Perluas deteksi melampaui cloud. Cari kode atau teks buatan AI dalam lalu lintas keluar (outbound traffic), terutama dari akun istimewa (privileged accounts).
  • Terapkan kontrol kebijakan secara kaku. Terapkan aturan “hak istimewa minimum” (least-privilege) yang ketat untuk setiap penggunaan internal layanan AI eksternal, dan segmen lingkungan yang dapat dijangkau oleh kredensial yang terkompromi.
  • Berkolaborasi dengan vendor. Tetap terlibat dengan saluran penghubung keamanan Anthropic dan OpenAI untuk menerima peringatan tentang perubahan kriteria akses atau penyalahgunaan yang ditemukan.

Sudut pandang sebaliknya

Para pendukung berpendapat bahwa tanpa saluran yang aman untuk pengujian mendalam, kerentanan akan tetap tersembunyi hingga dieksploitasi di dunia nyata. Oleh karena karena itu, program-program ini dapat mengurangi permukaan serangan secara keseluruhan dengan mengungkap celah lebih awal. Konsekuensinya adalah tingkat akses yang “kurang terjaga” mengundang penyalahgunaan oportunistik.

Apa yang perlu diperhatikan

  • Pembaruan pada proses verifikasi dari kedua perusahaan
  • Laporan penyalahgunaan yang berasal dari program tersebut
  • Pergeseran di seluruh industri dalam cara permukaan serangan terkait AI dikatalogkan

Intinya: jalur penelitian baru ini memberikan alat yang ampuh bagi peneliti keamanan, tetapi mereka juga menyerahkan alat yang sama kepada siapa pun yang dapat melewati gerbang. Tim pertahanan harus memperlakukan program ini sebagai sumber wawasan sekaligus jalur serangan baru.