Anthropic mengumumkan bahwa, mulai 14 Agustus, Claude Code tidak akan lagi meminta pengguna untuk mengeklik “approve” untuk setiap pemanggilan alat (tool call). Sebagai gantinya, pengklasifikasi risiko berbasis AI akan memutuskan tindakan mana yang memerlukan peninjauan manusia. Sebuah studi terhadap 1.053 penguji menunjukkan bahwa 97% klik dilakukan tanpa membaca perintah (prompt), dan pengklasifikasi tersebut berhasil menangkap 89% tindakan berbahaya, sementara manusia hanya menangkap 13,6%.

Mengapa model lama “klik untuk menyetujui” tidak efektif

Alur kerja lama memaksa manusia untuk mengonfirmasi setiap tindakan eksternal—seperti melakukan push kode atau menghapus file—dengan mengeklik sebuah tombol. Dalam praktiknya, pengguna menganggap dialog tersebut hanya sebagai formalitas dan menyetujuinya secara refleks. Angka-angka dalam studi tersebut mengungkap masalahnya: hampir setiap klik adalah sebuah refleks, dan sedikit peringatan asli yang mendapat perhatian justru melewatkan sebagian besar operasi yang berisiko. Ketika gerbang keamanan menghilang, keamanan sistem pun terkikis.

Apa yang dilakukan pengklasifikasi baru ini

Pengganti dari Anthropic adalah model terlatih yang mengevaluasi setiap tindakan yang tertunda dan hanya akan menginterupsi jika operasi tersebut masuk ke dalam salah satu dari tiga kategori:

  • Irreversible (Tidak dapat dibatalkan) – tindakan yang tidak dapat dibatalkan, seperti melakukan force-push ke repositori atau menghapus tabel basis data (dropping a database table).
  • Destructive (Merusak) – penghapusan massal atau menimpa file yang dapat menghapus hasil kerja.
  • Outward-facing (Menghadap ke luar) – langkah-langkah yang mengekspos kode atau pesan ke sistem eksternal, seperti membuka pull request atau mengirim notifikasi Slack.

Jika suatu tindakan tidak memenuhi kriteria tersebut, model akan membiarkannya berjalan secara otomatis, mengakhiri banjir perintah (prompts) yang selama ini diabaikan oleh pengguna.

Batasan dari pendekatan berbasis AI saja

Pengklasifikasi ini bukanlah pelindung universal. Ia mempelajari konsep umum tentang bahaya, bukan spesifikasi dari kode sumber (codebase) tertentu. Folder bernama “tmp” mungkin tidak berbahaya di sebagian besar proyek, tetapi bisa berisi artefak build yang kritis di proyek Anda; model tersebut kemungkinan besar akan menganggapnya aman. Performa dalam studi tersebut tidak menjamin hasil yang identik di setiap lingkungan produksi. Kasus-kasus ekstrem (edge cases)—terutama yang melibatkan alat khusus atau infrastruktur sensitif—masih memerlukan pengaturan izin eksplisit atau pemantauan ekstra.

Apa yang perlu dilakukan pengguna sekarang

  • Tinjau mode izin baru: Paket Pro, Max, dan Team akan secara otomatis mengadopsi pengklasifikasi ini. Jika Anda mengandalkan alur kerja izin khusus, verifikasi apakah hal tersebut masih selaras dengan kebijakan keamanan Anda.
  • Identifikasi tindakan berisiko tinggi: Petakan alur kerja (pipeline) CI/CD dan skrip penyebaran (deployment) Anda ke dalam tiga kategori pemicu tersebut. Sesuaikan skrip yang melakukan langkah-langkah irreversible atau destructive untuk menyertakan pengamanan eksplisit jika pengklasifikasi bawaan dirasa tidak cukup.
  • Pantau peringatan pengklasifikasi: Pantau frekuensi dan akurasi interupsi. Umpan balik awal akan membantu Anthropic menyempurnakan model tersebut dan mungkin akan mendorong Anda untuk mengaktifkan kembali konfirmasi manual untuk alur kerja tertentu.

Apa yang perlu diperhatikan selanjutnya

Beralih dari klik refleks manusia ke model terlatih adalah upaya nyata untuk menutup celah keamanan yang ada di banyak alur kerja (pipeline) CI.

Sumber: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg