Anthropic mengumumkan bahawa, bermula 14 Ogos, Claude Code tidak akan lagi meminta pengguna untuk mengklik “approve” bagi setiap panggilan alat. Sebaliknya, pengelasan risiko dipacu AI akan menentukan tindakan mana yang memerlukan semakan manusia. Satu kajian terhadap 1,053 penguji menunjukkan 97% klik berlaku tanpa membaca arahan, dan pengelasan tersebut berjaya mengesan 89% tindakan berbahaya manakala manusia hanya mengesan 13.6%.
Mengapa model “klik untuk lulus” yang lama gagal
Aliran kerja lama memaksa manusia untuk mengesahkan setiap tindakan luaran—seperti menolak kod, memadam fail—dengan mengklik butang. Dalam praktiknya, pengguna menganggap dialog tersebut sebagai sekadar formaliti dan meluluskannya secara refleks. Angka daripada kajian tersebut mendedahkan masalahnya: hampir setiap klik adalah refleks, dan beberapa amaran tulen yang mendapat perhatian terlepas daripada operasi yang paling berisiko. Apabila pintu keselamatan hilang, keselamatan sistem akan terhakis.
Apa yang dilakukan oleh pengelasan baharu ini
Pengganti daripada Anthropic ialah model terlatih yang menilai setiap tindakan tertunda dan hanya akan mengganggu apabila operasi tersebut jatuh ke dalam salah satu daripada tiga kategori:
- Irreversible (Tidak boleh diubah semula) – tindakan yang tidak boleh dibatalkan, seperti melakukan force-push ke repositori atau memadam jadual pangkalan data.
- Destructive (Memusnahkan) – pemadaman secara pukal atau menulis semula fail yang boleh memadamkan hasil kerja.
- Outward-facing (Menghadap ke luar) – langkah-langkah yang mendedahkan kod atau mesej kepada sistem luaran, seperti membuka pull request atau menghantar pemberitahuan Slack.
Jika sesuatu tindakan tidak memenuhi mana-mana kriteria ini, model tersebut akan membiarkannya diteruskan secara automatik, sekali gus menamatkan lambakan arahan yang sering diabaikan oleh pengguna.
Had pendekatan berasaskan AI sahaja
Pengelasan ini bukanlah pelindung sejagat. Ia mempelajari konsep umum tentang bahaya, bukannya butiran khusus bagi mana-mana kod sumber. Folder bernama “tmp” mungkin tidak berbahaya dalam kebanyakan projek tetapi boleh mengandungi artifak binaan yang kritikal dalam projek anda; model tersebut berkemungkinan besar akan menganggapnya selamat. Prestasi kajian tersebut tidak menjamin keputusan yang sama dalam setiap persekitaran pengeluaran. Kes-kes ekstrem—terutamanya yang melibatkan peralatan tersuai atau infrastruktur sensitif—masih memerlukan tetapan kebenaran eksplisit atau pemantauan tambahan.
Apa yang perlu dilakukan oleh pengguna sekarang
- Semak mod kebenaran baharu: Pelan Pro, Max, dan Team akan menggunakan pengelasan ini secara automatik. Jika anda bergantung pada aliran kerja kebenaran tersuai, sahkan bahawa ia masih selaras dengan polisi keselamatan anda.
- Kenal pasti tindakan berisiko tinggi: Petakan saluran paip CI/CD dan skrip penggunaan anda kepada tiga kategori pencetus tersebut. Laraskan skrip yang melakukan langkah yang tidak boleh diubah semula atau memusnahkan untuk menyertakan perlindungan eksplisit jika pengelasan lalai tidak mencukupi.
- Pantau amaran pengelasan: Jejaki kekerapan dan ketepatan gangguan. Maklum balas awal akan membantu Anthropic memperhalusi model tersebut dan mungkin mendorong anda untuk mengaktifkan semula pengesahan manual bagi aliran kerja tertentu.
Apa yang perlu diperhatikan seterusnya
Peralihan daripada klik refleks manusia kepada model terlatih adalah percubaan jelas untuk menutup jurang keselamatan yang wujud dalam banyak saluran paip CI.
Sumber: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
