Anthropic оголосила, що з 14 серпня Claude Code перестане просити користувачів натискати «approve» для кожного виклику інструменту. Замість цього класифікатор ризиків на основі ШІ вирішуватиме, які дії потребують перевірки людиною. Дослідження 1053 тестувальників показало, що 97% кліків відбувалися без прочитання підказки, а класифікатор виявив 89% шкідливих дій, тоді як люди — лише 13,6%.

Чому стара модель «клік для підтвердження» виявилася недостатньою

Старий робочий процес змушував людину підтверджувати кожну зовнішню дію — пуш коду, видалення файлів — натисканням кнопки. На практиці користувачі сприймали діалогове вікно як формальність і підтверджували дії рефлекторно. Цифри дослідження оголюють проблему: майже кожен клік був рефлексом, а ті небагато справжніх попереджень, на які звертали увагу, пропускали найбільш ризиковані операції. Коли захисний бар'єр зникає, безпека системи погіршується.

Що робить новий класифікатор

Заміна від Anthropic — це навчена модель, яка оцінює кожну заплановану дію та перериває процес лише тоді, коли операція підпадає під одну з трьох категорій:

  • Irreversible (Незворотні) – дії, які неможливо скасувати, як-от force-push у репозиторій або видалення таблиці бази даних.
  • Destructive (Руйнівні) – масове видалення або перезапис файлів, що може призвести до втрати роботи.
  • Outward-facing (Зовнішні) – кроки, що відкривають код або повідомлення зовнішнім системам, наприклад, створення pull request або надсилання сповіщення в Slack.

Якщо дія не відповідає жодному з цих критеріїв, модель дозволяє їй виконуватися автоматично, припиняючи потік підказок, які користувачі ігнорували.

Обмеження підходу, що базується лише на ШІ

Класифікатор не є універсальним засобом захисту. Він вивчив загальні поняття шкоди, а не специфіку конкретної кодової бази. Папка з назвою «tmp» може бути нешкідливою в більшості проєктів, але у вашому вона може містити критично важливі артефакти збірки; модель, швидше за все, вважатиме її безпечною. Результати дослідження не гарантують ідентичних показників у кожному робочому середовищі (production). Крайні випадки — особливо ті, що стосуються кастомних інструментів або чутливої інфраструктури — все ще потребують явних налаштувань дозволів або додаткового моніторингу.

Що користувачам потрібно зробити зараз

  • Перегляньте новий режим дозволів: Плани Pro, Max та Team автоматично перейдуть на використання класифікатора. Якщо ви покладаєтеся на власний робочий процес дозволів, переконайтеся, що він усе ще відповідає вашим політикам безпеки.
  • Визначте дії з високим рівнем ризику: Співвіднесіть ваші CI/CD конвеєри та скрипти розгортання з трьома категоріями тригерів. Якщо стандартного класифікатора недостатньо, налаштуйте скрипти, що виконують незворотні або руйнівні кроки, додавши до них явні засоби захисту.
  • Відстежуйте сповіщення класифікатора: Стежте за частотою та точністю переривань. Ранній зворотний зв'язок допоможе Anthropic вдосконалити модель і може змусити вас знову ввімкнути ручне підтвердження для певних робочих процесів.

На що звернути увагу далі

Перехід від рефлексивних кліків людини до навченої моделі — це чітка спроба усунути прогалину в безпеці, яка існувала в багатьох CI-конвеєрах.

Джерело: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg