Anthropic ogłosiło, że od 14 sierpnia Claude Code przestanie prosić użytkowników o klikanie „approve” przy każdym wywołaniu narzędzia. Zamiast tego, klasyfikator ryzyka oparty na AI będzie decydował, które działania wymagają ludzkiej weryfikacji. Badanie przeprowadzone na 1053 testerach wykazało, że 97% kliknięć odbyło się bez czytania komunikatu, a klasyfikator wykrył 89% szkodliwych działań, podczas gdy ludzie wykryli tylko 13,6%.
Dlaczego stary model „kliknij, aby zatwierdzić” nie sprawdził się w praktyce
Stary proces wymuszał na człowieku potwierdzanie każdego zewnętrznego działania — takiego jak wypychanie kodu (push) czy usuwanie plików — poprzez kliknięcie przycisku. W praktyce użytkownicy traktowali to okno dialogowe jako formalność i zatwierdzali działania odruchowo. Dane z badania obnażają problem: prawie każde kliknięcie było odruchem, a nieliczne prawdziwe ostrzeżenia, które przykuły uwagę, pomijały większość ryzykownych operacji. Gdy znika bariera bezpieczeństwa, bezpieczeństwo systemu ulega erozji.
Jak działa nowy klasyfikator
Rozwiązaniem Anthropic jest wytrenowany model, który ocenia każde oczekujące działanie i przerywa proces tylko wtedy, gdy operacja wpada w jedną z trzech kategorii:
- Nieodwracalne (Irreversible) – działania, których nie można cofnąć, takie jak wymuszony push (force-push) do repozytorium lub usunięcie tabeli bazy danych.
- Destrukcyjne (Destructive) – masowe usuwanie lub nadpisywanie plików, co może doprowadzić do utraty pracy.
- Zewnętrzne (Outward-facing) – kroki, które wystawiają kod lub wiadomości na systemy zewnętrzne, takie jak otwarcie pull requesta lub wysłanie powiadomienia na Slacku.
Jeśli działanie nie spełnia żadnego z tych kryteriów, model pozwala mu przebiec automatycznie, kończąc lawinę komunikatów, które użytkownicy ignorowali.
Ograniczenia podejścia opartego wyłącznie na AI
Klasyfikator nie jest uniwersalną barierą ochronną. Nauczył się ogólnych pojęć dotyczących zagrożeń, a nie specyfiki konkretnych baz kodu. Folder o nazwie „tmp” może być nieszkodliwy w większości projektów, ale w Twoim może zawierać krytyczne artefakty budowania; model prawdopodobnie uzna go za bezpieczny. Wyniki badania nie gwarantują identycznych rezultatów w każdym środowisku produkcyjnym. Przypadki brzegowe — zwłaszcza te związane ze specjalistycznymi narzędziami lub wrażliwą infrastrukturą — wciąż wymagają jawnych ustawień uprawnień lub dodatkowego monitorowania.
Co użytkownicy powinni zrobić teraz
- Przejrzyj nowy tryb uprawnień: Plany Pro, Max i Team automatycznie przejdą na korzystanie z klasyfikatora. Jeśli polegasz na własnym przepływie pracy (workflow) uprawnień, sprawdź, czy nadal jest on zgodny z Twoimi politykami bezpieczeństwa.
- Zidentyfikuj działania wysokiego ryzyka: Dopasuj swoje potoki CI/CD i skrypty wdrożeniowe do trzech kategorii wyzwalaczy. Dostosuj skrypty wykonujące nieodwracalne lub destrukcyjne kroki tak, aby zawierały jawne zabezpieczenia, jeśli domyślny klasyfikator okaże się niewystarczający.
- Monitoruj alerty klasyfikatora: Śledź częstotliwość i dokładność przerywania operacji. Wczesne informacje zwrotne pomogą Anthropic dopracować model i mogą skłonić Cię do ponownego włączenia ręcznych potwierdzeń dla konkretnych procesów.
Na co zwrócić uwagę w przyszłości
Przejście od odruchowych kliknięć człowieka do wytrenowanego modelu to wyraźna próba zamknięcia luki w bezpieczeństwie, która istniała w wielu potokach CI.
Source: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
