Anthropic는 8월 14일부터 Claude Code가 모든 도구 호출(tool call)에 대해 사용자에게 "승인(approve)" 버튼을 클릭하도록 요청하는 방식을 중단한다고 발표했습니다. 대신 AI 기반의 위험 분류기(risk classifier)가 어떤 작업에 인간의 검토가 필요한지 결정하게 됩니다. 1,053명의 테스터를 대상으로 한 연구에 따르면, 클릭의 97%가 프롬프트를 읽지 않은 상태에서 이루어졌으며, 분류기는 유해한 작업의 89%를 잡아낸 반면 인간은 단 13.6%만을 잡아냈습니다.
기존 "클릭하여 승인" 모델이 미흡했던 이유
기존 워크플로우는 코드 푸시(pushing code)나 파일 삭제와 같은 각각의 외부 작업을 수행할 때마다 사용자가 버튼을 클릭하여 확인하도록 강제했습니다. 실제로 사용자들은 이 대화창을 형식적인 절차로 취급하며 반사적으로 승인했습니다. 연구 결과는 이 문제를 여실히 보여줍니다. 거의 모든 클릭이 반사적인 행동이었으며, 주의를 끄는 데 성공한 소수의 실제 경고조차 대부분의 위험한 작업을 놓쳤습니다. 안전 장치가 사라지면 시스템 보안은 약화됩니다.
새로운 분류기의 역할
Anthropic이 도입한 대체 모델은 학습된 모델로, 대기 중인 각 작업을 평가하고 작업이 다음 세 가지 범주 중 하나에 해당할 때만 중단(interrupt)을 요청합니다.
- 되돌릴 수 없는 작업(Irreversible) – 저장소에 강제 푸시(force-push)를 하거나 데이터베이스 테이블을 삭제하는 등 되돌릴 수 없는 작업.
- 파괴적인 작업(Destructive) – 작업 내용을 삭제할 수 있는 대량 삭제 또는 파일 덮어쓰기.
- 외부 노출 작업(Outward-facing) – 풀 리퀘스트(pull request)를 생성하거나 Slack 알림을 보내는 등 코드나 메시지를 외부 시스템에 노출하는 단계.
작업이 이러한 기준 중 어느 것에도 해당하지 않으면 모델은 작업을 자동으로 진행시켜, 사용자들이 무시해 버리던 끊임없는 프롬프트의 홍수를 끝냅니다.
AI 전용 방식의 한계
이 분류기는 만능 안전장치가 아닙니다. 이 모델은 유해성에 대한 일반적인 개념을 학습했을 뿐, 특정 코드베이스의 세부 사항을 아는 것은 아닙니다. 예를 들어 "tmp"라는 이름의 폴더는 대부분의 프로젝트에서 무해할 수 있지만, 귀하의 프로젝트에서는 중요한 빌드 결과물(build artifacts)을 포함하고 있을 수도 있습니다. 이 경우 모델은 해당 폴더를 안전하다고 판단할 가능성이 높습니다. 연구 결과의 성능이 모든 운영 환경에서 동일한 결과를 보장하지는 않습니다. 특히 커스텀 도구나 민감한 인프라와 관련된 예외적인 사례(edge cases)의 경우, 여전히 명시적인 권한 설정이나 추가적인 모니터링이 필요합니다.
사용자가 지금 해야 할 일
- 새로운 권한 모드 검토: Pro, Max, Team 플랜에는 분류기가 자동으로 적용됩니다. 커스텀 권한 워크플로우를 사용 중이라면, 이것이 여전히 보안 정책과 일치하는지 확인하십시오.
- 고위험 작업 식별: CI/CD 파이프라인과 배포 스크립트를 세 가지 트리거 범주에 맞춰 분류하십시오. 기본 분류기가 불충분할 경우, 되돌릴 수 없거나 파괴적인 단계를 수행하는 스크립트에 명시적인 안전 장치를 포함하도록 조정하십시오.
- 분류기 알림 모니터링: 작업 중단(interruption)의 빈도와 정확도를 추적하십시오. 초기 피드백은 Anthropic이 모델을 미세 조정(fine-tune)하는 데 도움이 되며, 특정 워크플로우에 대해 수동 확인을 다시 활성화해야 할 수도 있습니다.
향후 주목할 점
인간의 반사적인 클릭에서 학습된 모델로 전환하는 것은 많은 CI 파이프라인에 존재했던 안전 공백을 메우려는 명확한 시도입니다.
출처: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
