Anthropic đã thông báo rằng, bắt đầu từ ngày 14 tháng 8, Claude Code sẽ ngừng yêu cầu người dùng nhấp vào “approve” (phê duyệt) cho mỗi lần gọi công cụ. Thay vào đó, một bộ phân loại rủi ro dựa trên AI sẽ quyết định hành động nào cần con người xem xét. Một nghiên cứu trên 1.053 người thử nghiệm cho thấy 97% lượt nhấp diễn ra mà không cần đọc lời nhắc, và bộ phân loại đã phát hiện được 89% các hành động gây hại trong khi con người chỉ phát hiện được 13,6%.
Tại sao mô hình "nhấp để phê duyệt" cũ lại không hiệu quả
Quy trình làm việc cũ buộc con người phải xác nhận từng hành động bên ngoài—như đẩy mã nguồn (push code), xóa tệp—bằng cách nhấp vào một nút. Trên thực tế, người dùng coi hộp thoại này như một thủ tục hình thức và phê duyệt theo phản xạ. Các con số từ nghiên cứu đã phơi bày vấn đề: hầu hết mọi lượt nhấp đều là phản xạ, và một vài cảnh báo thực sự nhận được sự chú ý lại bỏ lỡ hầu hết các hoạt động rủi ro nhất. Khi rào cản an toàn biến mất, tính bảo mật của hệ thống sẽ bị xói mòn.
Bộ phân loại mới hoạt động như thế nào
Giải pháp thay thế của Anthropic là một mô hình đã được huấn luyện để đánh giá từng hành động đang chờ xử lý và chỉ can thiệp khi hoạt động đó rơi vào một trong ba danh mục sau:
- Không thể đảo ngược (Irreversible) – các hành động không thể hoàn tác, chẳng hạn như force-push vào một repository hoặc xóa một bảng trong cơ sở dữ liệu.
- Có tính hủy diệt (Destructive) – xóa hàng loạt hoặc ghi đè các tệp có thể làm mất dữ liệu công việc.
- Hướng ra bên ngoài (Outward-facing) – các bước làm lộ mã nguồn hoặc tin nhắn cho các hệ thống bên ngoài, chẳng hạn như mở một pull request hoặc gửi thông báo Slack.
Nếu một hành động không đáp ứng bất kỳ tiêu chí nào trong số này, mô hình sẽ cho phép nó tiếp tục một cách tự động, chấm dứt tình trạng tràn ngập các lời nhắc mà người dùng thường bỏ qua.
Hạn chế của phương pháp chỉ sử dụng AI
Bộ phân loại này không phải là một biện pháp bảo vệ vạn năng. Nó học các khái niệm chung về tác hại, chứ không phải các chi tiết cụ thể của bất kỳ codebase nào. Một thư mục có tên “tmp” có thể vô hại trong hầu hết các dự án nhưng có thể chứa các build artifacts quan trọng trong dự án của bạn; mô hình có khả năng sẽ coi nó là an toàn. Hiệu suất của nghiên cứu không đảm bảo kết quả tương tự trong mọi môi trường production. Các trường hợp biên (edge cases)—đặc biệt là những trường hợp liên quan đến các công cụ tùy chỉnh hoặc cơ sở hạ tầng nhạy cảm—vẫn cần các thiết lập quyền rõ ràng hoặc giám sát bổ sung.
Người dùng cần làm gì ngay bây giờ
- Xem lại chế độ cấp quyền mới: Các gói Pro, Max và Team sẽ tự động áp dụng bộ phân loại này. Nếu bạn đang dựa vào một quy trình cấp quyền tùy chỉnh, hãy xác minh rằng nó vẫn phù hợp với các chính sách bảo mật của bạn.
- Xác định các hành động rủi ro cao: Đối chiếu các pipeline CI/CD và các script triển khai của bạn với ba danh mục kích hoạt. Điều chỉnh các script thực hiện các bước không thể đảo ngược hoặc có tính hủy diệt để bao gồm các biện pháp bảo vệ rõ ràng nếu bộ phân loại mặc định không đủ đáp ứng.
- Theo dõi các cảnh báo từ bộ phân loại: Theo dõi tần suất và độ chính xác của các lần can thiệp. Phản hồi sớm sẽ giúp Anthropic tinh chỉnh mô hình và có thể thúc đẩy bạn kích hoạt lại xác nhận thủ công cho các quy trình làm việc cụ thể.
Điều cần theo dõi tiếp theo
Việc chuyển đổi từ các cú nhấp chuột theo phản xạ của con người sang một mô hình đã được huấn luyện là một nỗ lực rõ ràng nhằm lấp đầy lỗ hổng an toàn vốn tồn tại trong nhiều pipeline CI.
Nguồn: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
