Anthropic anunció que, a partir del 14 de agosto, Claude Code dejará de pedir a los usuarios que hagan clic en "aprobar" para cada llamada a una herramienta. En su lugar, un clasificador de riesgos impulsado por IA decidirá qué acciones requieren revisión humana. Un estudio realizado con 1.053 evaluadores mostró que el 97 % de los clics se realizaron sin leer el mensaje, y el clasificador detectó el 89 % de las acciones perjudiciales, mientras que los humanos solo detectaron el 13,6 %.

Por qué el antiguo modelo de "clic para aprobar" no fue suficiente

El antiguo flujo de trabajo obligaba a un humano a confirmar cada acción externa —subir código, eliminar archivos— haciendo clic en un botón. En la práctica, los usuarios trataban el diálogo como una formalidad y aprobaban de forma reflexiva. Las cifras del estudio exponen el problema: casi cada clic era un reflejo, y las pocas advertencias genuinas que captaron la atención pasaron por alto la mayoría de las operaciones de riesgo. Cuando desaparece una barrera de seguridad, la seguridad del sistema se erosiona.

Qué hace el nuevo clasificador

El reemplazo de Anthropic es un modelo entrenado que evalúa cada acción pendiente e interrumpe solo cuando la operación entra en una de estas tres categorías:

  • Irreversible – acciones que no se pueden deshacer, como realizar un force-push a un repositorio o eliminar una tabla de una base de datos.
  • Destructiva – eliminaciones masivas o sobrescritura de archivos que podrían borrar el trabajo.
  • Hacia el exterior – pasos que exponen código o mensajes a sistemas externos, como abrir un pull request o enviar una notificación de Slack.

Si una acción no cumple con ninguno de estos criterios, el modelo permite que proceda automáticamente, poniendo fin a la avalancha de mensajes que los usuarios ignoraban.

Límites de un enfoque basado únicamente en IA

El clasificador no es una salvaguarda universal. Aprendió nociones generales de daño, no las especificidades de ningún código base. Una carpeta llamada "tmp" podría ser inofensiva en la mayoría de los proyectos, pero podría contener artefactos de compilación críticos en el suyo; es probable que el modelo la considere segura. El rendimiento del estudio no garantiza resultados idénticos en todos los entornos de producción. Los casos límite —especialmente aquellos que involucran herramientas personalizadas o infraestructura sensible— aún requieren configuraciones de permiso explícitas o un monitoreo adicional.

Qué deben hacer los usuarios ahora

  • Revisar el nuevo modo de permisos: Los planes Pro, Max y Team adoptarán automáticamente el clasificador. Si depende de un flujo de trabajo de permisos personalizado, verifique que siga alineado con sus políticas de seguridad.
  • Identificar acciones de alto riesgo: Mapee sus pipelines de CI/CD y scripts de despliegue con las tres categorías de activación. Ajuste los scripts que realizan pasos irreversibles o destructivos para incluir salvaguardas explícitas si el clasificador predeterminado es insuficiente.
  • Monitorear las alertas del clasificador: Realice un seguimiento de la frecuencia y la precisión de las interrupciones. Los comentarios tempranos ayudarán a Anthropic a perfeccionar el modelo y podrían llevarle a reactivar las confirmaciones manuales para flujos de trabajo particulares.

Qué observar a continuación

Pasar de los clics por reflejo humano a un modelo entrenado es un intento claro de cerrar una brecha de seguridad que existía en muchos pipelines de CI.

Fuente: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg