Anthropic y OpenAI han abierto una nueva vía de investigación que permite a equipos de seguridad acreditados trabajar con modelos de IA despojados de la mayoría de los filtros de seguridad. El “Cyber Verification Program” de Anthropic y el “Trusted Access for Cyber” de OpenAI ofrecen a los investigadores aprobados líneas directas a potentes modelos de lenguaje que pueden generar código, prompts e instrucciones sin restricciones. Este movimiento es importante porque crea una bifurcación clara en la cadena de suministro de la IA: un puñado de personas con acceso interno pueden investigar las versiones más débiles, mientras que el resto del mundo permanece tras barreras de seguridad más sólidas.

Por qué surgieron estos programas

Ambas empresas afirman que las iniciativas tienen como objetivo acelerar el descubrimiento de vulnerabilidades que podrían ser utilizadas como armas contra sus servicios. Al entregar a un grupo controlado de expertos un entorno de pruebas (sandbox) con menos restricciones, esperan sacar a la luz vectores de ataque antes de que los actores malintencionados los encuentren. El enfoque refleja la seguridad de software tradicional, donde los desarrolladores lanzan versiones de “bug-bounty” a una audiencia selecta.

Nuevo cálculo de riesgos para los defensores

La otra cara de la moneda es un modelo de acceso de dos niveles que obliga a cada organización a trazar una línea entre “investigador” y “hacker”. Esa línea se convierte ahora en una superficie de ataque potencial. Si un atacante roba credenciales, explota el acceso de un empleado interno o engaña al proceso de acreditación, puede sortear las barreras que protegen a la mayoría de los usuarios. Una vez dentro, el modelo sin restricciones puede ser persuadido para:

  • Generar scripts de phishing que evadan la detección
  • Crear exploits de día cero (zero-day) con fragmentos de código detallados
  • Producir prompts de ingeniería social convincentes adaptados a objetivos específicos

Los equipos de seguridad que construyeron sus defensas bajo la premisa de que los resultados de la IA siempre están filtrados deben replantearse esa suposición.

Cómo pueden responder los defensores

  • Tratar los programas como un vector de amenaza. Asumir que los adversarios intentarán infiltrarse en el proceso de acreditación y monitorizar patrones de inicio de sesión anormales en las plataformas de IA.
  • Ampliar la detección más allá de la nube. Buscar código o texto generado por IA en el tráfico saliente, especialmente desde cuentas privilegiadas.
  • Implementar controles de política de forma rígida. Aplicar reglas estrictas de “mínimo privilegio” para cualquier uso interno de servicios de IA externos, y segmentar los entornos que podrían ser alcanzados mediante una credencial comprometida.
  • Colaborar con los proveedores. Mantenerse en contacto con los canales de enlace de seguridad de Anthropic y OpenAI para recibir alertas sobre cambios en los criterios de acceso o abusos descubiertos.

El contraargumento

Los defensores argumentan que, sin un canal seguro para una investigación profunda, las vulnerabilidades permanecerán ocultas hasta que sean explotadas en entornos reales. Por lo tanto, los programas podrían reducir la superficie de ataque general al detectar fallos de forma temprana. El compromiso es que un nivel “menos protegido” invita al abuso oportunista.

Qué vigilar

  • Actualizaciones en el proceso de acreditación de cualquiera de las dos empresas
  • Informes de uso indebido derivados de los programas
  • Cambios en toda la industria en la forma en que se catalogan las superficies de ataque relacionadas con la IA

En conclusión: las nuevas vías de investigación proporcionan herramientas potentes a los investigadores de seguridad, pero también entregan las mismas herramientas a cualquiera que logre burlar la entrada. Los equipos de defensa deben tratar los programas tanto como una fuente de conocimiento como una nueva vía de ataque.