Anthropic et OpenAI ont chacune ouvert une nouvelle voie de recherche permettant à des équipes de sécurité agréées de travailler avec des modèles d'IA dépouillés de la plupart de leurs filtres de sécurité. Le « Cyber Verification Program » d'Anthropic et le « Trusted Access for Cyber » d'OpenAI offrent aux chercheurs approuvés un accès direct à des modèles de langage puissants capables de générer du code, des prompts et des instructions sans restriction. Cette initiative est importante car elle crée une bifurcation claire dans la chaîne d'approvisionnement de l'IA : une poignée d'initiés peut sonder les versions les plus vulnérables, tandis que le reste du monde reste protégé par des garde-fous plus stricts.

Pourquoi ces programmes ont vu le jour

Les deux entreprises affirment que ces initiatives visent à accélérer la découverte de vulnérabilités qui pourraient être exploitées contre leurs services. En confiant à un groupe restreint d'experts un environnement de test (sandbox) avec moins de restrictions, elles espèrent faire émerger des vecteurs d'attaque avant que des acteurs malveillants ne les trouvent. Cette approche reflète la sécurité logicielle traditionnelle, où les développeurs publient des versions de type « bug-bounty » pour un public sélectionné.

Nouveau calcul de risque pour les défenseurs

L'envers de la médaille est un modèle d'accès à deux niveaux qui oblige chaque organisation à tracer une ligne entre « chercheur » et « hacker ». Cette ligne devient désormais une surface d'attaque potentielle. Si un attaquant vole des identifiants, exploite l'accès d'un initié ou trompe le processus de vérification, il peut contourner les garde-fous qui protègent la plupart des utilisateurs. Une fois à l'intérieur, le modèle sans restriction peut être poussé à :

  • Générer des scripts de phishing qui échappent à la détection
  • Concevoir des exploits zero-day avec des extraits de code détaillés
  • Produire des prompts d'ingénierie sociale convaincants et adaptés à des cibles spécifiques

Les équipes de sécurité qui ont bâti leurs défenses sur l'hypothèse que les sorties de l'IA sont toujours filtrées doivent repenser ce postulat.

Comment les défenseurs peuvent réagir

  • Considérer les programmes comme un vecteur de menace. Partez du principe que les adversaires tenteront d'infiltrer le pipeline de vérification et surveillez les modèles de connexion anormaux sur les plateformes d'IA.
  • Élargir la détection au-delà du cloud. Recherchez du code ou du texte généré par l'IA dans le trafic sortant, en particulier à partir de comptes privilégiés.
  • Implémenter des contrôles de politique de manière rigide. Appliquez des règles strictes de « moindre privilège » pour toute utilisation interne de services d'IA externes, et segmentez les environnements qui pourraient être atteints par un identifiant compromis.
  • Collaborer avec les fournisseurs. Restez en contact avec les canaux de liaison de sécurité d'Anthropic et d'OpenAI pour recevoir des alertes concernant les changements des critères d'accès ou les abus découverts.

Le contre-argument

Les partisans soutiennent que sans un canal sûr pour un sondage approfondi, les vulnérabilités resteront cachées jusqu'à ce qu'elles soient exploitées dans la nature. Les programmes pourraient donc réduire la surface d'attaque globale en faisant émerger les failles précocement. Le compromis est qu'un niveau « moins protégé » invite aux abus opportunistes.

Ce qu'il faut surveiller

  • Les mises à jour du processus de vérification de l'une ou l'autre entreprise
  • Les rapports de mauvaise utilisation découlant des programmes
  • Les changements à l'échelle de l'industrie dans la manière dont les surfaces d'attaque liées à l'IA sont répertoriées

En résumé : les nouvelles voies de recherche offrent des outils puissants aux chercheurs en sécurité, mais elles remettent également ces mêmes outils à quiconque parvient à franchir la barrière. Les équipes de défense doivent considérer ces programmes à la fois comme une source de connaissances et comme une nouvelle voie d'attaque.