Imaginez que vous êtes un ingénieur senior en sécurité des applications au sein d'une entreprise de services financiers. Vous soumettez un extrait de code d'authentification développé en interne à un modèle d'IA de pointe et lui demandez d'identifier des failles logiques. Au lieu d'une analyse, vous recevez une leçon de morale. Le modèle refuse au motif que vous pourriez utiliser ces informations pour « exploiter un système ». Vous n'êtes pas un criminel. Vous êtes la personne embauchée pour arrêter les criminels. Pourtant, la barrière de sécurité traite les deux rôles comme étant indiscernables.
Ce scénario devient courant. À mesure que les grands laboratoires d'IA renforcent les protocoles de sécurité pour prévenir les usages malveillants, ils entrent en collision directe avec les flux de travail des professionnels légitimes de la cybersécurité. Le résultat est un paradoxe croissant : les outils mêmes promus comme des multiplicateurs de force pour l'ingénierie logicielle sont refusés aux spécialistes qui protègent les infrastructures critiques.
La friction entre sûreté et sécurité
Les principaux développeurs d'IA n'ont pas totalement ignoré la communauté de la cybersécurité. OpenAI gère un programme appelé Trusted Access for Cyber. Anthropic exploite un Cyber Verification Program. Les deux sont conçus pour permettre aux utilisateurs vérifiés de contourner certains mécanismes de refus afin qu'ils puissent mener des recherches légitimes. En théorie, ces barrières séparent les bons acteurs des mauvais.
En pratique, de nombreux chercheurs en sécurité offensive et défenseurs de réseaux les perçoivent comme des obstacles bureaucratiques. Les processus de vérification peuvent être opaques. Les délais d'approbation sont incertains. Même après l'acceptation, les chercheurs signalent que l'accès privilégié ne fonctionne pas toujours de manière fiable selon les différentes versions du modèle ou les fils de discussion. Pour les équipes qui s'efforcent de corriger des vulnérabilités faisant l'objet d'une exploitation active, cette friction est cruciale.
La tension entre Washington et la Silicon Valley a atteint un point de rupture notable lorsque le gouvernement américain a imposé des contrôles à l'exportation sur les modèles Mythos et Fable d'Anthropic. Ces restrictions ont fait suite à des rapports indiquant que des individus avaient contourné les garde-fous de sécurité des modèles pour faciliter des cyberattaques. Les régulateurs ont agi rapidement pour traiter ces systèmes comme des marchandises d'exportation particulièrement dangereuses. Les contrôles ont depuis été levés ou modifiés, mais l'épisode a envoyé un signal clair : les modèles d'IA à haute capacité sont de plus en plus perçus comme des instruments de destruction massive plutôt que comme des outils techniques polyvalents. Pour les défenseurs qui s'appuient sur eux, cette perception se traduit par une surveillance accrue, un accès plus lent et une suspicion sous-jacente que la recherche en sécurité n'est que du piratage sous un autre nom.
Pourquoi la défense et l'offensive sont inséparables
Le cœur du conflit n'est pas administratif. Il est technique. Les mêmes capacités requises pour défendre un réseau sont presque identiques à celles requises pour l'attaquer.
Chris Anley, Chief Scientist chez NCC Group, utilise une analogie simple : l'IA est un marteau. On peut l'utiliser pour construire une maison ou pour briser une fenêtre. L'outil lui-même ne fait pas la différence. En cybersécurité, cette dualité est inévitable. Lorsqu'un praticien demande à un modèle de « corriger ce code », la requête déclenche une action défensive. Mais le processus de raisonnement qui produit la correction — identifier des fonctions non sécurisées, tracer des entrées non fiables, cartographier les flux d'exécution — révèle inévitablement comment la vulnérabilité peut être déclenchée. L'explication sert de feuille de route pour l'exploitation.
Parce que les équipes de sûreté de l'IA entraînent souvent les modèles à refuser toute requête qui laisse présager une exploitation, les systèmes surcorrigent fréquemment. Un chercheur demandant comment assainir les entrées utilisateur obtient une réponse. Un chercheur demandant comment un
