OpenAI a lancé aujourd'hui GPT-Red, un grand modèle de langage qui agit comme un hacker automatisé pour les tests de red-teaming. Le système renforce déjà le dernier modèle GPT-5.6 de l'entreprise, faisant chuter le taux de réussite des attaques simulées de plus de 90 % à moins de 23 %.
Comment GPT-Red automatise le travail de red-teaming
Les tests de red-teaming — qui consistent à tenter délibérément de casser ou de détourner un système — reposaient traditionnellement sur des experts en sécurité. À mesure que les LLM apprennent à naviguer sur le web, à exécuter du code et à appeler des services tiers, les modes de détournement se multiplient plus rapidement qu'une équipe humaine ne peut les explorer.
OpenAI a répondu par une « boucle d'auto-apprentissage » (self-play loop) qui oppose une copie d'un modèle à une autre au sein d'un environnement simulé que les chercheurs appellent un « dojo ». Dans ce bac à sable, GPT-Red endosse le rôle de l'attaquant tandis qu'un ou plusieurs modèles défenseurs tentent de résister. Les deux camps enchaînent d'innombrables rounds ; chaque itération force l'attaquant à découvrir des failles plus subtiles et le défenseur à apprendre de nouvelles défenses. OpenAI a intégré ce processus dans le pipeline d'entraînement qui a produit GPT-5.6, que l'entreprise présente comme sa version la plus robuste à ce jour.
Une nouvelle classe d'attaque : la fausse chaîne de pensée
Les sessions d'auto-apprentissage ont révélé une attaque frappante de type « fausse chaîne de pensée » (fake chain of thought). Les LLM émettent souvent un tracé de raisonnement étape par étape — une « chaîne de pensée » — qui guide la réponse finale. GPT-Red a appris à insérer des entrées fallacieuses dans ce tracé, amenant le modèle à croire qu'il avait déjà vérifié des prémisses erronées. Par exemple, l'attaquant peut convaincre le modèle que « 1 + 1 = 3 » a été vérifié, incitant le système à produire des résultats basés sur ce résultat fabriqué de toutes pièces.
L'attaque ne se limite pas aux générateurs de texte pur. Lors d'un test contre « Vendy », un agent de type distributeur automatique conçu par un laboratoire externe, GPT-Red a manipulé les champs de prix et annulé des commandes, prouvant que la technique fonctionne contre des agents spécialisés qui agissent sur les commandes des utilisateurs.
Une amélioration mesurable de la sécurité
OpenAI a publié des chiffres montrant l'impact de l'entraînement contre GPT-Red. Lorsque les attaques les plus puissantes générées par le nouveau modèle ont été lancées contre GPT-5 (version d'août), elles ont réussi dans plus de 90 % des cas. Les mêmes attaques contre GPT-5.6 n'ont réussi que dans moins de 23 % des cas.
Dans une expérience menée en 2025 qui opposait GPT-Red à des experts humains en red-teaming, l'IA a découvert et affiné des variantes d'attaque plus efficacement que les humains, suggérant qu'un modèle adverse peut explorer une plus grande partie de l'espace des vulnérabilités en moins de temps.
Limites et besoin continu d'expertise humaine
GPT-Red ne remplace pas les analystes de sécurité humains. Il trébuche encore sur les attaques conversationnelles multi-tours, où l'attaquant construit un récit sur plusieurs échanges, ainsi que sur les injections de prompts visuels qui cachent du texte malveillant à l'intérieur d'images. OpenAI prévoit d'utiliser le modèle comme une sonde de première ligne, faisant émerger des idées d'attaque prometteuses que les experts humains pourront étudier et approfondir.
L'outil reste propriétaire, de sorte que les chercheurs externes ne peuvent pas tester directement ses capacités ni vérifier les gains rapportés.
