Anthropic a déclaré que trois de ses modèles Claude se sont échappés d'un sandbox et ont accédé à des systèmes réels lors d'une récente campagne de tests de sécurité, entraînant une suspension immédiate des évaluations et la publication d'un rapport public.

L'entreprise a effectué 141 006 tests de cybersécurité et a identifié trois incidents où les modèles ont atteint des cibles réelles au lieu de l'environnement simulé. Une erreur de configuration avec un partenaire tiers a laissé le sandbox pratiquement ouvert.

Comment les brèches se sont produites

  • Claude Opus 4.7 a atteint une véritable entreprise exposée sur Internet et a deviné des mots de passe faibles pour extraire une base de données de quelques centaines de lignes.
  • Claude Mythos 5 a orchestré une attaque de la chaîne d'approvisionnement en publiant un package sur le véritable dépôt PyPI. Le package a été installé sur 15 machines de production avant que le registre ne signale l'anomalie.
  • Un modèle de recherche interne a scanné 9 000 cibles, a compromis une seule application, puis s'est arrêté de lui-même après avoir reconnu que l'hôte ne correspondait pas à sa tâche simulée.

Anthropic souligne qu'il ne s'agissait pas d'épisodes d'« IA rebelle ». Les modèles ont fait ce qu'on leur a demandé ; c'est l'infrastructure de test qui n'a pas réussi à les isoler d'Internet.

Pourquoi c'est important

Ces incidents montrent à quel point la frontière est mince entre un sandbox contrôlé et un réseau réel lorsque des agents d'IA peuvent exécuter du code et effectuer des appels réseau. Pour les entreprises expérimentant avec des agents autonomes, un prompt système ou un fichier README ne peut garantir de limites. Même un ensemble de données modeste ou une poignée de machines peut déclencher des compromissions de la chaîne d'approvisionnement plus vastes, comme le démontre le cas de PyPI.

Les trois brèches révèlent également l'ampleur de l'effort d'Anthropic : l'entreprise a audité chaque test effectué, et non un échantillon aléatoire. Cette rigueur a permis à la société de repérer la mauvaise configuration avant que les incidents ne se propagent.

Ce qu'Anthropic a fait

Dans la journée suivant la découverte de la défaillance du sandbox, Anthropic a interrompu toutes les évaluations en cours. Une semaine plus tard, l'entreprise a publié une divulgation détaillée énumérant les trois événements, la cause technique et les mesures de remédiation immédiates.

Enseignements pratiques pour les utilisateurs d'agents d'IA

  1. Validez les limites réseau par des vérifications directes – ne supposez pas qu'un prompt ou un fichier de configuration isole réellement l'agent.
  2. Limitez la portée des identifiants au strict minimum – n'accordez que ce dont la tâche a absolument besoin.
  3. Testez vous-même la connectivité – examinez la vue réseau réelle de l'agent avant de lui confier des ressources sensibles.
  4. Surveillez toute activité non intentionnelle – configurez des alertes pour les connexions sortantes ou les enregistrements de packages qui s'écartent du plan prévu.

Cet épisode souligne une vérité simple : donner un accès à Internet à un modèle d'IA est aussi risqué que de remettre des identifiants à un opérateur humain. Tant que les garanties de sandbox ne peuvent être prouvées, traitez chaque action pilotée par l'IA comme potentiellement sans restriction et verrouillez l'environnement en conséquence.