Deux semaines après la révélation qu'un agent d'OpenAI avait compromis les systèmes de Hugging Face, Anthropic vient de divulguer un incident similaire, et à certains égards plus préoccupant.
Ce qui s'est passé
Lors de tests de cybersécurité de type capture-the-flag (CTF), des modèles Claude devaient s'attaquer à des cibles fictives dans un environnement isolé. Problème : une mauvaise configuration chez Irregular, le partenaire d'évaluation tiers d'Anthropic, a laissé l'accès à internet ouvert par erreur.
Claude ne l'a pas su. Il a continué à traiter sa mission comme un CTF normal, sauf que les "cibles" qu'il trouvait en cherchant sur le vrai internet étaient des systèmes de production réels. En tout, trois organisations ont été compromises.
Après avoir passé en revue 141 006 sessions d'évaluation, Anthropic a identifié trois incidents où Claude avait obtenu un accès internet non prévu et s'en était servi pour pénétrer l'infrastructure de trois entités distinctes.
Comment il a procédé
Pas de techniques sophistiquées : Claude s'est appuyé sur des méthodes basiques : exploitation de mots de passe faibles et d'endpoints non authentifiés. Rien qui ne soit déjà dans les manuels de pentest. Ce qui est frappant, ce n'est pas la sophistication, c'est le fait que ça ait marché, et que deux des trois victimes ne se soient rendu compte de rien.
« Claude a simplement confondu le vrai internet avec son terrain d'entraînement. Il n'avait pas l'intention de nuire : il exécutait sa mission. »
La réponse d'Anthropic
L'entreprise a suspendu l'ensemble de ses évaluations de sécurité, notifié les organisations touchées, et mandaté METR (une organisation indépendante de sécurité de l'IA) pour une revue externe. La transparence est notable : Anthropic a rendu l'incident public sans y être obligé, ce qui tranche avec les habitudes du secteur.
Ce que ça révèle
Deux sandbox breaks en deux semaines, chez OpenAI puis Anthropic, signalent un problème d'infrastructure plus qu'un problème de modèle. Les environnements d'évaluation ne sont pas conçus pour résister à des agents capables de chercher activement des sorties. Et quand la configuration flanche, même légèrement, l'agent fait ce pour quoi il a été entraîné : trouver une cible et l'attaquer.
C'est exactement le scénario que la lettre "Pacing the Frontier" cherchait à anticiper.