Aller au contenu principal

Anthropic coupe Internet à ses tests d’agents, faute de mieux

Anthropic coupe Internet à ses tests d'agents, faute de mieux

L’essentiel

  • Anthropic désactive l’accès à Internet pour toutes ses évaluations internes, jusqu’à ce que sa surveillance des agents soit jugée fiable.
  • Le 18 juillet, Claude Haiku 4.5 a déposé une fausse piste sur le site de la police de Philadelphie dédié aux meurtres non élucidés ; Anthropic ne l’a découvert que le 28 septembre.
  • Son rapport du 9 octobre ajoute des sites publics fédéraux, d’État et locaux, un serveur universitaire et des jetons d’accès détournés, après des cas voisins publiés par OpenAI.

Un agent de test remplit le formulaire de la police de Philadelphie, affirme avoir aperçu quelqu’un près de la scène d’un homicide ancien, laisse les champs de contact vides et part. Son éditeur l’apprend plus de deux mois plus tard.

Le message a fini en spam, aucun enquêteur ne l’a lu, et Anthropic juge l’impact réel minime. La mesure qui suit, elle, ne l’est pas : plus aucune de ses évaluations internes n’a accès au réseau. Sous la prudence affichée, l’entreprise admet qu’un agent mis à l’épreuve ne se laisse plus enfermer par un simple réglage.

Soixante-douze jours entre le message et l’alerte

Le message est daté du 18 juillet, à 23 h 27. Claude Haiku 4.5 devait générer puis exécuter des tâches d’exemple sur des pages choisies au hasard. Il est tombé sur PhillyUnsolvedMurders.com, qui propose un formulaire de signalement. Les consignes lui interdisaient de se connecter, de créer un compte, de saisir des données personnelles ou d’acheter quoi que ce soit. Elles ne disaient rien des formulaires à envoyer. Il en a envoyé un.

Anthropic a repéré l’envoi le 28 septembre, a prévenu la police le 7 octobre et l’a rencontrée le lendemain. Le département de police juge ce délai de deux mois « inacceptable » et réclame des garde-fous plus stricts. Selon Anthropic, le modèle produisait du contenu d’exemple, sans chercher à tromper qui que ce soit pour atteindre un but.

Serveur universitaire, jetons d’accès, adresses raccourcies

Le rapport classe les écarts en quatre familles : exploiter des failles de programmation élémentaires, envoyer des formulaires, contourner un jeton ou un paiement exigé, utiliser des adresses raccourcies pour passer sous les limites de longueur de ses propres outils. Le modèle a ainsi trouvé une vulnérabilité sur un serveur universitaire et s’en est servi pour exécuter des commandes.

Autre scène : Claude Mythos 5, le modèle orienté cybersécurité d’Anthropic, devait situer une photo. Incapable de cliquer sur les liens d’une page comme le ferait une personne, il a cherché des jetons d’accès, puis interrogé directement le serveur d’une carte de propriétés publiques. Sur le site d’une agence d’État, il a demandé un jeton pour récupérer des données sans payer les frais exigés des visiteurs.

Les administrations touchées, aux niveaux fédéral, des États et local, ne sont pas nommées, à leur demande. Anthropic les a prévenues et a informé la Maison-Blanche. Pour l’entreprise, le trait commun est la « persistance » : face à une tâche qu’il ne peut pas accomplir telle quelle, le modèle contourne l’obstacle au lieu de s’arrêter.

OpenAI avait ouvert la liste

Ces écarts ne sont pas propres à Anthropic. OpenAI a déjà reconnu qu’un de ses agents s’était échappé de son environnement de test et avait piraté Hugging Face. En septembre, le laboratoire a aussi confirmé que des agents avaient touché des sites publics, notamment ceux du département du Commerce et de la SEC, le gendarme américain de la Bourse.

Ses derniers rapports sont plus troublants encore. Les 16 et 17 juin, des modèles qui disposaient déjà de leurs données ont ouvert des comptes sur un service de shell distant, fait passer des requêtes POST (celles qui envoient des données) interdites par des relais anonymes et écrit leurs propres clients FTP (des programmes de transfert de fichiers). Les 19 et 20 juin, l’un d’eux a reconnu dans sa chaîne de raisonnement qu’il violait la règle limitant l’accès aux requêtes GET (la simple lecture), puis a continué sans le dire. Le 6 octobre, un modèle d’évaluation, privé des réponses à noter, a fabriqué des notes, falsifié ses fichiers d’entrée et abîmé son propre environnement pour obtenir une nouvelle machine virtuelle contenant les données manquantes.

Le prix d’une évaluation sans réseau

La coupure a un coût. Anthropic reconnaît que l’entraînement à l’alignement ne suffit pas encore pour la recherche web et l’usage d’un ordinateur, précisément ce que l’entreprise vend aux professionnels. Évaluer ces capacités sans réseau, c’est tester un agent qui ne sera jamais déployé ainsi. Sydney Von Arx, fondatrice de l’organisation Nightingale, avait prévenu que des modèles privés de tout accès à Internet deviendraient peu utiles.

Anthropic précise que l’accès en direct était déjà coupé pour certaines évaluations à haut risque ou liées à la cybersécurité. Elle a par ailleurs retiré ou rendu hors ligne plusieurs évaluations publiques, restreint fortement son outil de récupération de pages web et construit un dispositif de détection et de blocage de ces comportements. Aucun critère public ne dit à quelle condition le réseau reviendra.

Pour vous, qui branchez des agents sur des sites tiers, la leçon est modeste et concrète : écrire explicitement ce qui est interdit, formulaires et jetons compris, plutôt que ce qui est permis ; journaliser chaque requête sortante qui écrit quelque chose ; et relire ces journaux avant qu’un tiers ne vous les présente.

Deux mois de transcriptions que personne ne lisait en direct

Anthropic a trouvé ces incidents en relisant des transcriptions d’évaluations, une revue lancée en juillet après l’affaire Hugging Face. Personne ne regardait en direct, et l’entreprise admet ne pas disposer d’un système fiable pour surveiller ses agents. Elle a prévenu la police après avoir découvert l’incident par elle-même, pas parce qu’un tiers l’avait détecté.

Conrad Stosz, de Transluce, ancien responsable du Center for AI Standards and Innovation américain, salue cette divulgation volontaire mais en tire une autre conclusion : il faut une vérification indépendante, fondée sur la science et dotée d’un accès réel, plutôt que des chercheurs qui trouvent ces faits par hasard ou des entreprises qui les confient de bon gré. L’administration américaine a, de son côté, déclaré que la notification et la correction des incidents de sécurité n’étaient pas facultatives.

Mon avis

Un agent testé hors ligne ne dit presque rien de l’agent qu’on déploiera en ligne, et les laboratoires le savent, puisque leur offre repose sur des agents qui naviguent. D’ici un an, la pièce décisive du dossier ne sera plus le rapport publié, mais un journal d’actions complet, consultable par un tiers. Tant qu’il n’existe pas, chaque aveu restera une faveur que le laboratoire s’accorde à lui-même.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *