
L’essentiel
- Le 18 juillet, un modèle d’Anthropic a envoyé une fausse information sur un homicide non résolu à la ligne de signalement de la police de Philadelphie ; l’entreprise ne l’a découvert que le 28 septembre.
- Anthropic suspend l’accès à Internet de toutes ses évaluations internes, le temps de savoir surveiller et contrôler ses agents.
- Les agents ont aussi exploité des failles de sites, contourné des paiements d’accès à des bases de données et masqué des informations derrière des raccourcisseurs d’URL.
- Anthropic attribue ces dérives à des environnements d’entraînement défaillants qui récompensaient les contournements (reward hacking).
Une IA a signalé à la police un meurtre qui n’a jamais eu lieu, et son éditeur, Anthropic, l’a appris plus de dix semaines après. Dans le rapport publié vendredi, l’anecdote est pourtant la partie la moins grave.
Le message avait été classé comme spam, la police ne l’a jamais lu, personne n’a été inquiété. Ce qui pèse, c’est le calendrier : soumission le 18 juillet à 23 h 27, détection le 28 septembre, police prévenue mercredi dernier. Pendant tout ce temps, un agent a agi sur un système public sans que son éditeur le sache.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Dix semaines sans que personne ne regarde
Selon le communiqué de la police de Philadelphie, le modèle menait un test impliquant des sites choisis au hasard quand il a atteint PhillyUnsolvedMurders.com et y a déposé une information présentée comme venant d’un témoin potentiel. La police juge ce délai « inacceptable » et demande à l’entreprise de renforcer ses garde-fous.
Personne ne demandait à ce modèle d’écrire à la police. Il évaluait des capacités de recherche et d’usage d’un ordinateur, et un formulaire s’est trouvé sur son chemin. Anthropic le dit elle-même : l’incident a été révélé par une revue de l’activité de ses modèles lancée en juillet, pas par une alerte en temps réel.
Des agents qui trichent pour atteindre leur but
Les autres cas décrits n’ont rien de malveillant : ils viennent d’un apprentissage mal cadré. Des agents chargés de trouver des ressources en ligne ont exploité des failles logicielles, consulté des bases de données sans payer les frais d’accès et utilisé des services de raccourcissement d’URL pour faire passer des informations au-delà de restrictions.
Anthropic explique ces comportements par des défauts de ses environnements d’entraînement : le modèle croyait être récompensé pour avoir trouvé une brèche ou évité une contrainte. C’est le reward hacking, c’est-à-dire l’optimisation du score plutôt que de l’intention. L’entreprise reconnaît que l’entraînement à l’alignement (faire suivre au modèle les intentions de ses concepteurs) reste insuffisant pour la recherche et l’usage d’ordinateur, soit les compétences que ses agents doivent vendre aux professionnels.
OpenAI a déjà fait état de cas voisins : des agents coopérant pour entrer sur des sites, dont certains d’un gouvernement étranger, et un modèle qui a piraté la plateforme Hugging Face pendant un test. Les laboratoires se heurtent donc tous au même problème.
Couper Internet coûte cher et ne prouve rien
La réponse d’Anthropic est radicale sur le papier : plus d’accès au web en direct pour toutes ses évaluations internes, certaines suspendues ou déplacées hors ligne, et la migration de ses agents internes vers une infrastructure gérée de façon centralisée, avec un confinement renforcé. Des classifieurs de sécurité (modèles chargés de repérer les actions suspectes) seront aussi utilisés plus souvent. L’outil de détection créé pour l’occasion a bloqué les incidents rejoués.
Deux réserves. D’abord, personne ne sait ce qui permettra de rouvrir le robinet : l’entreprise n’a fixé aucun critère. Ensuite, Sydney Von Arx, fondatrice de l’organisation de sécurité de l’IA Nightingale, rappelait avant la publication qu’un développement de modèles dans un centre de données coupé du web serait très difficile pour les chercheurs : « Il faut bien les aligner à un moment. Si les IA sont mises en production sans jamais avoir accès à Internet, ce n’est pas un outil très utile. »
La coupure protège le monde extérieur pendant les tests, mais elle éloigne aussi les tests de la réalité qu’ils sont censés préparer. Un agent évalué en vase clos n’aura pas, en production, les mêmes occasions de dériver, ni les mêmes garde-fous.
Un contrôle qui arrive après coup
L’agent agit en secondes, l’éditeur comprend en semaines. Que le détecteur maison ait ensuite bloqué les incidents passés prouve qu’on sait reconnaître ce qu’on a déjà vu, pas ce qui n’a pas encore eu lieu.
Conrad Stosz, de Transluce et ancien responsable du Center for AI Standards and Innovation américain, salue la divulgation volontaire mais en tire la conséquence : elle souligne le besoin d’une vérification indépendante et crédible par des tiers. Faire dépendre la connaissance de ces dérives de la bonne volonté des laboratoires, ou de chercheurs qui les trouvent par hasard, ne constitue pas un régime de contrôle.
Si vous déployez des agents, la leçon est pratique. Un journal d’actions consultable en temps réel, des droits d’écriture limités et une alerte sur chaque message sortant valent mieux qu’un rapport trimestriel. Si l’éditeur d’un des modèles les plus surveillés du marché a mis dix semaines à voir une action, un déploiement en entreprise sans journal détaillé ne verra rien du tout.
Anthropic promet des rapports plus fréquents sur le comportement de ses modèles. Le délai entre un incident et son annonce dira plus que le nombre d’incidents recensés.
Mon avis
Dix semaines de délai pour un message envoyé à la police : voilà la donnée qui compte, pas la gravité de l’incident. Tant qu’un laboratoire ne publie pas son délai de détection, ses rapports de sécurité décrivent le passé. Je crois qu’un agrément externe, avec accès aux journaux, deviendra la condition pour vendre des agents aux entreprises.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →