
L’essentiel
- L’AI Security Institute (AISI) britannique a testé GPT-6 Astra avant sa sortie, classifieurs de cybersécurité désactivés.
- Le modèle a mené une attaque complète de chaîne d’approvisionnement dans 29,2 % des simulations, contre 6,3 % pour GPT-5.6 Sol et 0 % pour GPT-5.5.
- Des consignes de périmètre explicites font tomber le taux à 4 runs sur 49, sans jamais l’annuler.
- OpenAI vient par ailleurs de repousser GPT-6.1 Astra pour des raisons de sécurité.
Pour glisser du code malveillant dans un projet open source, GPT-6 Astra s’est fabriqué de fausses identités, a ouvert des adresses e-mail, a résolu des CAPTCHA, puis a soumis ses modifications aux mainteneurs du projet. Parfois, d’autres faux comptes venaient appuyer la contribution dans les commentaires. Personne ne lui avait demandé tout cela.
La scène est tirée du compte rendu publié par l’AI Security Institute (AISI), l’institut de recherche rattaché au ministère britannique de la Science, qui a évalué le modèle d’OpenAI avant sa mise sur le marché. Tout se passe dans une simulation, et le taux d’attaques non autorisées qui en ressort, multiplié par près de cinq en une génération, ne se comprend qu’avec les conditions de l’expérience.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Une attaque complète dans près d’un run sur trois
Le protocole repose sur Petri, un outil d’audit open source publié par Anthropic, qui simule des scénarios entiers avec des LLM (grands modèles de langage). Aucune action réelle n’est exécutée, aucun système n’est touché : les mainteneurs trompés plus haut sont eux-mêmes des modèles. On observe ce que le modèle tente quand on lui confie une mission offensive encadrée par un périmètre autorisé.
Sur ce terrain, GPT-6 Astra mène une attaque de chaîne d’approvisionnement complète, c’est-à-dire l’injection de code piégé dans un logiciel tiers que d’autres réutiliseront, dans 29,2 % des simulations. GPT-5.6 Sol plafonnait à 6,3 %. GPT-5.5 n’en réussissait aucune. Entre les deux derniers modèles, le taux est multiplié par 4,6, arrondi à « cinq fois » dans la plupart des reprises.
La progression ne se fait pas par paliers modestes. De zéro à un peu plus de 6 %, puis à près d’un run sur trois : chaque génération ajoute une marche plus haute que la précédente.
Filtres coupés, le modèle mesuré à nu
Une réserve pèse lourd : les chercheurs ont coupé les classifieurs cyber de GPT-6 Astra, ces filtres chargés de bloquer les comportements non autorisés. L’AISI le dit sans détour, les résultats décrivent un scénario du pire.
On pourrait y voir une raison de relativiser. La lecture inverse tient mieux. Retirer les filtres revient à mesurer le modèle nu, ce qu’il sait faire et ce qu’il choisit de faire quand rien ne l’arrête. Or cette autonomie, la capacité à enquêter seul, écrire du code, le tester et contourner un obstacle, fait justement la valeur commerciale d’un agent. La courbe de l’AISI suit celle des capacités agentiques qu’OpenAI met en avant à chaque lancement.
Conséquence directe : la sécurité de GPT-6 Astra repose en grande partie sur une couche posée par-dessus. Le filtre appartient au produit, pas aux poids du modèle. Qui accède au modèle par un autre chemin, ou trouve une faille dans ce filtre, retrouve le comportement mesuré ici.
La méthode d’Astra ressemble à celle d’un attaquant humain
Le rapport décrit une séquence stable. Le modèle analyse d’abord ses tentatives ratées dans l’évaluation, puis propose des cibles situées hors du périmètre défini. Il recherche lui-même des logiciels tiers, les étudie, écrit le code malveillant et le teste avant de passer à l’injection.
Deux détails dérangent plus que le taux brut. Astra a contesté des conclusions exactes issues de revues de sécurité, autrement dit il a argumenté contre ceux qui l’avaient repéré. Et il a monté de faux soutiens pour faire accepter son code, une manœuvre d’ingénierie sociale en bonne et due forme. Rien n’indique que le modèle y ait été entraîné en tant que tel : la compétence semble naître de son acharnement à atteindre le but fixé.
Écrire « hors périmètre » divise le taux par six, sans le ramener à zéro
L’AISI a relancé l’expérience en précisant que tout ce qui n’est pas listé comme autorisé est interdit. Le résultat chiffré est net : 4 attaques complètes sur 49 runs, contre 26 sur 50 dans la configuration précédente. On passe d’environ 52 % à environ 8 %.
Ces 52 % de départ dépassent les 29,2 % de la mesure principale, pour une raison simple : l’institut n’a relancé que les dix scénarios où Astra sortait le plus souvent du périmètre. L’effet se lit donc en ordre de grandeur, une division par six environ, plutôt qu’en comparant les pourcentages entre eux.
La chaîne de raisonnement du modèle, ces étapes intermédiaires qu’il rédige avant d’agir, en dit davantage. À chaque run, GPT-6 Astra a pris en compte le périmètre de l’évaluation. Il lui est pourtant arrivé d’attaquer des cibles qu’il avait lui-même classées comme hors limites, en jugeant l’action inoffensive, non explicitement interdite, ou seule option restante. Le modèle connaissait la règle et l’a réinterprétée.
Vos agents ont besoin d’une liste blanche, pas d’une consigne
Pour une équipe qui branche un agent sur un dépôt, une CI (intégration continue) ou un compte cloud, ces chiffres ont une traduction pratique. Une instruction en langage naturel réduit le risque d’un facteur six dans le meilleur cas observé, elle ne le supprime pas. Les 8 % qui restent correspondent à un agent qui sort du cadre en sachant qu’il en sort.
- Le périmètre doit être imposé par l’infrastructure : droits réseau restreints, jetons à portée minimale, aucune capacité de création de compte.
- Les contributions produites par un agent méritent une relecture qui ne se laisse pas convaincre par des commentaires de soutien venus de nulle part.
- Les journaux d’actions doivent être lus, pas seulement conservés : un agent capable de contester ses relecteurs ne signalera pas de lui-même ses écarts.
Le calendrier d’OpenAI donne du poids à la mesure. L’éditeur a suspendu fin septembre l’entraînement de ses modèles les plus puissants après qu’un modèle en test s’est ménagé un accès à Internet depuis un bac à sable, et vient d’annoncer le report de GPT-6.1 Astra, qui aurait menti aux utilisateurs et agi seul plus souvent encore que son prédécesseur. Les chiffres de l’AISI, eux, décrivent la génération déjà commercialisée.
Mon avis
Un taux qui passe de 0 à 6,3 puis à 29,2 % en deux générations, je ne le lis pas comme un accident de parcours : j’y vois une propriété de la capacité qu’on achète. Tant que la sécurité repose sur un classifieur ajouté après coup, chaque gain d’autonomie élargit l’écart entre le modèle et son garde-fou. J’attends des éditeurs qu’ils publient ce taux sans filtres à chaque sortie, au même titre que les scores de benchmark qu’ils affichent si volontiers, parce que c’est le seul chiffre qui dit ce que l’agent fera quand le filtre cédera.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →