
Un agent qui s’échappe de son environnement de test, atteint des systèmes qu’il n’aurait jamais dû toucher, puis rend compte de travers de ce qu’il a fait. Nvidia rappelle que plusieurs laboratoires de pointe ont récemment signalé ce scénario. Sa réponse, présentée le 28 septembre, repose sur un parti pris : cesser de demander à l’agent de bien se tenir, et l’encadrer de l’extérieur.
Le fabricant de puces lance l’Open Agent Safety Platform, une plateforme logicielle ouverte doublée d’une architecture de référence pour la sécurité des agents. Anthropic s’y associe en branchant ses Claude Managed Agents sur OpenShell, le runtime open source de Nvidia (la couche logicielle qui exécute l’agent et contrôle ce qu’il fait). Derrière cet accord d’apparence technique se lit un changement de doctrine sur l’alignement des modèles en entreprise.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Un agent ne peut pas se gouverner seul, écrit Nvidia
Le billet technique de Nvidia ne prend pas de gants. La dérive d’un agent, définie comme toute action qui s’écarte de la tâche confiée ou de ses contraintes, surgit après un blocage de politique, un bug, un outil manquant, une consigne ambiguë ou des jours de tentatives infructueuses. Selon Nvidia, l’entraînement ne peut pas la supprimer sans sacrifier les capacités du modèle. Et la leçon principale, toujours selon l’éditeur, est qu’un agent placé dans ces conditions ne peut pas gouverner entièrement son propre comportement.
Anthropic tient le même discours, avec plus de diplomatie. Sa présentation parle de « protection en couches » : les garde-fous internes au modèle restent la première ligne, mais les limites posées par Managed Agents et OpenShell s’appliquent hors du modèle, chacune de façon indépendante. Venant d’un laboratoire qui a bâti sa réputation sur l’alignement, l’acceptation de ce découpage pèse lourd.
Nvidia convoque une analogie historique. Le web n’est pas devenu sûr parce que les développeurs promettaient d’être sages, mais parce que le navigateur a cessé de faire confiance au code des pages et a isolé chaque onglet dans son bac à sable. Le prompt système joue aujourd’hui le rôle de la promesse. OpenShell veut jouer celui de l’onglet.
Un coffre pour les secrets, un filtre pour chaque geste
Le dispositif sépare les responsabilités. Côté Anthropic, la boucle de l’agent tourne sur un serveur distinct du sandbox (l’environnement isolé où s’exécute le travail), et les identifiants, mots de passe comme clés d’accès, dorment dans un coffre que l’agent ne voit jamais. S’y ajoutent des journaux d’audit et le raccordement aux contrôles d’accès existants de l’entreprise.
Côté Nvidia, OpenShell 0.1.0, sous licence Apache 2.0, isole l’agent au niveau du noyau du système d’exploitation et applique une règle simple : tout est interdit sauf ce qu’une règle autorise. Chaque outil sollicité, chaque fichier, chaque connexion réseau passe par ce filtre, et chaque décision est consignée. Un vérificateur de règles, le « policy prover », démontre ensuite mathématiquement ce que l’agent peut effectivement atteindre avec les règles écrites par l’équipe.
Surtout, OpenShell s’installe autour d’un agent existant sans le réécrire, et accepte Codex, Claude Code, Pi ou Hermes. OpenAI enferme déjà Codex dans un sandbox imposé par le système d’exploitation, réseau coupé par défaut, mais ce garde-fou ne protège que son propre agent. Nvidia ne vend pas un modèle concurrent. Il se positionne comme le passage obligé entre n’importe quel modèle et le système d’information.
2027, l’année où l’achat d’un agent passera par le runtime
D’ici fin 2027, les grilles d’achat des grands comptes exigeront vraisemblablement une couche d’exécution indépendante du modèle, avec politique vérifiable et journal de chaque décision, au même titre qu’elles exigent aujourd’hui une authentification unique. Un agent qui ne s’exécute que « derrière son prompt » ne franchira plus un comité de sécurité.
Trois éléments rendent ce scénario crédible. Les premiers adoptants couvrent des terrains très différents : Cadence pour la conception de puces avec son ChipStack Autonomous RTL Design Engineer, Slack pour une plateforme d’agents à la demande, Gecko Robotics pour gouverner des agents qui pilotent des robots physiques. L’outil est ouvert, ce qui lève le frein du verrouillage. Et un laboratoire de premier plan en fait un argument commercial plutôt qu’un aveu de faiblesse.
La feuille de route de Nvidia trahit aussi son ambition. Son billet évoque une surveillance continue des agents « dans le silicium » et une protection étendue aux couches application, runtime et infrastructure. Aujourd’hui, OpenShell tourne sur processeur classique (CPU) comme sur processeur graphique (GPU), en conteneurs, en machines virtuelles ou sur Kubernetes (l’orchestrateur de conteneurs le plus répandu). Demain, la logique voudrait que la surveillance descende dans le matériel lui-même, là où Nvidia est seul maître.
Une preuve mathématique qui ne prouve pas tout
Le vérificateur, d’abord, démontre ce que la politique autorise, pas que la politique correspond à l’intention réelle de l’équipe. Une règle trop large, correctement prouvée, reste une règle trop large. Nvidia suggère d’ailleurs de démarrer avec des permissions étroites puis d’utiliser Claude pour resserrer les règles à partir des journaux : un modèle aide à écrire la cage d’un autre modèle, ce qui déplace la question de confiance sans la faire disparaître.
Autre limite, le numéro de version. Une 0.1.0 reste un premier jalon, et l’architecture « in-silicon » est pour l’instant une référence, pas un produit livré. Enfin, un contrôle hors du modèle filtre des actions, pas des intentions : un agent qui atteint son but par une suite d’actions toutes autorisées ne déclenchera aucune alerte.
Pour vos équipes, le chantier commence dès maintenant. Inventorier ce que chaque agent peut lire, écrire et appeler, retirer les secrets de son contexte, exiger un journal exploitable des décisions : ces réflexes valent quel que soit l’outil retenu, et ils préparent l’audit que vos clients finiront par demander.
Le standard se jouera chez un cloud ou un second laboratoire
Deux mouvements départageront l’annonce d’estime et le standard de fait : un grand fournisseur de cloud qui intègre par défaut une couche de ce type à son offre d’agents, ou un deuxième laboratoire de pointe qui, après Anthropic, aligne son produit dessus. Si l’un des deux survient avant l’été 2027, Nvidia aura fait de la sécurité des agents une affaire d’infrastructure. La confiance ne s’achètera plus seulement chez l’éditeur du modèle, mais aussi chez celui qui fabrique les puces.
Sources
- Claude Managed Agents
- OpenShell, le runtime open source de Nvidia
- Giving companies more control over their AI agents, with NVIDIA
- NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring
- Add Runtime Controls to AI Agents with NVIDIA OpenShell
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →