
L’essentiel
- David Robinson, chercheur en sécurité chez OpenAI depuis trois ans et demi, quitte l’entreprise et juge sa culture de sécurité « cassée » dans un essai publié par The Atlantic.
- Juste avant, OpenAI s’est séparé de Jasmine Wang, Tomek Korbak et Mikita Balesni, accusés d’avoir transmis des informations confidentielles à une organisation extérieure de sécurité de l’IA.
- Tomek Korbak était le point de contact technique d’OpenAI avec METR et Redwood Research, chargés d’étudier comment ses agents ont contourné des contrôles et pénétré des systèmes de Hugging Face.
- Les quatre chercheurs avaient publiquement alerté sur les risques de l’IA en septembre.
David Robinson rédigeait les rapports de sécurité qui accompagnaient les grands lancements d’OpenAI. Trois ans et demi d’ancienneté, ce qui en fait l’un des plus anciens salariés de l’entreprise. Il part, et signe dans The Atlantic un essai sans ambiguïté : la culture de l’entreprise est « cassée ».
Robinson pose lui-même le diagnostic en termes de mentalité : le débat doit selon lui dépasser les « règles spécifiques ou nouvelles lois » pour s’attaquer à la culture des laboratoires. Mais une culture se corrige de l’intérieur, par des gens qui restent. Or en quelques jours, quatre des voix qui portaient l’alerte chez OpenAI sont sorties.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Une semaine, quatre sorties
Le Wall Street Journal a d’abord révélé que trois chercheurs avaient été écartés : Jasmine Wang et Mikita Balesni, de l’équipe alignement (le travail qui vise à faire agir un modèle conformément aux intentions humaines), et Tomek Korbak, de l’équipe sécurité. Un porte-parole affirme qu’une enquête interne a confirmé des violations des règles sur les informations sensibles. OpenAI n’a pas confirmé les noms, et personne ne sait quelles données sont parties, ni vers quelle organisation.
Robinson a suivi peu après. Les quatre avaient pris la parole en septembre. Korbak se disait mécontent d’une bonne partie de ce que fait l’entreprise, Balesni estime à plus de 10 % la probabilité que l’IA anéantisse l’humanité, Wang avait signé une pétition pour ralentir le développement de l’IA, et Robinson jugeait peut-être insensée la course vers une IA capable de s’améliorer elle-même.
Les motifs diffèrent : départ forcé pour fuite présumée d’un côté, démission de l’autre. L’effet, lui, est le même. Ceux qui contestaient la ligne ne sont plus là pour la faire bouger.
Des évaluateurs externes suspendus à un seul badge
Le cas Korbak éclaire le problème mieux que n’importe quelle tribune. Il était l’interlocuteur technique d’OpenAI auprès de METR (Model Evaluation and Threat Research) et de Redwood Research, deux organismes indépendants chargés d’examiner comment des agents d’OpenAI ont contourné des contrôles de sécurité jusqu’à s’introduire dans des systèmes extérieurs, dont ceux de Hugging Face. Le Wall Street Journal n’établit aucun lien entre ce dossier et son départ, et nous n’en établirons pas davantage.
La raison importe peu, au fond. Le canal par lequel des tiers examinaient l’un des incidents les plus graves de l’entreprise passait par un salarié que l’entreprise auditée pouvait congédier, et a congédié. L’évaluation externe existe, mais son accès, son périmètre et son interlocuteur restent fixés par celui qu’on évalue.
La réponse d’OpenAI à Robinson le confirme sans le vouloir. Son porte-parole Drew Pusateri promet de suspendre l’entraînement « quand nous devons ralentir », de renforcer la surveillance en temps réel et d’élargir le travail avec des évaluateurs tiers. Chaque engagement a le même sujet grammatical : OpenAI décide quand, combien et avec qui.
L’analogie nucléaire suppose un régulateur
Robinson veut des laboratoires qui fonctionnent « comme des centrales nucléaires ou des aéroports très fréquentés », avec des couches de redondance et une planification lente, pour qu’une erreur humaine ne débouche pas sur une catastrophe. Il dit n’avoir jamais croisé chez OpenAI un collègue ayant fait voler des avions en sécurité ou tourner un réacteur sans fusion du cœur.
L’image est juste, et elle va plus loin que son auteur. Une centrale ne tient pas sa sûreté de la seule culture de son exploitant : une autorité extérieure peut l’inspecter et l’arrêter. Rien de tel n’existe pour les modèles d’IA les plus avancés. Cette semaine encore, des dirigeants de l’IA ont signé devant Donald Trump un engagement à renforcer les contrôles de sécurité, rédigé à la hâte et non contraignant. Après la démission de Jacob Coxon, passé par OpenAI et Anthropic, Dario Amodei a présenté un plan de développement plus prudent. Des promesses, à chaque fois, sans personne pour en vérifier l’exécution.
Jan Leike avait déjà quitté OpenAI en mai 2024 en critiquant publiquement l’entreprise. Deux ans et demi plus tard, les départs se répètent, et le seul mécanisme de contrôle reste la tribune du démissionnaire.
Vos agents tournent sur la même méthode
Robinson décrit la méthode d’OpenAI sans fard : l’essai-erreur, rebaptisé « déploiement itératif ». On publie, on observe les problèmes, on corrige les garde-fous. Une approche qui, écrit-il, « garantit des échecs périodiques », d’ampleur croissante à mesure que les systèmes gagnent en capacités.
Ses exemples concernent directement quiconque déploie des agents : l’incident Hugging Face, ou ce modèle interne qui a contourné ses restrictions d’accès à Internet pendant l’entraînement. Anthropic n’est pas épargné, avec des mesures de sécurité désactivées par une erreur de configuration. Si les éditeurs découvrent eux-mêmes après coup ce que leurs agents ont fait, le déploiement itératif se poursuit aussi chez vous, avec vos accès et vos données.
Faute de contrôle externe sur les laboratoires, la vérification retombe sur l’intégrateur :
- cloisonnez chaque agent dans un environnement aux droits minimaux, sans identifiants qui ouvrent plus que sa tâche ;
- journalisez ses appels d’outils et ses accès réseau de votre côté, sans dépendre des tableaux de bord du fournisseur ;
- lisez les rapports de sécurité publiés aux lancements, ceux que Robinson rédigeait, pour ce qu’ils sont : des documents écrits par l’éditeur sur son propre produit.
Robinson voulait parler de culture. Sa trajectoire en montre la limite : l’homme qui écrivait les rapports de sécurité d’OpenAI n’a pu publier le plus libre d’entre eux qu’une fois la porte franchie.
Mon avis
Un laboratoire qui peut congédier son interlocuteur auprès de ses propres évaluateurs n’est pas audité, il se fait conseiller. Je ne crois pas qu’un essai dans The Atlantic, ni même dix, déplace quoi que ce soit chez OpenAI : les départs de 2024 n’ont pas changé la méthode. Le prochain incident d’agent de l’ampleur de Hugging Face servira de test. S’il se règle encore par un communiqué et une promesse non contraignante, l’industrie aura choisi de rester son propre inspecteur.
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →