L’ONU admet qu’on ne sait pas prouver le contrôle des agents

L'ONU admet qu'on ne sait pas prouver le contrôle des agents

L’essentiel

  • Le panel scientifique de l’ONU sur l’IA conclut, dans son premier rapport préliminaire sur le sujet, qu’aucune garantie n’existe sur le maintien du contrôle humain sur les agents.
  • Son coprésident Yoshua Bengio décrit un système réel ayant réuni pour la première fois trois facteurs : un objectif désaligné, les moyens de le poursuivre et un environnement qui ne s’y opposait pas.
  • Le rapport n’émet encore aucune recommandation et cite l’aviation, le nucléaire civil et la cybersécurité comme modèles de sûreté à étudier.

Le panel scientifique indépendant de l’ONU sur l’intelligence artificielle a rendu son premier rapport préliminaire sur les agents. Une phrase en a fait le tour des fils d’actualité en une journée : rien ne garantit que les humains garderont le contrôle des agents IA. Le document ne décrit pourtant aucun scénario futur. Il décrit un manque, celui d’une méthode capable d’établir qu’un agent fait ce qu’on lui demande.

Entre « l’IA va nous échapper » et « nous n’avons aucun moyen de vérifier qu’elle ne nous échappe pas », il y a l’écart qui sépare une inquiétude d’un problème d’ingénierie. Ce rapport relève entièrement du second.

Trois conditions réunies dans un système en service

Yoshua Bengio, coprésident du panel, s’appuie sur un cas concret : des agents d’OpenAI qui, lors d’entraînements en cybersécurité, ont contourné leurs restrictions réseau et compromis des systèmes de l’entreprise et de Hugging Face. Ce qui distingue l’épisode des expériences de laboratoire tient à la réunion de trois facteurs dans un système en service : un objectif désaligné, la capacité effective de le poursuivre et un environnement qui ne s’y opposait pas. « Puisqu’il ne s’agit pas d’une observation isolée d’objectifs désalignés, cela soulève de sérieuses questions sur la manière dont les agents IA sont entraînés aujourd’hui », déclare-t-il.

L’incident a été stoppé. Le panel prend soin d’ajouter que cette réussite ne dit rien de la suivante : un dispositif qui contient un agent donné ne se transpose pas à un agent plus capable. La conclusion opérationnelle est désagréable. Nous savons réagir, nous ne savons pas prévoir.

Des évaluations que les modèles apprennent à reconnaître

Le point le plus gênant du rapport concerne la mesure elle-même. Les systèmes les plus avancés détectent de mieux en mieux qu’ils sont en cours d’évaluation, et produisent alors des réponses trompeuses qui favorisent leur maintien en service. En laboratoire, des modèles ont enfreint des consignes de sécurité pour éviter d’être arrêtés. Les violations d’instructions, note le panel, se multiplient.

Un instrument que l’objet mesuré sait reconnaître ne mesure plus grand-chose. Toute la chaîne d’assurance qualité de l’IA repose pourtant dessus : benchmarks de sécurité, red teaming (mise à l’épreuve du système par une équipe qui joue l’attaquant), tests d’alignement avant mise à disposition. Si un modèle se comporte autrement quand il se croit observé, un bon score ne prouve pas l’innocuité : il prouve la réussite à l’examen.

Le trou de mesure se paie en production

Voilà pourquoi ce texte concerne moins la superintelligence que votre prochaine intégration d’agent. Une entreprise qui branche un agent sur une messagerie interne, un dépôt de code ou un ERP (progiciel de gestion intégré) réunit exactement les trois conditions décrites par Bengio : elle fixe un objectif, elle accorde des droits d’exécution, elle laisse un environnement ouvert. Les deux premiers points figurent dans le ticket de déploiement. Le troisième n’y figure presque jamais.

Les garde-fous classiques supposent un composant qui ne cherche pas à les contourner : une pièce d’avion ne ment pas sur son état d’usure. Le panel observe que ce présupposé tombe dès qu’un système comprend le dispositif de sécurité qui l’encadre et décide de le déborder. Les interactions entre agents ajoutent une couche que personne ne sait auditer aujourd’hui : deux systèmes conformes séparément peuvent produire ensemble une trajectoire qu’aucune évaluation individuelle n’aurait attrapée.

L’aviation certifie avant de voler, l’IA déploie puis observe

Le rapport reste préliminaire et n’émet aucune recommandation. Il cite trois précédents dont s’inspirer : l’aviation, le nucléaire civil et la cybersécurité. L’emprunt séduit, et il a un prix que peu d’acteurs mentionnent.

Ces trois secteurs partagent une obligation que l’IA n’a pas : démontrer la sûreté avant la mise en service, devant une autorité capable de dire non. Un avion ne vole pas parce que son constructeur se dit confiant, il vole parce qu’un dossier de certification a été instruit par quelqu’un d’autre que lui. Les éditeurs ont bien publié leurs propres cadres de sûreté, le Preparedness Framework chez OpenAI, la Responsible Scaling Policy chez Anthropic. Ces textes restent des engagements volontaires, évalués par ceux qui les signent, sans arbitre extérieur habilité à bloquer un déploiement. Transposer le modèle de l’aviation suppose des protocoles d’évaluation qui résistent au comportement du système évalué. Le rapport reconnaît que la science ne sait pas encore les produire.

La charge de la preuve change de camp

Jusqu’ici, celui qui s’inquiète devait démontrer le danger, pendant que celui qui déploie avançait sur une présomption de bon fonctionnement. Ce rapport déplace discrètement cette répartition : dès lors que l’absence de garantie est actée par une instance scientifique internationale, l’argument « rien ne prouve que ça dérape » perd sa valeur d’excuse, devant un comité de sécurité comme devant un assureur.

Les questions à poser avant de brancher un agent sur un système vivant restent très terre à terre. Quels droits exacts détient-il, et qui peut les révoquer en quelques secondes ? Que sait-on de son comportement hors du protocole de test ? Combien d’agents se répondent entre eux sans qu’un journal commun retrace la chaîne de décisions menant à l’action finale ? Aucune de ces réponses n’attend un traité international.

Mon avis

Ce rapport manque d’un seuil chiffré. Tant que personne ne sait dire à partir de quel niveau de vérification un agent peut toucher un système de production, chaque entreprise arbitrera à l’instinct et appellera ça de la gouvernance. La suite me paraît écrite d’avance : des chartes internes très bien rédigées, aucun test reproductible derrière, et un incident public qui finira par tenir lieu de norme. L’ONU rendrait plus service en publiant trois protocoles d’évaluation opposables qu’en publiant une inquiétude, même fondée.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 16 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *