L’IA bat les prévisions des experts et les labos accélèrent

L'IA bat les prévisions des experts et les labos accélèrent

En juillet 2025, un modèle d’IA a atteint le niveau médaille d’or aux Olympiades internationales de mathématiques. La médiane des experts interrogés trois ans plus tôt plaçait ce jalon cinq ans plus tard, celle des superprévisionnistes dix ans plus tard. Et pendant que cet écart se creuse, les laboratoires qui réclament un ralentissement publient à un rythme jamais atteint.

Deux séries de chiffres portent ce constat : une étude du Forecasting Research Institute (FRI) sur la justesse des prévisions en IA, et un décompte des sorties de modèles depuis 2024. Mises côte à côte, elles posent un problème à toute politique publique sur l’IA, qui repose toujours, au départ, sur une prévision.

339 spécialistes, et des erreurs toutes dans le même sens

Le FRI collecte depuis la mi-2022 des prévisions sur les progrès de l’IA. Le premier tour de son panel LEAP (Longitudinal Expert AI Panel) réunissait 339 experts : 76 informaticiens, 76 profils issus de l’industrie, 68 économistes et 119 spécialistes des politiques de l’IA. Parmi les informaticiens figuraient 30 professeurs d’établissements du top 20 mondial et 10 des 200 auteurs les plus cités du domaine. S’y ajoutaient des superprévisionnistes, des généralistes retenus pour la justesse de leurs pronostics passés.

Impossible, donc, d’imputer l’erreur à un échantillon de profanes. Et cette erreur a une direction. En moyenne, les experts attribuaient une probabilité de 24,6 % aux résultats de benchmarks qui se sont effectivement produits, les superprévisionnistes 9,7 %. Pour l’or aux Olympiades, ces probabilités tombent à 8,6 % et 2,3 %.

Pour se figurer l’écart, un double six aux dés a 2,8 % de chances de sortir. Les meilleurs prévisionnistes disponibles jugeaient la performance olympique de l’IA un peu moins probable que ce coup de dés.

Faut-il y voir un biais daté de 2022, d’avant ChatGPT ? Selon le FRI, le schéma s’est maintenu dans les enquêtes suivantes. En août et septembre 2025, les experts donnaient 10 % de chances (5,4 % pour les superprévisionnistes) à la résolution d’un problème du prix du millénaire d’ici fin 2027. Une IA en aurait peut-être déjà résolu un, même s’il reste à établir que la solution remplit les critères d’évaluation.

Virologie, cybersécurité, revenus : la même pente

Le phénomène déborde des mathématiques. Sur le Virology Capabilities Test, un benchmark de dépannage en laboratoire, les experts attendaient qu’un modèle égale une équipe de virologues de haut niveau en 2030, les superprévisionnistes en 2034. Le FRI estime que ce seuil a probablement été franchi dès avril 2025. Un benchmark de cybersécurité montre le même type de sous-estimation.

Côté économie, l’écart change d’échelle. La médiane des experts pour le plus gros revenu annuel récurrent (ARR) d’une entreprise d’IA fin 2026 s’établissait à 20 milliards de dollars, contre 16 milliards pour les économistes et 25 milliards pour les superprévisionnistes. Le FRI cite environ 100 milliards pour Anthropic en septembre 2026, et 65 milliards étaient déjà rapportés en juillet. L’estimation la plus optimiste visait quatre fois trop bas.

Là où les prévisions ont vu trop grand

Le tableau n’est pas uniforme, et le FRI le reconnaît. Les experts en biosécurité prévoyaient que 22,5 % des participants aidés d’un modèle de langage réussiraient des tâches de laboratoire biologique, les virologues 40 %, les superprévisionnistes 16,2 %. Lors d’un essai contrôlé, seuls 5,2 % y sont parvenus avec un modèle et l’accès à internet, contre 6,6 % avec internet seul. Aucun effet mesurable du modèle, sur un échantillon il est vrai restreint.

Même surestimation probable pour la voiture autonome : les experts tablaient sur 7,3 % de trajets de VTC autonomes aux États-Unis en 2027, quand une projection par modèle de langage en retient 2,5 %. Sur la croissance, l’emploi ou les dommages majeurs causés par l’IA, le FRI juge encore impossible de trancher.

La ligne de partage se dessine nettement. Les experts sous-estiment ce que les modèles réussissent en test, et surestiment la vitesse à laquelle ces capacités se traduisent dans le monde réel. Les répondants associaient d’ailleurs le jalon de virologie à un risque biologique accru, sans qu’aucune hausse documentée des dommages n’ait suivi. Un benchmark franchi ne dit pas qu’un usage suit.

Une annonce tous les 8,3 jours chez ceux qui veulent freiner

Le 12 septembre 2026, Dario Amodei, PDG d’Anthropic, publie sur son site personnel un essai intitulé « We Must Pace the Frontier », qui appelle l’industrie à ralentir la progression des capacités. Sam Altman et Elon Musk l’approuvent publiquement le jour même. Dix jours plus tard, Anthropic dévoile Claude Opus 5.5 et OpenAI ajoute deux modèles, Sol et Luna, à sa famille GPT-6.

Un décompte des annonces d’OpenAI, d’Anthropic, de Google, de xAI et de Meta depuis juillet 2024, mené par un média spécialisé, donne la mesure : une annonce tous les 11,8 jours en 2025 (31 sur l’année), une tous les 8,3 jours depuis janvier 2026 (32 au 23 septembre). Pendant près de deux ans, les trimestres ont oscillé entre 6 et 9 annonces. Le deuxième trimestre 2026 en a compté 12, le troisième en est à 14 avant sa clôture.

Ces 32 annonces demandent une lecture prudente. Une annonce peut regrouper plusieurs modèles dévoilés le même jour, et seuls les modèles marquants entrent dans le compte. Une partie de la cadence tient à l’incrémentation des numéros de version : Google a enchaîné trois Gemini Flash en moins de deux mois, alors que Gemini 3.5 Pro, présenté en mai, n’est toujours pas sorti. Le haut de gamme suit pourtant le même tempo, avec Fable 5.1 et Opus 5.5 publiés à trois semaines d’intervalle.

La contradiction s’estompe à la lecture du texte d’Amodei. Le ralentissement qu’il décrit ne suppose ni l’arrêt de l’entraînement ni celui du progrès technique. Il passe par des évaluateurs externes installés dans les laboratoires, puis par une coordination entre entreprises et entre pays. Le PDG y admet aussi que l’IA avance beaucoup plus vite depuis l’été, portée par sa capacité croissante à construire la génération suivante. La déclaration Pacing the Frontier, lancée cet été par des salariés d’OpenAI, d’Anthropic, de Google DeepMind et de Meta, rassemble 1 386 signataires, dont Amodei et Jakub Pachocki, directeur scientifique d’OpenAI. Elle réclame l’appui du gouvernement américain pour outiller un ralentissement concerté.

Réguler avec une horloge qui retarde

Mettez les deux séries bout à bout. Un législateur qui fixerait un seuil de capacité d’après la médiane des experts l’attendrait avec plusieurs années de retard, en mathématiques comme en virologie. Et le dispositif proposé par les laboratoires eux-mêmes, audits externes et coordination internationale, se négocie en mois, voire en années.

Au rythme de 2026, un mécanisme qui met un an à se mettre en place verra passer plus de quarante annonces de modèles avant son premier contrôle. Micah Carroll, chercheur chez OpenAI, le formule sans détour : « Au rythme actuel, il y aura toutes les deux semaines environ de nouveaux modèles qui aggraveront nettement les conséquences d’un mauvais usage ou d’un défaut d’alignement. »

Pour vous qui déployez ces modèles, la leçon est plus immédiate. Une feuille de route construite sur ce que l’IA saura faire dans deux ans part avec le biais du panel du FRI. Mieux vaut raisonner sur des capacités mesurées avec vos propres jeux de tests, réévaluées à chaque sortie, en gardant l’asymétrie en tête : la capacité arrive plus tôt que prévu, l’adoption réelle souvent plus tard.

Dario Amodei prévient que « le progrès semblera toujours rapide ». Les données du FRI vont plus loin : il a jusqu’ici dépassé ce qu’anticipaient les spécialistes les mieux placés, et chaque texte de régulation calé sur leurs prévisions naît avec ce retard déjà inscrit dans son calendrier.

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *