L’IA qui construit l’IA propose beaucoup mais décide peu

L'IA qui construit l'IA propose beaucoup mais décide peu

Pendant quatre semaines, 56 personnes ont développé un modèle de langage avec des agents IA à leurs côtés, et chaque tâche a été consignée. Le modèle s’appelle Atria Dawn Preview. Ses scores comptent moins que ce que révèlent ces journaux de bord : les agents fournissent une large part des options, presque jamais la décision finale.

Un modèle de 744 milliards de paramètres, construit à plusieurs mains

Atria Dawn Preview compte 744 milliards de paramètres et repose sur une architecture mixture-of-experts, où seule une fraction de ces paramètres travaille à chaque requête. L’équipe Atria, au Shanghai AI Laboratory, le destine aux tâches de recherche et d’ingénierie. Son entraînement relie chaque tâche à un environnement d’exécution réel : le modèle appelle des outils, produit des résultats intermédiaires, puis se voit confronté à des signaux externes comme des tests, des métriques ou des preuves tirées des sources.

Les performances sont honorables sans être spectaculaires. Selon l’équipe, le modèle arrive en tête sur 5 des 16 benchmarks mesurés, dont AutomationBench, CyberGym et MLE-Bench Lite, mais reste derrière la concurrence sur GDPval et SWE-Bench Pro. Aucun avantage global, donc.

L’intérêt du rapport technique tient à sa méthode. L’équipe a passé en revue 769 tâches du projet et noté, pour chacune, qui a proposé quoi et qui a tranché. L’IA intervenait dans 96,5 % d’entre elles. On dispose rarement d’une radiographie aussi fine d’un chantier où l’IA participe à la fabrication de l’IA.

De 11 à 28,5 actions par intervention humaine, sans gain d’autonomie

Premier indicateur, le plus flatteur en apparence : le nombre médian d’actions d’agent pour chaque intervention humaine. Il passe de 11 à 28,5 en quatre semaines, soit une multiplication par 2,6. Lu trop vite, ce ratio suggère des agents qui gagnent en autonomie semaine après semaine.

L’équipe Atria met elle-même en garde contre cette lecture. Chaque décision humaine déclenchait simplement une chaîne d’étapes plus longue. Les participants donnaient des consignes plus copieuses, les agents les déroulaient plus loin, mais le nombre de choix faits par la machine n’augmentait pas pour autant. Un salarié à qui l’on confie des dossiers plus épais ne devient pas son propre chef.

Pour vous qui suivez vos agents à travers des tableaux de bord, la leçon est directe. Compter les appels d’outils, les tokens consommés ou les étapes enchaînées mesure un volume d’exécution. Ce volume peut doubler sans que le projet avance d’un pas.

Jusqu’à 55 % des propositions, moins de 10 % des arbitrages

Le cœur du rapport porte sur la répartition des décisions. Pour le choix des méthodes et des paramètres, le schéma dominant se résume ainsi : l’IA propose, l’humain sélectionne, dans 55,4 % des cas. Au total, les humains ont pris 85,5 % des décisions sur ces sujets, contre 9,2 % pour l’IA.

Sur les objectifs et le périmètre des tâches, l’écart se creuse encore : l’humain a le dernier mot dans 93,4 % des cas. Selon le type de décision, la part des propositions venant de l’IA varie de 17 à 55 %. Sa part des décisions finales, elle, reste partout sous la barre des 10 %.

Cet écart entre une abondance d’idées et une poignée de choix désigne le goulot. Un agent peut générer dix pistes en quelques minutes ; quelqu’un doit encore les lire, les comparer et en retenir une. Plus la génération s’accélère, plus ce tri pèse lourd dans le calendrier.

Un tiers de travail qui n’aurait jamais été lancé

Les participants devaient aussi dire s’ils auraient pu mener leur part de la tâche sans IA, au même périmètre et à la même qualité. Sur 455 tâches achevées avec assistance, 151 ont été jugées irréalisables sans elle, environ un tiers. Elles se répartissent sur 27 des 56 participants : quelques utilisateurs chevronnés ne suffisent donc pas à expliquer la moyenne.

Cette proportion appelle de la prudence. Elle repose sur une auto-évaluation contrefactuelle, par des personnes qui estiment ce qu’elles auraient fait dans une autre configuration. Et elle émane de l’équipe qui construit le modèle, laquelle a tout intérêt à montrer que l’IA élargit le champ du possible. Le signal reste intéressant, avec une réserve de taille sur sa mesure.

Même sur ces 151 tâches, l’humain a choisi l’objectif dans 95,4 % des cas. L’IA rend faisable ce qui ne l’était pas ; elle ne décide pas de ce qui mérite d’être fait.

Face aux blocages, l’humain fournit surtout du contexte

Le même partage apparaît face aux difficultés. Sur 588 tâches où un blocage a été relevé, 76 % ont avancé grâce à une intervention humaine, et 23 % parce que l’agent a trouvé seul la solution.

La nature de cette aide frappe davantage que sa fréquence. Dans 35,2 % des cas, l’humain a ajouté du contexte ou clarifié les exigences ; dans 34,7 %, il a diagnostiqué le problème et changé de méthode. Les retouches partielles ne pèsent que 3,2 % des cas, la reprise complète du travail 0,7 %. Et lorsqu’une production devait être révisée, l’IA s’en chargeait elle-même dans 75,4 % des cas après un retour humain.

L’humain n’exécute presque plus : il informe et il oriente. Il manque à l’agent des intentions explicites, des contraintes formulées, un diagnostic quand il tourne en rond. Pour une équipe qui travaille ainsi, soigner les spécifications et documenter le contexte métier rapporte plus que d’ajouter un agent supplémentaire.

La capacité d’une équipe se mesure alors au nombre d’arbitrages qu’une personne peut rendre chaque jour sans perdre en discernement. Les prochains rapports de ce type gagneraient à évaluer la qualité de ces arbitrages, et plus seulement leur nombre. La vitesse des modèles construits avec des agents se jouera sur ce tri, bien plus que sur la cadence des machines.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *