
L’essentiel
- Anthropic ouvre en bêta publique les workflows dynamiques de Claude Managed Agents : un agent principal rédige un plan et le répartit entre jusqu’à 1 000 sous-agents travaillant en parallèle.
- Dans une base de 116 000 lignes où 70 bugs ont été plantés, un agent seul en a trouvé 14, 15 et 27 sur trois exécutions ; le workflow en a trouvé 66 à chaque fois.
- Le coût en tokens n’est pas chiffré : Anthropic avertit seulement que ces workflows peuvent en consommer beaucoup et conseille de commencer petit.
Anthropic a caché 70 bugs dans une base de code de 116 000 lignes, puis a lancé deux concurrents à leur recherche : un agent seul d’un côté, un workflow de l’autre. Trois exécutions chacun. L’écart est assez large pour qu’on se demande ce qu’il mesure exactement.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Ce que le test compare, au juste
Côté agent seul, les trois passages donnent 14, 15 et 27 bugs, soit entre 20 % et 39 % des défauts plantés. Côté workflow, 66 à chaque exécution : 94 % de la cible, trois fois de suite. Le résultat moyen compte moins que sa régularité. L’agent seul double presque son score d’un essai à l’autre, le workflow ne bouge pas. Pour une équipe qui voudrait brancher ce système dans une chaîne de revue, la constance pèse davantage que le pic.
Le périmètre reste étroit, pourtant. Une seule tâche (la détection de bugs), trois passages, des défauts posés par l’équipe qui commercialise l’outil. Des bugs plantés sont plus francs que ceux qui s’accumulent naturellement dans un dépôt, et rien dans l’annonce ne montre que l’écart se maintient sur de la migration, de la rédaction ou de l’analyse de documents. Autre angle mort : le total de 66 compte des bugs retrouvés, pas le bruit qui les accompagne. Combien de fausses alertes ont dû être écartées pour y arriver ? L’annonce ne le dit pas.
Le plan devient la pièce maîtresse
Le mécanisme tient en trois gestes : un agent principal écrit un plan, le distribue à des sous-agents (des instances de Claude chargées chacune d’un morceau du travail), puis fusionne les résultats. Jusqu’à 1 000 d’entre eux peuvent tourner en parallèle par exécution. Pour l’activer, il faut sélectionner le type d’agent « multiagent_20261001 » dans Claude Managed Agents, aujourd’hui en bêta publique.
Anthropic ne détaille pas ici le modèle utilisé dans chacun des deux camps. Si c’est le même, la lecture s’impose : le gain vient de la façon de découper et de coordonner, pas d’une intelligence supplémentaire. La valeur se déplace alors vers deux endroits. D’abord le plan : comment découpe-t-on 116 000 lignes pour que chaque sous-agent ait un périmètre utile et que les recoupements ne se perdent pas ? Ensuite la fusion : qui dédoublonne les trouvailles, qui tranche entre deux sous-agents en désaccord, qui vérifie qu’un « bug » signalé en est un ? Ces deux étapes restent du travail d’ingénierie, et ce travail décidera si les 66 bugs retrouvés se reproduisent chez vous.
La facture que personne ne chiffre
L’annonce reste muette sur le prix. Anthropic reconnaît que ces workflows peuvent consommer « beaucoup » de tokens (les unités de texte sur lesquelles l’usage est facturé) et recommande de démarrer petit. Le nombre de sous-agents mobilisés pendant le test n’est pas précisé non plus.
Un ordre de grandeur permet de poser la question sans inventer de tarif. L’agent seul trouve en moyenne un peu moins de 19 bugs sur trois essais, le workflow en trouve 66 : environ 3,5 fois plus. Pour que le workflow soit moins cher par bug trouvé, son exécution doit donc coûter moins de 3,5 fois celle d’un agent seul. Chaque sous-agent ouvre sa propre fenêtre de contexte et la facture. Avec quelques dizaines d’agents, le pari paraît jouable ; avec les 1 000 du plafond annoncé, il faudrait des tâches très découpables pour que le compte tienne. Rien ne permet de dire de quel côté se situe le test d’Anthropic.
Quoi tester avant de signer
La démarche la plus fiable consiste à reproduire l’expérience chez soi. Prenez un dépôt que vous connaissez, plantez-y vos propres défauts, lancez l’agent seul puis le workflow, et relevez trois choses : le nombre de défauts retrouvés, le nombre de fausses alertes, le total de tokens consommés. Le bon indicateur est le coût par bug confirmé, pas le coût par exécution.
Pour un premier essai, la commande « /claude-api managed-agents-onboard » dans Claude Code guide la mise en place, et la documentation d’Anthropic détaille le type d’agent multi-agents. Commencez avec une poignée de sous-agents, pas avec le plafond.
Mon avis
Le coût par bug confirmé sera bientôt la seule métrique qui compte, et les annonces d’éditeurs l’omettent systématiquement. Tant qu’elle manque, 66 sur 70 reste un chiffre de vitrine. Je ne mettrais aucun workflow de ce type en production sans avoir mesuré, sur mon propre code, ce que coûte chaque défaut réel retrouvé.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →