Claude Sonnet 5.5 passe de 10 à 70 % et fait douter d’Opus

Claude Sonnet 5.5 passe de 10 à 70 % et fait douter d'Opus

L’essentiel

  • Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5, au même tarif que Sonnet 5 : 2 dollars par million de jetons en entrée, 10 dollars en sortie.
  • Sur Terminal-Bench 4.0, qui évalue les agents de programmation en terminal, il obtient 70,6 % contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5.
  • La réflexion est désormais toujours active ; le paramètre between_tools permet de couper la réflexion initiale.
  • Sonnet 5.5 devient le modèle de l’offre gratuite de claude.ai, et Haiku 5.5 est annoncé pour les prochaines semaines.

Anthropic vient de livrer un modèle intermédiaire qui devance son propre haut de gamme sur le test le plus proche du travail quotidien d’un agent IA. Claude Sonnet 5.5, facturé au prix de Sonnet 5, affiche 70,6 % sur Terminal-Bench 4.0, là où Opus 5.5 s’arrête à 66,4 %. Avant de réorganiser vos pipelines autour de ce score, mieux vaut regarder comment il a été obtenu.

De 10,3 à 70,6 % : un point de départ très bas

Terminal-Bench 4.0 mesure la capacité d’un modèle à mener seul des tâches de programmation dans un terminal : lancer des commandes, lire les erreurs, corriger, recommencer. Passer de 10,3 % à 70,6 % d’une version à l’autre revient à multiplier le taux de réussite par près de sept. Aucune autre ligne du tableau publié par Anthropic ne bouge dans ces proportions.

Ce score de 10,3 % pour Sonnet 5 en dit sans doute autant sur le test que sur le modèle. Sur CursorBench 4.0, qui rejoue de vraies sessions de l’éditeur Cursor, l’écart entre les deux générations est de 21 points (34,1 % contre 55,5 %). Sur FrontierCode 1.1, il tombe à une dizaine de points. Un prédécesseur aussi faible sur un seul banc d’essai laisse penser que cette version de Terminal-Bench exige des comportements (enchaîner les outils, tenir une longue session) que Sonnet 5 ne maîtrisait presque pas.

Deux précisions encore. Tous ces chiffres viennent d’Anthropic, pas d’une évaluation indépendante. Et le score d’Opus 5.5 est celui obtenu au réglage d’effort « Xhigh », son meilleur, alors que le tableau ne précise pas le réglage retenu pour Sonnet.

Deux points d’écart avec Opus, zéro centime de hausse

Ailleurs, la hiérarchie tient, mais de justesse. Sur CursorBench, Sonnet 5.5 finit 2,3 points sous Opus 5.5 (55,5 % contre 57,8 %). Sur OSWorld 2.1, qui teste l’usage autonome d’un ordinateur, 1,7 point les sépare (80,1 % contre 81,8 %). Sur GDPval-AA, qui évalue le travail de bureau dans 44 métiers à partir des tâches GDPval d’OpenAI, il lui manque deux points Elo (un classement fondé sur des confrontations deux à deux, comme aux échecs) sur plus de 1 800 : 1 844 contre 1 846. Anthropic prévient toutefois que ces scores GDPval-AA viennent d’une préversion touchée par un bug, depuis corrigé.

Opus garde l’avantage là où le raisonnement pèse le plus : 67,7 % contre 64,5 % sur Humanity’s Last Exam avec outils, 54,4 % contre 52,1 % sur FrontierCode. Deux à trois points, donc, sur les problèmes les plus durs.

Côté facture, le tarif reste celui de Sonnet 5 : 2 dollars par million de jetons en entrée, 10 dollars en sortie, 0,20 dollar pour les lectures de cache. La baisse annoncée, « jusqu’à 30 % » par tâche, ne vient pas du prix unitaire. Elle vient du volume : selon le guide publié par Anthropic pour les développeurs, Sonnet 5.5 consomme nettement moins de jetons pour le même travail, en partie parce qu’il regroupe plus souvent ses appels d’outils et raccourcit ses boucles d’agent. Sur FrontierCode en réglage « High », l’éditeur annonce dix points de mieux que Sonnet 5 pour un coût par tâche en nette baisse. Un agent qui appelle peu d’outils verra un gain plus modeste.

Au réglage « Max », le modèle se saborde

L’anomalie la plus instructive du tableau concerne l’effort de réflexion. Sur FrontierCode, Sonnet 5.5 obtient 52,1 % en « Xhigh » mais seulement 46,2 % en « Max ». Anthropic l’explique : à l’effort maximal, le modèle déclenche plus souvent une fonction de revue de code qui répartit le travail entre plusieurs sous-agents, avec des dépassements de délai et des modifications hors du périmètre demandé.

Un test indépendant, le dessin d’un pélican à vélo en SVG (format d’image vectorielle) devenu rituel à chaque sortie de modèle, chiffre l’écart. En « Max », Sonnet 5.5 a réfléchi pendant 128 000 jetons, soit 1,28 dollar, avant d’épuiser son budget sans rien produire. En « Xhigh », il a livré son dessin en 41 secondes pour 5,74 centimes. Plus de vingt fois moins cher, et un résultat au bout.

Ce comportement compte d’autant plus que la réflexion est désormais toujours active. Le paramètre between_tools supprime la réflexion initiale pour ne réfléchir qu’entre deux appels d’outils. Anthropic signale aussi un piège de migration : une réponse peut commencer par un bloc de réflexion, et le code qui lit directement content[0].text casse. Le coût d’un agent se décide désormais autant dans le réglage de l’effort, tâche par tâche, que dans le choix du modèle.

Opus garde-t-il sa place dans un pipeline d’agents ?

Anthropic trace la frontière ainsi : Opus 5.5 pour le travail complexe qui demande un jugement fin, Sonnet 5.5 pour les tâches quotidiennes bien délimitées (correction de bugs, documentation, présentations, tableurs). Or une grande partie des agents IA en production vit dans cette seconde catégorie : un ticket, un périmètre, des tests qui disent si le problème est réglé.

Pour ces usages, payer Opus, facturé le double (4 dollars par million de jetons en entrée, 20 en sortie), revient à acheter deux ou trois points sur les cas les plus ardus. La dépense se défend pour une migration d’architecture ou un audit de sécurité. Pour trier des tickets ou réparer un test cassé, beaucoup moins. Le schéma le plus rationnel consiste à router : Sonnet par défaut, Opus en escalade quand un premier passage échoue.

La gamme bouge aussi par le bas. Sonnet 5.5 équipe maintenant l’offre gratuite de claude.ai, ce qui met un modèle de ce niveau à la portée de tous, et Haiku 5.5, promis pour les prochaines semaines, visera les gros volumes à bas coût. Face à GPT-6 Sol, qu’Anthropic crédite de 1 487 points sur GDPval-AA contre 1 844 pour Sonnet 5.5, l’éditeur défend son avance sur la performance plutôt que sur le prix.

Le haut de gamme d’Anthropic se retrouve à défendre un écart de quelques points, mesuré par son propre éditeur. La prochaine version d’Opus devra creuser la distance, ou revoir son tarif.

Mon avis

Pour la majorité des agents IA en production, Opus 5.5 est devenu une ligne de budget que je ne sais plus défendre. Les deux ou trois points qu’il conserve sur les problèmes les plus durs valent leur prix sur une poignée de tâches, pas sur un flux quotidien de tickets. Le gisement d’économies se trouve plutôt dans l’effort : une équipe qui laisse ses agents en « Max » paiera davantage pour un résultat moins bon qu’en « Xhigh ».

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *