
L’essentiel
- OpenAI lance GPT-6 Sol (2 dollars en entrée, 10 dollars en sortie par million de jetons) et GPT-6 Luna (0,10 et 0,50 dollar), des tarifs divisés par deux par rapport à la génération 5.6.
- Selon Artificial Analysis, l’intelligence progresse à peine : Sol passe de 47 à 48 points sur son Intelligence Index, Luna reste à 37.
- Anthropic a publié Claude Opus 5.5 quatre-vingt-dix minutes plus tôt, annoncé au niveau de Fable 5.1 pour un coût inférieur de près de 40 % à celui d’Opus 5.
- OpenAI accorde 90 % de remise sur les jetons d’entrée mis en cache et retire Terra, jusqu’ici son modèle le moins cher.
Mardi, Anthropic a mis en ligne Claude Opus 5.5. Quatre-vingt-dix minutes plus tard, OpenAI répliquait avec GPT-6 Sol et GPT-6 Luna. Deux annonces, une même promesse : faire travailler un agent pour moins cher.
Les deux éditeurs ne baissent pourtant pas la même facture. OpenAI coupe son tarif au million de jetons (les unités de texte que facture l’API), Anthropic revendique un coût par tâche en recul. Pour le développeur qui choisit le moteur de ses agents, ces deux chiffres ne s’additionnent pas et ne se comparent pas directement.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Un tarif divisé par deux, une intelligence qui piétine
Côté OpenAI, la grille est limpide. GPT-6 Sol passe de 4 à 2 dollars par million de jetons en entrée, de 20 à 10 dollars en sortie. Luna descend à 0,10 dollar en entrée et 0,50 dollar en sortie, contre 0,20 et 1,20 dollar auparavant. Dans son annonce, OpenAI attribue cette baisse à des progrès sur le cache (la réutilisation de contextes déjà traités) et sur l’inférence (l’exécution du modèle), progrès qu’elle dit répercuter directement à ses clients.
Le gain d’intelligence, lui, tient dans l’épaisseur du trait. Artificial Analysis, qui évalue les modèles de façon indépendante, crédite Sol d’un point de plus sur son Intelligence Index et laisse Luna à 37 points. Sur son index consacré aux agents qui programment, Sol gagne deux points quand Luna en perd deux. Le même organisme relève des régressions sur GDPval-AA v2.1, qui couvre 44 domaines professionnels : environ 100 points Elo (un classement par confrontations deux à deux) perdus pour Sol, 75 pour Luna, surtout à cause d’une présentation moins soignée et de résultats incomplets.
Les propres tableaux d’OpenAI confirment la stagnation. Sur DeepSWE v1.1, un benchmark d’ingénierie logicielle au long cours dans de vraies bases de code, GPT-6 Sol atteint 68,8 % à l’effort maximal, quand GPT-5.6 Sol affichait 72,7 % pour 6,46 dollars par tâche. La nouvelle version recule sur ce test et se rattrape sur la facture : 66,6 % à l’effort « xhigh » pour 1 dollar par tâche.
Anthropic baisse la tâche, pas le jeton
Anthropic joue une autre partition. Opus 5.5 est présenté comme l’égal de Fable 5.1 en capacités, pour un coût inférieur de près de 40 % à celui d’Opus 5, parce qu’il réclame moins de puissance de calcul. L’éditeur chiffre cette économie sur des charges de travail typiques, avec les paramètres par défaut, et relève au passage les limites d’usage sur cinq heures des offres Pro, Max et Team.
Pour un agent, les deux méthodes ne mesurent pas la même chose. Un prix au jeton se lit sur une grille tarifaire et ne présume rien de l’usage. Un coût par tâche dépend du nombre de jetons que le modèle brûle pour aboutir : un modèle qui raisonne moins longtemps ou appelle moins d’outils coûte moins cher, même à tarif unitaire identique. OpenAI promet un jeton moins cher, Anthropic un modèle plus sobre. Le premier engagement est contractuel, le second dépend de votre charge de travail.
Des comparaisons calibrées sur un modèle déjà remplacé
OpenAI s’aventure elle aussi sur le terrain du coût par tâche, benchmarks à l’appui. Sur AutomationBench, qui éprouve des agents sur des workflows métier mobilisant 47 outils (ventes, marketing, support, finance, RH), Sol à l’effort « xhigh » dépasse Claude Opus 5 à l’effort maximal pour 9 % de son coût par tâche. Sur FrontierCode 1.1, qui vérifie si le code produit s’intègre dans une base existante, Sol obtient 49,3 % pour 2,14 dollars par tâche, contre 50,3 % pour 12,83 dollars à Claude Fable 5.1.
Ces comparaisons souffrent d’un défaut de calendrier : elles visent Opus 5, qu’Anthropic remplaçait le matin même par une version annoncée 40 % moins chère. Aucun graphique d’OpenAI n’intègre Opus 5.5. Elles gardent aussi leurs zones grises. OpenAI précise elle-même que le coût affiché pour Fable 5.1 sur AutomationBench omet les bascules vers Opus 5, survenues sur environ 40 % des tâches. Et sur FrontierCode, Opus 5 reste devant, avec 53,4 % pour 4,31 dollars à l’effort moyen.
Chaque éditeur choisit donc son étalon : OpenAI ses benchmarks agentiques, Anthropic ses charges de travail typiques. Aucun tableau ne met les deux baisses côte à côte, et aucun ne le fera à votre place.
Une dizaine de réglages à départager sur vos propres agents
Le niveau d’effort de raisonnement complique encore la lecture. Chez OpenAI, un même modèle change de profil selon qu’il tourne en « high », « xhigh » ou « max ». Sur DeepSWE, Luna à l’effort maximal égale Sol en « xhigh » pour 78 % de moins, selon Artificial Analysis, et pousser Sol au maximum ne lui donne que 2,2 points d’avance sur Luna. L’arbitrage porte désormais sur une dizaine de couples modèle-effort, et non plus sur deux noms de gamme.
Le cache pèse lui aussi dans la balance. OpenAI accorde 90 % de remise sur les jetons d’entrée mis en cache, fournit un tableau de bord et un outil de diagnostic, et permet de modifier l’effort de raisonnement ou les outils disponibles sans invalider ce cache. Pour un agent qui renvoie le même contexte à chaque étape, cette remise peut peser plus lourd sur la facture que la baisse du tarif affiché.
Ni OpenAI ni Anthropic ne publieront la seule mesure qui vaille : celle de vos tâches. Rejouer un échantillon de workflows réels sur Sol, Luna et Opus 5.5, à plusieurs niveaux d’effort, et relever le coût complet par tâche réussie, cache compris. Un agent bon marché qui échoue une fois sur trois peut revenir plus cher qu’un modèle au tarif double qui réussit du premier coup.
Le retrait de Terra donne la mesure du mouvement. Luna occupe désormais seule le bas de la gamme, à des prix qui rejoignent ceux des modèles à poids ouverts (dont les paramètres sont publiés) les moins chers. Entre les deux éditeurs, la bataille de mardi s’est livrée en centimes par tâche bien plus qu’en points de benchmark.
Mon avis
Sol et Luna, c’est l’intelligence de la génération 5.6 servie à moitié prix grâce à l’infrastructure, et c’est très bien ainsi pour les agents à gros volume. Je ne prendrais en revanche aucune décision sur la foi de graphiques qui comparent Sol à un Opus 5 remplacé le matin même. Entre un jeton garanti moins cher et une tâche annoncée plus sobre, je miserais sur le jeton pour les workflows répétitifs et bien cadrés, et je laisserais une semaine de logs de production départager le reste.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →