OpenAI divise ses prix par cinq, pas le coût de vos agents

OpenAI divise ses prix par cinq, pas le coût de vos agents

L’essentiel

  • OpenAI a lancé GPT-6.1 Sol au DevDay du 29 septembre, facturé 2 dollars par million de tokens en entrée et 10 en sortie, contre 10 et 50 pour GPT-6 Astra.
  • Sol fait jeu égal avec Astra en programmation (75 % contre 74 % sur DeepSWE v1.1) et sur le travail de bureau.
  • Il recule sur l’automatisation de workflows, le computer use, la science et la factualité, avec un taux d’erreur de 7,7 % contre 3,9 % sur les prompts difficiles.
  • Ses prix s’alignent sur ceux de Claude Sonnet 5.5, avec une lecture en cache deux fois moins chère.

Mardi soir, sur la scène du DevDay, OpenAI a présenté GPT-6.1 Sol comme « le modèle le plus rentable en termes de performance disponible aujourd’hui ». Une intelligence « quasi-Astra » pour un cinquième du prix : l’annonce se lit d’emblée comme une affaire de tarif. Le tableau comparatif publié par OpenAI situe pourtant les écarts de Sol à un endroit bien précis, celui où travaillent les agents.

Pour une équipe qui fait tourner des agents en production, cet endroit pèse plus lourd que le prix affiché.

Un modèle calé sur le code, en retrait sur l’automatisation

En génie logiciel, Sol obtient 75 % sur DeepSWE v1.1, un point devant Astra. Sur GDP.pdf, un benchmark de travail professionnel, les deux modèles sont à égalité avec 32 %. Pour un assistant de développement ou un outil de rédaction, la promesse d’OpenAI tient.

Le reste du tableau dessine un autre profil. Sur AutomationBench, qui mesure l’automatisation de workflows, Sol plafonne à 36 % quand Astra atteint 41 % et Claude Opus 5.5 40 %. Sur OSWorld 2.0, le test de référence du computer use (un modèle qui pilote lui-même un ordinateur, clavier et souris), il cède deux points. En recherche scientifique, l’écart dépasse onze points. Et sur les prompts difficiles, son taux d’erreur factuelle double presque celui d’Astra.

Automatisation, pilotage d’interface, fiabilité des faits : ce sont les trois qualités qu’on attend d’un agent qui enchaîne des actions sans supervision.

Le prix du token trompe sur le prix de la tâche

Le prix au million de tokens (l’unité de texte que facturent les modèles) se compare facilement. Il ne dit pas combien coûte une tâche menée à terme. Un agent qui automatise un processus en vingt étapes ne se paie pas à la requête : il se paie à l’issue, réussie ou ratée.

Prenons un calcul volontairement simple. À consommation égale, Sol peut échouer et recommencer quatre fois avant de coûter autant qu’Astra. Sur une tâche où l’échec se voit (un test qui casse, un formulaire refusé), le calcul penche largement en sa faveur. Quand l’erreur passe inaperçue, la facture arrive plus tard et ne figure dans aucune grille tarifaire : une donnée fausse recopiée dans un CRM (le logiciel de gestion de la relation client), un chiffre halluciné dans un rapport remis à un client.

Un taux d’erreur factuelle presque doublé a donc un coût, simplement déplacé vers la vérification humaine ou la réparation.

La grille de Sol pousse aussi dans une direction assumée. La lecture en cache (le fait de réutiliser un contexte déjà envoyé au modèle) tombe à 0,10 dollar par million de tokens, dix fois moins que chez Astra et deux fois moins que chez Sonnet 5.5 ou Opus 5.5. OpenAI récompense les charges qui renvoient sans cesse le même long contexte, soit le profil type d’un agent qui boucle sur une base de code ou une documentation.

Même OpenAI confie ses Dots à Astra

Une autre annonce du DevDay trahit la hiérarchie interne. Les Dots, les nouveaux agents autonomes d’OpenAI, disponibles en continu avec leur propre ordinateur dans le cloud et plus de 4 000 connecteurs, tournent sur GPT-6 Astra. Pas sur Sol.

L’éditeur qui vante le rapport performance-prix de son nouveau modèle réserve son modèle le plus cher à ses agents les plus ambitieux, ceux qui doivent apprendre en continu et agir sans qu’on les surveille. OpenAI trace lui-même la frontière : Sol pour le volume, Astra pour l’autonomie.

Le même jour, OpenAI annonçait aussi que son abonnement Pro à 200 dollars offrirait deux fois moins d’usage, et lançait une formule à 500 dollars. La baisse de prix de l’API (l’interface par laquelle les développeurs appellent le modèle) et la hausse côté abonnés relèvent d’une même logique : faire payer l’intelligence de pointe à qui en a besoin, et céder le reste au prix du marché.

Refaire la table de routage, tâche par tâche

Le routage, c’est la logique qui décide quel modèle traite quelle requête. Beaucoup d’équipes l’ont bâti sur une règle binaire : un petit modèle pour le tri, le modèle phare pour tout ce qui compte. Sol rend cette règle caduque, parce qu’il couvre une large part de ce « tout ce qui compte » à un coût de milieu de gamme.

L’arbitrage se fait désormais par type de tâche, et non plus par niveau de gamme :

  • génération et revue de code, rédaction, synthèse : Sol, dont les scores rejoignent ceux d’Astra ;
  • agents qui enchaînent des actions dans des outils tiers ou pilotent une interface : à tester avant de basculer, puisque les écarts mesurés par OpenAI tombent là ;
  • tâches où une erreur factuelle coûte cher et passe inaperçue : garder le modèle le plus fiable, ou ajouter une étape de vérification dont le coût entre dans le calcul.

Côté Anthropic, Sol reprend au centime près les prix de Claude Sonnet 5.5, mais les deux éditeurs ne publient pas les mêmes benchmarks. Aucune comparaison propre n’est possible sur le papier. Vos propres jeux de tâches, mesurés au coût par tâche réussie, trancheront mieux que n’importe quelle grille.

Mon avis

OpenAI vient de rendre son propre modèle phare invendable pour la programmation, et c’est voulu : Astra n’a plus vocation qu’à servir les agents autonomes, là où chaque point de fiabilité se paie en incidents évités. Je vois arriver une API à deux vitesses, où le prix au token deviendra un argument marketing et où les contrats sérieux se négocieront au coût par tâche réussie. Les équipes qui migreront tout vers Sol sur la foi du tableau de prix découvriront leurs économies dans le budget de vérification.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *