
L’essentiel
- xAI a publié Grok 4.7, présenté par l’entreprise comme son modèle le plus capable en programmation et en travail de connaissance.
- Sur l’index indépendant Artificial Analysis Intelligence Index (v4.3.2), qui agrège dix benchmarks, il obtient 46 points contre 53 pour Claude Fable 5.1 et GPT-6.
- En programmation agentique, sur Terminal-Bench 4.0, il réussit 26 % des tâches, contre 60 % pour GPT-6 Astra et 55 % pour Claude Fable 5.1.
- Tarifs annoncés : 2 dollars par million de tokens en entrée, 6 dollars en sortie, un niveau proche de celui des modèles chinois.
xAI a rangé son nouveau modèle dans la case tarifaire des concurrents chinois. Grok 4.7 se facture 2 dollars le million de tokens (les unités de texte sur lesquelles se calcule la facture) en entrée et 6 dollars en sortie, loin des niveaux pratiqués par les modèles frontière occidentaux. Sur l’index indépendant Artificial Analysis Intelligence Index, il marque 46 points, quand Claude Fable 5.1 et GPT-6 en affichent 53 chacun.
L’entreprise met en avant un modèle de base plus grand, un apprentissage par renforcement prolongé et une meilleure aptitude à vérifier sa propre production. Son compte officiel promet une amélioration notable par rapport à Grok 4.6, au même prix et à la même vitesse. Le progrès interne n’est pas contesté. La distance qui le sépare du haut du tableau, elle, n’a pas bougé.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Dix benchmarks compressés en un score unique
L’index d’Artificial Analysis, dans sa version 4.3.2, agrège dix épreuves en une note unique. Pratique pour classer, trompeur pour décider : un score composite additionne des tests de connaissance, de raisonnement et d’exécution, puis lisse les écarts entre eux. Un modèle solide en questions fermées et faible en tâches longues ressort au même niveau qu’un modèle régulier partout.
Les 46 points de Grok 4.7 le placent en milieu de tableau, sans dire où il décroche. Les sept points qui le séparent de Claude Fable 5.1 et de GPT-6 ne se répartissent pas uniformément sur les dix épreuves. Il faut ouvrir le détail pour voir ce qui les produit.
Terminal-Bench 4.0, l’épreuve de l’exécution sans humain
Terminal-Bench 4.0 mesure la programmation agentique : le modèle reçoit un objectif, enchaîne des commandes dans un terminal et doit livrer un résultat qui passe les tests, sans main humaine entre les étapes. Grok 4.7 y réussit 26 % des tâches. GPT-6 Astra en réussit 60 %, Claude Fable 5.1 55 %.
L’écart va donc au-delà du double en faveur de GPT-6 Astra. Plus embarrassant pour xAI, DeepSeek V4.1 Flash, vendu encore moins cher, passe devant avec 27 %. Trois tâches sur quatre échouent quand personne ne regarde.
Un token à deux dollars, une tâche à reprendre
Le prix affiché se compte en tokens, la facture réelle se compte en tâches abouties. À 26 % de réussite, il faut environ quatre lancements pour obtenir une exécution correcte ; à 60 %, moins de deux. Compenser ce seul écart demanderait un token plus de deux fois moins cher que celui du concurrent, et le temps passé à relire, corriger et relancer resterait entier.
Ce calcul ne vaut que là où le modèle travaille seul et où l’échec se détecte tard. Sur un résumé, une extraction de données ou une classification, un modèle à 46 points fait le travail et le tarif bas devient un avantage net. Sur un agent qui modifie un dépôt, chaque échec coûte une revue humaine que l’économie de tokens ne finance pas.
Deux niveaux de raisonnement, un même résultat
Autre point mesuré par Artificial Analysis et peu commenté : les deux niveaux de raisonnement les plus élevés de Grok 4.7 obtiennent des performances à peu près identiques. Pour un acheteur, augmenter le budget de réflexion du modèle consomme des tokens de sortie, facturés 6 dollars le million, sans gain mesuré à l’arrivée.
La conséquence pratique est immédiate. Si vous intégrez le modèle, testez le niveau inférieur d’abord et gardez le maximum pour les cas où vous constatez vous-même une différence. La configuration par défaut d’un fournisseur optimise rarement votre facture.
Les usages où 46 points suffisent
Grok 4.7 est distribué via l’API Grok, Cursor et Grok Build. Le passage par Cursor pose une question de cohérence : cet outil sert à faire travailler un agent dans un dépôt de code, et l’exécution autonome est justement l’épreuve où le modèle n’obtient que 26 %. Les développeurs qui le brancheront là compareront vite avec ce qu’ils utilisaient avant.
Pour le reste, la grille tarifaire dessine un usage lisible : volume, tâches courtes, enjeux faibles, chaînes de traitement où l’on tolère un taux d’erreur parce qu’un contrôle existe en aval. Un modèle facturé 2 et 6 dollars qui tient 46 points a un marché, mais plus étroit que celui annoncé.
Chez xAI, le prix du million de tokens bougera encore : c’est la variable la plus rapide à actionner. Le taux de réussite sur les tâches longues, lui, demande une autre ligne de travail, du côté de l’entraînement à l’exécution et de la vérification. C’est la seule colonne dont la progression déplacerait le classement.
Mon avis
Un tarif calé sur les modèles chinois est un choix de positionnement, et je le lis comme tel : xAI vise le volume, pas la fiabilité. Ce qui me dérange, c’est la promesse de programmation mise en avant alors qu’un DeepSeek Flash passe devant sur l’épreuve agentique. À 26 % de réussite, la bonne place de Grok 4.7 se trouve dans les traitements de masse à faible enjeu, loin des agents de développement que Cursor met en vitrine. Et je ne vois pas la version suivante corriger ce classement en six mois : ce qui manque se gagne sur l’entraînement à l’exécution, et grossir le modèle de base n’y suffira pas.
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →