DeepSeek talonne GPT-5.6 Luna et coûte 60 % moins cher

DeepSeek talonne GPT-5.6 Luna et coûte 60 % moins cher

L’essentiel

  • DeepSeek a publié le 31 juillet les poids de V4 Flash 0731 sur Hugging Face, sous licence MIT : 304 milliards de paramètres, 13 milliards actifs, un million de tokens de contexte.
  • Le modèle atteint 50 points à l’Artificial Analysis Intelligence Index, soit un point derrière GPT-5.6 Luna, le modèle d’entrée de gamme d’OpenAI.
  • Il revient environ 60 % moins cher par tâche que Luna, malgré la baisse de 80 % déjà consentie par OpenAI : 0,14 dollar le million de tokens en entrée, 0,27 en sortie, et une remise de 98 % sur le cache là où le marché plafonne à 90 %.
  • Les quantifications publiées par Unsloth le font tourner sur une station de travail : 4 bits sur 168 Go de RAM, 3 bits autour de 110 Go, 1 bit dès 96 Go.

Un fichier de 167 gigaoctets à télécharger, une licence MIT, aucune contrepartie : DeepSeek a déposé le 31 juillet sur Hugging Face les poids de son V4 Flash 0731. Le même jour, ce modèle d’entrée de gamme se retrouvait à un point de GPT-5.6 Luna sur l’indice d’Artificial Analysis, pour une facture inférieure de 60 % par tâche. OpenAI avait pourtant déjà taillé 80 % dans le prix de Luna.

Une remise se décide, une licence ne se reprend pas

Les deux gestes n’ont pas la même nature. Une baisse de prix se vote en réunion et s’annule aussi vite : elle ne change rien au produit, qui reste une API fermée dont l’éditeur fixe seul le tarif, les quotas et la date de retrait. Publier des poids sous MIT engage l’inverse : ce qui est téléchargé reste téléchargeable, y compris le jour où l’éditeur change d’avis.

Luna vend un accès, V4 Flash vend un objet. Le premier vous laisse un tableau de facturation, le second un fichier de 167 Go sur votre disque. Et face à un concurrent qui ne facture rien pour les poids, une remise n’a plus grand-chose d’une offensive commerciale : elle affiche surtout le prix plancher qu’OpenAI accepte encore de défendre.

Un point d’écart sur l’indice, deux fois et demie sur l’addition

Sur l’Artificial Analysis Intelligence Index, V4 Flash 0731 marque 50 points, dix de plus que la version d’avril 2026, et se pose juste derrière Luna. Un point d’écart, autant dire que les deux modèles rendent le même service sur l’essentiel des usages d’entrée de gamme : résumé, extraction, classification, appels d’outils en série.

C’est sur le coût que la comparaison décroche. Trois mécanismes se cumulent. Le tarif affiché d’abord, 0,14 dollar le million de tokens en entrée et 0,27 en sortie. La remise de cache ensuite, portée à 98 % quand l’usage du marché s’arrête à 90 % : sur un agent qui rejoue en boucle le même prompt système, ce détail comptable divise la note par cinq. La sobriété enfin, puisque le modèle consomme 12 % de tokens de moins que son prédécesseur pour arriver au même endroit.

Le prix par million de tokens est une donnée de brochure. Le prix par tâche accomplie, lui, décide de ce que vous pouvez industrialiser. Diviser par plus de deux la facture d’un traitement ne le rend pas seulement plus économique : cela autorise des volumes qu’on renonçait jusqu’ici à lancer.

DeepSeek n’est d’ailleurs pas seul à jouer ce coup : le GLM-5.2 de Zhipu, publié lui aussi sous licence MIT, marque 51 points sur le même indice et mène le classement des modèles à poids ouverts. Mais avec plus de 700 milliards de paramètres et une sortie facturée 4,40 dollars le million de tokens, il ne vise ni la même machine ni le même budget.

Trois cents milliards de paramètres sur une station de travail

V4 Flash 0731 est un mélange d’experts (MoE, pour mixture of experts) : sur ses 304 milliards de paramètres, 13 milliards seulement s’activent à chaque token, ce qui explique qu’une telle masse reste rapide à l’inférence. Unsloth en a publié des quantifications de 1 à 4 bits, avec un rappel utile : la précision d’origine est majoritairement en FP4, une précision de 4 bits, donc descendre à 3 bits ne dégrade pas autant qu’on l’imagine. Comptez 168 Go de RAM en 4 bits, environ 110 Go en 3 bits, 96 Go pour la variante la plus agressive.

Ces volumes tiennent dans une machine d’atelier, pas dans un data center. Jusqu’ici, le compromis était simple : les modèles ouverts tournaient chez vous mais restaient en retrait, les modèles fermés tenaient le niveau mais imposaient leurs serveurs. Ce compromis vient de sauter sur le segment le plus volumineux du marché. Pour un dossier soumis au secret médical, industriel ou juridique, le calcul change : la donnée ne sort plus, et le coût variable de l’API devient un coût fixe de matériel qu’on amortit.

Trois réserves avant de migrer

Un indice composite reste un indice composite. Cinquante points contre cinquante et un, c’est un écart dans l’épaisseur du trait, pas une victoire : un seul organisme mesure, avec sa propre pondération. Le gain le plus solide est ailleurs, sur GDPval, un test qui simule des tâches de bureau complexes, où le modèle passe de 1 189 à 1 559 points Elo, avec des progrès marqués sur les tâches agentiques, celles où le modèle enchaîne seul plusieurs outils, et moins d’hallucinations qu’avant.

La deuxième réserve tient au niveau de raisonnement, que l’affichage tarifaire ignore. Simon Willison, en testant le modèle via OpenRouter, obtient un résultat décevant au réglage par défaut, et un bien meilleur en montant ce curseur d’un cran. Or pousser ce curseur, c’est brûler des tokens de raisonnement, donc rogner l’avantage de prix qui fait toute l’affaire. Avant d’annoncer 60 % d’économies à votre direction financière, mesurez le coût réel au niveau de raisonnement dont vos tâches ont besoin, pas à celui du benchmark.

La troisième réserve porte sur l’exécution en local : 96 Go de RAM suffisent à charger le modèle, pas à le servir confortablement à plusieurs utilisateurs. Une station de travail vous donne un laboratoire d’évaluation et un poste de traitement par lots, rarement une production sous charge.

Le segment d’entrée de gamme, celui qui absorbe le gros des volumes en entreprise, vient malgré tout de changer de camp. OpenAI y défend une part de marché à coups de remises, DeepSeek y distribue un fichier. Et défendre un tarif deux fois et demie plus élevé au nom d’un point d’indice, c’est faire reposer une position commerciale sur la mesure la plus fragile du dossier.

Mon avis

OpenAI a coupé 80 % de son prix pour tenir une position, pas pour en conquérir une, et la manœuvre a déjà échoué : un concurrent dont les poids sont gratuits fixera toujours le plancher avant vous. Je ne crois plus à une nouvelle salve de rabais sur l’entrée de gamme, parce qu’il n’y a rien à gagner à courir derrière zéro. La réponse d’OpenAI viendra de l’intégration, des connecteurs, du stockage, de tout ce qui rend le déménagement pénible plutôt que le modèle irremplaçable. Et le jour où trois cents milliards de paramètres tiendront correctement sur 64 Go de RAM, le prix du million de tokens n’intéressera plus grand monde.

Sources

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *