Mistral Large 4 accuse huit points de retard sur la Chine

Mistral Large 4 accuse huit points de retard sur la Chine

L’essentiel

  • Mistral Large 4, aperçu public lancé le 6 octobre, compte 1 050 milliards de paramètres dont 49 milliards actifs par token ; ses poids sont promis pour la fin du mois.
  • Sur l’indice d’intelligence d’Artificial Analysis, il affiche 38 points : huit de moins que le meilleur modèle ouvert chinois (MiMo-V2.6-Pro, 46) et vingt de moins que Claude Opus 5.5 (58).
  • Mistral place son avantage sur la cybersécurité, la finance et le droit, et sur la possibilité d’héberger soi-même un modèle qu’aucun fournisseur ne peut couper.

Huit points d’écart sur l’indice d’Artificial Analysis : voilà ce qui sépare Mistral Large 4 du meilleur modèle à poids ouverts chinois. Mistral, lui, parle de « meilleur modèle ouvert des États-Unis ou d’Europe sur les benchmarks agrégés ». Les deux phrases décrivent le même modèle.

En retirant la Chine de la comparaison, Mistral change le podium. Les chiffres montrent ce que ce découpage laisse de côté, puis ce que le modèle apporte à ceux qui doivent le déployer.

Quatre modèles ouverts chinois devant lui

Artificial Analysis fait tourner ses propres évaluations, ce qui en fait la mesure la moins dépendante du communiqué. Au 6 octobre, l’indice donne 58 points à Claude Opus 5.5 et 53 à GPT-6 Astra côté modèles fermés. Côté poids ouverts chinois : MiMo-V2.6-Pro de Xiaomi à 46, GLM-5.3 à 45, Kimi K3 à 44, GLM-5.3-Flash à 42. Mistral Large 4 est à 38.

L’écart varie donc selon l’adversaire : 8 points avec MiMo, 7 avec GLM-5.3, 6 avec Kimi K3, et encore 4 avec la variante Flash de GLM-5.3, un modèle pourtant plus léger que ce « Chonk » (le surnom que Mistral donne lui-même à Large 4). Avec 1 050 milliards de paramètres au total, la taille ne rattrape pas le retard.

Mistral ne le cache pas : l’entreprise reconnaît que plusieurs modèles chinois restent supérieurs dans certains domaines. Sa formule la plus prudente, « compétitif avec les modèles open source les plus forts au niveau mondial », décrit bien ce classement. Celle qui parle de dépasser « nettement » tout modèle ouvert américain ou européen demanderait une mesure indépendante, et les chiffres que nous avons sous les yeux ne couvrent pas ces concurrents.

Large 3 à Large 4 : plus gros, à peine plus actif

Mistral Large 3, sorti le 2 décembre 2025, comptait 675 milliards de paramètres dont 41 milliards actifs, entraînés sur 3 000 GPU (processeurs graphiques) H200, et il était publié sous licence Apache 2.0. Large 4 passe à 1 050 milliards, soit 56 % de plus, mais seulement à 49 milliards de paramètres actifs, soit environ 20 % de plus. Cette part active détermine le coût de chaque token généré.

L’entraînement a mobilisé 3 800 GPU Nvidia Grace Blackwell, dans les centres de données européens de Mistral, pendant environ deux mois. L’aperçu public est facturé 1,36 dollar le million de tokens en entrée et 4,18 dollars en sortie. La fiche technique affiche toutefois, depuis le 6 octobre, des tarifs barrés au profit de 0,68 et 2,09 dollars, sans dire combien de temps durera la remise.

Autre point, plus lourd pour un projet en entreprise : la fiche porte la mention « Open » sans nommer de licence, là où Large 3 affichait Apache 2.0. Pour une direction des systèmes d’information (DSI), la licence compte autant que le score.

Derrière en code, devant sur les métiers selon Mistral

Sur DeepSWE v1.1, test de programmation agentique, Large 4 obtient 61,7 %. Un tableau publié la veille par Reflection AI pour son propre modèle donne 68 % à Kimi K3 et 74,2 % à DeepSeek V4.1 Flash, deux modèles absents du graphique de Mistral. Le modèle reste aussi derrière GPT-6 Astra sur ce test.

En revanche, Mistral revendique de meilleurs résultats sur le Legal Agent Benchmark de Harvey, où il devancerait Kimi K3 et triplerait le score de GPT-6 Astra, ainsi qu’en finance face à GLM-5.3 et DeepSeek V4.1 Flash. Sur le repérage d’objets dans des images (visual grounding), l’entreprise affirme même battre des modèles fermés. Ces résultats viennent de l’éditeur et n’ont pas encore été répliqués : à traiter comme des hypothèses à tester sur ses propres documents.

La cybersécurité, seul terrain où la souveraineté se chiffre

Mistral concentre son argumentaire sur la cybersécurité. Son raisonnement : les fournisseurs de modèles fermés refusent parfois des requêtes légitimes de recherche de vulnérabilités ou de réponse à incident, et perdre l’accès à un modèle en pleine crise est en soi un risque. Guillaume Lample, cofondateur de Mistral, le dit ainsi : les clients disposeraient d’un modèle qu’ils possèdent et peuvent utiliser de manière illimitée.

Mistral annonce un score de 18 défis résolus sur 19 à un test de type CTF (capture the flag) avec appels d’outils. Le modèle serait aussi l’un des plus forts du Cyber Index d’Artificial Analysis, sans que nous disposions ici de son score exact. Pour affiner ces capacités, des partenaires de cybersécurité et des autorités étatiques accèdent à une version à modération réduite ; l’API publique, elle, bloque automatiquement les requêtes malveillantes.

Le calendrier complique l’argument. Un modèle qu’on héberge soi-même suppose des poids publiés, et ceux-ci sont attendus d’ici la fin octobre, avec des versions quantifiées (compressées) en FP8 et FP4 prévues pour tourner sur 4 à 8 GPU B200 ou B300. D’ici là, utiliser Large 4 revient à passer par l’API de Mistral, comme avec n’importe quel modèle fermé.

Pour un responsable sécurité, la décision se prépare donc maintenant : tester l’aperçu sur des cas réels, lire la licence dès qu’elle tombe, chiffrer le matériel nécessaire à l’auto-hébergement. Les 38 points se jugeront à l’usage, et la facture GPU pèsera dans la balance.

Mon avis

Un modèle huit points sous le meilleur ouvert chinois ne peut pas vendre sa souveraineté sur le classement général, et Mistral l’a compris : il la vend sur la cybersécurité, où la disponibilité compte plus que le dernier point d’indice. L’idée est solide, à condition que les poids sortent avec une licence lisible. Si la mention « Open » reste sans nom de licence, la souveraineté restera un argument commercial de plus.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *