
L’essentiel
- Xiaomi publie MiMo-V2.6-Pro et MiMo-V2.6-Flash en poids ouverts ; le Pro obtient 46 points à l’Intelligence Index d’Artificial Analysis, devant Kimi K3 et Qwen.
- Le gain vient d’un apprentissage par renforcement mené en moins de six jours, pour environ 2,62 millions de dollars (Pro) et 0,85 million (Flash).
- Deux semaines plus tôt, Anthropic nommait Xiaomi parmi sept laboratoires chinois accusés d’avoir extrait les capacités de Claude, avec environ 190 millions d’échanges au total.
- Xiaomi ouvre aussi sa boîte à outils : framework d’entraînement complet et environ 7 000 tâches notées automatiquement.
Lundi, Xiaomi a pris la tête du classement des modèles à poids ouverts avec MiMo-V2.6-Pro, un modèle dont chaque tâche coûte une fraction de ce que facturent ses concurrents. Quinze jours plus tôt, Anthropic publiait une liste de sept laboratoires chinois accusés d’avoir aspiré Claude. Xiaomi y figure. Ses principaux rivaux au classement aussi.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Plus de mille milliards de paramètres, 13 cents par tâche
MiMo-V2.6-Pro est un modèle à mélange d’experts (MoE, une architecture où seule une partie du réseau s’active à chaque requête) de 1 020 milliards de paramètres, dont 42 milliards actifs. Il atteint 46 points à l’Intelligence Index d’Artificial Analysis, ce qui le place en tête des modèles à poids ouverts, devant Kimi K3 de Moonshot AI et Qwen 3.8 Max d’Alibaba.
Le prix fait le reste : 0,435 dollar par million de tokens en entrée, 0,87 dollar en sortie. D’après les calculs d’Artificial Analysis, une tâche de test revient à environ 0,13 dollar. Le modèle se retrouve sur la frontière de Pareto, cette ligne où aucun concurrent ne fait mieux pour moins cher.
Xiaomi le situe lui-même légèrement derrière Claude Opus 5, GPT-5.6 Sol et Meta Muse Spark, donc à quelques points des meilleurs modèles fermés.
Six jours de renforcement suffisent-ils à expliquer le saut ?
Xiaomi attribue le progrès à l’apprentissage par renforcement (RL, pour reinforcement learning : le modèle apprend par essais, retours et récompenses). L’équipe dit avoir élargi cette phase sur trois axes : plus de données par étape d’entraînement, des environnements de tâches plus variés, davantage de calcul pour noter les solutions. Sur le test de programmation DeepSWE, le Pro passe de 58,4 à 72,6 points, le Flash de 48,8 à 65,7.
Pour garder l’entraînement stable à cette échelle, les ingénieurs ont gelé le mécanisme de répartition interne du modèle et empilé des protections contre le « reward hacking », ces raccourcis par lesquels un modèle obtient sa récompense sans résoudre la tâche. Le tout en moins de six jours, pour 2,62 millions de dollars.
Ce budget modeste pose question. Le renforcement affine un modèle de base, il ne crée pas ses capacités à partir de rien : plus la base est forte, plus six jours de RL rapportent. Or c’est justement la qualité de cette base qu’Anthropic conteste.
Sept laboratoires, 190 millions d’échanges avec Claude
Dans son rapport de threat intelligence (le suivi des menaces et des abus visant ses services), Anthropic a examiné les détournements de Claude détectés entre décembre 2025 et août 2026. Sept laboratoires chinois y sont nommés : Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax et SenseTime. Ensemble, ils auraient généré environ 190 millions d’échanges pour extraire les capacités de Claude et entraîner leurs propres modèles, une pratique qu’Anthropic qualifie de distillation illégale. En février, l’entreprise ne visait encore que trois laboratoires, DeepSeek, Moonshot AI et MiniMax, pour quelque 16 millions d’échanges : en sept mois, le volume a été multiplié par plus de dix.
La distillation consiste à faire produire à un modèle « professeur » des réponses en masse, puis à entraîner un modèle « élève » à les imiter. Le cas qui vise Xiaomi, étiqueté GTG-16008, porte sur plus de 400 000 échanges suivis sur vingt jours, en mars et avril 2026, soit quelques mois avant la sortie de V2.6.
Relisez le podium avec cette liste en main. Xiaomi devance Moonshot et Alibaba, deux laboratoires cités dans le même rapport. DeepSeek, classé plus loin, y figure aussi. Le classement des modèles ouverts ressemble moins à une compétition entre méthodes d’entraînement qu’au tableau d’honneur des élèves d’un même professeur.
Ces accusations restent celles d’Anthropic, partie intéressée, et rien dans les sources ne permet de mesurer la part de Claude dans MiMo-V2.6. Aucun benchmark ne le permet non plus : un score de 46 points dit ce qu’un modèle sait faire, jamais d’où il le tient.
7 000 tâches notées, le cadeau le plus durable de Xiaomi
Il serait injuste de s’arrêter là. Xiaomi publie davantage que des poids : le rapport technique, son framework d’entraînement complet, un modèle plus petit pour poursuivre l’entraînement et environ 7 000 tâches assorties de correcteurs automatiques, en développement logiciel, cybersécurité, bureautique et web design, plus un millier de tâches de composition musicale.
Leur provenance est documentée. Une partie du code vient de vraies pull requests GitHub d’employés et de requêtes d’utilisateurs ; d’autres consignes sont générées par un modèle de langage. Les tâches de sécurité s’appuient sur OSS-Fuzz et ses dizaines de milliers de vulnérabilités réelles. Les environnements bureautiques, eux, sont reconstruits de façon synthétique.
Cet apport vaut quelle que soit l’origine du modèle de base. Une équipe qui veut spécialiser son propre modèle par renforcement dispose désormais d’un banc d’essai prêt à l’emploi, avec ses correcteurs. C’est rare, et c’est reproductible.
Choisir un modèle ouvert devient une question de provenance
Pour une entreprise, MiMo-V2.6 est tentant : disponible sur Hugging Face, sur OpenRouter et par API au tarif de la V2.5 Pro, avec une variante Pro-UltraSpeed jusqu’à vingt fois plus rapide en sortie. Mais si vous l’intégrez dans un produit, vous héritez aussi d’un contentieux qui ne vous appartient pas.
Techniquement, rien ne s’y oppose. Sur le plan juridique et pour la réputation, c’est autre chose : un modèle dont une partie des capacités est revendiquée par l’éditeur qui les aurait fournies peut devenir encombrant si le différend arrive devant un régulateur ou un tribunal. Les équipes chargées de la conformité ont une ligne de plus à remplir dans leur grille d’évaluation, à côté du score et du prix par tâche.
Le problème dépasse Xiaomi. Si les meilleurs modèles ouverts progressent en partie en imitant les modèles fermés, l’écart entre les deux camps mesure moins une avance technologique que le temps nécessaire pour l’extraire.
Mon avis
Le classement des modèles ouverts ne mesure plus grand-chose tant qu’on ne sait pas quelle part de chaque score a été apprise et quelle part a été copiée. Je m’attends à ce que la provenance de l’entraînement devienne un critère d’achat aussi concret que la licence, et à ce que les éditeurs fermés verrouillent leurs API bien plus fort qu’aujourd’hui. Ce qui restera de MiMo-V2.6, à mon sens, ce sont ses 7 000 environnements de renforcement, pas son rang.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →