Qwen3.8-27B tient dans 17 Go et devance un modèle plus gros

Qwen3.8-27B tient dans 17 Go et devance un modèle plus gros

L’essentiel

  • L’équipe Qwen d’Alibaba publie les poids de Qwen3.8-27B sous licence Apache 2.0, un modèle dense et multimodal de 27 milliards de paramètres.
  • Selon Qwen, il devance Qwen3.7-Plus, pourtant nettement plus gros, en programmation et en tâches bureautiques.
  • Quantifié en 4 bits par Unsloth, il s’exécute sur 17 Go de mémoire vive ; le contexte natif atteint 262 000 tokens, un million avec la méthode YaRN.

L’équipe Qwen d’Alibaba a déposé sur Hugging Face les poids de Qwen3.8-27B, sous licence Apache 2.0. Deux éléments de la fiche technique portent l’annonce : le modèle est donné gagnant face à Qwen3.7-Plus, pourtant nettement plus gros, et sa version compressée tourne sur une machine dotée de 17 Go de mémoire vive. Le premier sort d’un tableau d’évaluations maison, le second d’une compression en 4 bits : deux précisions qui pèsent lourd avant d’engager une décision d’infrastructure.

27 milliards de paramètres denses face à un modèle plus gros

Qwen3.8-27B est un modèle dense : chacun de ses 27 milliards de paramètres participe à la génération de chaque token. C’est l’opposé d’une architecture mixture-of-experts, où un routeur n’active qu’une fraction du réseau à chaque passage. Dans la même série, Qwen a d’ailleurs sorti un Qwen3.8-2.4T-A95B, dont la nomenclature indique 2 400 milliards de paramètres au total pour 95 milliards actifs, en haut de la gamme.

Vient ensuite l’affirmation la plus commentée : selon Qwen, la version 27B dépasse Qwen3.7-Plus, plus gros, sur la programmation et les tâches bureautiques. Deux réserves s’imposent. La mesure émane de l’éditeur, sans évaluation indépendante publiée à ce stade. Et elle porte sur deux familles de tâches, pas sur tout le spectre : rien n’indique que l’écart tienne en raisonnement scientifique, en langues peu dotées ou sur des contextes très longs. À génération d’architecture égale, ce sont les données et le post-entraînement qui font désormais la différence, davantage que l’ajout de paramètres.

Les 17 Go décrivent une version compressée en 4 bits

Le chiffre publié par Unsloth ne décrit pas le modèle brut, mais une version compressée. En précision native sur 16 bits, 27 milliards de paramètres pèsent environ 54 Go, hors d’atteinte d’une machine grand public. Ramenés à 4 bits, ces mêmes poids tombent autour de 13,5 Go, et les 17 Go annoncés correspondent à cette enveloppe augmentée de la mémoire de travail.

Cette compression n’est pas gratuite. Diviser par quatre la précision d’un paramètre dégrade la sortie, plus ou moins selon la méthode et la couche concernée. Unsloth distribue ses fichiers GGUF (le format de poids lisible par llama.cpp) en Dynamic V3.0, annoncé en preview, qui module la précision couche par couche plutôt que d’écraser uniformément, avec des variantes NVFP4 (un format 4 bits accéléré par les cartes Nvidia récentes) pour le matériel qui sait en tirer parti. La démonstration mise en avant, une simulation de volcan interactive avec thermodynamique, écoulement des fluides et balistique produite par la version 4 bits, montre un modèle qui tient debout après compression. Elle ne dit rien, en revanche, de ce que cette compression coûte sur des tâches moins spectaculaires.

Le contexte long ne loge pas dans cette enveloppe

Qwen3.8-27B accepte nativement 262 000 tokens de contexte, et jusqu’à un million via YaRN, une technique qui étend la fenêtre au-delà de sa longueur d’entraînement. Ce chiffre s’annonce plus facilement qu’il ne se paie : le cache d’attention, qui conserve l’état de chaque token déjà lu, grossit avec la longueur de la conversation et s’ajoute aux poids en mémoire.

Les 17 Go valent donc pour un usage ordinaire, pas pour un million de tokens chargés d’un coup. Qwen le reconnaît implicitement en réservant la fenêtre d’un million à une version hébergée sur Qwen Cloud, annoncée comme prochainement disponible. Sur votre machine, la longueur réellement exploitable dépendra de la mémoire qui reste une fois les poids en place.

Le mode de réflexion se coupe, les appels d’outils tiennent mieux

Le modèle lit nativement images et vidéos, diagrammes et documents compris, jusqu’à des séquences de plusieurs heures. Il embarque un mode de réflexion activé par défaut mais désactivable requête par requête, ce qui a une traduction budgétaire immédiate : la réflexion se paie en tokens générés, et pouvoir la couper sur les demandes simples change le coût d’un agent qui tourne en boucle.

Côté outillage, Unsloth signale trois apports. Le modèle prend en charge le rôle developer, un niveau d’instructions distinct du message système, qui lui permet de fonctionner dans des environnements agentiques comme Codex. Il accepte un décodage MTP (multi-token prediction : plusieurs tokens produits à chaque passage), qui accélère l’inférence. Enfin, il lit plus fidèlement les objets imbriqués lors des appels d’outils. Ce dernier point n’a rien de spectaculaire à côté d’un score de benchmark, et c’est pourtant souvent lui qui décide si une chaîne d’appels arrive au bout ou casse au troisième outil.

Le calcul entre API et machine locale change de seuil

L’arbitrage n’a pas changé de nature, seulement de seuil. Une API se paie au token consommé, un modèle local se paie une fois, en matériel puis en exploitation. Tant qu’il fallait une carte professionnelle à plusieurs milliers d’euros pour héberger quelque chose de correct, le calcul penchait mécaniquement du côté de l’API.

À 17 Go, le ticket d’entrée se trouve dans un poste de développement récent. Qwen n’est pas seul sur ce créneau : gpt-oss-20b, publié par OpenAI sous la même licence Apache 2.0, tient lui aussi dans 16 Go de mémoire, mais en mixture-of-experts, avec 3,6 milliards de paramètres actifs seulement à chaque passage. La bascule se déplace vers les charges régulières et prévisibles : traitement de documents en lot, classification, extraction, assistance à la programmation en interne, tout ce qui tourne en continu avec un volume connu d’avance. Les données qui ne doivent pas quitter le réseau de l’entreprise font pencher un peu plus la balance, la licence Apache 2.0 levant au passage la question de l’usage commercial.

Pour les pics irréguliers, les tâches les plus difficiles et les très longs contextes, l’API conserve l’avantage. Ce qui change, c’est que la comparaison redevient possible sans engagement préalable : télécharger les poids sur Hugging Face ou ModelScope et mesurer soi-même, sur ses propres tâches, coûte une soirée au lieu d’un budget.

Mon avis

La densité redevient le terrain de compétition, parce que c’est la seule mesure que l’utilisateur ressent directement : ce qu’il peut faire tourner sur la machine qu’il possède déjà. Qwen3.8-27B ne remplacera pas les meilleurs modèles propriétaires sur les tâches les plus difficiles, et personne ne le prétend. Mais la barre du « suffisamment bon pour du travail sérieux » vient de descendre sous les 20 Go de mémoire vive, et tout fournisseur facturé au token devra justifier son prix face à une alternative sous Apache 2.0 qui tourne sur un portable correct. J’y vois une pression durable sur les tarifs, pas une parenthèse.

Sources

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *