Alibaba facture le multimodal cinq fois moins que Google

Alibaba facture le multimodal cinq fois moins que Google

L’essentiel

  • Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle multimodal pensé pour les agents : audio et vidéo traités ensemble, appel d’outils autonome, fenêtre de contexte d’un million de tokens.
  • L’API est facturée 0,15 dollar par million de tokens en entrée et 0,47 en sortie, contre 0,75 et 3,75 pour Gemini 3.8 Flash, dont le tarif d’introduction doit doubler le 1er janvier 2027.
  • Qwen annonce des performances proches de celles de Gemini 3.8 Flash sur les tests audio-vidéo WildClawBench-MM et UniClawBench, sans publier l’écart exact.

Une heure de vidéo en 720p, analysée à raison d’une image par seconde, revient à une vingtaine de centimes chez Alibaba. L’heure d’audio seul passe sous le centime. Qwen a publié ces deux montants avec le barème de Qwen3.8-Omni-Flash, sans mention de promotion de lancement. Celui de Google, lui, porte l’étiquette « tarif d’introduction ».

Un agent relit tout son historique à chaque tour

Qwen demande 0,15 dollar par million de tokens en entrée et 0,47 en sortie, le token étant l’unité de découpage du texte, du son et des images sur laquelle les API comptent leur facture. Google affiche 0,75 et 3,75 pour son Gemini 3.8 Flash, soit un rapport de cinq en entrée et de près de huit en sortie. Le face-à-face se limite d’ailleurs à ces deux-là : chez OpenAI, le modèle d’entrée de gamme GPT-5.6 Luna, à 0,20 dollar le million de tokens, n’accepte ni audio ni vidéo en entrée et renvoie la voix vers la famille gpt-realtime, facturée à part.

Le rapport prend son sens dans la colonne entrée. Un agent ne passe pas un appel, il en passe des dizaines, et à chaque tour le modèle relit l’historique accumulé : la transcription, les descriptions d’images déjà produites, les résultats des outils appelés. La facture se règle donc sur l’entrée.

Prenez une boucle raisonnable : vingt tours, deux cent mille tokens relus à chaque passage. Cela fait quatre millions de tokens en entrée, soit 0,60 dollar avec Qwen et 3 dollars avec Gemini Flash, aux tarifs publiés. À mille exécutions quotidiennes, l’écart atteint 2 400 dollars par jour et décide du nombre de tours qu’un produit peut s’autoriser avant de rendre sa réponse.

Vingt centimes l’heure, à une image par seconde

Le montant vidéo de Qwen repose sur une hypothèse précise : du 720p échantillonné à une image par seconde, audio compris. Une heure de contenu représente environ 3 600 images à décrire. Qwen précise que ce calcul exclut le coût des réponses générées.

Passer à cinq images par seconde, ce qu’exige toute tâche où l’information tient dans un geste ou une transition rapide, multiplie l’entrée par cinq. Le curseur d’échantillonnage pèse davantage sur votre facture que le choix du fournisseur : un agent mal réglé chez Alibaba coûtera plus cher qu’un agent sobre chez Google.

La sortie, elle, reste marginale sur ce type de tâche. Vingt mille tokens de notes structurées à 0,47 dollar le million représentent moins d’un centime. L’essentiel du budget part dans ce que le modèle regarde, pas dans ce qu’il écrit.

Proche de Gemini, sans chiffre pour le dire

Qwen situe son modèle « proche » de Gemini 3.8 Flash sur WildClawBench-MM et UniClawBench. Le mot vient de l’éditeur ; le chiffre qui le soutiendrait manque à l’annonce. Sur un score agrégé, une proximité globale peut recouvrir un décrochage franc sur une sous-tâche, la reconnaissance de locuteurs ou le suivi temporel par exemple.

Ces deux tests font travailler des agents dans des conteneurs, ces environnements isolés où l’agent exécute ses commandes, avec des points de contrôle étape par étape : le terrain exact que vise Qwen3.8-Omni-Flash. Raison de plus pour publier l’écart, car la fiabilité par tour se compose. Un modèle qui réussit 95 % de ses tours termine une tâche de trente étapes une fois sur cinq, quand un modèle à 98 % y arrive plus d’une fois sur deux. Trois points d’écart sur un test se transforment en plus du double sur la tâche réelle.

Ces 2,40 dollars d’écart par exécution pèsent peu si une exécution sur deux doit être relancée. Le calcul honnête se fait sur le coût par tâche achevée, une donnée que personne ne publie et que vous seul pouvez mesurer sur vos propres flux.

Le barème de Google doit doubler en janvier

Les 0,75 et 3,75 dollars de Gemini 3.8 Flash sont un tarif d’introduction, appelé à doubler le 1er janvier 2027. À cette date, et à prix constants chez Alibaba, le rapport passerait de cinq à dix en entrée, et de huit à seize en sortie.

Rien n’engage Qwen à tenir ses prix davantage que Google. Ce qui se décide en branchant un agent sur l’un ou l’autre, c’est surtout le coût d’un changement d’avis : le nombre de semaines nécessaires pour rebasculer une chaîne multimodale si le barème bouge. Ce coût-là s’évalue pendant qu’on écrit l’intégration.

Qwen s’installe dans Claude Code et Gemini CLI

Alibaba publie en parallèle Qwen-MM-Plugins, un ensemble open source qui ajoute le montage vidéo, la reconnaissance de locuteurs, les notes PDF issues d’une vidéo et des chaînes de traitement réutilisables. Ces briques se greffent sur Claude Code, Gemini CLI et Qwen Code. Qwen-Live gère de son côté l’interaction en direct via caméra et micro.

Le choix est cohérent avec la stratégie tarifaire : plutôt que d’attirer les développeurs dans un environnement maison, Qwen s’installe dans celui de ses concurrents, y compris l’outil en ligne de commande de Google. La substitution y devient une ligne de configuration.

Le taux de réussite par tour sur une tâche longue, lui, ne figure nulle part dans l’annonce. Sans cette mesure, les vingt centimes de l’heure de vidéo fixent un prix d’entrée sur le marché, guère plus.

Mon avis

Le tarif d’introduction de Gemini Flash est déjà périmé, et Google le sait depuis la publication de ces barèmes. J’attends un réalignement avant l’échéance de janvier plutôt qu’une migration massive des agents multimodaux vers Alibaba : la question de l’endroit où transitent des flux vidéo arrêtera plus d’une équipe européenne bien avant la facture. Le gain d’Alibaba se joue ailleurs, sur le plafond tarifaire de l’analyse vidéo, qui vient de baisser de 80 % pour tout le monde.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 16 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *