
L’essentiel
- DeepSeek a publié V4-Flash-Vision-Exp, une version expérimentale de son modèle rapide qui comprend désormais les images.
- Sur les bancs d’essai d’agents multimodaux internes de DeepSeek, cette variante arrive au niveau d’Opus 4.8, parfois devant : aucune mesure indépendante ne le confirme à ce stade.
- Chaque image coûte au maximum 384 tokens, avec jusqu’à 600 images par requête, aux tarifs de V4-Flash.
- Le modèle répond aux API Chat Completions et Responses d’OpenAI ainsi qu’au point d’entrée Messages d’Anthropic.
DeepSeek a greffé la vision sur son modèle le plus rapide. Dans la même annonce, l’entreprise publie le tableau qui le place au coude à coude avec Opus 4.8 sur des tâches d’agents. Deux livraisons le même jour : un modèle qu’on peut brancher en une heure, et un classement que personne ne peut rejouer.
La vision sert d’abord à lire des captures d’écran
V4-Flash-Vision-Exp prolonge V4-Flash : l’entreprise y ajoute le traitement d’images sans dégrader, affirme-t-elle, les performances du modèle de base en raisonnement et en connaissances générales. En pratique, il décrit une image, extrait du texte d’une capture d’écran, lit un diagramme. Il accepte le JPEG, le PNG, le GIF et le WebP. Surtout, il déduit le format à partir du contenu réel du fichier, sans se fier à l’extension ni au type MIME, l’étiquette de format que le programme appelant déclare à l’envoi.
Ce détail dort dans la documentation de l’API de DeepSeek, l’interface par laquelle un programme appelle le modèle. Il en dit plus long que le tableau de scores : on ne blinde pas la détection de format pour des démonstrations, on le fait pour des agents qui avalent des milliers de captures aux métadonnées sales.
Le plafond de 384 tokens change le découpage des lots
Le modèle ramène les images autour de 800 × 800 pixels en conservant leurs proportions, et un champ facultatif « detail » les réduit à 512 × 512 quand la finesse visuelle n’apporte rien. Quelle que soit la résolution d’origine, une image coûte au maximum 384 tokens, aux tarifs de V4-Flash. Une requête peut en contenir jusqu’à 600. À titre de comparaison, le barème d’Anthropic compte 1 296 tokens visuels pour une image de 1 000 × 1 000 pixels, et jusqu’à 4 784 tokens sur ses modèles haute résolution : ailleurs, la facture grimpe avec la taille de l’image.
Ces plafonds ne sont pas cosmétiques : ils dessinent le pipeline. Le côté le plus long d’une image monte à 8 192 pixels, mais tombe à 4 096 dès qu’une requête embarque quinze images ou plus : découper par lots de quatorze devient une décision technique. Les images ne passent que dans les messages utilisateur. Elles arrivent en Base64 ou par URL publique jusqu’à 32 MiB. La nouvelle Files API, gratuite, accepte 64 MiB et permet de téléverser un fichier une seule fois, puis de le rappeler par son identifiant.
Un score que DeepSeek ne risque rien à publier
Sur ses propres bancs d’essai d’agents multimodaux, DeepSeek situe la variante vision au niveau d’Opus 4.8, parfois au-dessus. La mesure est peut-être exacte. Elle n’est pas arbitrable : le laboratoire choisit les tâches, la méthode de notation et le moment de publier.
Mettez les deux promesses côte à côte. Un banc tiers promet un arbitrage : quelqu’un qui n’a rien à vendre décide de ce qui compte. Un banc maison promet une démonstration : celui qui vend décide de ce qui compte, puis constate qu’il gagne. Les deux produisent un nombre de même apparence ; un seul fait courir un risque à celui qui le publie.
Le contexte n’incite pas à la confiance. Le soupçon d’optimisation pour les bancs d’essai poursuit les laboratoires chinois depuis des mois, précisément parce que leurs scores se sont rapprochés du sommet plus vite que les capacités constatées en usage réel. Et sur les agents multimodaux, il n’existe même pas d’étalon indépendant qui fasse consensus. Ce trou dans la mesure profite d’abord à celui qui publie ses propres chiffres.
DeepSeek épouse les interfaces de ses concurrents
Le modèle répond aux API Chat Completions et Responses d’OpenAI, ainsi qu’au point d’entrée Messages d’Anthropic. DeepSeek a aussi publié la version 0.1.1 de son framework Harness, qui le prend en charge sans configuration. Changez l’URL de base, gardez votre code.
Les deux entreprises ne vendent pas la même chose. Anthropic vend un ensemble cohérent, où le modèle, l’outillage et le contrat de service tiennent ensemble. DeepSeek vend l’interchangeabilité : il se présente comme la pièce qu’on glisse à la place d’une autre sans rien réécrire, en se calant sur les interfaces de ses deux concurrents. L’un mise sur le coût que représente un départ, l’autre sur l’absence de ce coût.
Cinquante captures et une après-midi pour trancher
Cette compatibilité produit un effet que le tableau de scores n’aura jamais : elle rend l’affirmation vérifiable chez vous. Prenez cinquante captures de votre propre interface, celles sur lesquelles vos agents échouent aujourd’hui, et faites tourner les deux modèles derrière le même code. Comparez le taux de réussite de la tâche complète, pas l’élégance de la description d’image, et surveillez le volume de tokens consommés : les modèles chinois récents en brûlent parfois beaucoup plus que leurs équivalents occidentaux, ce qui rogne une part de l’avantage tarifaire.
Le suffixe « Exp » vaut avertissement : DeepSeek annonce un modèle expérimental, pas un socle sur lequel adosser un service en production. On le passe donc sur son propre banc, en une après-midi et pour quelques euros, avant d’en dire quoi que ce soit.
Mon avis
Le score face à Opus 4.8 ne m’apprend rien, la couche de compatibilité m’apprend tout : DeepSeek a compris que la partie se joue dans le code des autres, pas dans ses propres tableaux. En épousant les interfaces d’OpenAI et d’Anthropic, il se rend testable sans réécrire une ligne, donc adoptable par accident, et je trouve ce pari bien plus menaçant pour les leaders qu’un point de benchmark. Ce qui me gêne vraiment, c’est notre paresse collective : nous relayons des chiffres maison faute d’étalon multimodal indépendant, et personne ne financera ce banc d’essai puisqu’il ne fait vendre aucun modèle.
