
Un message arrive au support : un client ne peut plus se connecter et menace de résilier. Avant qu’un conseiller ne l’ait lu, un modèle a déjà estimé l’urgence, choisi l’équipe et décidé s’il fallait alerter un humain. Cloudflare affirme que son nouveau modèle Clef-flash rend ce verdict en 39 millisecondes, et en tire une conclusion assumée dans son annonce : « un humain n’a plus nécessairement besoin d’être dans la boucle » des décisions prises par des agents.
La phrase vend de la vitesse. Elle déplace aussi une responsabilité, et les chiffres publiés par l’éditeur permettent de mesurer ce que l’on obtient en échange.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Un classifieur greffé sur Qwen
Clef et Clef-flash appartiennent à une famille récente, les modèles de décision. Au lieu de produire un texte, ils répondent à plusieurs questions fixées à l’avance sur une même entrée et attribuent une probabilité à chaque option. Le logiciel qui les interroge s’en sert pour router un ticket, déclencher une escalade ou passer la main à un opérateur.
Cloudflare les place entre deux mondes. Les grands modèles de langage (LLM) raisonnent et appellent des outils, mais leurs sorties varient et prennent du temps. Les classifieurs classiques sont rapides, mais il faut les réentraîner à chaque nouvelle catégorie. Clef repose sur Qwen3.8-27B, Clef-flash sur Qwen3.5-9B. Les modèles de base restent intacts : Cloudflare leur greffe des composants additionnels, entraînés sur des données synthétiques, qui lisent les calculs internes du modèle pour en tirer options et probabilités. L’entraînement s’appuie sur sa propre variante d’une méthode baptisée RLCD (Reinforcement Learning for Calibrated Decisions, un apprentissage par renforcement censé rendre les probabilités fiables).
Les deux modèles sont publiés sur Hugging Face sous licence Apache-2.0 et tournent sur Workers AI, la plateforme d’inférence de Cloudflare. Leur API reste volontairement compatible avec celle de Jev, le modèle de TypeSafe AI, la start-up de l’ancien chercheur d’OpenAI Diogo Almeida qui a popularisé l’approche. Changer de fournisseur doit coûter le moins possible.
39, 209, 524 millisecondes : un écart mesuré à domicile
Les latences médianes annoncées : environ 39 ms pour Clef-flash, 209 ms pour Clef, un peu plus de 524 ms pour Jev. Sur le papier, le petit modèle va treize fois plus vite que son concurrent, le grand deux fois et demie.
Trois réserves tempèrent ces écarts. Une médiane dit ce qui arrive à la requête typique, pas aux plus lentes : au 95e percentile (le seuil sous lequel tombent 95 % des requêtes), Clef-flash monte à 122 ms, plus de trois fois sa médiane, quand Jev reste stable autour de 536 ms. Les mesures viennent ensuite de Cloudflare, sur son infrastructure, et l’éditeur revendique lui-même l’avantage de la proximité de ses centres de données en périphérie de réseau : une partie de l’écart tient donc à l’emplacement du serveur, pas au modèle. Enfin, un client qui appelle Workers AI depuis un autre cloud paiera son propre aller-retour réseau.
L’exemple concret fourni par l’éditeur remet l’écart à l’échelle. Son équipe de renseignement sur les menaces classe déjà des sites web avec Clef : récupération, rendu et classification ont pris 2,2 secondes, contre 4,7 secondes pour gpt-oss-120b, un modèle de langage généraliste, qui n’a rendu que deux catégories. Rapporté au travail complet, le gain passe de treize fois à un peu plus de deux.
La vitesse compte surtout quand les décisions s’enchaînent. Un agent qui prend dix arbitrages successifs attend environ 0,4 seconde avec Clef-flash, plus de cinq secondes avec Jev. Sur une boucle autonome, la différence devient perceptible.
La précision se lit benchmark par benchmark
Cloudflare dit devancer en vitesse tous les modèles de décision concurrents sur 43 benchmarks. Pour la précision, trois tableaux sont mis en avant, et ils ne donnent pas tous le même vainqueur :
- API Bank : Clef-flash 93,11, Clef 91,93, Jev 88,19. Avantage net à Cloudflare.
- PhishNChips : DiffusionGemma Jev 85,35, Clef 79,60, Clef-flash 75,05, Jev 62,55. Clef bat Jev, mais pas la meilleure variante concurrente.
- When2Call : Jev 80,97, Clef 72,37, Clef-flash 65,58. Jev mène de près de neuf points sur Clef et de plus de quinze sur Clef-flash.
When2Call, conçu par des chercheurs de NVIDIA et de Harvard, évalue la capacité à savoir quand appeler un outil, quand poser une question et quand s’abstenir. Le test le plus proche de la promesse « l’agent s’en remet à un humain si besoin » est justement celui où les modèles de Cloudflare sont les plus faibles. Avec un score de 65,58, Clef-flash se trompe sur environ un tiers des cas de ce banc d’essai.
Tous ces scores sont autodéclarés, et l’éditeur ne publie que trois des 43 évaluations dans le détail de sa comparaison.
Une probabilité de 1 % n’a pas de signataire
Dans l’exemple de classification web, un domaine reçoit 95 % de chances d’être un site de mode, 85 % d’être une boutique en ligne, moins de 1 % d’être un site d’hameçonnage. Ces chiffres ont l’air rassurants parce qu’ils sont précis. Leur valeur dépend entièrement de la calibration, c’est-à-dire du fait qu’un « 1 % » corresponde réellement à une erreur sur cent. Cloudflare dit y travailler avec RLCD ; aucune mesure indépendante de cette calibration ne figure dans l’annonce.
TypeSafe AI présente Jev comme « sans hallucinations », au sens où il ne peut répondre qu’à l’intérieur d’un espace de réponses prédéfinies. Le même raisonnement vaut pour Clef : un espace fermé supprime les réponses inventées, pas les mauvais choix. Un ticket urgent classé en priorité basse avec 92 % de confiance reste une erreur, simplement mieux présentée.
La licence Apache-2.0 joue ici en faveur de Cloudflare : poids ouverts, modèles de base connus, tout est inspectable. Encore faut-il que quelqu’un s’en charge. Avant de brancher un modèle de décision dans un agent, quelques garde-fous méritent d’être posés :
- journaliser chaque décision avec ses probabilités, pour pouvoir reconstituer un verdict après coup ;
- fixer les seuils d’automatisation sur vos propres données, et garder un humain sur la bande de confiance intermédiaire ;
- tester spécifiquement les cas où l’agent doit s’abstenir, puisque c’est le point faible révélé par When2Call ;
- mesurer la latence depuis votre infrastructure, pas depuis celle de l’éditeur.
OpenAI, TypeSafe, Cloudflare : trois façons de vendre un verdict
Le créneau se remplit vite. OpenAI a lancé fin septembre une API de décisions fondée sur GPT-6 Luna, qui accepte texte et images. Clef traite aussi les images, quand Jev se limite pour l’instant au texte, et sa fenêtre de contexte (la quantité de texte que le modèle peut lire d’un seul tenant) atteint 64 000 tokens, deux fois celle de Jev.
Cloudflare joue une autre carte : celle d’un opérateur de réseau, de DNS (le système qui traduit les noms de domaine en adresses) et de sécurité qui, depuis juillet, permet déjà aux sites de filtrer les robots d’IA selon leur objectif. En interne, Clef doit trier les signalements d’abus, organiser le support et séparer les bons bots des mauvais. L’entreprise qui décide déjà quel trafic passe veut maintenant fournir le composant qui décide à la place des agents.
Ces 39 millisecondes mesurent le temps d’un verdict. Elles ne disent rien du temps qu’il faudra, au premier incident sérieux, pour comprendre pourquoi un modèle de 9 milliards de paramètres a jugé qu’aucun humain n’avait besoin de regarder.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →