Griffin, l’IA de Tavus, dupe 48 % des testeurs en une minute

Griffin, l'IA de Tavus, dupe 48 % des testeurs en une minute

Soixante secondes d’appel vidéo ont suffi, dans l’étude de Tavus, pour que près d’un participant sur deux prenne une IA pour une personne. La start-up de San Francisco vient de présenter Griffin, qu’elle qualifie de premier « Human Interaction Model » (HIM), une classe de modèles conçus pour tenir une conversation en face à face, en temps réel.

Ces 48 % impressionnent, mais ils reposent sur un protocole que l’éditeur n’a pas détaillé. Avant d’y voir la preuve que la vidéo ne prouve plus rien, regardons ce que l’étude a réellement testé.

Un modèle qui lit le visage autant que la voix

Griffin ne se limite pas à générer un visage qui bouge les lèvres. D’après Tavus, il traite la parole, les expressions du visage, le ton de la voix, les gestes et les pauses, à la fois en réception et en génération de vidéo. Autrement dit, il écoute avec les yeux autant qu’avec les oreilles, et répond de la même manière.

Cette boucle perception-réaction distingue un avatar de conversation d’un simple deepfake (vidéo truquée par IA) préenregistré. Un silence trop long, un sourcil qui ne suit pas l’émotion de la phrase : ces indices, que les systèmes précédents laissaient filtrer, sont ceux que Griffin cherche à effacer.

Un écart de 0,09 point avec les humains

Tavus s’appuie sur deux mesures. La première, celle des 48 %, vient de sa propre étude : après une minute d’appel vidéo, près de la moitié des participants ont cru parler à une vraie personne. Les systèmes antérieurs plafonnaient à 2 %. Le saut est d’un facteur 24, ce qui place l’ancienne génération dans la catégorie « repérable au premier regard ».

La seconde mesure se présente comme un test indépendant mené avec Nvidia, qui évalue à quel point une IA paraît humaine dans une conversation audio-vidéo directe. Sur cette échelle, Griffin obtient 3,83 points, les humains 3,92 et le meilleur modèle précédent 2,80. L’écart avec une personne réelle tombe à 0,09 point, soit environ 2 % de la note humaine. Le meilleur modèle précédent restait à 1,12 point des humains : Griffin en comble 1,03.

Les deux séries vont dans le même sens : sur une conversation courte, la différence perçue avec un interlocuteur réel devient très mince.

Les angles morts du protocole

Le détail de l’expérience manque, et plusieurs paramètres changent la lecture de ces 48 %. Combien de participants ? Savaient-ils qu’une IA pouvait se trouver en face d’eux ? Si la question était binaire, humain ou machine, 48 % se situe à un cheveu du hasard pur, et le résultat dirait alors que les testeurs ne savaient plus distinguer, pas qu’ils étaient convaincus. Si la consigne était d’évaluer l’interlocuteur sans soupçon préalable, le chiffre aurait une autre portée.

Il y a aussi la durée. Une minute d’échange est le format idéal pour un système qui s’effondre sur le long cours : cohérence de la mémoire, répétitions, dérive du ton. Rien dans les chiffres publiés ne dit comment Griffin tient un entretien de quarante minutes.

Enfin, l’étude est celle de l’éditeur, et c’est Tavus lui-même qui qualifie d’indépendant le test mené avec Nvidia. La société a publié un rapport de recherche : c’est le document à lire avant de citer ces valeurs.

Recrutement à distance et arnaques : le visage ne rassure plus

Tavus met en avant des usages bienveillants : tutorat, entraînement à des conversations difficiles, assistance technique par caméra. Griffin-Lite, la préversion de recherche, est accessible à « certains testeurs », une version plus capable étant promise une fois « les questions de sécurité réglées ». L’entreprise reconnaît donc elle-même que le sujet est sensible.

Car la même capacité sert tout ce qui repose sur un appel vidéo comme preuve de présence humaine. Deux terrains sont en première ligne :

  • le recrutement à distance, où l’entretien en visioconférence tient lieu de vérification d’identité et de compétence ;
  • les arnaques par appel vidéo, où se faire passer pour un proche, un dirigeant ou un conseiller bancaire devient plus crédible quand l’interlocuteur réagit, hésite et sourit au bon moment.

Ces scénarios restent des projections : les sources ne mentionnent aucun cas d’abus lié à Griffin. Mais l’ordre de grandeur est parlant. Quand 98 % des gens repéraient l’IA, l’argument « je l’ai vue en vidéo » avait une vraie valeur. À 48 %, il ne vaut guère mieux qu’un tirage à pile ou face.

Que faire quand le visage ne garantit plus rien

Si vous recrutez, intégrez une étape qu’un avatar ne peut pas franchir en temps réel : un exercice pratique interactif, une demande imprévue, un échange sur un document que vous ne communiquez qu’à ce moment-là. La vérification d’identité doit passer par un canal séparé de la visioconférence, pièce officielle et rappel sur un numéro connu.

Si un appel vidéo vous sollicite pour un virement ou un accès, appliquez la règle que les banques recommandent déjà pour le téléphone : raccrocher, rappeler par un moyen que vous maîtrisez, convenir d’un mot de passe familial ou d’équipe pour les demandes sensibles.

Quant aux équipes qui construisent des produits, l’étiquetage les concerne dès maintenant : un avatar noté 3,83 quand un humain obtient 3,92 devrait déclarer ce qu’il est, sans attendre qu’une réglementation l’y oblige.

Tavus conditionne la sortie de la version complète à la résolution de ses « questions de sécurité ». Les garde-fous qu’elle retiendra, et le moment où un concurrent publiera sans elle, diront si ces 48 % restent un résultat de laboratoire ou deviennent la norme de l’appel vidéo.

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *