Une IA presque toujours fausse suffit à tuer notre doute

Une IA presque toujours fausse suffit à tuer notre doute

Quelle couleur portait l’équipe de football dans Joue-la comme Beckham ? Sans assistant, une bonne partie des participants d’une étude récente avouaient simplement ne pas s’en souvenir. Avec une IA à portée de clic, presque plus personne n’osait laisser la case vide.

L’expérience est signée Marcoccia, Quattrociocchi et Capraro (2026) : cinq protocoles, 3 132 participants, une seule question de fond. Disposer d’un modèle de langage change-t-il notre manière de gérer l’incertitude ? Les chercheurs ont volontairement choisi des questions sur lesquelles le modèle utilisé, Step 3.5 Flash (un modèle ouvert du chinois StepFun), se trompait presque toujours : des détails visuels de films, rarement décrits dans les textes en ligne, donc propices aux hallucinations (ces réponses inventées et livrées avec aplomb). Impossible, dès lors, de parler de délégation raisonnable à un outil fiable.

L’ignorance qui ne se déclare plus

Dans les deux premières études, les participants pouvaient choisir de consulter l’IA ou non. Le groupe privé d’assistant suspendait son jugement sur 36 % puis 44 % des questions. Le groupe équipé tombait à 6 % puis 3 %.

D’un côté, l’ignorance se déclare. De l’autre, elle se maquille. Le premier groupe sait qu’il ne sait pas et le dit ; le second emprunte une réponse, la fait sienne et passe à la question suivante.

Le plus troublant tient au choix des questions. Rien ne justifiait de s’en remettre à l’assistant, puisqu’il se trompait presque à chaque fois. Il suffisait qu’il réponde.

Plus sûrs d’eux, près de trois fois moins justes

La deuxième étude a mesuré la confiance des participants sur une échelle de 100. Sans IA, elle plafonnait à 29,6 points. Avec l’IA, elle grimpait à 75,9 points, environ deux fois et demie plus haut. Dans le même temps, la part de bonnes réponses passait de 27,6 % à 10,0 %.

Sur l’ensemble des études sans incitation, le constat se répète : 27,5 % de réponses justes sans assistant, 9,2 % avec. On répond davantage, on se trompe beaucoup plus, et on s’en croit plus sûr.

L’assistant promettait de combler un manque de savoir. Il a comblé un manque d’assurance. Confiance et exactitude partent dans des directions opposées, et tout le risque loge dans cet écart : un utilisateur qui doute vérifie, un utilisateur rassuré ne vérifie plus.

L’argent réveille le doute, l’interface le rendort

Les chercheurs ont ensuite introduit une incitation financière : 10 centimes gagnés par bonne réponse, 10 centimes perdus par erreur, rien pour « je ne sais pas ». Ils avaient préenregistré l’hypothèse que l’IA affaiblirait l’effet de cette incitation. Aucune des trois études concernées n’a montré d’interaction statistiquement significative : l’argent et l’assistant agissent chacun de leur côté.

L’incitation produit bien un effet. Dans la troisième étude, les participants sollicitaient moins l’IA (4,53 demandes sur six possibles, contre 5,27 sans enjeu) et répondaient plus souvent juste lorsqu’elle était disponible. L’abstention remontait légèrement, sans jamais approcher le niveau du groupe sans IA. Les auteurs le reconnaissent eux-mêmes : l’effet reste modeste.

La quatrième étude renverse le décor. La réponse de l’IA s’affichait automatiquement, sans que le participant ait à la demander, comme les résumés générés en tête des moteurs de recherche ou les suggestions non sollicitées des assistants d’écriture. Sans incitation, la suspension du jugement chutait alors de 35 % à 1 %.

Face à face, les deux leviers ne pèsent pas le même poids. L’argent pousse à douter, un peu. L’affichage spontané efface le doute, presque entièrement. Devoir poser la question ne protégeait déjà plus beaucoup ; ne même plus avoir à la poser achève le travail.

Aucun classement ne mesure l’utilisateur

L’étude a aussi soumis ses questions à GPT-5.5, Claude Sonnet 4.6 et Gemini 3.5 Flash. Ces modèles répondaient juste à la plupart des questions de contrôle, mais échouaient parfois sur les plus difficiles. Des modèles plus solides font reculer la fréquence des erreurs sans toucher au mécanisme qui les laisse passer.

Les benchmarks (ces classements qui comparent les modèles) mesurent une précision, question par question, dans le vide. Ils ne disent rien de ce que la réponse fait à la personne qui la lit. Un modèle juste neuf fois sur dix, branché sur une interface qui supprime l’abstention, laisse filer sa dixième réponse, la fausse, jusqu’à un utilisateur qui n’a plus le réflexe de la soupçonner.

Pour une équipe qui intègre un assistant dans un produit, l’enjeu glisse du choix du modèle vers le design de l’interface. Plusieurs pistes découlent de ces résultats :

  • laisser l’utilisateur formuler son propre avis avant d’afficher la suggestion, plutôt que l’imposer d’emblée ;
  • rendre visible l’incertitude du modèle, et autoriser l’assistant lui-même à répondre qu’il ne sait pas ;
  • mesurer, dans vos tests utilisateurs, le taux d’abstention et de vérification, pas seulement la satisfaction ou le taux de réponse.

Du quiz de cinéma au diagnostic médical

Les auteurs assument les limites de leur travail. Les questions portent sur des détails de cinéma, et rien ne garantit que la déférence envers l’IA soit aussi forte face à un diagnostic, une clause de contrat ou une ligne de code. Les incitations testées restent faibles : des enjeux plus lourds, ou fondés sur la réputation, pourraient réduire l’écart, sans que l’on sache encore de combien.

Le protocole a pourtant un mérite rare : il isole l’effet de l’interface de la qualité des réponses. En prenant un modèle presque toujours faux, il montre que la confiance se fabrique sans elle.

Un assistant qui se trompe se corrige avec une meilleure version du modèle. Un utilisateur qui ne doute plus, aucune mise à jour ne le répare. La métrique qui manque aux fiches techniques se relève chez vous : combien de vos utilisateurs osent encore laisser une case vide ?

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *