La transcription IA décroche encore sur vos réunions

Carte illustrant l'article sur les limites de la transcription IA en réunion, avec un taux d'erreur pouvant atteindre 57 %.

La transcription IA affiche des scores de précision flatteurs, mais ces chiffres sont mesurés sur de l’audio propre. Sur une réunion à trois voix qui se coupent la parole, la même technique perd une part sensible de sa fiabilité. Avant de chercher l’outil le plus précis du marché, il faut donc savoir lequel tient sur vos propres enregistrements.

Les ordres de grandeur publiés par AssemblyAI en juillet 2026 résument l’écart : 95 à 98 % de précision sur un enregistrement de studio, 85 à 92 % sur un appel en visioconférence, 70 à 85 % dans un environnement bruyant. Sur les benchmarks de réunions multi-locuteurs, le taux d’erreur qui tient compte de l’attribution des voix grimpe entre 35 et 57 %. Même famille de modèles, autre planète.

WER, cpWER : comment se mesure une erreur de transcription IA

L’indicateur de référence s’appelle le WER (Word Error Rate, taux d’erreur par mot). On aligne la transcription produite sur une transcription de référence faite par un humain, puis on compte les mots remplacés, oubliés et ajoutés, rapportés au nombre de mots de la référence. Un WER de 5 % correspond à peu près à la « précision de 95 % » des argumentaires commerciaux.

Ce chiffre a trois angles morts.

  • Il traite tous les mots à égalité. Rater « euh » ou rater le nom du client pèse pareil dans le calcul, alors que la seconde erreur rend le compte rendu inutilisable.
  • Il dépend de la normalisation. Ponctuation, majuscules, chiffres écrits en lettres ou non : selon les règles retenues avant le calcul, le même fichier peut afficher des scores assez différents.
  • Il ignore qui parle. Un WER classique ne vérifie pas que la phrase est attribuée à la bonne personne. D’où l’apparition du cpWER (concatenated minimum-permutation WER), qui regroupe le texte par locuteur avant de comparer et sanctionne donc aussi les erreurs d’attribution.

Pour les langues ou les usages où découper en mots pose problème, on utilise aussi le CER (Character Error Rate, taux d’erreur par caractère). Le principe reste le même : un pourcentage d’écart à une référence humaine.

Retenez surtout ceci : un score n’a de sens qu’avec son corpus. Un modèle évalué sur des livres audio lus au micro ne vous dit presque rien de son comportement sur un point d’équipe enregistré par un ordinateur portable posé au milieu de la table.

Chevauchements, accents, noms propres : les trois décrochages récurrents

La parole qui se superpose

C’est le cas le plus pénalisant. Quand deux personnes parlent en même temps, le signal mélange deux voix que le modèle doit démêler avant même de reconnaître les mots. Le challenge SLT 2026 consacré aux lunettes connectées (arXiv 2608.12034) le chiffre nettement : le CER moyen passe de 8,6 % à 14,2 % dès que le taux de chevauchement dépasse 15 % de l’enregistrement.

Or une réunion vivante dépasse facilement ce seuil : relances, approbations, interruptions. Les travaux de recherche publiés en 2026 sur le sujet (arXiv 2603.17769 et 2603.22709) décrivent toujours la parole superposée comme un problème ouvert. Les modèles progressent, la difficulté structurelle demeure.

Les accents et la prise de son

Un modèle apprend sur les voix qu’on lui montre. Un accent régional marqué, un locuteur non natif, un micro de mauvaise qualité ou une salle qui résonne l’éloignent de ses conditions d’entraînement. Chaque facteur isolé coûte quelques points ; cumulés, ils expliquent l’essentiel de la chute entre la fourchette « studio » et la fourchette « bruyant ».

Les noms propres et le jargon

Noms de clients, de produits internes, acronymes maison : le modèle ne les a jamais rencontrés, il les remplace par le mot courant le plus proche phonétiquement. Statistiquement, ces erreurs pèsent peu dans le WER. En pratique, ce sont elles qui ruinent un compte rendu. Plusieurs services permettent d’injecter un vocabulaire personnalisé : c’est souvent le réglage au meilleur rapport effort/gain.

Diarisation : identifier qui parle reste le maillon faible

La diarisation (segmentation de l’audio par locuteur) répond à la question « qui a dit quoi ? ». C’est une brique distincte de la reconnaissance des mots, et c’est elle qui explique les cpWER élevés observés sur les réunions.

Ses erreurs typiques sont connues : deux voix proches fusionnées en un seul locuteur, une même personne scindée en deux quand elle change de ton ou s’éloigne du micro, des interventions brèves (« d’accord », « non ») rattachées au mauvais interlocuteur. Toutes se multiplient pendant les chevauchements.

Pour un sous-titrage ou une prise de notes personnelle, c’est tolérable. Pour un procès-verbal, un entretien de recrutement ou une décision attribuée à quelqu’un, une réplique mal attribuée est une erreur de fond. Le texte peut être juste mot pour mot et faux sur l’essentiel.

Local ou cloud : où partent vos enregistrements

Une réunion enregistrée contient souvent ce qu’une entreprise protège le plus : données clients, arbitrages internes, informations sur des salariés. Le choix entre un service cloud et un modèle qui tourne sur vos propres machines ne se joue donc pas seulement sur la précision.

Le cloud offre en général les modèles les plus récents, la diarisation intégrée et aucune infrastructure à maintenir. En contrepartie, l’audio quitte votre périmètre : il faut lire où il est traité, combien de temps il est conservé et s’il peut servir à entraîner le modèle. Dans le cadre du RGPD, ce sont des questions à trancher avant le premier fichier envoyé, pas après.

Le local, avec un modèle ouvert comme Whisper d’OpenAI, garde l’audio chez vous. Il demande en revanche une machine correctement équipée, souvent un GPU, et la diarisation doit généralement être ajoutée avec une brique séparée. Sur un enregistrement difficile, l’écart de qualité avec les meilleures offres cloud peut exister ; il se mesure, il ne se suppose pas.

Une règle simple aide à trancher : plus l’enregistrement est sensible, plus le coût d’une fuite dépasse celui de quelques points de précision.

Le protocole de test à faire soi-même avant de choisir

Puisque les chiffres publiés ne décrivent pas vos conditions, le seul repère fiable est celui que vous construisez. Comptez une demi-journée.

  • Constituer un petit corpus représentatif. Trois à cinq extraits de dix minutes tirés de vos vrais usages : une visio, une réunion en salle, un échange animé où les gens se coupent la parole.
  • Produire une référence humaine. Transcrire ces extraits à la main, avec le nom de chaque intervenant. C’est la partie ingrate, et c’est elle qui donne sa valeur au test.
  • Fixer la normalisation une fois pour toutes. Mêmes règles de ponctuation, de casse et de chiffres pour tous les outils comparés, sinon l’écart mesuré reflète vos règles plutôt que les modèles.
  • Mesurer le WER, puis l’attribution. Calculer le taux d’erreur global, puis vérifier réplique par réplique que les interventions sont attribuées à la bonne personne.
  • Compter les erreurs qui comptent. Dresser la liste des noms propres, chiffres et décisions présents dans la référence, et noter combien chaque outil en restitue correctement.
  • Isoler les passages superposés. Relever les moments où deux voix se croisent et comparer les outils sur ces seuls segments : les écarts entre outils s’y creusent le plus.

Vous obtenez ainsi un tableau qui vous appartient, et qui restera valable quand les modèles changeront : il suffira de repasser les nouveaux venus sur le même corpus.

Un dernier levier coûte moins cher que n’importe quel abonnement : la prise de son. Un micro par intervenant, ou au minimum un micro de conférence placé au centre, fait souvent gagner davantage que le passage à un modèle plus récent. Et une règle de réunion aussi banale que « on ne parle pas à deux » améliore la transcription autant que la réunion elle-même.

La transcription automatique est déjà un outil de productivité réel. Tant que la parole superposée reste un problème de recherche ouvert, sa fiabilité se jugera sur vos enregistrements, pas sur ceux des brochures.

Questions frequentes

Qu’est-ce que le WER en transcription IA ?

Le WER (Word Error Rate) est le taux d’erreur par mot : on compte les mots remplacés, oubliés et ajoutés par rapport à une transcription de référence faite par un humain, rapportés au nombre de mots de cette référence. Un WER de 5 % correspond approximativement à une précision de 95 %.

Pourquoi la transcription IA est-elle moins précise en réunion ?

Les réunions cumulent les difficultés : voix qui se chevauchent, prise de son distante, bruit ambiant et plusieurs locuteurs à distinguer. Selon AssemblyAI (juillet 2026), la précision passe de 95 à 98 % en studio à 85 à 92 % en visioconférence, et 70 à 85 % en environnement bruyant.

Qu’est-ce que la diarisation ?

La diarisation est l’étape qui découpe un enregistrement par locuteur pour indiquer qui parle à quel moment. Elle est distincte de la reconnaissance des mots et se trompe surtout pendant les chevauchements de parole et sur les interventions très courtes.

Faut-il transcrire ses réunions en local ou dans le cloud ?

Le cloud donne accès aux modèles les plus récents et à une diarisation intégrée, mais l’audio sort de votre infrastructure. Le local, avec un modèle ouvert comme Whisper, garde les données chez vous au prix d’une machine équipée et d’une configuration plus technique. Plus l’enregistrement est sensible, plus le local se justifie.

Comment tester un outil de transcription IA avant de le choisir ?

Transcrivez à la main quelques extraits de dix minutes tirés de vos vraies réunions, puis comparez chaque outil à cette référence avec les mêmes règles de normalisation. Vérifiez le taux d’erreur, l’attribution des répliques, les noms propres et les passages où les voix se superposent.

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 16 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *