Nvidia offre un modèle gratuit qui sait qui parle en réunion

Nvidia offre un modèle gratuit qui sait qui parle en réunion

Un comité de direction, six voix autour d’une table, un micro posé au centre. Pour savoir qui a dit quoi, il fallait jusqu’ici presque toujours confier l’enregistrement à un service de transcription en ligne. Nvidia vient de publier un modèle qui fait ce tri en direct, avec des poids en libre accès et une taille assez modeste pour laisser espérer qu’il tourne ailleurs que dans un centre de données.

Cent millions de paramètres pour démêler huit voix

Le modèle s’appelle Nemotron 3 Diarization. La diarisation, c’est l’étape qui attribue chaque segment de parole à un locuteur : elle ne transcrit rien, elle dit « qui parle, et quand ». Avec environ 100 millions de paramètres, le modèle distingue jusqu’à huit personnes et repère les moments où plusieurs d’entre elles parlent en même temps. Il traite aussi bien des fichiers enregistrés que de l’audio en direct.

Nvidia propose de l’associer à Parakeet, son système de reconnaissance vocale, pour obtenir une transcription étiquetée par locuteur. La mémoire tampon audio se règle sur quatre niveaux, de 30,4 secondes à 0,32 seconde : plus elle est courte, plus la réponse est immédiate, et plus la précision baisse en général.

Les résultats publiés placent le modèle en tête du Diarization-Bench de VoiceArena, avec un DER (diarization error rate, la part du temps de parole mal attribuée, manquée ou inventée) de 14,72 %. Le système suivant affiche 19,3 %. Ce classement est exigeant : les chevauchements de parole comptent, et le moindre décalage au moment où un locuteur passe la main à un autre est pénalisé. Face à son prédécesseur, Streaming Sortformer, le taux d’erreur recule d’environ 40 % en moyenne sur huit jeux de test, avec une mémoire tampon de 1,04 seconde.

La diarisation, dernier rempart des offres payantes

La reconnaissance vocale libre s’est banalisée depuis plusieurs années. Ce qui justifiait encore l’abonnement à un service de transcription, pour une entreprise, tenait souvent à la diarisation : un compte rendu où tout le monde parle d’une seule voix ne sert pas à grand-chose. Des briques ouvertes existaient déjà, comme le modèle Community-1 de pyannote, mais elles visent surtout le traitement différé de fichiers enregistrés. Suivre plusieurs voix en temps réel, avec une bonne qualité, restait l’affaire des plateformes.

Avec un modèle gratuit, léger et capable de suivre une conversation au fil de l’eau, l’ensemble reconnaissance vocale plus attribution des voix peut désormais s’assembler à partir de composants ouverts, sur une infrastructure que l’entreprise contrôle. Pour une réunion de ressources humaines, un arbitrage juridique, un conseil d’administration ou une consultation médicale, l’audio peut ne plus sortir des murs.

Vous gardez aussi la main sur la chaîne suivante. Une transcription attribuée devient la matière première d’un résumé généré par un LLM (grand modèle de langage), d’un agent qui extrait les décisions et les tâches, ou d’un index RAG (génération augmentée par récupération) interrogeable sur l’historique des réunions. Tout cela peut rester en local, sans qu’aucune donnée ne transite par un tiers.

Des voix sans nom, et pas plus de huit

Le modèle a des limites nettes. Les étiquettes qu’il produit sont anonymes, du type « speaker_2 » : rattacher chaque voix à un nom reste un travail à construire. Au-delà de huit participants, dans un bruit de fond marqué ou une salle qui résonne, le taux d’erreur grimpe. Or la salle de réunion moyenne, avec sa climatisation et ses murs vitrés, n’a pas la propreté acoustique d’un jeu de test.

Un DER de 14,7 % signifie aussi qu’environ un septième du temps de parole reste mal traité. Sur un compte rendu interne, l’écart est tolérable. Sur une retranscription à valeur juridique, il impose une relecture humaine. Et le mode le plus réactif, avec la mémoire tampon la plus courte, n’est pas celui qui a produit les meilleurs scores.

Un classement unique ne suffit pas non plus à juger un modèle : les équipes qui envisagent un déploiement auront intérêt à le tester sur leurs propres enregistrements. La licence des poids (OpenMDW 1.1) autorise, selon la fiche du modèle, l’usage commercial, ce qui lève au moins un frein.

Les outils libres d’abord, les DSI ensuite

Première étape, d’ici le printemps 2027 : l’intégration dans les outils libres de prise de notes et de transcription locale. La taille du modèle s’y prête, et l’écosystème de la voix open source absorbe vite ce genre de brique. Condition : un empaquetage simple, qui ne dépende pas d’une chaîne logicielle lourde.

Deuxième étape, vers la fin 2027 : des DSI (directions des systèmes d’information) qui proposent en interne un service de compte rendu automatique réservé aux réunions sensibles. Condition plus délicate : résoudre l’identification nominative. Associer une voix à une personne suppose des empreintes vocales, que le RGPD range parmi les données biométriques dès lors qu’elles servent à identifier quelqu’un. Consentement, conservation, droit d’opposition : le chantier sera juridique avant d’être technique.

Troisième étape, en parallèle : les services payants déplacent leur valeur vers la couche supérieure. Résumé, suivi des décisions, branchement sur l’agenda et la messagerie, agents qui relancent les participants. La diarisation, elle, ne sera plus un critère d’achat. C’est notre pari pour fin 2027.

Un outil pourrait accélérer tout ce calendrier : un logiciel de réunion libre, largement installé, qui livrerait par défaut une attribution nominative des voix calculée sur le poste. Envoyer une réunion confidentielle chez un prestataire pour savoir qui a parlé deviendrait alors difficile à justifier devant un DPO (délégué à la protection des données).

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *