
L’essentiel
- L’équipe Hunyuan Speech de Tencent, avec des chercheurs de plusieurs universités, présente Gander, un modèle qui dialogue en continu pendant qu’il exécute une tâche longue.
- L’architecture sépare un « cervelet » conversationnel d’un « cerveau » remplaçable, que l’on peut brancher sur Codex ou Claude Code sans réentraîner la partie vocale.
- Sur Full-Duplex-Bench v3, Gander prend la parole au bon moment dans les 100 scénarios et coupe l’utilisateur dans 8 % des cas, contre 13,5 % pour GPT-Realtime.
- Contrepartie mesurée : sa précision sur les tâches passe légèrement sous celle du concurrent le plus faible du panel.
Vous confiez une correction de bug à un agent. Il part, et le fil se vide : deux, trois minutes sans un mot, jusqu’à un verdict qu’il est trop tard pour infléchir. L’équipe Hunyuan Speech de Tencent, associée à des chercheurs de plusieurs universités, propose un modèle bâti pour supprimer ce blanc. Il s’appelle Gander, et il parle pendant qu’il travaille.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Deux horloges dans un seul modèle
Rien n’interdit sur le papier à un assistant vocal de commenter son propre travail. Tout s’y oppose dans la pratique, parce que les deux activités ne tournent pas à la même vitesse.
Une conversation réclame une réponse en quelques centaines de millisecondes. Fouiller des fichiers, planifier, écrire du code demande du temps de réflexion. Les chercheurs le formulent sans détour : un modèle unique doit arbitrer entre la vitesse et la capacité de raisonnement. Les assistants d’aujourd’hui tranchent en imposant le tour de parole. Vous parlez, il répond, et pendant qu’il exécute, il se tait.
Dans une discussion réelle, personne ne fonctionne ainsi. On se coupe, on lâche un « attends », on écoute tout en parlant. Gander est conçu pour ce désordre : il traite en continu la vidéo, la parole et le texte, y compris pendant qu’il émet du son, et peut poser une question ou donner un point d’avancement sans y avoir été invité.
Un cervelet qui parle, un cerveau qu’on débranche
Le vocabulaire est emprunté à l’anatomie. Le cervelet tient la conversation en temps réel : il écoute, répond, relance, signale où en est le travail. Le cerveau prend en charge le raisonnement et la tâche longue, en arrière-plan.
L’intérêt de l’architecture tient au branchement entre les deux. Le cerveau est remplaçable : le rapport technique cite Codex ou Claude Code comme systèmes agentiques susceptibles d’occuper la place, sans réentraîner le modèle conversationnel. Pour leurs propres tests, les auteurs ont installé à ce poste un modèle non précisé de la famille GPT-5.6 d’OpenAI.
La conséquence pratique est un découplage des cycles de vie. La partie vocale, coûteuse à entraîner et pénible à régler, reste stable. La partie qui exécute suit les progrès du marché, et chaque montée en gamme du moteur de raisonnement profite à l’ensemble sans toucher à ce qui parle.
Pendant l’exécution, vous gardez la main. L’exemple du rapport montre une demande de compatibilité Python 3.12 ajoutée à la volée, alors que l’agent est déjà lancé sur la correction du bug.
Une seconde pour décider de parler ou de se taire
Comment le cervelet sait-il quand ouvrir la bouche ? Gander découpe l’échange en segments d’une seconde. À chacun, il choisit d’écouter, de parler, ou de s’arrêter net si vous reprenez la parole.
Cette décision se prend sans module séparé de détection d’activité vocale, la brique habituellement chargée de repérer le début et la fin d’une prise de parole. Le modèle s’appuie sur environ les deux dernières minutes de conversation comme mémoire de travail. La règle du dialogue s’apprend désormais à l’intérieur du modèle.
Premier sur la prise de parole, dernier sur la précision
Aucun banc d’essai n’existe encore pour ce type de modèle hybride. Les chercheurs se sont rabattus sur Full-Duplex-Bench v3, qui évalue les assistants vocaux sur différents scénarios de tâches. Gander y décroche la meilleure prise de parole du lot : il intervient au bon moment dans la totalité des 100 scénarios, et coupe son interlocuteur dans 8 % des cas. GPT-Realtime en est à 13,5 %, et le plus maladroit du panel frôle 48 %. Le tout avec un modèle relativement petit, opposé à GPT-Realtime, Gemini Live et Grok.
Le prix à payer se lit dans le même document. Sur la précision des tâches, Gander passe légèrement sous le plus faible de ses concurrents. Les auteurs en donnent l’explication : le score porte sur la chaîne complète, reconnaissance vocale et restitution comprises, si bien que chaque erreur de transcription se paie au résultat final. Alimenté directement en texte, le cerveau fait nettement mieux.
Un autre effet de bord est assumé. La compréhension vidéo et audio recule, au point que Gander se retrouve en dessous de son propre modèle de base sur un test. Les chercheurs l’imputent à un entraînement qui privilégie la fluidité de l’échange. Bien parler, tout le temps, se paie ailleurs.
Reprendre la main sur une tâche de dix minutes
Les scores comptent moins que la découpe qu’ils valident. Le silence pendant l’exécution tient à l’architecture du modèle unique, sommé de dialoguer et de raisonner à la même cadence. Rien dans le raisonnement long n’impose ce mutisme.
Séparer le canal qui dialogue du moteur qui exécute change la boucle de contrôle. Sur une tâche de dix minutes, on peut demander où elle en est, ajouter une contrainte, l’interrompre. Une consigne mal formulée se rattrape alors en chemin, quand elle coûtait jusqu’ici dix minutes et un résultat à jeter.
Restent la transcription et la restitution, qui plombent aujourd’hui le score de l’ensemble. Le rapport ne dit pas si un cerveau textuel plus puissant suffirait à compenser, ou s’il faudra en faire un chantier séparé.
Mon avis
Je retiens de Gander son connecteur, pas sa performance. Un cervelet vocal entraîné une fois, branché sur n’importe quel exécutant, ressemble beaucoup à ce que deviendra la couche d’interaction des agents : un composant à part, choisi indépendamment du moteur qui travaille. Les fournisseurs qui vendent aujourd’hui la voix et le raisonnement en bloc ont tout à perdre à cette séparation, ce qui ne l’empêchera pas d’arriver. Changer de cerveau finira par être aussi banal que changer de modèle dans un fichier de configuration, et l’écart de précision constaté ici aura fondu tout seul.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →