
L’essentiel
- Google DeepMind a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de dialogue vocal accessibles via l’API Gemini et Google AI Studio.
- La variante Extended Thinking prend la première place de l’index de qualité speech-to-speech d’Artificial Analysis, avec 82,6 points.
- L’audio est facturé 0,005 dollar la minute en entrée et 0,018 dollar en sortie, soit environ 1,38 dollar l’heure, contre au moins 3 dollars pour GPT-Live-1 d’OpenAI.
Google DeepMind a publié deux modèles de dialogue vocal, Gemini 3.8 Live et sa variante Extended Thinking, et l’argument mis en avant ne porte ni sur le timbre ni sur le naturel de la voix. Il tient à une grille tarifaire de deux lignes, qui aboutit au montant que retiendront les équipes produit : 1,38 dollar l’heure de conversation. Sur la qualité perçue, Google concède ouvertement le terrain à son concurrent.
Deux lignes de facturation, une heure de conversation
Le tarif publié sépare ce que le modèle entend de ce qu’il dit : 0,005 dollar la minute d’audio en entrée, 0,018 dollar la minute en sortie. Additionnées, ces deux lignes donnent 0,023 dollar la minute, soit 1,38 dollar sur soixante minutes.
Cette addition suppose que le micro reste ouvert et que l’agent parle pendant toute l’heure. Aucune conversation ne fonctionne ainsi : les deux interlocuteurs alternent, et la sortie ne tourne que lorsque l’agent répond. L’entrée, elle, court en continu dès lors qu’on veut pouvoir couper l’agent en pleine phrase, ce que ces modèles autorisent. Le tarif horaire annoncé est donc un plafond confortable plutôt qu’une moyenne d’usage : sur un agent qui écoute beaucoup et répond court, la facture réelle tombe nettement en dessous.
Le facteur deux ne compte qu’à partir de mille heures par jour
Face à ce montant, GPT-Live-1 est affiché à 0,05 dollar la minute, soit 3 dollars minimum pour la même heure : un facteur 2,17, présenté comme une rupture tarifaire. Encore faut-il comparer ce qui se facture de la même façon. La documentation d’OpenAI précise que ce tarif de 0,05 dollar couvre la seule couche vocale, le modèle qui répond restant facturé à part ; xAI, lui, demande 0,08 dollar la minute pour Grok Voice Think Fast 2.0, raisonnement compris. Diviser une facture par deux ne change pas la nature d’un projet : cela déplace le seuil à partir duquel il devient rentable.
Pour un prototype qui consomme trente heures de conversation par mois, la différence se compte en dizaines de dollars : aucun arbitrage technique ne se décidera là-dessus. Elle change d’échelle sur de gros volumes. Mille heures de conversation quotidiennes, l’ordre de grandeur d’un centre de contact de taille moyenne, représentent 1 380 dollars par jour chez Google contre 3 000 dollars chez OpenAI, soit environ 591 000 dollars d’écart sur une année pleine. À ce niveau, le choix du modèle sort de la discussion d’ingénierie et remonte au contrôle de gestion.
Le sommet du classement et le tarif bas ne désignent pas le même modèle
La première place revendiquée sur le Speech to Speech Quality Index d’Artificial Analysis, avec un indice de 82,6, est celle de Gemini 3.8 Live Extended Thinking. Le modèle qui porte l’argument de coût, lui, c’est Gemini 3.8 Live, que Google présente comme construit pour l’échelle et l’efficacité tarifaire, et qui se classe deuxième du Speech Agent Arena. Avant de bâtir un budget sur ce tarif de 1,38 dollar, vérifiez laquelle des deux variantes vous intéresse réellement : un modèle qui raisonne en parlant produit mécaniquement plus de tokens qu’un modèle qui répond du tac au tac.
Les autres notes se lisent avec la même prudence. Extended Thinking affiche 97,7 % sur Big Bench Audio, une épreuve de raisonnement, et 68,6 % sur τ-Voice, qui mesure l’aboutissement de tâches par la voix. Pour quiconque envisage la production, le résultat décisif se trouve ailleurs : 35,1 % sur τ-Voice-banking, le scénario bancaire conçu par Sierra. Le modèle en tête de l’index échoue donc sur près de deux tâches bancaires vocales sur trois. Un indice de qualité à 82,6 points et un taux de réussite à 35,1 % ne décrivent pas la même réalité, et c’est le second qui décidera si votre agent peut toucher à un compte client.
Le duplex complet manque toujours à Gemini
Sur la fluidité, Google ne cache pas son retard. GPT-Live-1 dispose du duplex complet, la capacité à écouter et à parler simultanément, et les démonstrations lui donnent une voix plus naturelle. Gemini contourne l’obstacle par des procédés conversationnels : une réponse parlée immédiate du type « Let me check that… », soit « je vérifie », pour accuser réception de la demande, et un commentaire à voix haute pendant les tâches longues.
La documentation de Google indique qu’Extended Thinking raisonne et parle en même temps. La nuance compte : réfléchir en parlant n’est pas écouter en parlant. Le premier évite les silences gênants pendant qu’un raisonnement en plusieurs étapes se déroule, le second permet de se faire couper la parole comme un humain le ferait. Le reste du dispositif tient la route : exécution d’outils et appels de services externes en arrière-plan sans interrompre l’échange, traitement de l’image en quasi temps réel, détection et bascule automatiques entre 97 langues au fil d’une même conversation.
Changer de fournisseur demande quelques jours de travail
Un dernier paramètre échappe à la comparaison tarifaire : le coût de sortie. Un agent vocal se branche sur une interface WebSocket et un flux audio, rien de plus. Le développeur Simon Willison a publié le jour du lancement une interface de test écrite sans la moindre bibliothèque. Elle appelle directement le point d’entrée BidiGenerateContent de l’API Gemini, le canal par lequel un programme dialogue avec le modèle, et s’appuie sur l’API Web Audio du navigateur pour capter et restituer le son. Une couche aussi fine se recâble en quelques jours sur un autre fournisseur.
L’avantage de prix ne verrouille donc personne, et il ne tiendra que jusqu’au prochain ajustement de la grille d’OpenAI. Si vous évaluez un agent vocal ce trimestre, mesurez d’abord le taux de réussite sur vos propres scénarios, puis multipliez votre volume réel d’heures par 0,023 dollar. Ces deux nombres vous en apprendront davantage que n’importe quel classement.
Mon avis
Dans mes arbitrages, les 35,1 % de réussite sur le scénario bancaire pèsent plus lourd que les deux dollars d’écart horaire. À ce niveau de fiabilité, un agent vocal ne remplace personne au support client : il qualifie des appels avant transfert, et c’est déjà beaucoup. Je m’attends à des premiers déploiements sérieux cantonnés aux tâches à faible enjeu, et à des équipes qui découvriront que le poste de coût qui grimpe est le raisonnement facturé en arrière-plan, pas les minutes d’audio. L’avantage tarifaire de Google se jouera alors sur une autre grille que celle qu’il publie aujourd’hui.
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking, blog Google
- Annonce de Google DeepMind sur X
- Gemini Live audio, Simon Willison
Sources
- GPT-Live-1
- Grok Voice Think Fast 2.0
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Tool: Gemini Live audio
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →