Google DeepMind lance les modèles audio Gemini 3.8 Live avec des tarifs API bas, concurrençant GPT-Live-1 d’OpenAI sur le coût, la qualité et l’adoption par les développeurs.

Google DeepMind a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio conçus pour les développeurs qui créent des applications vocales conversationnelles. Disponibles via l’API Gemini et Google AI Studio, ces modèles offrent à Google une nouvelle entrée dans la compétition avec GPT-Live-1 d’OpenAI tout en affichant un prix publié nettement plus bas pour les conversations vocales.
Ce lancement compte parce que les systèmes vocaux en temps réel vont au-delà de la transcription et du chat de base. Selon The Decoder, Gemini 3.8 Live peut prendre en charge des agents vocaux qui effectuent des appels API en arrière-plan, traitent des entrées visuelles et continuent de parler pendant ces opérations. Google indique également que les modèles prennent en charge plus de 97 langues, même si la source ne fournit pas davantage de détails sur les performances ou la disponibilité langue par langue.
Gemini 3.8 Live est positionné comme le modèle audio standard en temps réel, tandis que Gemini 3.8 Live Extended Thinking ajoute une variante orientée raisonnement. Tous deux sont destinés aux développeurs plutôt que d’être présentés uniquement comme des fonctionnalités grand public. Selon The Decoder, la sortie comprend des applications d’exemple sur GitHub, offrant aux équipes produit un point de départ pour tester des workflows vocaux.
L’ensemble des fonctionnalités vise des applications qui combinent la parole avec l’usage d’outils et le contexte multimodal. Un agent vocal pourrait, par exemple, interpréter des entrées visuelles tout en gérant une requête API externe et en maintenant une interaction parlée. La source n’identifie pas d’intégrations d’entreprise spécifiques, de clients en production ni de conditions de disponibilité générale au-delà de l’accès via l’API Gemini et Google AI Studio.
Cette distinction est importante pour les développeurs. Un modèle capable de parler naturellement n’est qu’une partie d’un produit vocal. Les développeurs ont aussi besoin d’une exécution fiable des outils, de la gestion des interruptions, de contrôles de latence, de la journalisation et de garde-fous autour des actions déclenchées par des demandes vocales. Les capacités décrites par Google couvrent une partie de cette architecture, mais les éléments disponibles ne montrent pas à quel point les modèles fonctionnent de manière constante en environnement de production.
La différence concurrentielle la plus claire est le coût. The Decoder indique que Google facture 0,005 $ par minute pour l’entrée audio et 0,018 $ par minute pour la sortie audio. Sur la base du calcul de la publication, une heure de conversation vocale coûte environ 1,38 $ selon les hypothèses tarifaires de Google.
Le même rapport place GPT-Live-1 d’OpenAI à 0,05 $ par minute, ce qui porte une heure de conversation à environ 3 $ ou davantage. Le total exact pour une application donnée dépendra du ratio entre audio d’entrée et audio de sortie, des pauses, des reprises, des appels d’outils et d’autres activités facturables ; la comparaison horaire doit donc être considérée comme une estimation illustrative plutôt que comme un coût opérationnel universel.
Même avec cette réserve, l’écart de prix pourrait influencer la manière dont les équipes conçoivent les produits vocaux. Des coûts d’inférence plus faibles facilitent les tests de conversations plus longues, l’offre de fonctionnalités vocales à davantage d’utilisateurs et la conduite d’expérimentations avant qu’un modèle économique ne soit prouvé. Pour les startups, le coût peut déterminer si un workflow vocal est viable ou non. Pour les grandes entreprises, il peut influencer le fait que la voix soit proposée comme interface principale ou comme ajout coûteux.
Le prix seul ne tranche pas. The Decoder affirme que le modèle d’OpenAI devrait sembler plus naturel, car GPT-Live-1 utilise le full duplex, ce qui lui permet d’écouter et de parler en même temps. La publication a aussi jugé les démonstrations d’OpenAI plus convaincantes à l’oreille, tout en caractérisant le compromis apparent de Google comme une meilleure efficacité tarifaire plutôt qu’une qualité conversationnelle clairement supérieure.
L’affirmation de performance la plus forte du rapport provient du classement Artificial Analysis Speech-to-Speech Leaderboard. The Decoder indique que Gemini 3.8 Live Extended Thinking a obtenu 82,6 % et s’est classé premier devant les derniers modèles GPT-Live-1 d’OpenAI.
Il s’agit d’un résultat de benchmark, pas d’une preuve que le modèle de Google offrira la meilleure expérience dans toutes les applications. Les scores d’un leaderboard peuvent dépendre de la conception des tests, des prompts, des critères d’évaluation et des versions du modèle. La source ne fournit ni la méthodologie du classement, ni des intervalles de confiance, ni une répartition des points gagnés ou perdus par les modèles.
L’évaluation de la naturalité conversationnelle dans le rapport repose aussi sur l’écoute de démonstrations. C’est un contexte de marché utile, mais ce n’est pas une évaluation contrôlée de la latence, de la reprise après interruption, de la précision factuelle, de la fiabilité de l’usage des outils ou de la satisfaction des utilisateurs. Ni la source ni les éléments disponibles ne fournissent de chiffres d’adoption indépendants, de références clients ou de données de fiabilité en production pour Gemini 3.8 Live.
Pour les équipes qui évaluent le lancement, le test pratique sera probablement la performance au niveau de la tâche plutôt qu’un simple score speech-to-speech. Les développeurs devraient comparer la latence de réponse, la gestion des tours de parole, le comportement en cas d’interruption, la prononciation, la cohérence multilingue et le coût des conversations selon différents schémas d’élocution. Ils devraient aussi vérifier si le modèle gère correctement le contexte visuel et les actions API sans créer d’interruptions dangereuses ou confuses.
La stratégie de Google est simple : rendre le développement vocal en temps réel moins cher tout en offrant suffisamment de capacités multimodales et d’usage d’outils pour attirer les développeurs qui expérimentent déjà avec des agents IA. L’accès via l’API Gemini et Google AI Studio abaisse la barrière du prototypage, et les exemples GitHub peuvent aider les équipes à passer plus vite d’une démonstration à une première application.
La principale opportunité concerne les produits où l’interaction vocale est fréquente mais ne requiert pas la conversation la plus humaine possible. Le tri du support client, les assistants internes, la recherche vocale, les outils de terrain et les workflows mains libres pourraient tous bénéficier de coûts audio plus faibles. En revanche, les applications liées à la vente, à la santé, à la finance ou à d’autres conversations sensibles peuvent accorder plus de poids au tour de parole naturel, au comportement prévisible, aux contrôles des données et à l’auditabilité qu’au prix.
Le lancement soulève aussi une question de déploiement pour les entreprises qui choisissent entre fournisseurs de modèles. Un tarif à la minute plus bas peut être compensé par du travail d’ingénierie si le modèle nécessite davantage de reprises, produit des tours de parole plus maladroits ou requiert une orchestration supplémentaire pour égaler l’expérience d’un concurrent. Les équipes devraient donc calculer le coût total par tâche terminée, et pas seulement le prix par token audio ou par minute.
Le premier signal sera les tests indépendants de Gemini 3.8 Live face à GPT-Live-1 sur la latence, les interruptions, le raisonnement visuel, la parole multilingue et l’exécution d’outils. Le classement d’Artificial Analysis fournit un point de référence initial, mais des évaluations plus larges montreront si le résultat tient en dehors du cadre du benchmark.
Les développeurs devraient aussi surveiller les preuves d’une utilisation réelle en production : clients nommés, études de cas publiques, données d’usage et limites de service plus claires. Le prix de Google peut susciter l’expérimentation, mais l’adoption durable dépendra de la fiabilité, de la disponibilité et de la qualité des outils API environnants.
Enfin, les mises à jour de modèles des deux entreprises pourraient rapidement changer la comparaison. OpenAI pourrait répondre par des prix plus bas ou un meilleur accès, tandis que Google pourrait privilégier un tour de parole plus naturel. La question concurrentielle n’est donc pas simplement de savoir quel modèle est le moins cher aujourd’hui, mais quel fournisseur peut offrir une qualité vocale acceptable et un comportement d’agent fiable à grande échelle.
Gemini 3.8 Live donne aux développeurs une raison crédible de reconsidérer l’économie de l’IA vocale. L’avantage tarifaire rapporté par Google est suffisamment important pour modifier les expérimentations produit, en particulier pour les applications fondées sur des conversations fréquentes ou prolongées.
Mais le lancement n’élimine pas le compromis central entre coût et qualité d’interaction. L’évaluation la plus utile combinera le benchmark rapporté avec des workflows réels, où la latence, les interruptions, les appels d’outils et la sécurité comptent autant qu’un score de leaderboard. Pour l’instant, Google a présenté l’argument du coût ; les développeurs doivent encore établir si l’expérience est suffisamment solide pour leurs utilisateurs.