Google a annoncé la mise à disposition d’un nouvel ensemble de modèles audio pour les développeurs via Gemini API et Google AI Studio, comprenant Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking pour les conversations vocales en temps réel, ainsi que Gemini 3.5 Transcribe pour convertir la parole en continu en texte. L’entreprise affirme que ces nouveaux modèles sont destinés à créer des expériences vocales qui ne se contentent pas de répondre, mais qui peuvent aussi raisonner et exécuter des tâches tout en maintenant le flux de la conversation.
Des agents vocaux qui exécutent des tâches pendant la conversation
Gemini 3.8 Live offre des capacités vocales directes de type speech-to-speech, permettant à l’agent de traiter les demandes et d’exécuter des actions sans interrompre temporairement la conversation. La fonctionnalité d’appel asynchrone de fonctions permet d’exécuter en arrière-plan des appels d’API et d’outils, tout en poursuivant la diffusion de la réponse vocale à l’utilisateur.
Le modèle peut également utiliser des entrées visuelles en direct afin de fournir du contexte sur ce que dit l’utilisateur et ce qu’il voit, et traiter avec précision les données alphanumériques telles que les codes de confirmation, les numéros de dossier et les données techniques. Les modèles prennent en charge plus de 97 langues, tout en conservant la cohérence de l’accent, et permettent en outre d’intégrer l’audio en temps réel à des mises à jour de données structurées au sein de la même réponse.
Gemini 3.8 Live Extended Thinking ajoute quant à lui une option réglable de réflexion en arrière-plan pour traiter des problèmes complexes comportant plusieurs étapes. Selon Google, ce modèle occupe la première place du classement Speech-to-Speech d’Artificial Analysis. L’annonce n’a pas précisé la méthodologie d’évaluation ni la comparaison complète ; ce résultat reste donc lié à la mesure mentionnée dans la source.
Convertir la parole en texte dans plus de 85 langues
Google a également lancé Gemini 3.5 Transcribe, un modèle consacré à la reconnaissance vocale avec une faible latence. L’entreprise indique que le modèle a atteint un taux d’erreur moyen de 4,0 % pour la transcription en continu et de 2,6 % pour la transcription sans diffusion en continu. Il prend en charge plus de 85 langues et peut gérer automatiquement le changement de langue au sein d’une phrase ou entre plusieurs phrases.
Les développeurs peuvent transmettre une liste personnalisée de vocabulaire comprenant jusqu’à 1 000 termes afin d’orienter la reconnaissance vers des termes spécialisés, des noms peu courants et des noms d’entreprises. Le mode Smart Transcription fournit des transcriptions plus prêtes à la lecture grâce à une mise en forme structurée, à la correction de certaines formulations et à la suppression des mots de remplissage et des hésitations.
Qu’est-ce qui change concrètement pour les développeurs ?
Cette mise à disposition réunit l’écoute, le raisonnement et l’exécution d’outils dans des interfaces vocales en temps réel, ce qui réduit la nécessité de créer une chaîne distincte de modèles de conversion de la parole en texte, d’un modèle conversationnel et d’un moteur de conversion du texte en parole. Toutefois, l’annonce ne supprime pas les exigences liées à l’infrastructure de diffusion audio ; c’est pourquoi Google propose également l’accès aux modèles par l’intermédiaire de partenaires d’intégration tels qu’Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel et Vision Agents.
Les modèles Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont disponibles via Live API, au tarif annoncé de 0,005 dollar par minute d’entrée audio et de 0,018 dollar par minute de sortie audio. La source précise en note que l’estimation des coûts repose sur 3 dollars par million de jetons d’entrée et 12 dollars par million de jetons de sortie, ce qui invite les développeurs à vérifier le mécanisme de facturation réel avant un déploiement à grande échelle.
Les modèles peuvent être testés sur ai.studio/live, ou utilisés au moyen d’applications exemples disponibles sur GitHub, ou encore via la compétence Live API. La gamme audio de Google comprend également Gemini 3.5 Live Translate pour la traduction de parole à parole dans plus de 70 langues, Gemini 3.1 Flash TTS pour la génération vocale et Lyria 3.5 pour la génération musicale.