Intelligence artificielle

Google lance de nouveaux modèles Gemini pour créer des applications vocales en temps réel

Google a annoncé la mise à disposition de Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking et Gemini 3.5 Transcribe pour les développeurs via Gemini API et Google AI Studio. Ces modèles visent à créer des agents vocaux capables de suivre la conversation et d’exécuter des tâches, ainsi qu’à convertir la parole en texte avec un faible taux d’erreur dans plus de 85 langues.

2026-09-15
5 min de lecture
3 vues
فريق تحرير certi.news
Google lance de nouveaux modèles Gemini pour créer des applications vocales en temps réel

Google a annoncé la mise à disposition d’un nouvel ensemble de modèles audio pour les développeurs via Gemini API et Google AI Studio, comprenant Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking pour les conversations vocales en temps réel, ainsi que Gemini 3.5 Transcribe pour convertir la parole en continu en texte. L’entreprise affirme que ces nouveaux modèles sont destinés à créer des expériences vocales qui ne se contentent pas de répondre, mais qui peuvent aussi raisonner et exécuter des tâches tout en maintenant le flux de la conversation.

Des agents vocaux qui exécutent des tâches pendant la conversation

Gemini 3.8 Live offre des capacités vocales directes de type speech-to-speech, permettant à l’agent de traiter les demandes et d’exécuter des actions sans interrompre temporairement la conversation. La fonctionnalité d’appel asynchrone de fonctions permet d’exécuter en arrière-plan des appels d’API et d’outils, tout en poursuivant la diffusion de la réponse vocale à l’utilisateur.

Le modèle peut également utiliser des entrées visuelles en direct afin de fournir du contexte sur ce que dit l’utilisateur et ce qu’il voit, et traiter avec précision les données alphanumériques telles que les codes de confirmation, les numéros de dossier et les données techniques. Les modèles prennent en charge plus de 97 langues, tout en conservant la cohérence de l’accent, et permettent en outre d’intégrer l’audio en temps réel à des mises à jour de données structurées au sein de la même réponse.

Gemini 3.8 Live Extended Thinking ajoute quant à lui une option réglable de réflexion en arrière-plan pour traiter des problèmes complexes comportant plusieurs étapes. Selon Google, ce modèle occupe la première place du classement Speech-to-Speech d’Artificial Analysis. L’annonce n’a pas précisé la méthodologie d’évaluation ni la comparaison complète ; ce résultat reste donc lié à la mesure mentionnée dans la source.

Convertir la parole en texte dans plus de 85 langues

Google a également lancé Gemini 3.5 Transcribe, un modèle consacré à la reconnaissance vocale avec une faible latence. L’entreprise indique que le modèle a atteint un taux d’erreur moyen de 4,0 % pour la transcription en continu et de 2,6 % pour la transcription sans diffusion en continu. Il prend en charge plus de 85 langues et peut gérer automatiquement le changement de langue au sein d’une phrase ou entre plusieurs phrases.

Les développeurs peuvent transmettre une liste personnalisée de vocabulaire comprenant jusqu’à 1 000 termes afin d’orienter la reconnaissance vers des termes spécialisés, des noms peu courants et des noms d’entreprises. Le mode Smart Transcription fournit des transcriptions plus prêtes à la lecture grâce à une mise en forme structurée, à la correction de certaines formulations et à la suppression des mots de remplissage et des hésitations.

Qu’est-ce qui change concrètement pour les développeurs ?

Cette mise à disposition réunit l’écoute, le raisonnement et l’exécution d’outils dans des interfaces vocales en temps réel, ce qui réduit la nécessité de créer une chaîne distincte de modèles de conversion de la parole en texte, d’un modèle conversationnel et d’un moteur de conversion du texte en parole. Toutefois, l’annonce ne supprime pas les exigences liées à l’infrastructure de diffusion audio ; c’est pourquoi Google propose également l’accès aux modèles par l’intermédiaire de partenaires d’intégration tels qu’Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel et Vision Agents.

Les modèles Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont disponibles via Live API, au tarif annoncé de 0,005 dollar par minute d’entrée audio et de 0,018 dollar par minute de sortie audio. La source précise en note que l’estimation des coûts repose sur 3 dollars par million de jetons d’entrée et 12 dollars par million de jetons de sortie, ce qui invite les développeurs à vérifier le mécanisme de facturation réel avant un déploiement à grande échelle.

Les modèles peuvent être testés sur ai.studio/live, ou utilisés au moyen d’applications exemples disponibles sur GitHub, ou encore via la compétence Live API. La gamme audio de Google comprend également Gemini 3.5 Live Translate pour la traduction de parole à parole dans plus de 70 langues, Gemini 3.1 Flash TTS pour la génération vocale et Lyria 3.5 pour la génération musicale.

Source de l’actualité
Google Official News
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités