Intelligence artificielle

Google lance les modèles Gemini 3.8 Flash TTS et Flash-Lite pour une conversion personnalisable du texte en voix

Google a annoncé deux nouveaux modèles de synthèse vocale permettant de créer des voix personnalisées, de diriger l’interprétation ligne par ligne et de produire des dialogues faisant intervenir plusieurs locuteurs dans plus de 100 langues. Gemini 3.8 Flash TTS est disponible pour les développeurs via Gemini API et Google AI Studio, tandis que Flash-Lite cible les utilisations audio à grande échelle.

2026-09-23
5 min de lecture
73 vues
certi.news Editorial Team
Google lance les modèles Gemini 3.8 Flash TTS et Flash-Lite pour une conversion personnalisable du texte en voix

Google a annoncé les modèles Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS de synthèse vocale, en mettant l’accent sur la création de voix plus expressives et sur le contrôle de la manière dont chaque ligne du texte est interprétée. L’entreprise indique que les deux modèles s’adressent aux développeurs, aux créateurs et aux organisations qui conçoivent des livres audio, des podcasts, des agents vocaux et des expériences interactives.

Deux modèles pour deux usages différents

Gemini 3.8 Flash TTS a été conçu pour créer des voix et des personnages personnalisés au moyen de commandes en langage naturel, avec un contrôle du rôle, de l’accent et des caractéristiques vocales dans plus de 100 langues et accents. Google propose également une bibliothèque de plus de 2 000 voix prêtes pour la production, comprenant des variantes régionales telles que l’espagnol mexicain, le français québécois et l’anglais écossais.

Gemini 3.8 Flash-Lite TTS se concentre quant à lui sur les utilisations à haut volume et à moindre coût, comme le doublage, la production de contenus audio et les agents vocaux qui nécessitent un contrôle du ton, du rythme et des détails expressifs à grande échelle.

Un contrôle détaillé de l’interprétation vocale

Les deux modèles permettent de diriger l’interprétation ligne par ligne au moyen d’instructions qui définissent la vitesse, l’émotion, l’accent et le style d’exécution. Leurs capacités comprennent la création de scènes dialoguées pour deux locuteurs à partir d’un seul texte, tout en préservant la distinction entre les deux voix et en organisant l’alternance des rôles, ainsi que des effets sonores non verbaux tels que le rire, le soupir, le halètement et de brèves indications d’écoute.

Google affirme que Flash TTS peut préserver la qualité et le rythme de la voix ainsi que l’identité du personnage lors d’une production audio longue pouvant durer des heures, en réduisant les variations des caractéristiques du locuteur. L’entreprise travaille également sur une fonctionnalité de remixage des voix permettant de modifier la hauteur, la vitesse et l’accent, mais celle-ci est encore « bientôt disponible ».

Clonage vocal et contrôles annoncés

Il est possible de créer un profil vocal cohérent à partir d’un échantillon vocal de 30 secondes, à condition que celui-ci appartienne à l’utilisateur ou qu’il détienne les droits nécessaires pour l’utiliser. Google demande l’enregistrement d’un consentement verbal du propriétaire de la voix et sa correspondance avec le locuteur de référence avant de créer la copie vocale.

L’entreprise confirme que chaque extrait audio produit par les modèles Gemini Audio comporte un filigrane invisible via SynthID, ainsi que l’utilisation d’informations d’identification C2PA dans les capacités de clonage vocal. Ces mécanismes visent à faciliter la détection des voix générées par l’intelligence artificielle et à renforcer la transparence de leur origine. Toutefois, le consentement à l’utilisation de la voix d’une autre personne et les contraintes réglementaires restent des facteurs déterminants, indépendamment du mécanisme de vérification technique lui-même.

Disponibilité et changements concrets

Le déploiement de Gemini 3.8 Flash TTS auprès des développeurs a commencé via Gemini API et Google AI Studio, et auprès des utilisateurs via Gemini Notebook. Il sera ensuite disponible via l’API dans Gemini Enterprise. Flash-Lite TTS a quant à lui commencé à être déployé via Google Vids. Google a également annoncé des partenariats ou des intégrations avec des plateformes et des entreprises telles que Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft et Ollang.

Concrètement, cette annonce fait passer la conversion du texte en voix d’une dépendance à des voix fixes à un flux de travail plus proche de la réalisation d’une performance vocale : conception d’un personnage, rédaction d’instructions d’interprétation, puis production d’un dialogue long ou multilingue. Google affirme que Flash TTS a obtenu la première place dans le Voice Design Benchmark de Hume AI avec un score de 71,4, ainsi que dans la modélisation des accents avec un score de 60,8. Les deux modèles ont également obtenu les première et deuxième places dans son indice de qualité globale. Ces résultats sont présentés par l’entreprise dans le cadre de l’annonce et ne remplacent pas une évaluation indépendante du coût et des performances dans des scénarios de production réels.

La fonctionnalité de clonage vocal n’est pas disponible via AI Studio dans l’Illinois, au Texas, dans l’Espace économique européen, au Royaume-Uni, en Suisse et en Inde, conformément aux restrictions mentionnées dans l’annonce.

Source de l’actualité
Google Official News
Ouvrir la source originale ↗
c
Auteur

certi.news Editorial Team

Dans la même catégorie

À lire également

Voir toutes les actualités