Inteligencia artificial

Google lanza los modelos Gemini 3.8 Flash TTS y Flash-Lite para convertir texto en voz personalizable

Google anunció dos nuevos modelos de conversión de texto a voz que permiten crear voces personalizadas, dirigir la interpretación línea por línea y producir diálogos con múltiples hablantes en más de 100 idiomas. Gemini 3.8 Flash TTS está disponible para desarrolladores a través de Gemini API y Google AI Studio, mientras que Flash-Lite está orientado a usos de audio a gran escala.

2026-09-23
4 min de lectura
73 visitas
certi.news Editorial Team
Google lanza los modelos Gemini 3.8 Flash TTS y Flash-Lite para convertir texto en voz personalizable

Google anunció los modelos Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS para convertir texto en voz, con énfasis en crear voces más expresivas y controlar la forma de interpretar cada línea del texto. La empresa afirma que ambos modelos están dirigidos a desarrolladores, creadores y organizaciones que crean audiolibros, pódcast, agentes de voz y experiencias interactivas.

Dos modelos para dos usos diferentes

Gemini 3.8 Flash TTS está diseñado para crear voces y personajes personalizados mediante instrucciones en lenguaje natural, con control sobre el papel, el acento y las características de la voz en más de 100 idiomas y dialectos. Google también ofrece una biblioteca con más de 2000 voces listas para producción, que incluye variantes regionales como el español mexicano, el francés quebequés y el inglés escocés.

Por su parte, Gemini 3.8 Flash-Lite TTS se centra en usos de gran volumen y menor coste, como el doblaje, la producción de contenido de audio y los agentes de voz que necesitan controlar el tono, el ritmo y los detalles expresivos a gran escala.

Control detallado de la interpretación vocal

Ambos modelos permiten dirigir la interpretación línea por línea mediante instrucciones que especifican la velocidad, la emoción, el acento y la forma de interpretar. Entre sus capacidades se incluye la creación de escenas dialogadas para dos hablantes a partir de un solo texto, manteniendo la diferencia entre ambas voces y organizando el intercambio de turnos, además de efectos de sonido no verbales como risas, suspiros, jadeos y breves señales de escucha.

Google afirma que Flash TTS puede mantener la calidad y el ritmo de la voz, así como la identidad del personaje, durante una producción de audio larga de varias horas, reduciendo las variaciones en las características del hablante. La empresa también trabaja en una función para remezclar voces, que permitirá ajustar el tono, la velocidad y el acento, pero que todavía está «próximamente disponible».

Clonación de voz y controles anunciados

Se puede crear un perfil de voz coherente a partir de una muestra de voz de 30 segundos, siempre que pertenezca al usuario o que este tenga los derechos para utilizarla. Google exige grabar el consentimiento verbal del propietario de la voz y compararlo con el hablante de referencia antes de crear la copia de voz.

La empresa confirma que cada clip de audio producido por los modelos Gemini Audio incluye una marca de agua invisible mediante SynthID, además del uso de credenciales C2PA en las capacidades de clonación de voz. Estos mecanismos tienen como objetivo facilitar la detección del audio generado por inteligencia artificial y reforzar la transparencia sobre su origen. No obstante, el consentimiento para utilizar la voz de otra persona y las restricciones regulatorias siguen siendo factores decisivos fuera del propio mecanismo de verificación técnica.

Disponibilidad y qué cambia en la práctica

El lanzamiento de Gemini 3.8 Flash TTS para desarrolladores comenzó a través de Gemini API y Google AI Studio, y para usuarios a través de Gemini Notebook; posteriormente estará disponible mediante API en Gemini Enterprise. Flash-Lite TTS comenzó a distribuirse a través de Google Vids. Google también anunció asociaciones o integraciones con plataformas y empresas como Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft y Ollang.

En la práctica, el anuncio traslada la conversión de texto a voz de la dependencia de voces fijas a un flujo de trabajo más cercano a la dirección de una interpretación vocal: diseñar un personaje, redactar instrucciones de interpretación y después producir un diálogo largo o multilingüe. Google afirma que Flash TTS ocupó el primer puesto en el estándar Voice Design Benchmark de Hume AI, con una puntuación de 71.4, y en modelado de acentos, con una puntuación de 60.8; además, ambos modelos obtuvieron el primer y segundo puesto en su índice de calidad general. Estos resultados fueron presentados por la empresa como parte del anuncio y no sustituyen una evaluación independiente del coste y el rendimiento en escenarios reales de producción.

La función de clonación de voz no está disponible a través de AI Studio en Illinois, Texas, el Espacio Económico Europeo, el Reino Unido, Suiza e India, según las restricciones mencionadas en el anuncio.

Fuente de la noticia
Google Official News
Abrir fuente original ↗
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias