A Google anunciou os modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS para conversão de texto em fala, com foco na criação de vozes mais expressivas e no controle da forma de interpretar cada linha do texto. A empresa afirma que os dois modelos são destinados a desenvolvedores, criadores e organizações que produzem audiolivros, podcasts, agentes de voz e experiências interativas.
Dois modelos para dois usos diferentes
O Gemini 3.8 Flash TTS foi projetado para criar vozes e personagens personalizados por meio de comandos em linguagem natural, com controle sobre o papel, o sotaque e as características da voz em mais de 100 idiomas e sotaques. A Google também oferece uma biblioteca com mais de 2000 vozes prontas para produção, incluindo variações regionais como o espanhol mexicano, o francês quebequense e o inglês escocês.
Já o Gemini 3.8 Flash-Lite TTS se concentra em usos de alto volume e menor custo, como dublagem, produção de conteúdo em áudio e agentes de voz que precisam controlar o tom, o ritmo e os detalhes expressivos em larga escala.
Controle detalhado do desempenho vocal
Os dois modelos permitem orientar a interpretação linha a linha usando instruções que definem a velocidade, a emoção, o sotaque e a forma de atuação. Entre as capacidades estão a criação de cenas dialogadas para dois falantes a partir de um único texto, preservando a diferença entre as duas vozes e organizando a alternância de turnos, além de efeitos sonoros não verbais como risadas, suspiros, ofegos e breves sinais de escuta.
A Google afirma que o Flash TTS consegue manter a qualidade e o ritmo da voz, assim como a identidade do personagem, durante uma produção de áudio longa que se estende por horas, reduzindo a variação das características do falante. A empresa também está trabalhando em um recurso de remixagem de vozes, que permitirá ajustar o tom, a velocidade e o sotaque, mas ele ainda está «chegando em breve».
Clonagem de voz e controles anunciados
É possível criar um perfil de voz consistente a partir de uma amostra de voz de 30 segundos, desde que ela pertença ao usuário ou que ele possua os direitos de uso. A Google exige a gravação do consentimento verbal do proprietário da voz e sua correspondência com o falante de referência antes da criação da cópia vocal.
A empresa afirma que todo clipe de áudio produzido pelos modelos Gemini Audio contém uma marca-d’água não visível por meio do SynthID, além do uso de credenciais C2PA nos recursos de clonagem de voz. Esses mecanismos têm como objetivo facilitar a detecção de áudio gerado por inteligência artificial e aumentar a transparência de sua origem. Ainda assim, o consentimento para usar a voz de outra pessoa e as restrições regulatórias continuam sendo fatores decisivos fora do próprio mecanismo técnico de verificação.
Disponibilidade e o que muda na prática?
O lançamento do Gemini 3.8 Flash TTS para desenvolvedores começou por meio da Gemini API e do Google AI Studio, e para usuários por meio do Gemini Notebook, com disponibilidade posterior via API no Gemini Enterprise. Já o Flash-Lite TTS começou a ser disponibilizado pelo Google Vids. A Google também anunciou parcerias ou integrações com plataformas e empresas como Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft e Ollang.
Na prática, o anúncio transfere a conversão de texto em fala da dependência de vozes fixas para um fluxo de trabalho mais próximo da direção de uma performance vocal: projetar um personagem, escrever instruções de interpretação e, então, produzir um diálogo longo ou multilíngue. A Google afirma que o Flash TTS ficou em primeiro lugar no Voice Design Benchmark da Hume AI, com pontuação de 71.4, e em modelagem de sotaques, com pontuação de 60.8, além de os dois modelos terem ficado em primeiro e segundo lugar em seu índice de qualidade geral. Esses resultados foram apresentados pela empresa no anúncio e não substituem uma avaliação independente de custo e desempenho em cenários reais de produção.
O recurso de clonagem de voz não está disponível por meio do AI Studio em Illinois, Texas, no Espaço Econômico Europeu, no Reino Unido, na Suíça e na Índia, de acordo com as restrições mencionadas no anúncio.