Google宣布推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型,重点是创建更具表现力的声音,并控制文本每一行的演绎方式。该公司表示,这两款模型面向开发者、创作者以及构建有声书、播客、语音代理和互动体验的机构。
面向不同用途的两款模型
Gemini 3.8 Flash TTS旨在通过自然语言指令创建定制声音和角色,并支持以100多种语言和方言控制角色、口音及声音特征。Google还提供包含2000多种可投入生产的现成声音库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
Gemini 3.8 Flash-Lite TTS则侧重大规模、低成本应用,例如配音、音频内容制作,以及需要大范围控制语气、节奏和表现细节的语音代理。
对语音演绎进行细致控制
这两款模型都支持使用指定速度、情绪、口音和演绎方式的指令逐行指导朗读。其能力包括从一份文本创建两位说话人的对话场景,同时保持两种声音的差异并安排角色轮换;此外还支持笑声、叹气、喘息和简短的倾听提示等非语言声音效果。
Google表示,Flash TTS能够在持续数小时的长时间音频制作过程中保持音质、节奏和角色身份,并减少说话人特征的变化。该公司还在开发声音重新混音功能,可调整音高、速度和口音,但该功能仍处于“即将推出”状态。
声音克隆与已公布的控制措施
可以从时长为30秒的声音样本创建一致的声音档案,前提是该样本属于用户本人,或用户拥有使用权。Google要求录制声音所有者的口头同意,并在创建声音副本前将其与参考说话人进行匹配。
该公司确认,Gemini Audio模型生成的每个音频片段都通过SynthID携带不可见水印,同时在声音克隆能力中使用C2PA凭证。这些机制旨在帮助识别由人工智能生成的声音,并提高其来源透明度。不过,在技术验证机制本身之外,获得他人使用其声音的同意以及监管限制仍是关键因素。
可用性以及实际变化
Gemini 3.8 Flash TTS已开始通过Gemini API和Google AI Studio向开发者推出,并通过Gemini Notebook向用户推出;之后还将通过Gemini Enterprise中的API提供。Flash-Lite TTS则已开始通过Google Vids推出。Google还宣布与Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen、Wondercraft和Ollang等平台及公司开展合作或集成。
在实际应用中,这一公告将文本转语音从依赖固定声音,转变为更接近语音表演制作的工作流程:设计角色、编写演绎指令,然后制作长篇或多语言对话。Google表示,Flash TTS在Hume AI的Voice Design Benchmark中以71.4分排名第一,在方言建模中以60.8分排名第一;两款模型还在其总体质量指数中分别获得第一和第二名。这些结果是公司在公告中提供的结果,不能替代对实际生产场景中成本和性能的独立评估。
根据公告中提到的限制,伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度无法通过AI Studio使用声音克隆功能。