人工智能

Google推出Gemini 3.8 Flash TTS和Flash-Lite,可定制地将文本转换为语音

Google宣布推出两款新的文本转语音模型,可创建定制声音、逐行指导演绎,并以100多种语言生成多说话人对话。Gemini 3.8 Flash TTS已通过Gemini API和Google AI Studio面向开发者提供,而Flash-Lite则面向大规模语音应用。

2026-09-23
1 分钟阅读
73 浏览量
certi.news Editorial Team
Google推出Gemini 3.8 Flash TTS和Flash-Lite,可定制地将文本转换为语音

Google宣布推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型,重点是创建更具表现力的声音,并控制文本每一行的演绎方式。该公司表示,这两款模型面向开发者、创作者以及构建有声书、播客、语音代理和互动体验的机构。

面向不同用途的两款模型

Gemini 3.8 Flash TTS旨在通过自然语言指令创建定制声音和角色,并支持以100多种语言和方言控制角色、口音及声音特征。Google还提供包含2000多种可投入生产的现成声音库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

Gemini 3.8 Flash-Lite TTS则侧重大规模、低成本应用,例如配音、音频内容制作,以及需要大范围控制语气、节奏和表现细节的语音代理。

对语音演绎进行细致控制

这两款模型都支持使用指定速度、情绪、口音和演绎方式的指令逐行指导朗读。其能力包括从一份文本创建两位说话人的对话场景,同时保持两种声音的差异并安排角色轮换;此外还支持笑声、叹气、喘息和简短的倾听提示等非语言声音效果。

Google表示,Flash TTS能够在持续数小时的长时间音频制作过程中保持音质、节奏和角色身份,并减少说话人特征的变化。该公司还在开发声音重新混音功能,可调整音高、速度和口音,但该功能仍处于“即将推出”状态。

声音克隆与已公布的控制措施

可以从时长为30秒的声音样本创建一致的声音档案,前提是该样本属于用户本人,或用户拥有使用权。Google要求录制声音所有者的口头同意,并在创建声音副本前将其与参考说话人进行匹配。

该公司确认,Gemini Audio模型生成的每个音频片段都通过SynthID携带不可见水印,同时在声音克隆能力中使用C2PA凭证。这些机制旨在帮助识别由人工智能生成的声音,并提高其来源透明度。不过,在技术验证机制本身之外,获得他人使用其声音的同意以及监管限制仍是关键因素。

可用性以及实际变化

Gemini 3.8 Flash TTS已开始通过Gemini API和Google AI Studio向开发者推出,并通过Gemini Notebook向用户推出;之后还将通过Gemini Enterprise中的API提供。Flash-Lite TTS则已开始通过Google Vids推出。Google还宣布与Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen、Wondercraft和Ollang等平台及公司开展合作或集成。

在实际应用中,这一公告将文本转语音从依赖固定声音,转变为更接近语音表演制作的工作流程:设计角色、编写演绎指令,然后制作长篇或多语言对话。Google表示,Flash TTS在Hume AI的Voice Design Benchmark中以71.4分排名第一,在方言建模中以60.8分排名第一;两款模型还在其总体质量指数中分别获得第一和第二名。这些结果是公司在公告中提供的结果,不能替代对实际生产场景中成本和性能的独立评估。

根据公告中提到的限制,伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度无法通过AI Studio使用声音克隆功能。

新闻来源
Google Official News
查看原始来源 ↗
c
作者

certi.news Editorial Team

同一分类

你可能还喜欢

查看所有新闻