人工智能

Google推出用于构建实时语音应用的新Gemini模型

Google宣布通过Gemini API和Google AI Studio向开发者提供Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking和Gemini 3.5 Transcribe。 ​​这些模型旨在构建能够跟进对话并执行任务的语音代理,同时以较低错误率将超过85种语言的语音转换为文本。

2026-09-15
1 分钟阅读
3 浏览量
فريق تحرير certi.news
Google推出用于构建实时语音应用的新Gemini模型

Google宣布通过Gemini API和Google AI Studio向开发者提供一组新的音频模型,包括用于实时语音对话的Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,以及用于将流式语音转换为文本的Gemini 3.5 Transcribe。公司表示,这些新模型面向的目标是构建不只是进行回复、还能够推理和执行任务,同时保持对话流畅性的语音体验。

可在对话期间执行任务的语音代理

Gemini 3.8 Live提供speech-to-speech类型的实时语音能力,使代理能够处理请求并执行操作,而无需暂停对话。异步函数调用功能可以在后台执行API调用和工具调用,同时继续向用户流式传输语音回复。

该模型还可以使用实时视觉输入,为用户所说和所看到的内容提供上下文,并准确处理确认码、索赔编号和技术数据等字母数字数据。模型支持超过97种语言,同时保持口音一致性;此外,还支持在同一回复中将实时语音与结构化数据更新结合起来。

Gemini 3.8 Live Extended Thinking则增加了一个可调节的后台思考选项,用于处理复杂的多步骤问题。据Google称,该模型在Artificial Analysis的Speech-to-Speech排行榜中排名第一。公告没有说明评估方法或完整的比较细节,因此这一结果仍与来源中提到的测量方式相关。

支持85种语言的语音转文本

Google还推出了Gemini 3.5 Transcribe,这是一款专门用于低延迟语音识别的模型。公司表示,该模型在流式转换中的平均词错误率为4.0%,在非流式转换中为2.6%。它支持超过85种语言,并能够自动处理句内或句子之间的语言切换。

开发者可以传入包含最多1,000个术语的自定义词汇表,引导识别专业术语、不常见的名称和公司名称。Smart Transcription模式通过结构化格式、修正部分措辞以及删除填充词和犹豫词,提供更适合阅读的文本。

对开发者而言,实际有哪些变化?

这些功能将监听、思考和工具执行结合到实时语音界面中,从而减少分别构建语音转文本模型、对话模型和文本转语音引擎这一整套链路的需求。不过,该公告并没有消除音频流基础设施方面的要求;因此,Google也通过Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel和Vision Agents等集成合作伙伴提供模型访问。

Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking可通过Live API使用,公布的价格为音频输入每分钟0.005美元、音频输出每分钟0.018美元。来源在脚注中指出,成本估算基于每百万输入令牌3美元和每百万输出令牌12美元,因此开发者在扩大使用规模前需要核查实际计费机制。

可以通过ai.studio/live试用这些模型,也可以使用GitHub上的示例应用,或利用Live API技能。Google的音频模型系列还包括Gemini 3.5 Live Translate,可在超过70种语言之间进行语音到语音翻译;Gemini 3.1 Flash TTS用于语音生成;以及用于音乐生成的Lyria 3.5。

新闻来源
Google Official News
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻