人工智能

ElevenLabs 发布 Eleven v4 和 v4 Turbo,支持超过 90 种语言

ElevenLabs 宣布推出 Eleven v4 和 Eleven v4 Turbo 文本转语音模型,支持超过 90 种语言,并可从时长 10 秒的录音中克隆声音。根据公司测试,Turbo 版本面向实时音频应用和人工智能代理,语音开始输出的中位延迟约为 150 毫秒。

2026-09-29
1 分钟阅读
0 浏览量
certi.news
ElevenLabs 发布 Eleven v4 和 v4 Turbo,支持超过 90 种语言

ElevenLabs 发布了 Eleven v4 和 Eleven v4 Turbo 两款文本转语音模型,此次更新重点改善语音表现力、说话者身份一致性,并支持需要近乎即时响应的应用。两款模型均可通过 ElevenAgents、ElevenCreative 和 ElevenAPI 使用,免费账户也可以进行体验。

更强的语调和语境控制

公司表示,Eleven v4 采用了新的架构,能够在生成语音时理解语境、语调、语速、情绪和人物性格。其目标是在较长文本中保持说话者身份一致,并根据场景性质改变朗读方式,例如戏剧性、紧急、喜剧或日常对话。

模型还可以利用对话中的前文来调整后续句子的语调。ElevenLabs 扩展了随 Eleven v3 推出的语音标签系统,现在可以在请求中加入多条指令,并按特定顺序应用这些指令。指令示例包括笑声、愤怒、特定口音、轻微雨声和手机震动。公司还宣布改进对国际音标(IPA)的支持,以帮助准确读出特殊词语和姓名。

声音克隆与语言支持

据 ElevenLabs 称,Eleven v4 可以从一段时长不超过 10 秒的录音中克隆声音。公司还重新为新模型提供 Professional Voice Clone 功能,此前 Eleven v3 不支持该功能。

Eleven v4 和 Eleven v4 Turbo 支持超过 90 种语言,而 Eleven v3 支持约 70 种语言。公司表示,日语、巴西葡萄牙语、普通话和粤语获得了特别改进;此外,根据公司的评估,克隆的声音能够以更自然的本地口音说出其他语言。

v4 Turbo 实际上有哪些变化?

Eleven v4 Turbo 专为语音人工智能代理、呼叫中心以及直接受响应延迟影响的实时应用而设计。该模型支持双向流式传输,因此可以在句子完全生成之前开始生成语音。

公司测试称,语音输出开始的时间中位数约为 150 毫秒,而推理时间中位数约为 100 毫秒。这些数字仍是 ElevenLabs 进行的测试结果,并非独立测量结果。公司指出,该模型可以在大语言模型完成回复之前开始说话,还能以语音方式处理通话中发生争执、转接给另一名客服代表或将来电者置于等待状态等场景。

可用性与已公布的限制

两款模型均可通过 ElevenAgents、ElevenCreative 和 ElevenAPI 使用,也可以通过免费账户进行体验。免费套餐每月包含 1 万积分,付费套餐起价为每月 6 美元。Eleven v4 支持每次处理最多生成 1 万个字符,并提供连接音频片段以及在有声读物和播客等长篇内容中保持节奏和语调的工具。

此次发布的重要性在于,它将多语言表现力改进与一条低延迟响应路径结合起来;但实际结果的质量仍将取决于语言、文本性质以及使用环境中的响应时间,同时还需要确认声音克隆是否适合预期用途。来源未提供将两款模型与竞争对手直接比较的独立测试。

新闻来源
c
作者

certi.news

同一分类

你可能还喜欢

查看所有新闻