人工知能

ElevenLabs、90以上の言語をサポートするEleven v4とv4 Turboを発表

ElevenLabsは、90以上の言語をサポートし、10秒間の録音から音声を複製できるテキスト読み上げモデル「Eleven v4」と「Eleven v4 Turbo」を発表した。Turbo版は、同社のテストによると音声開始までの中央値が約150ミリ秒で、リアルタイム音声アプリケーションやAIエージェントを対象としている。

2026-09-29
1 分で読めます
0 閲覧数
certi.news
ElevenLabs、90以上の言語をサポートするEleven v4とv4 Turboを発表

ElevenLabsは、音声表現、話者のアイデンティティーの一貫性、ほぼ即時の応答を必要とするアプリケーションへの対応強化に重点を置いたアップデートとして、テキスト読み上げモデル「Eleven v4」と「Eleven v4 Turbo」を発表した。両モデルはElevenAgents、ElevenCreative、ElevenAPIで利用でき、無料アカウントから試すこともできる。

イントネーションと文脈をより細かく制御

同社によると、Eleven v4は、音声を生成する際に文脈、イントネーション、話す速度、感情、人格を解釈できる新しいアーキテクチャーを採用している。これにより、長文の中でも話者のアイデンティティーを維持しながら、ドラマチック、緊迫、コミカル、日常的な会話など、場面の性質に応じて話し方を変えることを目指している。

また、モデルは会話内の前の文を利用して、後続する文のイントネーションを調整できる。ElevenLabsは、Eleven v3で導入した音声タグシステムも拡張し、1つのリクエスト内に複数の指示を組み込み、特定の順序で適用できるようにした。指示の例には、笑い、怒り、特定のアクセント、小雨、電話の振動などが含まれる。同社は、固有の単語や名前の発音を支援するため、国際音声記号(IPA)のサポートも改善したと発表した。

音声クローンと対応言語

ElevenLabsによると、Eleven v4は、長さがわずか10秒の録音から音声を複製できる。また同社は、Eleven v3ではサポートしていなかったProfessional Voice Clone機能を、新モデルで再び利用可能にした。

Eleven v4とEleven v4 Turboは90以上の言語をサポートしており、Eleven v3の約70言語から増加した。同社は、日本語、ブラジルポルトガル語、標準中国語、広東語で特に改善したほか、同社の評価によれば、音声クローンが他の言語をより自然な現地アクセントで話せるようになったとしている。

v4 Turboで実際に何が変わるのか?

Eleven v4 Turboは、音声AIエージェント、コールセンター、応答時間の影響を直接受けるリアルタイムアプリケーション向けに設計された。モデルは双方向ストリーミングをサポートしており、文全体の生成が完了する前に音声生成を開始できる。

同社のテストによると、音声出力開始までの時間の中央値は約150ミリ秒、推論時間の中央値は約100ミリ秒だった。これらはElevenLabsが実施したテストの結果であり、独立した測定値ではない。同社によると、このモデルは大規模言語モデルの応答が完了する前に話し始めることができ、通話中の意見の相違、別の担当者への転送、発信者の保留といったシナリオにも音声で対応できる。

提供状況と公表された制限

両モデルはElevenAgents、ElevenCreative、ElevenAPIで利用でき、無料アカウントから試すこともできる。無料プランには月1万クレジットが含まれ、有料プランは月額6ドルから始まる。Eleven v4は1回の処理で最大1万文字を生成でき、オーディオブックやポッドキャストなどの長尺コンテンツで音声クリップを結合し、リズムとイントネーションを維持するためのツールも備えている。

今回の発表の重要性は、多言語での表現力向上と低遅延応答のための独立した経路を組み合わせた点にある。ただし、実際の結果の品質は、言語、テキストの性質、利用環境における応答時間に左右されるほか、音声クローンが意図した用途に適しているかを確認する必要もある。情報源は、両モデルを競合製品と直接比較する独立したテストを提示していない。

ニュースの出典
c
著者

certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る