人工知能

Google،リアルタイム音声アプリ構築向けにGeminiの新モデルを発表

Googleは、Gemini APIとGoogle AI Studioを通じて、Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking、Gemini 3.5 Transcribeを開発者向けに提供開始した。これらのモデルは、会話を追跡してタスクを実行できる音声エージェントの構築に加え、85以上の言語で低い誤り率による音声テキスト変換を対象としている。

2026-09-15
1 分で読めます
3 閲覧数
فريق تحرير certi.news
Google،リアルタイム音声アプリ構築向けにGeminiの新モデルを発表

Googleは、Gemini APIとGoogle AI Studioを通じて、開発者向けに新たな音声モデル群の提供を開始した。これには、リアルタイムの音声会話向けのGemini 3.8 LiveとGemini 3.8 Live Extended Thinking、ストリーミング音声をテキストに変換するGemini 3.5 Transcribeが含まれる。同社によると、新モデルは単に応答するだけでなく、会話の流れを維持しながら推論やタスクの実行も行える音声体験の構築を目的としている。

会話中にタスクを実行する音声エージェント

Gemini 3.8 Liveは、speech-to-speech形式のリアルタイム音声機能を提供する。これによりエージェントは、会話を一時停止することなく、要求に対応して処理を実行できる。非同期の関数呼び出し機能では、ユーザーへの音声応答のストリーミングを継続しながら、APIやツールの呼び出しをバックグラウンドで実行できる。

また、モデルはライブの視覚入力を利用して、ユーザーが話している内容や見ているものに関するコンテキストを得られるほか、確認コード、請求番号、技術データなどの英数字データも正確に扱える。モデルは97以上の言語をサポートし、アクセントの一貫性を維持する。さらに、リアルタイム音声と構造化データの更新を同じ応答内で統合できる。

一方、Gemini 3.8 Live Extended Thinkingは、複雑で複数の段階からなる問題に対応する際、バックグラウンドで思考するための調整可能なオプションを追加する。Googleによると、このモデルはArtificial AnalysisのSpeech-to-Speechランキングで首位に立っている。発表では評価方法や完全な比較の詳細は明らかにされていないため、この結果は情報源で示された測定に基づくものにとどまる。

85以上の言語で音声をテキストに変換

Googleは、低遅延の音声認識に特化したモデル、Gemini 3.5 Transcribeも発表した。同社によると、このモデルの平均単語誤り率は、ストリーミング変換で4.0%、非ストリーミング変換で2.6%だった。85以上の言語をサポートし、文中または文と文の間で言語が切り替わる場合にも自動で対応できる。

開発者は、最大1,000語のカスタム語彙リストを渡し、専門用語、一般的でない名前、企業名などの認識を誘導できる。Smart Transcriptionモードでは、整ったフォーマット、一部の表現の修正、フィラーや言いよどみの削除により、より読みやすいテキストを生成できる。

開発者にとって実際に何が変わるのか

今回の提供により、リアルタイム音声インターフェースで、聞き取り、思考、ツールの実行を統合できる。これにより、音声からテキストへの変換モデル、会話モデル、テキストから音声への変換エンジンを別々に組み合わせる必要性が減る。ただし、発表によって音声ストリーミングのインフラ要件がなくなるわけではない。そのためGoogleは、Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel、Vision Agentsなどの統合パートナーを通じてもモデルへのアクセスを提供している。

Gemini 3.8 LiveとGemini 3.8 Live Extended ThinkingはLive APIを通じて利用でき、料金は音声入力が1分あたり0.005ドル、音声出力が1分あたり0.018ドルと公表されている。情報源の脚注によると、費用の見積もりは入力100万トークンあたり3ドル、出力100万トークンあたり12ドルに基づいているため、開発者は規模を拡大する前に実際の課金方式を確認する必要がある。

モデルはai.studio/liveで試用できるほか、GitHubのサンプルアプリを利用したり、Live APIスキルを活用したりできる。Googleの音声モデル群には、70以上の言語で音声から音声への翻訳を行うGemini 3.5 Live Translate、音声を生成するGemini 3.1 Flash TTS、音楽を生成するLyria 3.5も含まれている。

ニュースの出典
Google Official News
原文を開く ↗
ف
著者

فريق تحرير certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る