Google은 Gemini API와 Google AI Studio를 통해 개발자에게 새로운 음성 모델 제품군을 제공한다고 발표했습니다. 여기에는 실시간 음성 대화를 위한 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking, 스트리밍 음성을 텍스트로 변환하는 Gemini 3.5 Transcribe가 포함됩니다. 회사는 새로운 모델들이 단순히 응답하는 데 그치지 않고, 대화의 흐름을 유지하면서 추론하고 작업을 수행할 수 있는 음성 경험 구축을 목표로 한다고 밝혔습니다.
대화 중 작업을 수행하는 음성 에이전트
Gemini 3.8 Live는 speech-to-speech 방식의 실시간 음성 기능을 제공하므로, 에이전트가 대화를 일시 중지하지 않고도 요청을 처리하고 작업을 수행할 수 있습니다. 비동기 함수 호출 기능을 사용하면 사용자의 음성 응답을 계속 스트리밍하는 동안 API와 도구 호출을 백그라운드에서 실행할 수 있습니다.
또한 모델은 실시간 시각 입력을 사용해 사용자가 말하는 내용과 보고 있는 것에 대한 맥락을 확보할 수 있으며, 확인 코드, 청구 번호, 기술 데이터와 같은 영숫자 데이터를 정확하게 처리할 수 있습니다. 모델은 97개 이상의 언어를 지원하고 억양의 일관성을 유지하며, 동일한 응답 안에서 실시간 음성과 구조화된 데이터 업데이트를 결합할 수 있습니다.
Gemini 3.8 Live Extended Thinking은 복잡하고 여러 단계로 구성된 문제를 처리할 때 백그라운드에서 사고할 수 있는 조정 가능한 옵션을 추가합니다. Google에 따르면 이 모델은 Artificial Analysis의 Speech-to-Speech 순위표에서 1위를 차지했습니다. 발표에서는 평가 방법론이나 전체 비교의 세부 사항을 설명하지 않았으므로, 이 결과는 출처에 언급된 측정 기준과 관련된 것으로 남습니다.
85개 언어를 통한 음성-텍스트 변환
Google은 낮은 지연 시간의 음성 인식을 위해 설계된 모델인 Gemini 3.5 Transcribe도 출시했습니다. 회사는 이 모델이 스트리밍 변환에서 평균 단어 오류율 4.0%, 비스트리밍 변환에서 2.6%를 기록했다고 밝혔습니다. 85개 이상의 언어를 지원하며, 문장 안이나 문장 사이에서 언어가 전환되는 상황도 자동으로 처리할 수 있습니다.
개발자는 최대 1,000개의 용어가 포함된 사용자 지정 어휘 목록을 전달해 전문 용어, 흔하지 않은 이름, 회사명을 중심으로 인식을 유도할 수 있습니다. Smart Transcription 모드는 구조화된 서식, 일부 표현의 수정, 군더더기와 머뭇거림 표현의 삭제를 통해 더 읽기 쉬운 텍스트를 제공합니다.
개발자에게 실질적으로 달라지는 점은?
이번 제공은 실시간 음성 인터페이스에서 듣기, 사고, 도구 실행을 결합하므로 음성을 텍스트로 변환하는 모델, 대화 모델, 텍스트를 음성으로 변환하는 엔진을 별도의 체인으로 구축해야 할 필요를 줄여줍니다. 그러나 이번 발표가 음성 스트리밍 인프라 요구 사항을 없애는 것은 아니므로 Google은 Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel, Vision Agents와 같은 통합 파트너를 통해서도 모델에 접근할 수 있도록 했습니다.
Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 Live API를 통해 제공되며, 발표된 가격은 음성 입력 분당 0.005달러, 음성 출력 분당 0.018달러입니다. 출처는 각주에서 비용 추정이 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 12달러를 기준으로 한다고 설명하므로, 개발자는 확장하기 전에 실제 과금 방식을 검토해야 합니다.
ai.studio/live를 통해 모델을 사용해 보거나, GitHub의 샘플 애플리케이션을 사용하거나, Live API 스킬을 활용할 수 있습니다. Google의 음성 제품군에는 70개 이상의 언어로 음성 간 번역을 제공하는 Gemini 3.5 Live Translate, 음성 생성을 위한 Gemini 3.1 Flash TTS, 음악 생성을 위한 Lyria 3.5도 포함되어 있습니다.