인공지능

Google, 맞춤 설정 가능한 음성 변환을 위한 Gemini 3.8 Flash TTS 및 Flash-Lite 모델 출시

Google이 맞춤형 음성 생성, 한 줄 단위의 연기 지시, 100개 이상의 언어를 지원하는 다중 화자 대화 제작을 제공하는 새로운 텍스트 음성 변환 모델 2종을 발표했다. Gemini 3.8 Flash TTS는 Gemini API와 Google AI Studio를 통해 개발자에게 제공되며, Flash-Lite는 대규모 음성 사용 사례를 겨냥한다.

2026-09-23
3 분 읽기
73 조회수
certi.news Editorial Team
Google, 맞춤 설정 가능한 음성 변환을 위한 Gemini 3.8 Flash TTS 및 Flash-Lite 모델 출시

Google은 텍스트를 음성으로 변환하는 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS 모델을 발표했다. 두 모델은 더욱 표현력 있는 음성 생성과 텍스트의 각 줄이 전달되는 방식을 제어하는 데 중점을 둔다. 회사에 따르면 두 모델은 오디오북, 팟캐스트, 음성 에이전트 및 인터랙티브 경험을 구축하는 개발자, 제작자, 기업을 대상으로 한다.

서로 다른 용도를 위한 두 모델

Gemini 3.8 Flash TTS는 자연어 명령을 통해 맞춤형 음성과 캐릭터를 만들도록 설계되었으며, 100개 이상의 언어와 방언에서 역할, 억양 및 음성 특성을 제어할 수 있다. Google은 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 등 지역별 변형을 포함한 2000개 이상의 제작용 음성 라이브러리도 제공한다.

Gemini 3.8 Flash-Lite TTS는 더 낮은 비용으로 대량 사용이 필요한 더빙, 오디오 콘텐츠 제작, 억양과 리듬 및 표현의 세부 사항을 대규모로 제어해야 하는 음성 에이전트 등의 용도에 초점을 맞춘다.

음성 연기에 대한 세밀한 제어

두 모델은 속도, 감정, 억양 및 연기 방식을 지정하는 지침을 사용해 한 줄 단위로 낭독을 지시할 수 있다. 하나의 텍스트에서 두 화자가 등장하는 대화 장면을 만들고, 두 음성의 차이를 유지하며 발화 순서를 구성할 수 있다. 또한 웃음, 한숨, 헐떡임, 짧은 청취 신호와 같은 비언어적 음향 효과도 지원한다.

Google은 Flash TTS가 수 시간에 걸친 장시간 오디오 제작에서도 음성 품질과 리듬 및 캐릭터 정체성을 유지하고 화자 특성의 변화를 줄일 수 있다고 밝혔다. 또한 음성의 피치, 속도 및 억양을 조정할 수 있는 음성 리믹스 기능을 개발 중이지만, 이 기능은 아직 «곧 출시 예정»이다.

음성 복제 및 발표된 보호 장치

사용자 본인의 음성이거나 사용 권리를 보유한 경우, 30초 분량의 음성 샘플을 통해 일관된 음성 프로필을 만들 수 있다. Google은 음성 소유자의 구두 동의를 녹음하고, 음성 사본을 생성하기 전에 이를 기준 화자와 대조할 것을 요구한다.

회사는 Gemini Audio 모델이 생성하는 모든 오디오 클립에 SynthID를 통한 비가시 워터마크가 포함되며, 음성 복제 기능에는 C2PA 자격 증명도 사용된다고 강조했다. 이러한 메커니즘은 AI가 생성한 음성을 더 쉽게 탐지하고 그 출처의 투명성을 높이는 것을 목표로 한다. 그러나 다른 사람의 음성을 사용하는 데 대한 동의와 규제상의 제한은 기술적 검증 메커니즘 자체와 별개로 여전히 핵심적인 요소다.

출시 현황과 실제로 달라지는 점

Gemini 3.8 Flash TTS는 Gemini API와 Google AI Studio를 통해 개발자에게, Gemini Notebook을 통해 사용자에게 출시되기 시작했으며, 이후 Gemini Enterprise의 API를 통해 제공될 예정이다. Flash-Lite TTS는 Google Vids를 통해 출시되기 시작했다. Google은 또한 Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft 및 Ollang을 포함한 플랫폼과 기업과의 협력 또는 통합을 발표했다.

실제로 이번 발표는 텍스트 음성 변환을 고정된 음성에 의존하는 방식에서 음성 연출에 가까운 작업 흐름으로 전환한다. 즉, 캐릭터를 설계하고, 낭독 지침을 작성한 다음, 장시간 대화 또는 다국어 대화를 제작하는 방식이다. Google에 따르면 Flash TTS는 Hume AI의 Voice Design Benchmark에서 71.4점으로 1위를 차지했고, 방언 모델링에서는 60.8점을 기록했으며, 두 모델은 회사의 전체 품질 지수에서 각각 1위와 2위를 차지했다. 이러한 결과는 발표에서 회사가 제시한 것으로, 실제 제작 시나리오에서 비용과 성능에 대한 독립적인 평가를 대신할 수는 없다.

발표에 명시된 제한에 따르면 일리노이, 텍사스, 유럽경제지역, 영국 및 스위스와 인도에서는 AI Studio를 통한 음성 복제 기능을 이용할 수 없다.

뉴스 출처
Google Official News
원문 보기 ↗
c
작성자

certi.news Editorial Team

같은 카테고리

추천 기사

모든 뉴스 보기