인공지능

Google 출시, 다국어 실시간 음성 전사를 위한 Gemini 3.5 Transcribe

Google은 실시간 전사와 녹음 파일을 대상으로 주파수 처리, 텍스트 서식 지정, 화자 인식을 지원하는 음성-텍스트 변환 모델 Gemini 3.5 Transcribe를 발표했다. 이 모델은 Gemini API와 Google의 개발자 및 기업용 플랫폼을 통해 공개 프리뷰로 제공되며, Google 애플리케이션에 단계적으로 통합된다.

2026-08-26
4 분 읽기
9 조회수
فريق تحرير certi.news
Google 출시, 다국어 실시간 음성 전사를 위한 Gemini 3.5 Transcribe

Google은 2026년 8월 26일 Gemini 3.5 Transcribe를 발표했다. 이 모델은 실시간 음성 전사와 지능형 음성 상호작용을 위해 설계된 새로운 음성-텍스트 변환 모델이다. 회사에 따르면 이 모델은 단순히 원시 음성을 단어로 변환하는 데 그치지 않고, 주파수와 자기 수정 발화를 정리하며, 전문 용어를 인식하고, 바로 사용할 수 있는 형식에 가까운 서식이 지정된 텍스트를 출력한다.

이 모델은 음성 에이전트, 실시간 번역 또는 자막 도구, 녹음된 통화와 회의를 분석하기 위한 처리 파이프라인을 구축하는 개발자를 대상으로 한다. Gemini API를 통해 Google AI Studio에서 사용할 수 있으며, Gemini Enterprise Agent Platform에서도 제공된다.

서로 다른 용도를 위한 두 가지 인터페이스

Google은 두 개의 পৃথ한 인터페이스를 통해 이 모델을 제공한다. 첫 번째는 Live API로, gemini-3.5-transcribe-live 모델을 사용하며 1초 미만의 지연 시간으로 지속적인 양방향 스트리밍을 제공한다. 따라서 대화형 음성 애플리케이션에 적합하다. 두 번째는 Interactions API로, gemini-3.5-transcribe 모델을 사용해 녹음, 회의, 통화 기록을 처리하고 화자별로 발화를 구분하며 단어 단위의 타임스탬프를 추가한다.

Google에 따르면 Gemini 3.5 Transcribe는 말하는 도중 일정이나 단어를 바꾸는 것과 같은 자기 수정 발화를 처리하고, 중얼거림과 같은 군더더기 말을 제거하며, 텍스트 서식을 자동으로 지정할 수 있다. 또한 전문 용어와 이례적인 철자를 인식하도록 제공할 수 있는 사용자 지정 어휘를 지원하며, 방언과 지역별 억양을 처리하면서 85개 이상의 언어를 감지하고 전사할 수 있다.

녹음된 음성에서 이 모델은 타임스탬프와 함께 최대 3명의 화자를 구분하며, 3명을 초과하는 화자에 대한 지원은 아직 실험 단계다. 또한 스트리밍 중 언어 전환을 처리할 수 있다. 이는 다국어 대화에서 중요한 기능이지만, 출처는 지원되는 모든 언어 또는 언어별 성능 한도에 대한 세부 정보를 제공하지 않는다.

Chirp 3와 비교한 성능 수치

Google이 인용한 Artificial Analysis 측정에 따르면, 이 모델은 스트리밍 환경에서 평균 단어 오류율 4.0%, 비스트리밍 사용 사례에서 2.6%를 기록했다. 여러 언어와 지역으로 구성된 FLEURS 벤치마크에서는 스트리밍에서 5.50%, 비스트리밍 사용에서 5.04%의 단어 오류율을 기록했다. 회사는 이전 전사 모델인 Chirp 3와 비교해 최종 전사 결과가 나오는 지연 시간이 70% 개선됐다고 밝혔다.

이 수치는 정확도와 속도가 모두 향상됐음을 보여주지만, 모든 음성 환경에서 결과가 동일하다는 의미는 아니다. 결과는 벤치마크, 언어, 녹음 품질, 화자 수, 소음 수준에 따라 달라진다. 또한 출처는 Artificial Analysis의 방법론을 자세히 설명하지 않으며 언어별 전체 결과표도 제공하지 않는다.

Google 인터페이스에서 개발자 도구까지

Google은 이미 Gemini 애플리케이션과 일부 Android 실험 기능에서 이 모델을 사용하고 있다. 여기에는 음성을 서식이 지정된 텍스트로 변환하고, 군더더기 말을 제거하며, 수정하고, 음성으로 글쓰기 방식을 바꿀 수 있는 Rambler 기능이 포함된다. macOS용 Gemini 애플리케이션에서는 음성 명령이 화면의 맥락을 활용해 로컬 파일 요약, 애플리케이션 간 텍스트 재사용, 또는 다른 Gemini 모델을 호출한 이미지 생성과 같은 작업을 수행할 수 있다.

Google Antigravity는 사용자 권한을 받은 후 화면의 맥락과 대화 기록을 활용해 활성 파일과 문서의 이름 및 에이전트의 아이디어를 더 정확하게 인식한다. 또한 Google AI Studio의 Build 모드에서 음성을 사용해 애플리케이션을 구축할 때 이 모델에 접근할 수 있다. Google은 어떤 웹 입력란에서도 음성으로 입력하는 기능이 곧 Chrome에 제공될 예정이라고 밝혔다.

실제로 무엇이 달라지는가?

가장 중요한 변화는 음성 전사가 단순한 초기 기록 단계를 넘어 음성을 이해하고 정리하며 애플리케이션의 맥락과 연결하는 계층으로 전환된다는 점이다. 개발자에게 이는 각각의 수정 발화나 군더더기 말을 별도로 처리할 필요 없이 음성 인터페이스를 구축할 수 있음을 의미한다. 또한 제품의 특성에 따라 실시간 스트리밍이나 보관된 녹음을 선택할 수 있다.

Gemini 3.5 Transcribe는 현재 Google AI Studio의 Gemini API와 Google Antigravity를 통해 개발자에게, Gemini Enterprise Agent Platform을 통해 기업에 공개 프리뷰로 제공된다. 이후 Gemini Enterprise for Customer Experience에도 제공될 예정이다. 사용자의 경우 macOS용 Gemini 애플리케이션에서 영어로 사용할 수 있으며, Rambler는 일부 국가와 언어에서 Android로 제공된다. Chrome에도 곧 제공될 예정이다.

뉴스 출처
Google Official News
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기