26 августа 2026 года Google объявила о Gemini 3.5 Transcribe — новой модели преобразования речи в текст, разработанной для транскрипции аудио в реальном времени и интеллектуального голосового взаимодействия. Вместо простого преобразования необработанного аудио в слова модель, по словам компании, очищает частотные помехи и самокоррекции, распознаёт специализированные термины и выдаёт отформатированный текст, более близкий к готовому к использованию виду.
Модель предназначена для разработчиков, создающих голосовых агентов, инструменты для перевода или субтитров в реальном времени, а также конвейеры обработки для анализа звонков и встреч после их записи. Она доступна через Gemini API в Google AI Studio, а также через Gemini Enterprise Agent Platform.
Два интерфейса для разных сценариев использования
Google предлагает модель через два отдельных интерфейса. Первый — Live API с использованием модели gemini-3.5-transcribe-live; он обеспечивает непрерывную двустороннюю передачу данных с задержкой менее секунды, что подходит для интерактивных голосовых приложений. Второй — Interactions API с использованием gemini-3.5-transcribe для обработки записей, встреч и журналов звонков, включая распределение речи между говорящими и добавление временных меток на уровне слов.
Google утверждает, что Gemini 3.5 Transcribe умеет обрабатывать самокоррекции, например изменение времени встречи или слова во время разговора, удалять слова-паразиты, такие как запинки, и автоматически форматировать текст. Модель также поддерживает пользовательские словари, которые можно предоставить для распознавания специализированных терминов и необычных вариантов написания, а также обнаружение и транскрипцию более чем на 85 языках с учётом региональных диалектов и акцентов.
В записанных материалах модель распределяет речь между максимум тремя говорящими и добавляет временные метки, тогда как поддержка более трёх говорящих пока остаётся экспериментальной. Она также умеет обрабатывать переключение между языками во время трансляции — важную функцию для многоязычных разговоров, однако источник не приводит подробностей обо всех поддерживаемых языках или ограничениях производительности для каждого языка.
Показатели производительности по сравнению с Chirp 3
Согласно измерениям Artificial Analysis, на которые ссылается Google, средний показатель ошибки слов модели составил 4,0% в потоковых сценариях и 2,6% в непотоковых сценариях использования. На тесте FLEURS по набору языков и регионов показатель ошибки слов составил 5,50% в потоковом режиме и 5,04% в непотоковом. Компания утверждает, что задержка до получения окончательной версии улучшилась на 70% по сравнению с предыдущей моделью транскрипции Chirp 3.
Эти показатели указывают на одновременное повышение точности и скорости, однако сравнение не означает, что результаты будут одинаковыми в любой аудиосреде: они зависят от теста, языка, качества записи, количества говорящих и уровня шума. Кроме того, источник не разъясняет подробно методологию Artificial Analysis и не предоставляет полную таблицу результатов по языкам.
От интерфейсов Google до инструментов разработчиков
Google уже использует модель в приложении Gemini и некоторых экспериментах Android, включая функцию Rambler, которая преобразует речь в отформатированный текст, позволяет удалять слова-паразиты, вносить исправления и менять стиль написания голосом. В приложении Gemini для macOS голосовые команды могут использовать контекст экрана для выполнения таких задач, как суммирование локальных файлов, повторное использование текста между приложениями или создание изображений с вызовом других моделей Gemini.
Google Antigravity использует контекст экрана и историю разговоров — после получения разрешения пользователя — для улучшения распознавания имён активных файлов и документов, а также идей агента. Доступ к модели также можно получить в режиме Build внутри Google AI Studio для создания приложений с помощью голоса. Google заявляет, что функция голосового ввода в любое веб-поле скоро появится в Chrome.
Что меняется на практике?
Главное изменение заключается в переходе от голосовой транскрипции как первичного этапа расшифровки к уровню понимания и очистки речи с привязкой к контексту приложения. Для разработчиков это означает возможность создавать голосовые интерфейсы, не требующие отдельной обработки каждой коррекции или каждого слова-паразита, с возможностью выбирать между потоковой передачей в реальном времени и архивными записями в зависимости от характера продукта.
В настоящее время Gemini 3.5 Transcribe доступна разработчикам в режиме публичного предварительного просмотра через Gemini API в Google AI Studio и Google Antigravity, а организациям — через Gemini Enterprise Agent Platform; позднее модель появится в Gemini Enterprise for Customer Experience. Для пользователей она доступна в приложении Gemini для macOS на английском языке, тогда как Rambler доступна на Android в определённых странах и на определённых языках; выход в Chrome ожидается позднее.