Google объявила о предоставлении разработчикам нового набора голосовых моделей через Gemini API и Google AI Studio. В него входят Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для синхронных голосовых разговоров, а также Gemini 3.5 Transcribe для преобразования потоковой речи в текст. По словам компании, новые модели предназначены для создания голосовых интерфейсов, которые не ограничиваются ответами, а способны рассуждать и выполнять задачи, сохраняя непрерывность диалога.
Голосовые агенты, выполняющие задачи во время разговора
Gemini 3.8 Live предлагает возможности прямого взаимодействия speech-to-speech, благодаря чему агент может обрабатывать запросы и выполнять действия, не приостанавливая разговор. Функция асинхронного вызова функций позволяет выполнять вызовы API и инструментов в фоновом режиме, продолжая передавать пользователю голосовой ответ.
Модель также может использовать живые визуальные входные данные, чтобы получать контекст о том, что говорит пользователь и что он видит, а также точно работать с буквенно-цифровыми данными, такими как коды подтверждения, номера заявок и технические сведения. Модели поддерживают более 97 языков, сохраняя последовательность акцента, а также позволяют объединять синхронный звук со структурированными обновлениями данных в одном ответе.
Gemini 3.8 Live Extended Thinking добавляет настраиваемую возможность фонового рассуждения при работе со сложными многоэтапными задачами. Согласно Google, эта модель занимает первое место в рейтинге Speech-to-Speech от Artificial Analysis. В объявлении не уточняется методика оценки или полный набор сравнений, поэтому этот результат остаётся связанным с указанным в источнике измерением.
Преобразование речи в текст на 85 языках
Google также запустила Gemini 3.5 Transcribe — модель, предназначенную для распознавания речи с низкой задержкой. Компания сообщает, что модель достигла среднего показателя ошибки по словам 4,0% при потоковом преобразовании и 2,6% при непотоковом преобразовании. Она поддерживает более 85 языков и может автоматически обрабатывать переключение между языками внутри предложения или между предложениями.
Разработчики могут передавать пользовательский список слов, содержащий до 1 000 терминов, чтобы направить распознавание на специализированные термины, редкие имена и названия компаний. Режим Smart Transcription предоставляет более готовые к чтению расшифровки благодаря структурированному форматированию, исправлению некоторых формулировок и удалению слов-паразитов и слов, связанных с запинками.
Что это меняет на практике для разработчиков?
Эта доступность объединяет распознавание, рассуждение и выполнение инструментов в синхронных голосовых интерфейсах, что снижает необходимость создавать отдельную цепочку из моделей преобразования речи в текст, разговорной модели и движка преобразования текста в речь. Однако объявление не отменяет требований к инфраструктуре потоковой передачи аудио, поэтому Google также предоставляет доступ к моделям через интеграционных партнёров, таких как Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel и Vision Agents.
Модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking доступны через Live API по заявленной цене 0,005 доллара за минуту входного аудио и 0,018 доллара за минуту выходного аудио. Источник в сноске указывает, что оценка стоимости основана на 3 долларах за миллион входных токенов и 12 долларах за миллион выходных токенов, поэтому разработчикам следует проверить фактический механизм тарификации перед масштабированием.
Модели можно протестировать через ai.studio/live, использовать демонстрационные приложения с GitHub или воспользоваться навыком Live API. В голосовой набор Google также входят Gemini 3.5 Live Translate для перевода с речи на речь более чем на 70 языках, Gemini 3.1 Flash TTS для генерации речи и Lyria 3.5 для генерации музыки.