Inteligência artificial

Google lança novos modelos Gemini para criar aplicações de voz em tempo real

A Google anunciou a disponibilização do Gemini 3.8 Live, do Gemini 3.8 Live Extended Thinking e do Gemini 3.5 Transcribe para desenvolvedores por meio da Gemini API e do Google AI Studio. Os modelos têm como objetivo criar agentes de voz capazes de acompanhar a conversa e executar tarefas, além de converter fala em texto com baixa taxa de erros em mais de 85 idiomas.

2026-09-15
4 min de leitura
3 visualizações
فريق تحرير certi.news
Google lança novos modelos Gemini para criar aplicações de voz em tempo real

A Google anunciou a disponibilização de um novo conjunto de modelos de áudio para desenvolvedores por meio da Gemini API e do Google AI Studio, incluindo o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking para conversas de voz em tempo real, além do Gemini 3.5 Transcribe para converter fala transmitida em texto. A empresa afirma que os novos modelos são voltados à criação de experiências de voz que não se limitam a responder, mas também conseguem raciocinar e executar tarefas, mantendo o fluxo da conversa.

Agentes de voz executam tarefas durante a conversa

O Gemini 3.8 Live oferece recursos de voz direta no estilo speech-to-speech, permitindo que o agente lide com solicitações e execute ações sem pausar a conversa. O recurso de chamadas assíncronas de funções permite executar chamadas de APIs e ferramentas em segundo plano, enquanto a resposta de voz continua sendo transmitida ao usuário.

O modelo também pode usar entradas visuais ao vivo para fornecer contexto sobre o que o usuário diz e vê, além de lidar com precisão com dados alfanuméricos, como códigos de confirmação, números de solicitações e dados técnicos. Os modelos são compatíveis com mais de 97 idiomas, mantendo a consistência do sotaque, além de integrar voz em tempo real com atualizações de dados estruturados na própria resposta.

Já o Gemini 3.8 Live Extended Thinking adiciona uma opção ajustável de raciocínio em segundo plano para lidar com problemas complexos e com várias etapas. Segundo a Google, esse modelo ocupa o primeiro lugar no painel Speech-to-Speech da Artificial Analysis. O anúncio não esclareceu os detalhes da metodologia de avaliação nem da comparação completa; portanto, esse resultado permanece vinculado à medição mencionada na fonte.

Conversão de fala em texto em 85 idiomas

A Google também lançou o Gemini 3.5 Transcribe, um modelo dedicado ao reconhecimento de fala com baixa latência. A empresa afirma que o modelo alcançou uma taxa média de erro de palavras de 4,0% na conversão em fluxo e de 2,6% na conversão sem fluxo. Ele é compatível com mais de 85 idiomas e consegue lidar automaticamente com a alternância entre idiomas dentro da frase ou entre frases.

Os desenvolvedores podem fornecer uma lista personalizada de vocabulário com até 1.000 termos para orientar o reconhecimento de termos especializados, nomes incomuns e nomes de empresas. O modo Smart Transcription oferece textos mais prontos para leitura por meio de formatação estruturada, correção de algumas construções e remoção de palavras de preenchimento e hesitações.

O que muda na prática para os desenvolvedores?

Essa disponibilização reúne escuta, raciocínio e execução de ferramentas em interfaces de voz em tempo real, reduzindo a necessidade de criar uma cadeia separada de modelos de conversão de fala em texto, um modelo de conversação e um mecanismo de conversão de texto em fala. No entanto, o anúncio não elimina os requisitos de infraestrutura para transmissão de áudio; por isso, a Google também oferece acesso aos modelos por meio de parceiros de integração, como Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel e Vision Agents.

Os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking estão disponíveis por meio da Live API, com preço anunciado de 0,005 dólar por minuto de entrada de áudio e 0,018 dólar por minuto de saída de áudio. A fonte indica, em sua nota de rodapé, que a estimativa de custo se baseia em 3 dólares por milhão de tokens de entrada e 12 dólares por milhão de tokens de saída, o que exige que os desenvolvedores verifiquem o mecanismo de cobrança real antes de ampliar o uso.

Os modelos podem ser testados em ai.studio/live, ou os desenvolvedores podem usar aplicativos de exemplo do GitHub ou aproveitar a habilidade Live API. O conjunto de áudio da Google também inclui o Gemini 3.5 Live Translate para tradução de fala para fala em mais de 70 idiomas, o Gemini 3.1 Flash TTS para geração de fala e o Lyria 3.5 para geração de música.

Fonte da notícia
Google Official News
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias