Inteligencia artificial

Google lanza nuevos modelos Gemini para crear aplicaciones de voz en tiempo real

Google ha anunciado la disponibilidad de Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking y Gemini 3.5 Transcribe para desarrolladores a través de Gemini API y Google AI Studio. Los modelos están orientados a crear agentes de voz capaces de mantener el diálogo y ejecutar tareas, además de convertir voz en texto con bajas tasas de error en más de 85 idiomas.

2026-09-15
4 min de lectura
3 visitas
فريق تحرير certi.news
Google lanza nuevos modelos Gemini para crear aplicaciones de voz en tiempo real

Google ha anunciado la disponibilidad de un nuevo conjunto de modelos de audio para desarrolladores a través de Gemini API y Google AI Studio, que incluye Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking para conversaciones de voz en tiempo real, y Gemini 3.5 Transcribe para convertir voz en streaming a texto. La empresa afirma que los nuevos modelos están destinados a crear experiencias de voz que no se limiten a responder, sino que también puedan razonar y ejecutar tareas mientras mantienen el flujo del diálogo.

Agentes de voz que ejecutan tareas durante la conversación

Gemini 3.8 Live ofrece capacidades de voz directa de tipo speech-to-speech, de modo que el agente puede gestionar solicitudes y ejecutar acciones sin pausar la conversación. La función de llamadas asíncronas a funciones permite ejecutar llamadas a API y herramientas en segundo plano, mientras continúa la transmisión de la respuesta de voz al usuario.

El modelo también puede utilizar entradas visuales en directo para proporcionar contexto sobre lo que dice y ve el usuario, y gestionar con precisión datos alfanuméricos como códigos de confirmación, números de reclamación y datos técnicos. Los modelos admiten más de 97 idiomas, manteniendo la coherencia del acento, además de integrar audio en tiempo real con actualizaciones de datos estructurados dentro de la misma respuesta.

Por su parte, Gemini 3.8 Live Extended Thinking añade una opción ajustable para razonar en segundo plano al abordar problemas complejos y de varios pasos. Según Google, este modelo ocupa el primer puesto en la clasificación Speech-to-Speech de Artificial Analysis. El anuncio no explicó los detalles de la metodología de evaluación ni la comparación completa, por lo que este resultado sigue estando vinculado a la medición mencionada en la fuente.

Conversión de voz a texto en 85 idiomas

Google también ha lanzado Gemini 3.5 Transcribe, un modelo especializado en reconocimiento de voz con baja latencia. La empresa afirma que el modelo logró una tasa media de error de palabras del 4,0 % en la conversión en streaming y del 2,6 % en la conversión no transmitida. Admite más de 85 idiomas y puede gestionar automáticamente los cambios de idioma dentro de una frase o entre frases.

Los desarrolladores pueden proporcionar una lista de vocabulario personalizada de hasta 1.000 términos para orientar el reconocimiento hacia terminología especializada, nombres poco comunes y nombres de empresas. El modo Smart Transcription ofrece transcripciones más preparadas para la lectura mediante un formato estructurado, la corrección de ciertas formulaciones y la eliminación de palabras de relleno y vacilaciones.

¿Qué cambia en la práctica para los desarrolladores?

Esta disponibilidad combina la escucha, el razonamiento y la ejecución de herramientas en interfaces de voz en tiempo real, lo que reduce la necesidad de crear una cadena independiente de modelos de conversión de voz a texto, un modelo conversacional y un motor de conversión de texto a voz. Sin embargo, el anuncio no elimina los requisitos de infraestructura para el streaming de audio; por ello, Google también ofrece acceso a los modelos mediante socios de integración como Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel y Vision Agents.

Los modelos Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking están disponibles a través de Live API, con un precio anunciado de 0,005 dólares por minuto de entrada de audio y 0,018 dólares por minuto de salida de audio. La fuente indica en una nota al pie que la estimación del coste se basa en 3 dólares por cada millón de tokens de entrada y 12 dólares por cada millón de tokens de salida, por lo que los desarrolladores deben revisar el mecanismo de facturación real antes de ampliar su uso.

Los modelos se pueden probar en ai.studio/live, utilizar mediante aplicaciones de ejemplo de GitHub o aprovechar a través de la habilidad Live API. El conjunto de audio de Google también incluye Gemini 3.5 Live Translate para la traducción de voz a voz en más de 70 idiomas, Gemini 3.1 Flash TTS para generar voz y Lyria 3.5 para generar música.

Fuente de la noticia
Google Official News
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias