Google anunció el 26 de agosto de 2026 Gemini 3.5 Transcribe, un nuevo modelo de conversión de voz a texto diseñado para la transcripción de audio instantánea y las interacciones de voz inteligentes. En lugar de limitarse a convertir el audio sin procesar en palabras, la empresa afirma que el modelo limpia las frecuencias y las autocorrecciones, reconoce términos especializados y genera texto con formato, más cercano a una versión lista para usar.
El modelo está dirigido a desarrolladores que crean agentes de voz, herramientas de traducción o subtitulado en tiempo real y flujos de procesamiento para analizar llamadas y reuniones después de grabarlas. Está disponible a través de Gemini API en Google AI Studio, así como mediante Gemini Enterprise Agent Platform.
Dos interfaces para dos usos diferentes
Google ofrece el modelo mediante dos interfaces independientes. La primera es Live API, que utiliza el modelo gemini-3.5-transcribe-live y proporciona transmisión bidireccional continua con una latencia inferior a un segundo, algo adecuado para aplicaciones de conversación de voz interactiva. La segunda es Interactions API, que utiliza gemini-3.5-transcribe para procesar grabaciones, reuniones y registros de llamadas, con atribución del habla a los participantes y marcas de tiempo a nivel de palabra.
Google afirma que Gemini 3.5 Transcribe puede gestionar autocorrecciones, como cambiar una cita o una palabra mientras se habla, eliminar palabras de relleno como las muletillas y dar formato al texto automáticamente. También admite vocabularios personalizados que se le pueden proporcionar para reconocer términos especializados y grafías inusuales, y admite la detección y transcripción de más de 85 idiomas, con gestión de dialectos y acentos regionales.
En las grabaciones, el modelo atribuye el habla a hasta tres participantes con marcas de tiempo, mientras que la compatibilidad con más de tres participantes sigue siendo experimental. También puede gestionar el cambio entre idiomas durante la transmisión, una función importante en las conversaciones multilingües, aunque la fuente no ofrece detalles sobre todos los idiomas compatibles ni sobre los límites de rendimiento de cada idioma.
Cifras de rendimiento frente a Chirp 3
Según las mediciones de Artificial Analysis citadas por Google, el modelo logró una tasa media de error de palabras del 4,0 % en casos de transmisión y del 2,6 % en casos de uso no transmitidos. En el estándar FLEURS, a través de un conjunto de idiomas y regiones, registró una tasa de error de palabras del 5,50 % en transmisión y del 5,04 % en uso no transmitido. La empresa afirma que la latencia hasta la versión final mejoró un 70 % frente al modelo de transcripción anterior, Chirp 3.
Estas cifras apuntan a una mejora doble en precisión y velocidad, pero la comparación no significa que los resultados vayan a ser idénticos en todos los entornos de audio; dependen del estándar, el idioma, la calidad de la grabación, el número de participantes y el nivel de ruido. Además, la fuente no explica en detalle la metodología de Artificial Analysis ni ofrece una tabla completa de resultados por idioma.
De las interfaces de Google a las herramientas para desarrolladores
Google ya utiliza el modelo en la aplicación Gemini y en algunas experiencias de Android, incluida la función Rambler, que convierte el habla en texto con formato y permite eliminar palabras de relleno, realizar correcciones y cambiar el estilo de escritura mediante la voz. En la aplicación Gemini para macOS, los comandos de voz pueden aprovechar el contexto de la pantalla para realizar tareas como resumir archivos locales, reutilizar texto entre aplicaciones o generar imágenes mediante la invocación de otros modelos Gemini.
Google Antigravity utiliza el contexto de la pantalla y el historial de conversaciones, después de obtener el permiso del usuario, para mejorar el reconocimiento de nombres de archivos, documentos activos e ideas del agente. También se puede acceder al modelo en el modo Build de Google AI Studio para crear aplicaciones mediante la voz. Google afirma que la función de voz a texto en cualquier campo web llegará próximamente a Chrome.
¿Qué cambia en la práctica?
El cambio más importante es la transición de la transcripción de audio de un paso inicial de volcado a una capa para comprender y limpiar el habla, además de vincularla con el contexto de la aplicación. Para los desarrolladores, esto significa que pueden crear interfaces de voz que no requieran un procesamiento independiente para cada corrección o palabra de relleno, con la opción de utilizar transmisión instantánea o grabaciones archivadas según la naturaleza del producto.
Gemini 3.5 Transcribe está disponible actualmente en vista previa pública para desarrolladores a través de Gemini API en Google AI Studio y Google Antigravity, y para empresas mediante Gemini Enterprise Agent Platform, con una llegada posterior a Gemini Enterprise for Customer Experience. Para los usuarios, está disponible en la aplicación Gemini para macOS en inglés, mientras que Rambler está disponible en Android en países e idiomas determinados, con una llegada prevista a Chrome.