Inteligencia artificial

Google lanza la comprensión agentiva de vídeo en Gemini para reducir el consumo de tokens hasta un 88 %

Google ha añadido la «comprensión agentiva de vídeo» a Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, de modo que el modelo determina las partes y modalidades que necesita examinar en lugar de procesar el vídeo a una velocidad de fotogramas fija. La empresa afirma que la función reduce el consumo de tokens hasta un 88 % y el coste hasta un 66 %, al tiempo que mejora la precisión hasta un 7 %.

2026-09-01
5 min de lectura
5 visitas
فريق تحرير certi.news
Google lanza la comprensión agentiva de vídeo en Gemini para reducir el consumo de tokens hasta un 88 %

Google ha anunciado el lanzamiento de la capacidad de «comprensión agentiva de vídeo» (Agentic Video Understanding) en Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite, disponible de inmediato para analizar archivos subidos y vídeos de YouTube mediante la Gemini API en Google AI Studio y Gemini Enterprise Agent Platform. La empresa afirma que la función puede reducir el consumo de tokens hasta un 88 %, disminuir los costes de análisis hasta un 66 % y mejorar la precisión hasta un 7 % en las pruebas comparativas.

La actualización aborda un problema fundamental del análisis de vídeos largos: el procesamiento tradicional trata el clip con una velocidad de fotogramas fija, que por defecto es de un fotograma por segundo y puede modificarse mediante la API. Este método puede pasar por alto momentos rápidos o detalles que no aparecen en la muestra seleccionada, mientras que aumentar la velocidad de fotogramas incrementa el número de tokens y el coste.

¿Cómo funciona el modo agentivo?

En lugar de ingerir todo el flujo de vídeo de forma fija, Gemini puede determinar qué debe verse, la velocidad adecuada para examinarlo y la modalidad más útil para la tarea: fotogramas, audio o texto transcrito. El modelo llama a una herramienta interna para cargar las partes relevantes del archivo de vídeo dentro de un ciclo guiado por el objetivo y vuelve a examinar ventanas temporales específicas cuando es necesario.

Google explica que los desarrolladores podían crear manualmente algunos de estos mecanismos, pero trasladar al modelo el proceso de búsqueda y examen dinámicos reduce el esfuerzo de programación necesario. La función no aplica ningún cargo adicional; utiliza los precios estándar de tokens de la Gemini API, y basta con establecer la opción de procesamiento en agentic en la configuración de la API.

¿Qué cambia en la práctica para los desarrolladores?

Google afirma que las ventajas son más evidentes con contenido largo, desde guías instructivas de 10 minutos y conferencias de 90 minutos hasta grabaciones de varias horas. Entre los usos que presenta la empresa se incluyen:

  • Recuperar momentos con una precisión inferior a un segundo, incluidos cambios de estado y límites de cortes rápidos necesarios para la edición automatizada.
  • Buscar una información específica dentro de un vídeo largo o una grabación de varias horas sin consumir millones de tokens.
  • Detectar anomalías mediante un nuevo muestreo de las ventanas temporales importantes a una velocidad de fotogramas mayor.
  • Contar movimientos y objetos repetidos con mayor precisión mediante su seguimiento a lo largo del tiempo.

Según las pruebas de Google, Gemini 3.7 Flash con comprensión agentiva ofrece la mejor calidad general y la mejor combinación de calidad y coste entre los modelos probados, y se sitúa en lo que la empresa describe como la frontera de eficiencia entre precisión y coste. Estos resultados siguen siendo cifras anunciadas por la empresa y no garantizan un rendimiento idéntico en todos los tipos de vídeo o tareas.

¿Por qué es importante esta noticia?

El cambio real no consiste en añadir un modelo nuevo, sino en transformar el análisis de vídeo de un procesamiento exhaustivo y fijo en una selección adaptativa de partes y señales. Esto puede beneficiar a las aplicaciones que dependen de la búsqueda en archivos largos o de la detección de eventos rápidos, porque la reducción de tokens no se produce aquí ignorando por completo el vídeo, sino dirigiendo el examen hacia los clips que el modelo considera relacionados con la pregunta.

Por otra parte, los desarrolladores aún deben evaluar la precisión de la selección agentiva en escenarios en los que el momento importante sea poco frecuente o no esté claro, y la fuente no ofrece detalles independientes sobre la metodología completa de las pruebas ni sobre los valores absolutos de coste. Por ello, las cifras de mejora deben interpretarse como resultados comparativos anunciados por Google, no como sustituto de probar la función con el contenido de cada aplicación.

Disponibilidad y plan de expansión

La función está disponible actualmente mediante la Gemini API en Google AI Studio y Gemini Enterprise Agent Platform para los tres modelos mencionados. Google tiene previsto ofrecer próximamente mejoras de eficiencia y calidad a todos los usuarios de la aplicación Gemini mediante los modelos Flash y Flash-Lite, y también utilizará la función durante los próximos meses en «Ask YouTube», en la página de visualización de vídeos, con el objetivo de proporcionar respuestas de mayor calidad basadas en las imágenes visuales del clip.

Fuente de la noticia
Google Official News
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias