Un patrón para analizar vídeos que selecciona de forma adaptativa las partes y señales más relevantes para la tarea, como fotogramas, audio o texto transcrito.
Google ha añadido la «comprensión agentiva de vídeo» a Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, de modo que el modelo determina las partes y modalidades que necesita examinar en lugar de procesar el vídeo a una velocidad de fotogramas fija. La empresa afirma que la función reduce el consumo de tokens hasta un 88 % y el coste hasta un 66 %, al tiempo que mejora la precisión hasta un 7 %.