Uma abordagem de análise de vídeo que seleciona adaptativamente as partes e os sinais mais relevantes para a tarefa, como quadros, áudio ou texto transcrito.
A Google adicionou a capacidade de «compreensão agentiva de vídeo» ao Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite, permitindo que o modelo determine as partes e os meios que precisa examinar, em vez de processar o vídeo a uma taxa de quadros fixa. A empresa afirma que o recurso reduz o consumo de tokens em até 88% e o custo em até 66%, além de melhorar a precisão em até 7%.