Ein Ansatz zur Videoanalyse, der adaptiv die für die jeweilige Aufgabe relevantesten Segmente und Signale auswählt, etwa Einzelbilder, Audio oder transkribierten Text.
Google hat dem Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite die Fähigkeit zum „agentischen Videoverständnis“ hinzugefügt. Dadurch bestimmt das Modell selbst, welche Abschnitte und Medien es prüfen muss, anstatt das Video mit einer festen Bildrate zu verarbeiten. Nach Angaben des Unternehmens senkt die Funktion den Token-Verbrauch um bis zu 88 % und die Kosten um bis zu 66 %, während die Genauigkeit um bis zu 7 % steigt.