Google hat die Fähigkeit zum „agentischen Videoverständnis“ (Agentic Video Understanding) für Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite eingeführt. Sie steht ab sofort zur Analyse hochgeladener Dateien und von YouTube-Videos über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform zur Verfügung. Nach Angaben des Unternehmens kann die Funktion den Token-Verbrauch um bis zu 88 % senken, die Analysekosten um bis zu 66 % reduzieren und die Genauigkeit in Benchmarks um bis zu 7 % verbessern.
Das Update zielt auf ein grundlegendes Problem bei der Analyse langer Videos: Bei der herkömmlichen Verarbeitung wird der Clip mit einer festen Bildrate verarbeitet, standardmäßig mit einem Bild pro Sekunde, wobei sich dieser Wert über die API ändern lässt. Dadurch können schnelle Momente oder Details übersehen werden, die in der ausgewählten Stichprobe nicht erscheinen. Eine höhere Bildrate führt dagegen zu einer größeren Token-Anzahl und höheren Kosten.
Wie funktioniert der agentische Modus?
Statt den gesamten Videostream auf statische Weise zu verarbeiten, kann Gemini bestimmen, was angesehen werden sollte, welche Prüfgeschwindigkeit geeignet ist und welches Medium für die Aufgabe am nützlichsten ist: Einzelbilder, Audio oder transkribierter Text. Das Modell ruft ein internes Tool auf, um im Rahmen einer zielgerichteten Schleife relevante Abschnitte der Videodatei zu laden, und untersucht bei Bedarf bestimmte Zeitfenster erneut.
Google erklärt, dass Entwickler einige dieser Mechanismen bereits manuell entwickeln konnten. Die Verlagerung der dynamischen Suche und Prüfung auf das Modell reduziert jedoch den dafür erforderlichen Programmieraufwand. Für die Funktion fällt keine zusätzliche Gebühr an: Es gelten die standardmäßigen Token-Preise der Gemini API. In den API-Einstellungen muss lediglich die Verarbeitungsoption auf agentic gesetzt werden.
Was ändert sich dadurch praktisch für Entwickler?
Google zufolge zeigen sich die Vorteile besonders bei langen Inhalten – von 10-minütigen Anleitungen und 90-minütigen Vorlesungen bis hin zu Aufnahmen, die sich über mehrere Stunden erstrecken. Zu den vom Unternehmen vorgestellten Anwendungsfällen gehören:
- Das Abrufen von Momenten mit einer Genauigkeit von unter einer Sekunde, einschließlich Zustandsänderungen und schneller Schnittgrenzen, die für die automatisierte Bearbeitung erforderlich sind.
- Das Auffinden einer bestimmten Information in einem langen Video oder einer mehrstündigen Aufzeichnung, ohne Millionen von Token zu verbrauchen.
- Das Erkennen von Anomalien durch erneute Stichproben der wichtigen Zeitfenster mit einer höheren Bildrate.
- Das präzisere Zählen wiederkehrender Bewegungen und Objekte durch zeitliches Tracking.
Nach den Tests von Google liefert Gemini 3.7 Flash mit agentischem Verständnis die insgesamt beste Qualität sowie die beste Kombination aus Qualität und Kosten unter den getesteten Modellen und liegt an dem, was das Unternehmen als Effizienzgrenze zwischen Genauigkeit und Kosten bezeichnet. Diese Ergebnisse sind weiterhin vom Unternehmen veröffentlichte Zahlen und keine Garantie für eine identische Leistung bei jedem Videotyp oder jeder Aufgabe.
Warum ist diese Nachricht wichtig?
Die eigentliche Änderung besteht nicht in der Einführung eines neuen Modells, sondern darin, die Videoanalyse von einer statischen, umfassenden Verarbeitung auf eine adaptive Auswahl von Abschnitten und Signalen umzustellen. Das kann Anwendungen zugutekommen, die auf der Suche in langen Archiven oder der Erkennung schneller Ereignisse beruhen, da die Token-Reduzierung hier nicht durch das vollständige Ignorieren des Videos entsteht, sondern dadurch, dass die Prüfung auf die Ausschnitte gelenkt wird, die das Modell als mit der Frage verbunden ansieht.
Entwickler müssen dagegen weiterhin die Genauigkeit der agentischen Auswahl in Szenarien bewerten, in denen der wichtige Moment selten oder unklar ist. Außerdem liefert die Quelle keine unabhängigen Details zur vollständigen Testmethodik oder zu den absoluten Kostenwerten. Daher sollten die Verbesserungsraten als von Google veröffentlichte Benchmark-Ergebnisse verstanden werden und nicht als Ersatz für Tests der Funktion mit den Inhalten der jeweiligen Anwendung.
Verfügbarkeit und Ausbauplan
Die Funktion ist derzeit über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform für die drei genannten Modelle verfügbar. Google beabsichtigt, die Verbesserungen bei Effizienz und Qualität in den kommenden Monaten allen Nutzern der Gemini-App über die Modelle Flash und Flash-Lite bereitzustellen. Außerdem soll die Funktion in den kommenden Monaten in „Ask YouTube“ auf der Videowiedergabeseite eingesetzt werden, um qualitativ hochwertigere Antworten zu liefern, die sich auf die visuellen Inhalte des Clips stützen.