Google a annoncé le lancement de la capacité de « compréhension agentique des vidéos » (Agentic Video Understanding) dans Gemini 3.7 Flash, Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. Elle est immédiatement disponible pour analyser des fichiers importés et des vidéos YouTube via Gemini API dans Google AI Studio et Gemini Enterprise Agent Platform. L’entreprise affirme que cette fonctionnalité peut réduire la consommation de jetons jusqu’à 88 %, diminuer les coûts d’analyse jusqu’à 66 % et améliorer la précision jusqu’à 7 % lors des tests de référence.
Cette mise à jour vise un problème majeur de l’analyse des vidéos longues : le traitement traditionnel parcourt la séquence selon une fréquence d’images fixe, d’une image par seconde par défaut, qui peut être modifiée via l’interface API. Cette méthode peut manquer des moments rapides ou des détails qui n’apparaissent pas dans l’échantillon sélectionné, tandis qu’une augmentation de la fréquence d’images entraîne une hausse du nombre de jetons et des coûts.
Comment fonctionne le mode agentique ?
Au lieu d’absorber l’intégralité du flux vidéo de manière fixe, Gemini peut déterminer ce qui doit être visionné, la vitesse d’examen appropriée et le support le plus utile pour la tâche : les images, l’audio ou le texte transcrit. Le modèle appelle un outil interne pour charger les parties pertinentes du fichier vidéo dans le cadre d’une boucle orientée vers un objectif, puis réexamine certaines fenêtres temporelles lorsque cela est nécessaire.
Google explique que les développeurs pouvaient déjà créer manuellement certains de ces mécanismes, mais que le transfert de la recherche et de l’examen dynamiques au modèle réduit l’effort de programmation requis. La fonctionnalité n’entraîne pas de frais supplémentaires : elle utilise les tarifs standard des jetons de Gemini API, et il suffit de définir l’option de traitement sur agentic dans les paramètres de l’API.
Qu’est-ce qui change concrètement pour les développeurs ?
Google affirme que les gains sont plus visibles avec les contenus longs, qu’il s’agisse de guides de 10 minutes, de cours de 90 minutes ou d’enregistrements durant plusieurs heures. Les utilisations présentées par l’entreprise comprennent :
- la récupération de moments plus précis qu’une seconde, notamment les changements d’état et les limites de coupes rapides nécessaires au montage automatisé ;
- la recherche d’une information précise dans une vidéo longue ou un enregistrement de plusieurs heures sans consommer des millions de jetons ;
- la détection d’anomalies grâce au rééchantillonnage des fenêtres temporelles importantes à une fréquence d’images plus élevée ;
- le comptage plus précis de mouvements et d’objets répétés grâce à leur suivi dans le temps.
Selon les tests de Google, Gemini 3.7 Flash avec la compréhension agentique offre la meilleure qualité globale et le meilleur équilibre entre qualité et coût parmi les modèles testés, et se situe sur ce que l’entreprise décrit comme la frontière d’efficacité entre précision et coût. Ces résultats restent des chiffres publiés par l’entreprise et ne garantissent pas des performances identiques pour tous les types de vidéos ou toutes les tâches.
Pourquoi cette actualité est-elle importante ?
Le changement réel ne consiste pas à ajouter un nouveau modèle, mais à faire passer l’analyse vidéo d’un traitement exhaustif et fixe à une sélection adaptative des parties et des signaux. Cela pourrait être utile aux applications qui reposent sur la recherche dans de longues archives ou sur la détection d’événements rapides, car la réduction du nombre de jetons ne vient pas ici d’une omission totale de la vidéo, mais de l’orientation de l’examen vers les séquences que le modèle juge liées à la question.
En revanche, les développeurs doivent toujours évaluer la précision de la sélection agentique dans les scénarios où le moment important est rare ou difficile à identifier. De plus, la source ne fournit pas de détails indépendants sur la méthodologie complète des tests ni sur les valeurs absolues des coûts. Les pourcentages d’amélioration doivent donc être considérés comme des résultats de référence publiés par Google, et non comme un substitut aux tests de la fonctionnalité sur le contenu de chaque application.
Disponibilité et plan d’extension
La fonctionnalité est actuellement disponible via Gemini API dans Google AI Studio et Gemini Enterprise Agent Platform pour les trois modèles mentionnés. Google prévoit de déployer prochainement des améliorations en matière d’efficacité et de qualité auprès de tous les utilisateurs de l’application Gemini via les modèles Flash et Flash-Lite. L’entreprise les utilisera également au cours des prochains mois dans la fonctionnalité « Ask YouTube » sur la page de visionnage des vidéos, afin de fournir des réponses de meilleure qualité fondées sur les éléments visuels de la séquence.