A Google anunciou o lançamento da capacidade de «compreensão agentiva de vídeo» (Agentic Video Understanding) no Gemini 3.7 Flash, Gemini 3.6 Flash e Gemini 3.5 Flash-Lite, disponibilizando-a imediatamente para a análise de arquivos enviados e vídeos do YouTube por meio da Gemini API no Google AI Studio e na Gemini Enterprise Agent Platform. A empresa afirma que o recurso pode reduzir o consumo de tokens em até 88%, diminuir os custos de análise em até 66% e melhorar a precisão em até 7% nos testes de referência.
A atualização tem como alvo um problema fundamental na análise de vídeos longos: o processamento tradicional lida com o clipe a uma taxa de quadros fixa, que por padrão é de um quadro por segundo e pode ser ajustada por meio da API. Esse método pode deixar passar momentos rápidos ou detalhes que não aparecem na amostra selecionada, enquanto aumentar a taxa de quadros eleva o número de tokens e o custo.
Como funciona o modo agentivo?
Em vez de absorver todo o fluxo de vídeo de maneira fixa, o Gemini pode determinar o que deve ser assistido, a velocidade adequada para a análise e o meio mais útil para a tarefa: quadros, áudio ou texto transcrito. O modelo chama uma ferramenta interna para carregar as partes relevantes do arquivo de vídeo em um ciclo orientado por objetivo e, quando necessário, examina novamente janelas temporais específicas.
A Google explica que os desenvolvedores já conseguiam criar manualmente alguns desses mecanismos, mas transferir o processo de busca e análise dinâmica para o modelo reduz o esforço de programação necessário. O recurso não cobra uma taxa adicional; ele usa os preços padrão de tokens da Gemini API, e basta definir a opção de processamento como agentic nas configurações da API.
O que muda na prática para os desenvolvedores?
A Google afirma que os ganhos aparecem com mais clareza em conteúdos longos, desde guias instrucionais de 10 minutos e palestras de 90 minutos até gravações que se estendem por horas. Entre os usos apresentados pela empresa estão:
- Recuperar momentos com precisão inferior a um segundo, incluindo mudanças de estado e limites de cortes rápidos necessários para a edição automática.
- Buscar uma informação específica dentro de um vídeo longo ou de uma gravação de várias horas sem consumir milhões de tokens.
- Detectar anomalias ao coletar novamente amostras das janelas temporais importantes a uma taxa de quadros mais alta.
- Contar movimentos e objetos recorrentes com maior precisão, rastreando-os ao longo do tempo.
De acordo com os testes da Google, o Gemini 3.7 Flash com compreensão agentiva oferece a melhor qualidade geral e a melhor combinação entre qualidade e custo entre os modelos testados, situando-se no que a empresa descreve como a fronteira de eficiência entre precisão e custo. Esses resultados continuam sendo números divulgados pela empresa, e não uma garantia de desempenho idêntico em todo tipo de vídeo ou tarefa.
Por que esta notícia é importante?
A mudança efetiva não é a adição de um novo modelo, mas a transformação da análise de vídeo, que deixa de ser um processamento abrangente e fixo para se tornar uma seleção adaptativa de partes e sinais. Isso pode beneficiar aplicações que dependem de buscas em arquivos longos ou do monitoramento de eventos rápidos, pois a redução de tokens não vem de ignorar completamente o vídeo, mas de direcionar a análise para os trechos que o modelo considera relacionados à pergunta.
Por outro lado, os desenvolvedores ainda precisam avaliar a precisão da seleção agentiva em cenários nos quais o momento importante é raro ou pouco claro, e a fonte não fornece detalhes independentes sobre a metodologia completa dos testes nem sobre os valores absolutos de custo. Portanto, as porcentagens de melhoria devem ser lidas como resultados de referência divulgados pela Google, e não como substitutas para testar o recurso no conteúdo de cada aplicação.
Disponibilidade e plano de expansão
O recurso está disponível atualmente por meio da Gemini API no Google AI Studio e na Gemini Enterprise Agent Platform para os três modelos mencionados. A Google pretende lançar em breve melhorias de eficiência e qualidade para todos os usuários do aplicativo Gemini por meio dos modelos Flash e Flash-Lite e também usá-las nos próximos meses no recurso «Ask YouTube», na página de exibição de vídeos, com o objetivo de fornecer respostas de maior qualidade baseadas nas imagens visuais do clipe.