人工智能

Google在Gemini中推出代理式视频理解,令令牌消耗最高降低88%

Google已将“代理式视频理解”能力加入Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,使模型能够确定需要检查的片段和媒介,而不是以固定帧率处理视频。公司称,该功能可将令牌消耗降低最高88%、成本降低最高66%,同时将准确率提升最高7%。

2026-09-01
1 分钟阅读
5 浏览量
فريق تحرير certi.news
Google在Gemini中推出代理式视频理解,令令牌消耗最高降低88%

Google宣布在Gemini 3.7 Flash、Gemini 3.6 Flash和Gemini 3.5 Flash-Lite中推出“代理式视频理解”(Agentic Video Understanding)能力,并立即通过Google AI Studio和Gemini Enterprise Agent Platform中的Gemini API,支持分析上传的文件和YouTube视频。公司称,该功能可将令牌消耗降低最高88%、分析成本降低最高66%,并在基准测试中将准确率提升最高7%。

此次更新针对长视频分析中的一个核心问题:传统处理方式按照固定帧率处理视频,默认每秒一帧,也可以通过API界面进行调整。这种方式可能会错过快速发生的瞬间或所选样本中未出现的细节,而提高帧率又会增加令牌数量和成本。

代理模式如何运作?

Gemini不再以固定方式吞入完整的视频流,而是能够确定应该观看哪些内容、以何种速度进行检查,以及哪种媒介对任务最有用:视频帧、音频或转录文本。模型会调用一个内部工具,在目标导向的循环中加载视频文件中的相关片段,并在需要时重新检查特定时间窗口。

Google解释说,开发者此前也能够手动构建其中一些机制,但将动态搜索和检查过程交给模型,可以减少所需的编程工作。该功能不会收取额外费用,而是采用Gemini API的标准令牌价格;开发者只需在API设置中将处理选项设为agentic即可。

这对开发者实际上有什么变化?

Google称,内容越长,收益越明显,范围涵盖时长10分钟的教程、时长90分钟的讲座,以及持续数小时的录制内容。公司展示的使用场景包括:

  • 找出精确到不足一秒的瞬间,包括状态变化以及自动剪辑所需的快速切点。
  • 在长视频或数小时的多段录制内容中查找特定信息,而无需消耗数百万个令牌。
  • 通过以更高帧率重新采样重要时间窗口,发现异常情况。
  • 通过进行时间上的跟踪,更准确地统计重复出现的动作和物体。

根据Google的测试,搭载代理式理解能力的Gemini 3.7 Flash,在经过测试的模型中提供了最佳总体质量,以及质量与成本之间的最佳组合,并处于公司所称的准确率与成本之间的效率前沿。这些结果仍是公司公布的数据,并不保证在每种视频类型或每项任务中都能取得相同表现。

为什么这条消息很重要?

这项变化的实际意义并不是增加了一个新模型,而是将视频分析从固定的全面处理转变为对片段和信号的自适应选择。这可能有助于那些依赖在长篇档案中搜索或监测快速事件的应用,因为这里的令牌减少并非来自完全忽略视频,而是将检查引导至模型认为与问题相关的片段。

另一方面,开发者仍需评估代理式选择在重要时刻罕见或不明确的场景中的准确性,而且来源没有提供有关完整测试方法或绝对成本数值的独立细节。因此,应将这些提升比例视为Google公布的基准测试结果,而不是替代在各自应用内容上测试该功能的依据。

可用性和扩展计划

目前,该功能已通过Google AI Studio和Gemini Enterprise Agent Platform中的Gemini API,支持上述三个模型。Google计划很快通过Flash和Flash-Lite模型,向所有Gemini应用用户推出效率和质量改进;未来几个月内,公司还将在视频观看页面的“Ask YouTube”功能中使用该能力,旨在提供质量更高、基于视频画面内容的回答。

新闻来源
Google Official News
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻