一段90分钟的讲座视频,过去AI分析要烧掉大量算力,现在成本能砍掉近九成。Google DeepMind在2026年9月1日发布了Gemini的「Agentic Video Understanding」功能,让AI不再傻乎乎地把整段视频从头到尾读一遍,而是像人一样,先听问题,再带着目的去视频里找答案。

这个功能目前已经在Gemini 3.7 Flash、Gemini 3.6 Flash和Gemini 3.5 Flash-Lite上开放使用。核心变化在于,AI从「被动接收」变成了「主动侦查」——它会根据你的提问,自己决定该看视频的哪一段、该用多高的清晰度去看。

打开网易新闻 查看精彩图片

传统方式为什么又贵又笨?

打开网易新闻 查看精彩图片

过去Gemini处理视频用的是「静态处理」:不管视频多长,统一按每秒1帧的速率抽帧,然后把所有画面和音频一股脑塞给模型。这个方法对付短视频还行,但遇到几十分钟甚至几小时的素材就麻烦了——要么消耗大量token,要么为了省成本降低帧率,结果把一闪而过的关键画面漏掉了。

Agentic Video Understanding的思路完全不同。它让Gemini先理解问题,再反过来决定「我需要看视频的哪个部分」。如果某个区间的信息不够,它还能主动调整那个区间的帧率和分辨率,重新看一遍。处理资源不再平均分配,而是集中火力在真正需要的地方。

能干什么?从数拍手到找剪辑点

Google官方举了几个典型场景,每一个都踩在传统方案的痛点上:

  • 数动作次数:比如数一段视频里拍了多少次手。快速动作在1FPS的静态处理下很容易被漏掉或混淆,新功能可以自动提高帧率重新确认。
  • 找剪辑点:定位视频编辑中剪切的位置,这类瞬间变化往往只有几帧。
  • 长视频搜索:在数小时的录像里找某个特定事件,不用从头到尾全看一遍。
  • 异常检测:先低帧率扫一遍,发现异常区间再提高帧率细看。

Google给出的测试数据显示,相比传统静态处理,Agentic Video Understanding能把token消耗最多降低88%,同时精度最高提升约7%。在10分钟的解说视频、90分钟的讲座这类中长视频上,效率改善尤其明显。

成本与精度的「帕累托前沿」

在专门测试长视频理解能力的「1H-VideoQA」基准上,Google对比了单次查询的成本和精度。结果启用Agentic Video Understanding的Gemini 3.7 Flash,在所有被测模型中处于「帕累托前沿」——简单说,就是没有其他模型能在同等成本下做到更高精度,或在同等精度下做到更低成本。整体分析成本最多可削减66%

打开网易新闻 查看精彩图片

这个结果并不意外。过去处理长视频,大量token浪费在无关画面上;现在AI只盯着关键区间看,省下的算力自然可观。

怎么用?API指定一下就行

开发者想用这个功能很简单:在Gemini API里把视频处理方式指定为「agentic」即可。目前Google AI Studio和Gemini Enterprise Agent Platform已经支持,上传的视频和公开的YouTube视频都能分析。功能本身不额外收费,只按正常的Gemini API token价格计费。

如果你处理的是5分钟以内的短视频、更看重响应速度,Google也保留了传统的静态处理模式,开发者可以根据场景自行选择。

下一步:进入Gemini应用和YouTube

Google不打算把这个能力锁在API里。官方计划在近期把Agentic Video Understanding带到Gemini应用的Flash和Flash-Lite版本中。另外,几个月内还会集成到YouTube视频观看页面的「Ask YouTube」功能里,让用户直接对着视频提问时,AI能给出更靠谱的回答。

从「AI看视频」到「AI知道该看哪里」,这个转变听起来不大,但对长视频分析的成本结构来说,是一次实打实的改变。对于经常处理会议录像、课程回放、监控素材的团队,这个功能值得第一时间试试。