长视频理解一直有个老大难问题:视频越长,Token越多,计算开销越大。传统做法是剪掉不重要的帧,保留"关键帧"。但ECCV 2026上这篇名为SemVID的论文提出了一种新思路——不保关键帧,改保"证据链"。
从"关键帧"到"证据链"
打开网易新闻 查看精彩图片
关键帧策略的问题在于:它只关注画面本身的重要性,却忽略了帧与帧之间支撑时序定位的逻辑关系。SemVID的核心创新,正是把剪枝目标从"这帧重不重要"换成"这帧是不是时间定位的证据链上的一环"。
具体做法是给每个Token分配三种语义角色:Object(物体)、Motion(运动)、Context(上下文)。通过区分这三种角色,系统能更精准地判断哪些Token对视频时序定位(VTG)任务真正有用,哪些可以安全剪掉。
训练免费,效果更稳
值得注意的一点是,SemVID是训练免费(training-free)的方法——不需要额外微调模型,直接用在现有模型上即可。论文称,相比传统关键帧保留策略,这种"证据链"保留方式在VTG任务上表现更稳定。
这项工作的价值在于:它重新定义了长视频Token剪枝的评判标准——不是看画面多"关键",而是看信息在时序推理中是否构成完整证据。对于视频问答、事件定位等下游任务,这个思路可能比单纯追求视觉显著性更贴合实际需求。
热门跟贴