ECCV 2026 收录论文 SemVID 提出一种无需训练的长视频 Token 剪枝方法。其核心创新在于,将保留目标从“关键帧”转向支撑时间定位的“证据链”,以此获得更稳定的视频时序定位(VTG)性能。

从“关键帧”到“证据链

打开网易新闻 查看精彩图片

以往的长视频处理思路,倾向于挑选视觉信息最丰富的帧作为“关键帧”来代表整个视频。但 SemVID 认为,这种方式可能丢失对时间定位至关重要的线索。该方法的思路是,保留那些能构成完整证据链条的 Token,而非孤立的关键帧。

具体实现上,SemVID 通过三种语义角色来组织 Token:Object(物体)Motion(运动)Context(上下文)。这三种角色共同支撑起对视频内容的时间定位能力,让模型在理解长视频时拥有更稳定的表现。

无需训练,直接应用

作为一项无需训练(training-free)的方法,SemVID 可以直接应用于现有模型,无需额外的微调或参数更新。这一特性降低了其落地门槛,为长视频理解任务提供了一种轻量级的优化思路。

该研究为长视频处理中计算开销与定位精度之间的平衡,提供了一个新的解决方向。