三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26
6494点击    2026-07-30 15:57

长视频理解,正在成为多模态大模型的重要能力。


用户开始不再只问“视频里有什么”,而是希望模型能进一步回答:这个事件从什么时候开始?到什么时候结束?这类任务被称为视频时序定位(Video Temporal Grounding, VTG)。


但视频越长,visual tokens越多,推理成本也越高。


一个直接思路是:剪掉一部分视觉token。


SemVID正是围绕这个问题展开。它的核心观点是:相比传统针对VideoQA的剪枝,VTG剪枝不是简单删掉“不重要画面”,而是要保住一条支撑时间定位的evidence chain。该工作已被ECCV 2026会议录用。


VideoQA剪枝和VTG剪枝,根本目标不同


以往很多token pruning方法主要服务于VideoQA。VideoQA的目标通常是回答“视频里有什么”“人物在做什么”“物体是什么颜色”。这类问题往往只需要少数关键帧展示相关画面就可能答对。


但VTG的目标完全不同。VTG要定位“什么时候开始、什么时候结束”。模型不仅要看到query相关对象,还要看到动作前后的状态变化。


比如查询是“一个人从柜子里拿出包”,模型不仅要看到“人”“柜子”“包”,还要看到动作发生前后的状态变化:手什么时候伸向柜子,包什么时候被拿出。


如果剪枝方法只保留几个最显著或最相关的画面,模型可能知道事件确实出现过,却无法判断准确边界。


换句话说,VideoQA剪枝回答的是:哪些画面够回答问题?VTG剪枝真正要回答的是:哪些证据能支撑时间定位?


这就是SemVID与既有方法的根本差异。


SemVID的核心动机:保住Evidence Chain


下图展示了SemVID的核心motivation,即VTG需要的不只是局部证据,而是一条跨帧连接的证据链。


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


在VTG中,事件往往不是由最显著的某几帧决定的,而是由一系列状态变化共同定义的。


事件边界附近的token负责告诉模型“变化从这里开始和结束”,而中间的relay token负责连接前后状态。


一旦这些中间节点被剪掉,证据链就会断裂。模型可能仍然看到若干高相关画面,却无法显式地将这些画面关联起来,组成连续推理路径。


结果就是:语义理解还在,时间定位变差。


因此,SemVID提出两个面向VTG的剪枝目标,意于组成支撑定位的证据链:


  • Evidence Retention:保留与query语义高度相关的token,尤其是事件边界附近的关键证据。
  • Connectivity Strength:保留跨帧连接,让证据能沿时间传播,而不是变成孤立碎片。


方法:从语义角度分离每个token在视频中的角色


围绕证据链,SemVID设计了一个training-free token pruning框架。它不需要重新训练backbone,只在推理阶段决定保留哪些视觉token。


整个方法分两步。


先决定每一帧保留多少token


如果平均分配预算,无关片段会浪费token;如果只根据query相关度,预算又可能集中到少数高相关帧,导致中间帧被剪空,时间链路断裂。


SemVID因此同时考虑query相关度和帧间变化两个信号。


相关帧包含目标事件,而变化帧往往靠近动作转折或事件边界,从而保证预算分配涵盖完整时间轴和证据链。


在每帧内部选择具体token


如下图所示,SemVID显式保留三类语义角色不同的token:Object、Motion和Context。


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


Object token保留与query相关的对象证据,负责回答“发生了什么”。


为了防止反复选中同一物体附近的patch,导致预算被相似的局部区域占满,SemVID使用MMR,让选出的object token既相关又互补,从而覆盖更完整的对象证据。


Motion token保留动作转折,负责回答“什么时候发生变化”。


SemVID根据相邻帧之间的局部特征变化选择motion token,并结合相关度过滤与query无关的背景运动。


它们不是普通运动区域,而是连接事件前后状态的relay node。


Context token保留场景锚点,负责回答“证据发生在什么环境中”。


极端剪枝下,如果只留下对象局部,视频会变成一组碎片化证据。少量context anchor可以维持场景连续性,帮助模型把对象和动作放回正确语境中。


实验:SemVID是否真的保住了证据链?


论文在Charades-STA和ActivityNet-Grounding上使用Qwen3-VL和Qwen2.5-VL进行评测。实验验证了SemVID是否在强压缩下仍能保持VTG所需的边界定位能力。


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


上图表明在相同token预算下,SemVID在mIoU、ER和CS上整体优于现有剪枝方法。


尤其在低保留率下,其他方法往往出现明显性能下降;而SemVID仍能稳定保持较高mIoU。这说明SemVID的优势不只是“压缩token”,而是把有限token留在了真正影响时间定位的位置。


其中,mIoU衡量最终定位精度,ER衡量关键证据是否被保留,CS衡量证据是否能跨帧连起来。


可以看到,SemVID的mIoU提升通常伴随ER和CS的提升,这与团队的核心动机一致:VTG剪枝不能只保留高相关画面,还必须保留一条可追踪的evidence chain。


消融实验进一步解释了SemVID为什么有效。


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


去掉Object Token后,mIoU和ER下降,说明query相关的对象证据是定位基础;去掉Motion Token后,mIoU和CS下降最明显,说明动作变化token是连接事件前后状态的关键relay;去掉Context Token后,CS也会下降,说明少量场景锚点能帮助维持时间连续性,避免证据碎片化。


可视化:SemVID能稳定保留动作相关证据


下图展示了不同剪枝方法的attention热力图。


三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26


相比VisionZip和FastVID,SemVID即使在12.5%的极低预算下,仍能稳定聚焦在动作发生前后的语义相关区域,例如人物手部、物体和动作交互位置。


总结


SemVID最重要的启发是,VTG剪枝不能只保留“看起来相关”的画面,而要保留能支撑边界定位的证据链。


通过object/motion/context三种语义角色,SemVID能在training-free条件下,把有限token更准确地分配给对象证据、动作转折和场景锚点,从而实现更稳定的长视频时序定位。


当然,SemVID也还有进一步改进空间。当前motion token主要依赖帧间特征变化来刻画运动,在镜头移动、背景剧烈变化或遮挡较多的场景中,仍可能受到干扰。


论文标题:Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
论文作者:Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan
作者单位:University of Warwick;University of Amsterdam;Amazon AGI
论文地址:https://arxiv.org/abs/2603.05663
代码地址:https://github.com/JiaqiLi404/SemVID


文章来自于"量子位",作者 "SemVID团队"。

关键词: AI新闻 , 模型训练 , SemVID , VideoQA
AI转型,免费服务,就找AITNT