惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
The Blog of Author Tim Ferriss
IT之家
IT之家
Engineering at Meta
Engineering at Meta
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
C
Check Point Blog
T
Tailwind CSS Blog
博客园 - Franky
H
Help Net Security
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Google DeepMind News
Google DeepMind News
博客园 - 叶小钗
J
Java Code Geeks
腾讯CDC
罗磊的独立博客
爱范儿
爱范儿
阮一峰的网络日志
阮一峰的网络日志
Martin Fowler
Martin Fowler
酷 壳 – CoolShell
酷 壳 – CoolShell
I
InfoQ
B
Blog
V
Visual Studio Blog
F
Fortinet All Blogs

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与...
2026-06-25 · via 雷峰网
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
从“谁被关注”到“谁在变化”,重新定义Token的重要性。

    作者丨李傲 中国人民大学

近年来,以LLaVA、Qwen系列为代表的大视觉语言模型(LVLM)推动了多模态智能的发展,在视觉理解与推理任务中展现不错的表现。然而,其伴随着高昂的推理成本。面对高分辨率图像或者视频时,模型往往需要处理大量视觉Token,而这些Token会在整个推理过程中持续参与计算,成为制约模型效率的重要瓶颈。因此,如何识别并保留真正重要的视觉Token,在尽可能不影响性能的前提下降低计算开销,已成为当前多模态大模型研究的重要课题。

来自山东大学,MBZUAI的研究团队提出了TransPrune:从演化的视角衡量视觉Token的重要性,在保持整体性能无损的同时,将推理成本降低60%。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

论文arxiv链接:https://arxiv.org/abs/2507.20630

代码:https://github.com/liaolea/TransPrune

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

01

重要的Token不仅是“被关注的”,还是“持续演化”的

现有Token Pruning方法大多依赖Attention Score或Token Similarity来衡量视觉Token的重要性,但这些方法在实际使用中都存在一定局限性。

基于Attention的方法通常假设“被关注得多的Token就更重要”,然而Attention本身存在位置偏差 (Attention Sink),使得一些与语义无关的Token也可能获得较高的注意力权重,从而影响重要性判断的准确性。

基于Token Similarity的方法则主要从冗余性角度出发,通过衡量Token之间的相似程度来进行融合,但这类方法往往忽略了具体任务指令的影响,难以针对不同问题动态调整Token的重要性分配。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

论文发现,除了依赖某一层的Attention分数来判断Token的重要性,还可以观察Token在整个前向传播过程中的“变化轨迹”。当一个视觉Token承载更重要的语义信息时,它在传播中往往会经历更显著的表征变化。重要Token并不是静态存在的,而是在模型内部持续发生“演化”。

基于这一观察,论文将这种变化定义为Token Transition,并从两个维度对其进行量化:一方面是Magnitude Change,即Token向量L2范数的变化,重要语义Token通常会表现出更明显的幅值变化;另一方面是Direction Change,即Token表示方向的偏移,通过输入与输出表示之间的余弦相似度进行衡量。

实验结果表明,真正重要的Token往往同时具有更大的Magnitude变化和更显著的Direction变化,且这一现象在LLM的中间层尤为突出。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

02

TransPrune: 基于Token演化的渐进式Token压缩方法

TransPrune整体方法由两个互补模块构成:Token Transition Variation(TTV)与Instruction-Guided Attention(IGA),分别从“Token自身在网络中的演化轨迹”和“任务语义对Token的显式约束”两个角度衡量视觉Token的重要性。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

TTV作为核心评分机制,在模型前向传播过程中持续跟踪每个视觉Token在不同层之间的表示变化,并将这种变化量化为统一的重要性得分,实现对Token“动态重要性”的估计。

单层的TTV往往具有较强噪声,容易受到局部波动或特定层结构的影响,导致重要性判断不稳定。相比之下,如果观察Token在多个层中的持续变化趋势,就可以更可靠地捕捉其“长期语义贡献”。因此,论文对TTV引入了跨层累积机制来获得更加稳定Token的重要性估计。

然而,仅依靠TTV无法对齐具体问题指令的需求。为此,方法进一步引入IGA模块,通过利用文本指令与视觉Token之间的注意力关联,显式建模当前问题对不同视觉区域的关注程度,从而为Token筛选提供任务层面的约束与引导。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

03

实验结果:对比现有within-LLM的裁剪方法领先

论文对比了现有的within-LLM的方法,证明TransPrune在较低的TFLOPs的情况下仍然取得了性能的领先。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

论文还探索了TransPrune与projector-based压缩方法的组合效果。当将其与VisionZip等方法结合使用时,在额外减少约三分之一计算量的情况下,模型性能仅出现极小幅度下降,表明Token Transition所刻画的“动态重要性”与现有projector-based压缩范式具有良好的互补性,不仅可以独立发挥作用,还能够作为插件式模块嵌入到其他高效推理框架中,从而进一步提升整体计算效率。

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

04

结语

通过发现并量化Token Transition这一现象,论文发现了一个全新的视觉Token重要性的衡量角度:不再仅仅取决于它在某一层中“被关注的程度”,还体现在它在整个网络传播过程中“持续演化的强度”。

基于这一观察,论文提出了TransPrune剪枝框架,在多个主流视觉语言模型上实现了显著的推理加速,并保持了优异的性能表现。

这项工作不仅能够为高效视觉语言模型研究提供新的解决方案,也能够启发研究者从动态表征演化的角度重新理解Transformer中的信息流动过程,为未来的多模态模型高效推理带来更多可能性。

雷峰网(公众号:雷峰网)

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

扫描上方二维码

或点击阅读原文关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知