为什么基于注意力的token选择在极端稀疏下难以奏效
早期的自适应计算工作已确立ViT可以跳过token,但大多数方法要么在早期层处理完所有token后进行剪枝或合并,要么蒸馏教师的注意力来决定关注位置[3][5]。LookWhere表明,从DINOv2注意力中蒸馏出的选择器-提取器分解在ImageNet和ADE20K上实现了强准确率-效率权衡,并能泛化到高分辨率交通、鸟类和台球基准[5]。SPOT通过聚合跨层和跨头的注意力动态扩展了这一路线,在减少GFLOPS的同时提升了相对DeiT基线的ImageNet准确率[3]。然而,这两种方法都将选择绑定于反映视觉显著性而非任务相关性的注意力图,LookThere的作者展示了DINOv2注意力散布到鸟类或汽车周围的枝叶上,而非标志牌上[1]。
实际后果是,注意力蒸馏选择器需要比必要更多的token来维持准确率,而且随着稀疏度提高,其优势逐渐缩小。LookThere自身的对比显示,LookWhere在SigLIP 2零样本分类上以92%稀疏度运行时准确率大幅下降,从稠密时的71.3%降至44.6%,而LookThere仍保持61.7% [1]。这一差距是最清晰的证据,表明在激进的token预算下,瓶颈在于启发式方法本身,而不仅仅是选择器的架构。
联合强化学习以任务反馈替代启发式方法
LookThere将推理分解为一个浅层选择器和一个高容量提取器,前者观察低分辨率视图,后者仅处理被选中的高分辨率图块[1]。选择器输出图块上的分层伯努利策略,提取器的任务损失则成为奖励信号,通过组相对策略优化进行优化,因此选择器学习的是哪些图块真正有助于预测,而非教师模型关注哪些图块[1]。这与PRANCE不同,后者同样使用PPO进行token和通道决策,但通过Result-to-Go机制优化组合式的架构与token空间[8]。LookThere保持骨干网络固定,仅学习空间选择,这简化了信用分配,并使其能够扩展到高分辨率输入,而PRANCE式的联合优化尚未在此类场景中得到验证。
强化学习的公式化方法也与视觉之外的研究相关联。Sparsity Forcing将GRPO与联合效率-性能奖励应用于多模态LLM中的视觉token剪枝,并报告动态top-p采样优于固定的top-k或阈值策略[4]。Video-KTR利用token级归因来塑造视频推理中的RL更新,表明选择性token监督提高了在Video-Holmes及相关基准上的准确率[6]。LookThere的贡献在于将这种RL-for-sparsity逻辑引入空间视觉Transformer选择,其中动作空间是patch掩码,而非语言模型中的token预算。
帕累托前沿实际移动的位置
在基于DINOv2初始化的ImageNet分类任务上,LookThere在10%的patch比例下与LookWhere持平;而在SigLIP、MAE和EVA初始化下,LookThere均超越LookWhere,top-1准确率分别达到81.6%、78.1%和83.0%,而LookWhere分别为68.2%、67.7%和48.3% [1]。EVA的结果最为引人注目:LookWhere骤降至48.3%,而LookThere仍保持83.0%,这表明注意力蒸馏高度依赖于教师模型具有任务相关的注意力,而RL选择则不然 [1]。在ADE20K分割任务上,LookThere在全部四种骨干网络上均较LookWhere提升了mIoU,在DINOv2下以15%的输入比例达到42.0%,而LookWhere为34.9% [1]。
高分辨率结果正是该方法最具区分度的场景。在Traffic Signs上,LookThere在仅使用5%的patch时准确率就几乎与DINOv2持平,即便在0.2%的极端稀疏度下仍具竞争力;而在Billiards上,它以极少的patch数量达到了其DINOv2教师模型98.8%的准确率,计算量为50 GFLOPs,而LookWhere为261 GFLOPs [1]。在基于CACViT的类别无关计数任务中,LookThere在相同稀疏度下取得了比LookWhere更低的MAE,尽管它缺乏显式的选择监督 [1]。这些正是深度计算前进行选择最为关键的场景,因为处理所有高分辨率token是不可行的。
泛化主张及其边界
LookThere 报告了跨任务和跨架构的泛化能力:ImageNet 分类、ADE20K 分割、Places365 场景识别、MS-COCO 实例分割、通过 SigLIP 2 蒸馏实现的零样本分类,以及计数回归 [1]。在 Places365 上,以 86% 的稀疏度,它保持 57.5%,而 LookWhere 为 55.6%;在 MS-COCO 实例分割上,仅使用 25% 的 patch,它达到 0.444 mask AP,而 LookWhere 为 0.327,密集骨干网络为 0.473 [1]。这些结果支持了如下主张:RL 选择比注意力蒸馏能更好地跨任务类型迁移,但它们全都处于基于 ViT 的识别与回归任务这同一大类之中。
局限性部分明确指出,该方法继承了强化学习的样本低效性,并可能在低数据情形下过拟合,此时提取器会以无法泛化的方式弥补糟糕的选择[1]。块级信用分配仍然困难,因为奖励被分配给整个掩码,而GRPO仅通过分组比较部分缓解了这一问题[1]。该论文还聚焦于空间选择;时间选择和多模态选择被留作未来工作[1]。来自无人机检测的独立证据表明,基于注意力方差的动态token剪枝可以在边缘部署中奏效,但那是不同的选择标准,并未检验LookThere的强化学习公式[7]。采用熵引导的量子启发式剪枝进行联邦GI病变分类同样展示了隐私约束下的token剪枝,但同样采用非强化学习的选择机制[2]。因此边界是清晰的:LookThere的极端稀疏性优势是在所报告的基准上得到证明的,而非在所有视觉任务、模型规模或数据情形下都得到保证。
关于这些来源
本研究页面基于8项研究(7项同行评审,1项预印本)——发表于2025年至2026年,其中8项来自2024年或之后——这些研究是从通过质量筛选的8项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的75篇论文中筛选而来。
本文引用的文献
看那里!通过强化选择实现的稀疏视觉
LookThere引入了一个端到端强化学习框架,联合训练浅层token选择器和深层特征提取器,仅需0.2%的输入patch即可实现准确识别,并在分类、分割、零样本、计数和高分辨率基准测试中超越LookWhere [1]。
联邦胃肠道病变分类:基于临床熵引导的量子启发式视觉Transformer令牌剪枝
这项基础性联邦学习研究采用临床熵引导的量子进化算法,用于ViT中的自适应令牌剪枝,在三个客户端的胃肠道内窥镜分类任务上实现了92.33%的微平均准确率和99.23%的特异性[2]。
SPOT:通过视觉Transformer中令牌相关性的注意力动态稀疏化
SPOT是一种前驱令牌稀疏化框架,它聚合多个ViT层中的令牌嵌入和注意力动态,在减少GFLOPS的同时提高了ImageNet准确率,超越了DeiT基线,并可迁移至CIFAR-100、Food-101、DTD和EuroSAT [3]。
稀疏性强制:增强多模态大语言模型的标记稀疏性
稀疏性强制方法将GRPO与效率-性能联合奖励相结合,以增强多模态大语言模型中的token稀疏性,表明动态top-p采样比固定top-k或基于阈值的剪枝实现了更好的效率-性能权衡[4]。
看向何处?通过自监督学习“看哪里”与“看什么”实现高效视觉识别
LookWhere通过蒸馏自监督教师注意力,确立了选择-提取领域的先前最优水平,在ImageNet、ADE20K以及高分辨率交通、鸟类和台球基准上实现了出色的精度-效率权衡[5]。
Video-ktr:通过关键令牌归因强化视频推理
Video-KTR表明,结合视觉、时间与不确定性信息的token级归因信号能够塑造视频多模态模型中的强化学习更新,从而在包括Video-Holmes在内的五个基准上提升推理准确率[6]。
基于视觉Transformer和边缘计算的无人机实时目标检测。
这项基础性无人机检测研究通过分层窗口注意力和基于注意力方差的动态令牌剪枝,使视觉Transformer适配边缘部署,在DJI Matrice 300 RTK的现场试验中实现了73.9%的mAP@0.5:0.95和38.1 FPS [7]。
PRANCE:面向自适应ViT推理的联合令牌优化与结构化通道剪枝
PRANCE 使用带有 Result-to-Go 训练机制的 PPO 联合优化 token 选择和结构化通道剪枝,在保持无损 top-1 准确率的情况下仅保留约 10% 的 token,将 FLOPs 减少约 50% [8]。
