[CVPR 2026] PGPO:拒绝“平均主义”,多模态强化学习的细粒度进化

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

2026-01-01
Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin
总结
问题
方法
结果
要点
摘要

本文提出了 Perception-Grounded Policy Optimization (PGPO),这是一种针对多模态大模型(LVLMs)推理优化的细粒度强化学习框架。通过动态重塑 Token 级别的 Advantage,该方法在 Qwen2.5-VL 系列模型上实现了平均 18.7% 的性能提升,刷新了多步视觉推理任务的 SOTA 指标。

TL;DR

在多模态大模型(LVLM)的强化学习过程中,并非所有的 Token 对视觉信息的依赖都是平等的。本文提出的 Perception-Grounded Policy Optimization (PGPO) 针对性地解决了传统强化学习(如 GRPO)在信用分配上的“平均主义”弊端。通过量化 Token Visual Dependency,PGPO 能够识别并放大那些真正承载视觉逻辑的关键 Token 的学习信号,从而在不增加明显计算开销的前提下,显著提升复杂几何、数学和逻辑推理的准确度。

痛点深挖:被稀释的“视觉感知”

当前的 LVLM 系列模型(如 Qwen2-VL, Llama-3-V)在推理任务中广泛采用可验证奖励的强化学习(RLVR)。然而,标准的优化策略(如 GRPO)通常将一个序列级别的 Advantage(优势函数)无差别地广播给所有 Token。

这存在一个核心悖论:在一段长达几百个词的推理链中,可能只有 5% 的 Token(如具体的几何坐标或图表数值)是必须盯着图看才能写出来的,剩下的内容大多是通用的语法连接或逻辑推导。在这种“大锅饭”制度下,真正的视觉感知信号被淹没在大量的语言先验噪声中,导致模型虽然能说会道,却经常在最关键的视觉观察点上“睁眼瞎”。

核心机制:量化“视觉依赖度”

作者首先提出了 Token Visual Dependency () 的概念。其直觉非常直接:如果在遮掉图像(Unconditioned)后,模型预测某个 Token 的概率发生了剧烈变化,说明这个 Token 对视觉信息高度依赖。

这种变化被量化为:

实验观察到的三个直觉:

  1. 分布极度稀疏:只有极少数 Token 拥有高依赖分值。
  2. 高度语义相关:高分 Token 往往是数字、几何实体词、动词等“核心锚点”。
  3. 幻觉的克星:实验发现,当模型产生幻觉(Hallucinated Tokens)时,其视觉依赖度极低。这意味着 可以作为衡量模型是否“在胡说八道”的反向指标。

方法论:PGPO 优势重构

PGPO 并不单纯是给高分 Token 加权,它设计了一套严密的数学框架来确保训练平衡。

PGPO 框架总览

关键步骤:

  1. 对数压缩与归一化:解决 KL 散度长尾分布带来的数值不稳定。
  2. 阈值门控重分配
    • 抑制区:低于阈值的 Token 权重被极力压缩,减小噪声梯度。
    • 增强区:高于阈值的视觉锚点 Token 被大幅增强(Boosting)。
  3. 总和守恒归一化(Mass-Conserving):论文严谨地证明了,必须保持整条序列的总 Advantage 不变(均值为 0),否则会导致梯度爆炸或策略坍塌。

实验结果:推理能力的阶跃

在 Qwen2.5-VL 平台上,PGPO 在七大挑战性基准测试中均超越了现有最强基线(如 VPPO, DAPO)。

实验结果对比

在对空间感知要求极高的 Geo3kMathVerse 任务中,PGPO 的优势尤为明显。通过 Case Study 可以看到,PGPO 能够引导模型在推理过程中通过类似“内部单白”的方式,反复校验图像中的具体几何参数(如下方案例中对 20° 夹角的精确捕捉)。

案例分析:几何推理对比

深度洞察与总结

PGPO 的成功再次验证了梯度信噪比在强化学习中的核心地位。在多模态领域,简单地增加奖励反馈是不够的,关键在于如何分配这些反馈。

  • 局限性:由于需要进行一次“视觉屏蔽”的额外前向传导,PGPO 增加了约 10% 的计算开销。虽然作者通过并行计算控制了成本,但在更大规模参数的模型上,这种开销仍需权衡。
  • 未来展望:这种“基于感知的信用分配”思想完全能够平移到其他模态,例如在视频模型中识别对“时间维度”高度依赖的帧,或在音频任务中提取关键音素。

正如论文标题所言:“Not All Tokens See Equally”。PGPO 让我们看清了视觉信息是如何渗入模型的每一轮思考之中的。

发现相似论文

试试这些示例

  • 查找最近其他试图解决多模态大模型强化学习中 Token 级别信用分配或梯度稀释问题的研究。
  • 哪篇论文最早利用 KL 散度或 Bayesian Surprise 来量化多模态任务中的视觉信息贡献,本文在此基础上做了哪些优化?
  • 有哪些研究将类似 PGPO 的动态优势重分配方法应用到了视频理解、具身智能或纯文本推理的长链任务中?
目录
[CVPR 2026] PGPO:拒绝“平均主义”,多模态强化学习的细粒度进化
1. TL;DR
2. 痛点深挖:被稀释的“视觉感知”
3. 核心机制:量化“视觉依赖度”
3.1. 实验观察到的三个直觉:
4. 方法论:PGPO 优势重构
4.1. 关键步骤:
5. 实验结果:推理能力的阶跃
6. 深度洞察与总结