强化学习真的教给 LLM 新知识了吗?揭秘 RLVR 训练下的推理陷阱

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

2025-04-18
Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang
总结
问题
方法
结果
要点
摘要

本文批判性地评估了基于可验证奖励的强化学习(RLVR)在提升大语言模型(LLM)推理能力方面的真实作用。通过 pass@k 指标,研究发现当前的 RL 研究(如 DeepSeek-R1 相关技术)更多是提升了采样效率,而非拓展了 base model 的推理边界。

TL;DR

清华大学的一项最新研究给当前火热的 "o1/R1 类强化学习" 泼了一盆冷水。研究指出:目前的 Reinforcement Learning with Verifiable Rewards (RLVR) 并没有让大模型产生“顿悟”,它只是把 base model 原本就有的推理路径挑出来,提高了个别路径的出现频率。简单来说,RL 优化了抽奖效率,但缩小了奖池范围。

背景定位:身处“R1 式”狂热中的冷思考

自从 DeepSeek-R1 和 OpenAI o1 证明了 RL 在数学和编程上的奇效,学术界普遍认为 LLM 进入了“自我进化”时代。但本文通过严谨的实验证明:在当前的算法框架下,RL 模型推理能力的上限完全由 base model 决定。

痛点深挖:被 pass@1 掩盖的真相

传统测试习惯看平均分(pass@1),这让大家觉得 RL 简直是神药。但作者提出了一个尖锐的视角:如果让模型多猜几次(加大 k 值),base model 能做出来的题,RL 后的模型反而做不出来了。

这意味着:RL 训练像是一种“思想钢印”,它强化了一组特定的正确答案,随之代价是抹杀了模型在这个问题之外的其他可能性。

核心方法演练:pass@k 作为“真实上限”的探测器

推理路径偏移示意图

左图深刻展示了论文的核心结论:

  • 问题 A:Base model 概率低,RL 把它提上来了(采样效率提升)。
  • 问题 B:Base model 概率低但有解,RL 训练后,这个解彻底消失了(边界缩小)。

作者还利用 Perplexity (困惑度) 分析 证明了:RL 模型产生的推理步骤,其分布完全落在 base model 的原本分布之内。换句话说,模型并没有发明任何新的思考逻辑(如自我反思、步步重检),这些能力原本就沉睡在 base model 庞大的预训练参数里。

实验战绩:Base Model 的“逆袭”

性能对比曲线

在数学(GSM8K, MATH)、代码(HumanEval)和视觉推理(MathVista)的多重测试中,曲线呈现了惊人的一致性:

  1. k < 10 时,RLVR 模型遥遥领先。
  2. 随着 k 增大,Base model 的曲线斜率更高,最终反超。
  3. 结论:Base model 拥有更广的“解空间”,只是平时不爱说正确答案。

深度洞察:为什么 RL 没能超越原主?

论文指出两个关键差异:

  • 巨大的动作空间:语言的组合是指数级的,目前的 RL 很难在没见过的情况下“盲猜”出复杂的推理路径。
  • 预训练先验的诅咒:为了保证生成不乱码,RL 必须依赖 Base model 的先验知识。这成了一个“回音壁”,让模型只在已知领域内打转。

相对而言,模型蒸馏(Distillation) 表现出了不同的特性。如下图所示,蒸馏模型(如 R1-Distill)能显著提升 pass@k 曲线的全段,因为它真正从强大的 Teacher 模型那里吸取了新的推理模式。

蒸馏与RL对比

总结与启示

目前的 RLVR 训练更像是一种“对齐(Alignment)”而非“学习(Learning)”。

未来的路在哪?

  1. 高效探索策略:不再满足于 Token 级别的采样。
  2. 细粒度过程奖励 (PRM):不仅告诉模型“结果对不对”,更要告诉它“哪一步想得妙”。
  3. 多轮 Agent 交互:让模型在与环境的真实反馈中获得 Base model 之外的“经验”。

这篇文章提醒我们:不要低估 Base model 的潜力,也不要高估现有 RL 算法的“智力发现”能力。

发现相似论文

试试这些示例

  • 查找最近其他探讨大语言模型强化学习中“推理多样性坍塌”或“探索效率(Exploration Efficiency)”问题的论文。
  • 哪篇论文最早定义了 pass@k 指标,现有研究中是否有比 pass@k 更能准确衡量模型推理潜能上限的度量衡?
  • 有哪些研究在 LLM 的强化学习中成功引入了非二元(Non-binary)的进程奖励信号(Process Rewards)并实现了推理能力的本质突破?
目录
强化学习真的教给 LLM 新知识了吗?揭秘 RLVR 训练下的推理陷阱
1. TL;DR
2. 背景定位:身处“R1 式”狂热中的冷思考
3. 痛点深挖:被 pass@1 掩盖的真相
4. 核心方法演练:pass@k 作为“真实上限”的探测器
5. 实验战绩:Base Model 的“逆袭”
6. 深度洞察:为什么 RL 没能超越原主?
7. 总结与启示