BaNEL与稀疏奖励机制:仅从失败中学习能带来什么、不能带来什么

BaNEL仅使用失败尝试对生成模型进行后训练,在稀疏奖励任务上超越了新颖性奖励基线,同时减少了奖励预言机的调用次数。

直接答案

标准的基于奖励的后训练假设基座模型已经能获得一些正向信号,并且奖励预言机足够廉价,可以进行密集查询。BaNEL 针对的是相反的 regime:基座成功率接近零且奖励调用昂贵,仅从零奖励样本中学习,通过在环生成模型拟合失败分布并引导生成远离失败 [1]。在若干刻意稀疏的任务上,它无需观察到任何一次成功即可提升成功率,在减少奖励评估次数的同时,以最高达数个数量级的优势超越基于计数和 RND 的新颖性奖励 [1]。这一结果将失败数据重新定义为一种可学习的分布,而非需要被抑制的梯度,但其主张受限于所测试的稀疏奖励任务和所报告的 NRE 预算 [1]

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

当成功罕见时,标准奖励后训练流程为何停滞不前

当代生成式后训练依赖两个假设:监督预训练广泛覆盖了生成空间,而奖励函数提供了足够密集的信息以提升质量[1]。RLHF及其变体使这一流程成为对齐语言模型的默认方案,其中奖励模型基于人类或AI偏好进行训练,并通过策略梯度方法加以优化[8][9]。奖励塑造工作通过约束奖励并以参考值为中心对其进行归一化,进一步稳定了这一循环,表明决定训练是否持续有效的不仅是奖励信号的有无,更是其形态[2]。但这些成功都预设了一个前提:基础策略偶尔能产生获得奖励的样本,且奖励查询的成本可以承受。

BaNEL 所隔离的是更困难的情形:基础成功概率低到模型可能永远见不到正样本,而奖励预言机又足够昂贵,以至于奖励评估次数(NREs)本身成为一等预算约束 [1]。在经典策略梯度下,全零奖励批次产生的梯度恰好为零,因此学习退化为无法超越基础成功率的暴力采样 [1]。常数负基线会产生非零的经验梯度,但长期仅在负样本上训练会破坏预训练知识并导致模型崩溃 [1]。GFlowNet 式的基于奖励的采样在这里同样失效:当 r(x)=0 时,轨迹平衡损失退化为 log pθ 的经验方差,这会在采样批次上赋予任意质量,而其余部分则不受控制 [1]。因此,BaNEL 所针对的缺口并非一般意义上的探索,而是在唯一信号是失败之结构时的学习。

BaNEL的举措:将失败分布视为待学习的生成模型

BaNEL的核心思想是将学习失败背后的规律性视为另一个循环内生成建模问题[1]。该算法从当前提议分布中采样候选样本,将失败模型pφ拟合到这些零奖励样本上,并形成贝叶斯后验,通过似然比pθ(x)/pφ(x)对提议分布重新加权,仅接受在先验下比在失败模型下可能性高得多的候选样本[1]。当阈值的选择使得恰好有m个候选样本从mf个中被接受时,这一过程与交叉熵方法的精英选择步骤一致,区别仅在于CEM按奖励排名,而BaNEL按似然比排名,因为奖励始终为零[1]。带蒸馏的序贯过滤(算法2)跨轮次累积拒绝区域,并将过滤后的分布蒸馏回模型中,作者认为这在理论上等价于维护多个负模型,但效率要高得多[1]

该设计直接针对先前稀疏奖励方法的两种失败模式。基于计数的伪计数每次奖励评估只更新一次密度模型,而多次更新会为非新颖状态抬高奖励;RND的预测器-目标MSE同样会在反复更新时无论新颖性如何都收缩,从而提高NREs [1]。BaNEL则利用额外算力在每个阶段更充分地训练pφ,因此在固定NRE预算下,成功率随算力扩展 [1]。这是该论文最尖锐的概念性主张:失败数据不仅仅是要被减去的负梯度,而是一种其规律性可以被建模并反转的分布。

稀疏奖励实验实际证明了什么

作者构建了带有刻意过滤的奖励为1样本的序列生成任务。在MNIST 0→6任务中,一个在0数字上预自回归Transformer必须发现6;基础成功率为8e-26,而BaNEL的后验样本向右侧被移除的0形数字偏移,类似于6 [1]。在所有方法的总NRE预算为7500的情况下,BaNEL相对于基础模型的改进因子随着用于训练pφ的epoch数量增加而增长,而基于计数和RND的基线无法利用额外的计算量 [1]。在针对数字加法语言模型的对抗攻击中,BaNEL找到了进位链和前导零提示来攻破目标,基于规则的攻击率分别为99.02%和99.96%,而预训练模型为0.04% [1]。在预训练模型失败的具有挑战性的GSM8K子集上,BaNEL再次在没有观察到任何奖励为1的样本的情况下提高了成功率 [1]

与新颖性奖励的对比是核心亮点:BaNEL在成功率上比基于计数的方法和RND方法高出最多数个数量级,同时使用的奖励评估次数更少[1]。这一对比框架之所以重要,是因为它区分了稀疏奖励文献中常常混为一谈的两种预算。新颖性奖励通过频繁调用预言机来购买探索;BaNEL则通过对失败进行循环内生成建模来购买探索,以计算换取预言机查询。MNIST计算扩展曲线是最清晰的证据,表明这种权衡是实质性的而非偶然的[1]

BaNEL如何与好奇心、负强化学习及基于偏好的替代方案相比较

早期好奇心研究工作已经确立,智能体能够从新颖性中自行生成稠密信号。情景好奇心(Episodic Curiosity)通过可达性而非原始惊讶度将观测与情景记忆进行比较,并表明ICM等预测误差方法可能退化为退化行为,例如在无奖励的DMLab任务中持续放电[3]。BaNEL继承了这一诊断——内在奖励不随算力扩展且必须频繁查询预言机——但用学习到的失败模型取代了新颖性奖励[1]。因此,这一谱系在动机上连续,在机制上断裂:EC追问的是到达某一观测需要多少步,而BaNEL追问的是先验比失败模型产生该观测的可能性高出多少。

负奖励学习有一条独立的研究脉络。TOPR表明,采用非对称 tapered 重要性采样的 REINFORCE 能够在统一的离线框架中处理正样本和负样本,并且基线参数实际上控制着目标函数中正负样本的混合比例[4]。PREFORL在离线强化学习中采取了不同路线,将成功演示与失败案例及人工合成的退化行为进行对比,以避免稀疏奖励 D4RL 任务中的价值高估[5]。两者都证实了负样本携带可用信息,但都假设存在某种正样本或偏好信号可供对比。BaNEL的独特主张是根本不需要任何成功样本,因为失败分布本身就是学习目标[1]。这比 TOPR 或 PREFORL 的假设更强,而这正是稀疏奖励实验所要检验的内容。

结论止步之处:任务范围、预言机预算与未测量区间

论文自身的框架将主张限定在已测试的稀疏奖励任务和所报告的NRE预算范围内[1]。在所提供的证据中,没有任何内容表明当奖励密集时、当存在可用于对比的正样本时,或当奖励预言机足够廉价以致新颖性奖励不构成瓶颈时,BaNEL能够提供帮助。MNIST、对抗攻击和GSM8K子集任务都是经过刻意筛选成功样本的序列生成问题;对其他模态、更长时域或连续控制的泛化在此尚未得到检验。计算扩展结果同样是有条件的:BaNEL受益于对pφ进行额外轮次的训练,因此如果无法获得该计算资源,其相对于新颖性奖励的优势就会缩小[1]

仍有两个更广泛的不确定性。第一,奖励过度优化是在针对不完美代理指标进行优化时已知的失效模式,代理指标优化与真实奖励退化之间存在平滑的缩放关系[7];BaNEL的失败模型并非奖励模型,但在针对学习信号进行长时间优化时会发生什么,这同一问题仍未得到解答。第二,相邻设定中的样本效率研究表明,高奖励预言机可以抬高群体基线并使优势估计复杂化[6],而奖励塑形研究表明,有界且塑形良好的奖励拓宽了安全训练窗口[2]。BaNEL的似然比过滤器是否以相同方式与这些动态相互作用,仍是一个开放问题。诚实的总结是:BaNEL展示了一种针对狭窄但重要场景的新机制,而非对奖励监督的通用替代。

关于这些来源

本研究页面基于9项研究(6篇同行评审,3篇预印本)——发表于2022年至2026年间,其中5篇发表于2024年或之后,合计被引用1,666次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又是从超过5亿篇文献的数据库中检索到的140篇论文中筛选而来。

本文引用的文献

1

BaNEL:仅使用负奖励的生成建模探索后验

BaNEL仅使用零奖励样本对生成模型进行后训练,通过拟合一个在环失败模型并引导生成远离该模型,在稀疏奖励任务上以更少的奖励评估次数,将成功率较基于计数和RND的新颖性奖励提升高达数个数量级。

2

奖励塑形以缓解RLHF中的奖励黑客问题

这项奖励塑形研究确立了具有快速初始增长和逐渐收敛特性的有界RL奖励能够稳定PPO训练并缓解奖励黑客问题,其中PAR仅需一个参考奖励。

3

基于可达性的情景好奇心

情景好奇心(Episodic Curiosity)利用情景记忆引入了基于可达性的新颖性奖励,在ViZDoom和DMLab导航任务中表现优于ICM,并避免了预测误差好奇心中所见的退化性激发行为。

4

Tapered Off-Policy REINFORCE:面向LLM的稳定高效强化学习

TOPR 将非对称锥形重要性采样应用于 REINFORCE,实现了稳定的离策略 LLM 微调,统一处理正例和负例,并表明基线参数控制着正例的有效比例。

5

基于稀疏奖励离线数据集的偏好策略优化

PREFORL 使用对比偏好学习来对抗失败和合成退化行为,以避免价值高估,在稀疏奖励的 D4RL Adroit 和 MuJoCo 任务上实现了最先进的归一化分数。

6

注释作为展开:面向视频多模态大语言模型的高效可扩展强化学习

这项视频多模态大语言模型强化学习研究考察了样本效率与可扩展性,并指出高奖励的预言机抬高了组基线,使优势估计变得更加复杂。

7

奖励模型过度优化的缩放定律

这项缩放定律研究测量了奖励模型的过度优化现象,表明随着代理奖励优化的推进,黄金奖励分数会平滑下降,且系数随奖励模型参数规模而变化。

8

RLAIF与RLHF:利用AI反馈扩展基于人类反馈的强化学习

RLAIF表明,基于AI生成的偏好来训练奖励模型,在摘要和对话任务中可达到与RLHF相当的性能,而d-RLAIF则完全绕过了奖励模型的训练。

9

基于人类反馈的强化学习综述

这份RLHF综述涵盖了从控制、机器人学到大型语言模型领域中以人类反馈学习的基础知识,考察了算法与人类反馈如何相互作用。