单样本结果之前,早期OPD工作已确立了哪些结论
在线策略蒸馏已成为一种核心的后训练技术,因为学生模型采样自身的 rollout,而教师模型在每个访问到的前缀处提供密集的 token 级监督,从而避免了离线策略蒸馏在固定的教师生成序列上所面临的暴露偏差 [3]。包括 Qwen3、MiMo 和 GLM-5 在内的工业流水线在监督微调和结果奖励强化学习之外也采用了 OPD,而 Thinking Machines Lab 以极低的 RL 计算成本复现了 Qwen3 的 OPD 方案 [3]。Li 等人的前驱论文确定了支配 OPD 成功的两个条件:学生和教师必须共享兼容的思维模式,且教师必须提供学生尚未见过的真正新能力 [3]。该论文还表明,成功的 OPD 的特征是在学生访问过的状态上,在高概率重叠 token 上逐步对齐,这是一个小的共享 token 集合,集中了 97%-99% 的概率质量 [3]。关键的是,基准性能并不能预测 OPD 的结果:R1-Distill-7B 的得分高于 JustRL-1.5B,却产生了相同的退化蒸馏结果,因为从学生的角度来看,同家族的 1.5B 和 7B 教师在分布上无法区分 [3]。
单条查询即可恢复全量数据OPD的大部分增益
锚点论文将数据供给降至最低——仅用单个查询进行训练,而学习曲线与单样本RLVR惊人地相似:学生模型在数百步内持续提升[1]。在数学任务上,单样本OPD在第300步达到68.5,而全数据OPD为69.8,恢复了师生差距的69%和全数据OPD增益的87%;第300步之后,两条曲线始终保持在约3分以内,截至第1000步,恢复比例在62%至89%之间[1]。该效应在不同模型家族中均稳健:R1-Distill-1.5B、Llama-3B-It和OLMo-7B-It-DPO基线的平均数学得分分别为77.1、28.2和70.8,经单样本OPD后分别升至85.5、40.2和82.4[1]。该效应还延伸至数学之外,单样本OPD在代码生成、指令遵循和智能体工具使用上分别恢复了师生差距的73%、66%和64%[1]。该增益对查询难度、响应长度预算和采样温度均不敏感,且一个学生从未解决的查询与一个它总能解决的查询效果相当[1]。
状态覆盖而非查询数量解释了数据效率
锚点论文的核心测量指标是状态覆盖率:状态由教师模型在每个前缀处的最后一层隐藏向量表示,通过在全数据OPD rollout上运行PCA和K-means聚类为200个组,覆盖率则是一个设置所触及的聚类比例[1]。单次OPD在第300步达到71.5%的状态覆盖率,其中65.9%在第100步时已经达到,随后200步仅增加了5.6个百分点[1]。加入语义上不同的查询会同时提升覆盖率和验证准确率:4个查询达到79.8%的覆盖率和0.699的准确率,16个查询达到98.9%的覆盖率和0.709的准确率,与全数据OPD的0.708相当[1]。因果消融实验固定查询不变,同时将不同轨迹数从1变化到64,准确率从0.606升至0.666,证实了驱动增益的是状态多样性而非查询身份[1]。这与前驱工作的token重叠机制相关联:OPD之所以成功,是因为它在学生访问过的状态上逐步对齐高概率token,因此关键在rollout触及了哪些状态,而非收集了多少问题[3]。
决定运行时长的是算法,而非数据
锚点论文的第二个发现是,无论OPD是在单个查询上训练还是在整个数据集上训练,对齐放缓的速度都相近,而且即使是一组固定的状态也需要数百步才能被吸收[1]。在前述两种设置下,top-16重叠率都攀升至全数据水平,重叠token优势趋近于零,绝对熵差在数百步内几乎闭合[1]。因此,移除新鲜状态的供给并不会缩短运行时间,这表明一组固定的状态本身就足以让一次OPD运行持续数百步[1]。这正是锚点论文与前驱工作纯数据中心式解读的分歧所在:Li等人表明OPD学习的是思维模式,且更接近教师后训练数据的提示集能够锐化对齐,但他们并未分离出究竟是数据量还是吸收速率限制了运行[3]。锚点论文的答案是:决定运行长度的是优化器,而非训练集,这也是它称OPD数据过饱但算法饥饿的原因[1]。
多教师OPD与轻内容输入检验边界
状态覆盖的结果可推广至多教师OPD,即一个学生在单次运行中于多个领域上训练,每个查询被路由至其所属领域的教师[1]。全数据MOPD将平均验证准确率从43.5提升至52.8,弥补了79%的师生差距,并与三次独立全数据OPD运行所得的53.8仅差1.0个百分点[1]。将每个领域的查询数从1增加到16,可将平均准确率从50.1提升至52.9,与全数据MOPD持平,并恢复了其101%的增益,各领域的比例分别为:数学93%、代码生成136%、指令遵循109%[1]。作为进一步的压力测试,内容轻量模板和域外WildChat查询也接近真实查询基线,在其三分之一的rollout token上达到该水平,不过若使用立即关闭思考块的脚手架,则会坍缩为简短的元层面回复[1]。作者提醒,这并不意味着任务内容普遍可有可无;它表明内容并非有用信号的唯一来源,而在这些实验中,显式的领域内容对最终性能的影响约为一个百分点[1]。
相互竞争的证据与结论的边界
一条与之竞争的研究路线对蒸馏数据为何有用得出了不同结论。SRPO 使用以反思为条件的教师分数,在学生同策略 rollout 上作为动态目标,其作者报告语义内容至关重要:匹配反思的格式、风格和 token 数量并不能传递收益,只有与任务相关的语义内容才能带来改进 [4]。他们认为这排除了基于教师强制或暴露于未来信息的解释,因为如果这些机制是原因,不匹配的反思也应提供类似的收益 [4]。锚论文的内容轻量模板似乎与此相冲突,但实验设置不同:SRPO 从以反思补丁为条件的自教师蒸馏,而锚论文从独立的领域教师在学生 rollout 上蒸馏,且锚论文明确指出,立即关闭思考块的脚手架会崩溃 [1][4]。锚论文自身的局限性也很明确:状态覆盖是针对由全数据 rollout 构建的参考空间所测的语义级代理,因此它报告的是查询集到达了该空间的多少,而非其自身覆盖了什么,并且它对每个簇等权处理,而不考虑访问频率或剩余教师信号 [1]。决定吸收率的因素仍然悬而未决,且 MOPD 运行仅使用三个领域、每个领域一个教师,随着教师数量的增加,多样性结果的适用范围仍待探索 [1]。
这对后训练实践为何重要
锚点论文将数据设计从收集问题转向选择教师与状态:当学生的 rollout 到达教师能够提供有用监督的区域时,输入才是有用的,而陈述一个问题只是到达这些区域的一种方式 [1]。这与蒸馏研究中更广泛的数据中心主题相关联,其中数据集蒸馏合成小型信息丰富的数据集以压缩训练数据,而综述指出蒸馏数据可能丢弃语义上有意义的信息并产生过度自信的预测 [5]。锚点论文的状态覆盖度量提供了一种选择标准,前提是它能够从查询本身估计出来,而无需运行全量数据来进行对照测量;作者还提出通过在每 token 差距的信任域下将一批数据复用多个 epoch,或按 token 仍携带多少教师信号对其进行加权,使训练更具步数效率 [1]。与一次性 RLVR 的比较进一步凸显了区别:RLVR 从轨迹结果中更新,其信号随着模型学会解决训练查询而减弱,而 OPD 在查询被解决后仍能从局部教师-学生差距中继续学习,尽管这些差距会逐渐缩小 [1]。在超过 1000 步中,OPD 将其与教师的差距缩小了 72%,其在验证准确率上的增益是同一查询上 RLVR 的两倍以上,并且当以 rollout token 而非训练步数进行匹配时,这一优势依然存在 [1]。
关于这些来源
本研究页面基于5项研究(4项同行评审,1项预印本)——发表于2023年至2026年间,其中4项来自2024年及以后,合计被引用420次——这些研究是从通过质量筛选的11项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的67篇论文中筛选而来。
本文引用的文献
重新思考大语言模型的在线策略蒸馏II:一个训练示例
这篇锚点论文表明,单次同策略蒸馏在四个任务领域和三个模型系列上恢复了全数据OPD的大部分增益,并通过状态覆盖解释了这一点——其中单次查询达到全数据状态的71.5%,16个多样化查询达到98.9%——同时指出限制因素是吸收率而非数据供给。
目标检测中的知识蒸馏:从CNN到Transformer的综述
本综述将知识蒸馏确立为一种基础技术,用于将大型目标检测模型压缩为高效的学生模型,同时保持准确性,涵盖从CNN到Transformer的架构以及从2D检测到3D重建和文档分析的应用。
重新思考大语言模型的在线策略蒸馏:现象、机制与方案
前驱论文将思维模式兼容性和真正新的教师知识确定为决定OPD成功的两个条件,表明成功的OPD在学生访问的状态下与高概率重叠词元对齐,并证明基准性能无法预测OPD结果。
SRPO:面向长时程推理的自我反思策略优化
SRPO提出了相竞争的证据,表明反思中的语义内容对于自我反思策略优化至关重要,不匹配的反思无法传递收益,并报告称自我蒸馏在没有更大教师模型的情况下达到了有竞争力的性能,同时在持续学习中更好地保留了能力。
数据集蒸馏的综合综述
这篇数据集蒸馏综述将方法分类为元学习框架和数据匹配框架,指出在高分辨率数据和复杂标签空间蒸馏方面的局限性,并观察到在蒸馏数据上训练的模型由于丢弃了具有语义意义的信息,往往输出过度自信的预测。
