《Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models》提出了一种名为同策略自蒸馏On-Policy Self-Distillation, OPSD的新框架用于提升大语言模型LLM的数学推理能力。以下是对其主要研究内容的全面总结。一、研究背景与问题动机当前提升LLM推理能力的后期训练方法主要有三类但各有局限监督微调SFT在高质量推理数据上训练但存在暴露偏差和泛化能力弱的问题。带可验证奖励的强化学习RLVR如GRPO通过采样和二元奖励优化但奖励信号稀疏仅序列级且当组内奖励相同时梯度消失采样成本高、效率低。知识蒸馏传统方法为离策略蒸馏存在训练与推理分布不匹配同策略蒸馏虽缓解了分布偏移但通常需要一个独立且更大的教师模型且未显式利用数据集中的真实解答。核心研究问题一个足够强大的LLM能否通过自蒸馏充当自己的教师核心直觉受人类学习启发——学生做错题后查看正确答案可以合理化推理过程并内化方法。类似地LLM在获得特权信息如真实答案或参考思维链时能够“合理化”并教导较弱的自身。评估/合理化通常比生成更容易。二、方法同策略自蒸馏OPSD1. 核心思想使用同一个LLM通过不同条件上下文实例化两个策略3. 关键设计全词汇表 logit 蒸馏在每个位置匹配教师和学生的完整下一词元分布提供密集的词元级监督。逐词元逐点KL裁剪由于风格词元的散度远高于数学词元会主导训练信号因此对词汇表级散度贡献进行裁剪上限 τ稳定训练并提升性能。替代目标也可采用采样词元策略梯度形式将教师对数概率作为密集奖励信号。4. 理论视角OPSD可视为带密集词元级奖励的策略梯度每个位置都提供学习信号即使最终答案错误。与STaR对比STaR使用序列级二元奖励全对或全错所有词元共享相同信用错误时信号消失OPSD则为每个词元提供细粒度信用分配。三、实验设置与主要结果1. 实验设置模型Qwen3-1.7B、Qwen3-4B、Qwen3-8B指令微调版。训练数据OpenThoughts数学推理子集最多30K问题-解答对。评估基准AIME 2024、AIME 2025、HMMT 2025竞赛级数学。基线SFT、GRPO。关键配置教师固定为初始策略以稳定训练LoRA微调OPSD仅需1次 rollout、1024词元、100步训练。2. 主要结果OPSD在所有规模上均优于SFT并匹配或超过GRPO。词元效率极高OPSD每问题仅需1次 rollout1024词元100步内收敛GRPO需8次16k词元 rollout且常因奖励多样性崩溃而停滞。SFT性能下降因真实解答风格简洁导致测试时推理长度缩短。GRPO的局限超过一半批次奖励标准差为零无梯度信号浪费采样预算。3. 消融实验消融维度主要发现散度目标前向KL最佳36.7→43.9反向KL和JSD提升有限或为负生成风格TM-off学生 TM-on教师最佳数学词元KL最高逐词元KL裁剪防止性能崩溃稳定训练生成长度1024 vs 4096无一致提升早期词元更关键蒸馏方式全词汇表 logit 蒸馏优于采样词元策略梯度AIME25: 84.1 vs 82.1HMMT25: 60.0 vs 57.3四、与相关工作的对比方法同策略密集反馈需外部教师利用真实答案SFT否否否是GRPO是否序列级否是仅验证同策略蒸馏是是是否OPSD是是否是与上下文蒸馏Snell et al., 2022后者为离策略硬蒸馏OPSD为同策略软蒸馏。与STaR/ReST后者为迭代自训练过滤SFT硬蒸馏OPSD为逐词元分布匹配。与同策略蒸馏Agarwal et al., 2024; Lu Lab, 2025后者需独立教师OPSD用同一模型。同期工作SDPO环境反馈作为特权信息、SDFT持续学习任务。五、结论与局限性结论OPSD是一个简单有效的后期训练框架让单个LLM同时充当教师和学生利用真实解答作为特权信息在学生自身 rollout 上提供密集词元级监督。实验证明其优于离策略蒸馏/SFT匹配或超过GRPO样本效率显著更高词元效率提升明显。局限性实验仅限≤8B参数模型更大规模待验证。未显式利用生成答案的正确性验证。问题难度需在模型理解阈值内否则教师无法提供有效监督。未来方向课程学习、自适应难度、结合正确性验证信号。六、核心贡献总结提出OPSD框架单模型自蒸馏利用真实答案作为特权信息无需外部教师或奖励模型。逐词元逐点KL裁剪解决风格词元主导训练信号的问题稳定训练。实验验证在三个竞赛级数学基准上匹配/超越GRPO词元效率显著提升优于SFT。深入分析散度目标、生成风格、生成长度、蒸馏方式的影响以及与STaR的理论对比。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要知识蒸馏通过将教师大语言模型LLM的知识压缩以训练更小的LLM从而提升其推理能力。同策略蒸馏On-policy distillation改进了这一方法让学生模型采样自身轨迹同时由教师LLM提供密集的词元级监督从而解决了离策略蒸馏方法中训练与推理之间的分布不匹配问题。然而同策略蒸馏通常需要一个独立的、往往更大的教师LLM并且没有显式利用推理数据集中已有的真实解答。受一个直觉启发——即一个足够强大的LLM能够对外部特权推理轨迹进行合理化解释并教导其较弱的自身——我们提出了同策略自蒸馏On-Policy Self-Distillation, OPSD一种让单个LLM在不同上下文下同时充当教师和学生的学习算法。教师策略以特权信息例如经过验证的推理轨迹为条件而学生策略仅看到问题训练目标是最小化学生自身 rollout 上这两个分布之间的逐词元散度。我们在多个数学推理基准上验证了该方法的有效性相比强化学习方法实现了更优的词元效率并优于离策略蒸馏方法。1. 引言近年来大语言模型LLM的进展在推理和指令遵循方面展现出了令人印象深刻的能力。在后期训练中实现这些能力通常依赖于强化学习方法例如带可验证奖励的强化学习RLVR如 GRPOShao et al., 2024; Guo et al., 2025; Team et al., 2025; Rastogi et al., 2025; Yu et al., 2025、在高质量推理数据集上的监督微调SFTGuha et al., 2025; Team et al., 2025; Xiaomi, 2026或知识蒸馏——近期工作表明从先进教师模型进行蒸馏在性能和训练效率上均可超越RLYang et al., 2025; Xiaomi, 2026; Lu Lab, 2025。尽管这些方法各自取得了成功但每种方法都有其固有局限。RLVR存在若干低效之处1对每个提示采样一组回答计算开销大并且在估计真实价值函数时可能引入高方差此外当所有样本都正确或都错误时梯度信号会消失Yu et al., 2025; Zhao et al., 20252奖励信号稀疏并且在生成输出的所有词元上均匀施加忽略了细粒度的词元级反馈。监督微调存在暴露偏差和泛化能力较弱的问题Agarwal et al., 2024; Chu et al., 2025。传统知识蒸馏从教师模型提供密集的词元级监督但依赖于离策略数据Hinton et al., 2015。同策略蒸馏的近期进展——学生模型采样自身轨迹而教师策略提供密集的词元级监督——通过结合同策略训练的分布真实性与密集反馈展现出了更优的样本效率Agarwal et al., 2024; Lu Lab, 2025。总之我们的贡献如下我们提出了同策略自蒸馏OPSD一个新颖的框架使单个模型能够同时充当教师和学生利用真实答案在学生的 rollout 上提供密集的词元级监督。我们提出了一种逐词元逐点KL裁剪机制该机制能够稳定训练并提升性能因为我们发现风格词元可能会主导数学词元的训练信号。我们在三个竞赛级数学推理任务上评估了OPSD证明它能在显著提高词元效率的情况下匹配GRPO的性能并优于监督微调。我们分析了不同散度目标的影响、学生生成长度的影响以及学生-教师生成风格的影响。2. 背景2.1 面向自回归大语言模型的知识蒸馏这种方法将蒸馏与模仿学习联系起来Ross et al., 2011学生通过从教师对其自身输出的指导中学习来迭代改进结合了强化学习的同策略相关性和监督学习的密集奖励信号从而在保持计算效率的同时缓解暴露偏差。2.2 带可验证奖励的强化学习带可验证奖励的强化学习RLVR已成为大语言模型后期训练的一种流行方法特别是在数学和编程等结果易于验证的任务上使用近端策略优化PPOSchulman et al., 2017和组相对策略优化GRPOShao et al., 2024等算法。3. 方法3.1 从可验证推理数据集学习3.2 同策略自蒸馏动机通过理解解答来学习。我们提出一个受学生学习方式启发的不同视角当学生遇到困难时与其进行长时间的试错不如查看解答、理解推理过程并内化方法。类似地如果一个模型能够获得正确答案或推理 y∗并且足够有能力它就可以对推理步骤进行合理化解释并自我教导——类似于学生复习解答并重新追溯其为何有效。这一直觉激发了我们的框架我们直接利用真实解答 y∗ 作为训练期间的特权信息使模型能够充当自己的教师而不需要外部奖励模型或更大的教师模型。OPSD作为密集奖励策略梯度及与STaR的比较。公式9中的目标可以看作带密集词元级奖励的策略梯度。在附录D中我们对此进行形式化并与STaRZelikman et al., 2022进行对比。STaR是一个密切相关的方法它也使用同一模型生成推理轨迹然后进行拒绝采样并在正确轨迹上执行SFT。该过程可以看作带序列级二元奖励的策略梯度该奖励为所有词元分配相同的信用并在样本错误时消失。相比之下OPSD无论最终答案正确与否都在每个词元位置提供反馈。4. 实验我们进行全面的实验以回答以下研究问题1OPSD在推理性能和样本效率上与SFT和GRPO相比如何§4.22OPSD中的逐词元逐点KL裁剪如何帮助稳定训练§4.3.33生成风格、生成长度对性能有何影响§4.3.44全词汇表 logit 蒸馏相比采样词元策略梯度是否有优势§4.3.54.1 实验设置模型和数据集。我们在Qwen3Team, 2025b模型系列的三个规模上进行实验Qwen3-1.7B、Qwen3-4B和Qwen3-8B使用指令微调版本。对于训练数据我们使用OpenThoughtsGuha et al., 2025的数学推理子集采样最多30K个带思维链推理的问题-解答对。我们在竞赛级数学基准上评估包括AIME 2024、AIME 2025、HMMT 2025。基线。我们与在同一数据集上训练的两种方法进行比较1SFT在专家轨迹上进行标准监督微调可视为从生成推理轨迹的更强大LLM进行离策略蒸馏2GRPOShao et al., 2024使用对照真实答案验证的二元结果奖励的组相对策略优化。最大生成长度设为16k。实现细节。我们将教师策略固定为初始策略而非当前正在更新的学习策略因为我们发现这有助于稳定训练并隐式地起到正则化作用防止过度偏离初始策略。我们在实验中使用全词汇表 logit 蒸馏。所有实验均在A100或H100 GPU上使用LoRAHu et al., 2022进行。更多实验细节见附录B。4.2 主要结果表2报告了竞赛级数学推理基准上的结果。OPSD始终优于SFT并在所有规模上超越基础模型在每个设置中匹配或超过GRPO。值得注意的是OPSD仅使用每个问题一次 rollout 就实现了这些增益并在100步内收敛每个问题仅需采样1024个词元而GRPO需要8次16k词元的 rollout并且由于熵崩溃可能在后期步骤中出现性能下降——在该OpenThoughts数据集下组内大多数奖励标准差为零无法产生学习信号并浪费采样预算。我们还观察到在同一数据集上训练时SFT在不同任务和模型规模上表现出一致的性能下降我们将其归因于真实解答的简洁推理风格导致测试时推理长度缩短。我们将OPSD的词元效率归因于教师分布提供的密集词元级监督并假设较早的词元可能对有效蒸馏贡献更大因为它们可能代表推理过程中更关键的分支点。如表2所示与GRPO相比OPSD在100步训练内实现了更高的词元学习效率。在100步内当采样组内的结果奖励相同时GRPO的性能停滞学习信号更少导致零梯度。这些结果表明OPSD可能比GRPO和SFT更高效地从同一推理数据集中提取学习信号同时大幅减少训练时间。4.3 消融研究与讨论在本节中我们进行广泛的消融研究以考察OPSD中的关键设计选择包括1散度目标2学生和教师的生成风格例如思考模式开/关3逐词元KL裁剪的效果4学生生成长度的影响5全词汇表 logit 蒸馏与采样词元蒸馏的比较。4.3.1 散度目标的影响OPSD中的一个关键设计选择是用于特权教师与学生之间逐词元分布匹配的散度。我们在表3中使用Qwen3-1.7B在AIME25上比较前向KL、反向KL和JSD。所有目标都在相同的逐点裁剪方案下评估以保证稳定性。前向KL始终产生最强的增益在第50步将性能从36.7提升至43.9并在第100步仍高于基线。相比之下反向KL和JSD提供的改进有限或为负。因此我们在所有剩余实验中采用前向KL。4.3.2 生成风格和逐词元KL裁剪的影响OPSD中的另一个关键设计选择是学生和教师模型的生成风格因为它决定了学生学习哪些词元以及教师提供的监督风格。Qwen3模型支持两种生成模式思考模式开TM-on模型产生自我反思的思维链词元思考模式关TM-off模型直接生成回答。为确定哪种组合产生最有效的学习信号我们分析所有四种学生/教师模式配对下的前向KL散度 KL(pT∥pS)将词元分为三组数学数字、运算符和数学关键词、风格推理连接词和其他。表5报告了每个类别内的平均逐词元KL。在所有模型规模上TM-off学生搭配TM-on教师在数学词元上产生最大的KL表明对数学相关词元有更强的监督。报告的KL值对应于每个位置在词汇表上的期望散度如表5所示该期望高度偏斜风格词元贡献了不成比例的大值。这促使我们使用逐点裁剪来控制这种重尾贡献。实证上该配置实现了最佳的下游性能。因此我们采用TM-off学生/TM-on教师配置。4.3.3 逐词元逐点裁剪的影响如表5所示风格词元可能表现出比数学相关词元更高的KL散度导致它们主导训练信号。我们使用逐词元逐点裁剪来缓解这一问题。如图4所示对于Qwen3-1.7B裁剪稳定了训练并防止性能下降鉴于OPSD在百步训练内快速收敛这一点尤为重要。4.3.4 生成长度的影响由于我们的目标在词元级操作公式6每个样本生成的词元数量直接决定了学生可获得的监督信号量。更长的序列让学生接触更多教师反馈但也增加计算成本并可能引入噪声或无信息的续写。为研究这一权衡我们在Qwen3-1.7B上进行消融将同策略采样的学生回答的生成长度在1024和4096词元之间变化并使用全词汇表 logit 蒸馏。如图5所示增加生成长度并未在两个任务上带来一致的改进。我们将其归因于较早的词元对学习更关键随着学生生成变长在足够长的学生前缀条件下后面的词元对教师来说变得越来越可预测因此对后面词元施加的惩罚更少。这一现象也在Lu Lab, 2025中被注意到。4.3.5 学习目标比较全词汇表 logits 蒸馏 vs. 采样词元蒸馏我们在公式6中的目标定义为教师和学生分布之间的逐词元差异。在实践中OPSD可以通过两种方式实例化该目标。1全词汇表 logit 蒸馏如GKDAgarwal et al., 2024对于每个词元位置我们通过完整softmax计算整个词汇表上的 D(pT∥pS)产生两个策略之间适当的词元级 f-散度。2采样词元优势策略梯度目标如Lu Lab2025的同策略蒸馏方法我们仅在学生实际采样的词元 y^​n​ 上评估教师和学生的对数概率并将反向KL项作为标量优势用于策略梯度风格损失。因此第一种变体直接匹配完整词元分布而第二种优化的是由教师对数概率塑形的同策略RL目标而非全分布散度。我们在Qwen3-4B上使用2048词元生成预算进行蒸馏比较这些变体。表4总结了结果。全词汇表散度目标相比采样词元目标提供了一致的增益。这表明让学生接触完整的教师分布比仅依赖逐词元同策略塑形提供更丰富的监督。然而全词汇表计算由于需要在每个位置存储词汇表大小的logits而带来更高的峰值内存使用表明性能与效率之间存在权衡。5. 相关工作LLM自训练。我们的工作与一系列研究表明LLM可以通过生成和利用自身监督信号来改进Allen-Zhu Li, 2020; Xu et al., 2024b; Chen et al., 2024; Wang et al., 2023; Sun et al., 2023; Yuan et al., 2024; Yang et al., 2024。精神上最接近的是上下文蒸馏Snell et al., 2022它使用同一底层模型同时作为教师和学生为教师提供特权上下文然后在没有上下文的情况下对教师生成的输出进行SFT训练学生。这可以视为离策略方法其学习信号是离散词元序列。在推理领域ReSTGulcehre et al., 2023和STaRZelikman et al., 2022同样依赖迭代自训练循环——在提示或答案条件下生成理由通过奖励或真实答案过滤然后在成功轨迹上微调——同样产生硬蒸馏Mitra Ulukus2025将其扩展到软蒸馏。在上下文编辑中Qi et al.2025从学生进行同策略采样并表明上下文诱导的知识可以通过最小化散度进行软蒸馏来内化并在知识编辑设置中展示了这一点。OPSD与这些方法的不同之处在于我们在推理任务中对学生自身 rollout 执行同策略软蒸馏教师的监督是逐词元分布匹配而不是生成理由用于SFT。OPSD将推理改进视为学习一个由数据集真实解答和模型自身推理能力共同诱导的条件分布。同期SDPOHübottter et al., 2026探索了类似算法使用环境反馈作为特权信息SDFTShenfeld et al., 2026在持续学习任务上探索了同策略自蒸馏。同策略蒸馏方法直接在学生自身策略采样的轨迹上训练学生模型同时教师模型通过基于KL的正则化或相关目标提供逐词元指导Agarwal et al., 2024; Xu et al., 2024a; Gu et al., 2024; Lu Lab, 2025; Xiaomi, 2026; Yang et al., 2025。这些方法通过在学生的访问分布上直接优化来缓解分布偏移但通常依赖一个独立的、往往更大的教师模型。在本工作中我们探索一个LLM能否通过以更多特权答案信息为条件并利用自身推理能力来引导一个较弱的自身走向改进的推理从而实现自我教导。同策略训练范式也广泛用于机器人和深度强化学习例如DAggerRoss et al., 2011其中人类教师在学生策略访问的状态上提供纠正性监督。通过SFT和RL改进LLM推理。SFT和RL是改进LLM推理能力的两种主要方法。在高质量推理轨迹上进行SFT已展现出强大性能Yu et al., 2023; LI et al., 2024; Paster et al., 2023; Team, 2025a; Ye et al., 2025; Muennighoff et al., 2025; Zhou et al., 2023。然而先前工作表明SFT可能依赖记忆而非稳健泛化Chu et al., 2025。相比之下直接优化基于结果的目标的RL可以表现出更好的泛化能力Huan et al., 2025。GRPOGuo et al., 2025; Shao et al., 2024等较新算法通过从组级奖励估计优势无需显式评论家如PPOSchulman et al., 2017从而实现可扩展的RL。在这一工作基础上越来越多的研究强调了RLVR在推理任务上的有效性Yu et al., 2025; Liu et al., 2025; Yue et al., 2025; An et al., 2025; Zheng et al., 2025。6. 结论我们提出了同策略自蒸馏OPSD一个简单而有效的框架用于在推理任务上对大型语言模型进行后期训练。OPSD背后的直觉是一个足够强大的推理LLM在获得关于推理问题答案的特权信息时能够利用自身的合理化能力来指导其较弱的自身而无需访问真实答案从而实现自我教导。我们通过实验证明OPSD比离策略蒸馏/SFT取得更好的性能并与GRPO相当或更好同时展现出显著优于GRPO的样本效率。