Distilled Reinforcement Learning for LLM Post-training

论文元数据


论文标题:Distilled Reinforcement Learning for LLM Post-Training(面向 LLM 后训练的蒸馏强化学习)

阅读范围与证据边界

  • 本解读基于论文的完整文本提取与其中保留的公式、表格文本、图注、附录和参考文献信息;这是一个文本回退(text fallback)输入,并非对原始 PDF 的直接视觉阅读。
  • 未直接检查 PDF 页面布局、颜色、曲线几何形状、图中点位/误差带、视觉排版关系,以及文本提取或图注中未保留的图表细节。因此,下文对 Figure 2–6 的讨论仅依据正文叙述和图注,不把它们当作经视觉核验的证据。
  • “作者主张”指论文明确提出的机制解释或结论;“论文直接证据”限于文本中报告的设置、公式和表格数值;“分析者判断”则是基于这些材料的审计,不等同于论文已经证明的因果结论。
  • 附录 B 提供了主要训练超参数与部分评测协议,但提取文本未给出完整的训练数据构成、每项基准的样本规模、随机种子、方差/置信区间、逐题失败案例及全部 OPD 实现细节。这限制了对显著性、评测污染和复现实质难度的判断。
  • 本文是 arXiv 预印本;在缺少独立复现、代码审计和多种教师/奖励设定验证的情况下,不应把其结果升级为通用的 LLM 后训练定律。

1. 一页速览:值不值得看

维度判断
问题如何把强教师模型的 token 级偏好融入基于可验证结果奖励的 RL,使学生既保留 on-policy RL 的任务优化,又避免传统 on-policy distillation(OPD)对教师分布的无条件模仿。这个问题直接对应推理模型后训练中的信用分配与跨模型家族蒸馏。
一句话方法在 GRPO 风格的策略梯度中,用“教师概率 / 旧学生概率”的 token 级反向重要性比率,重加权正优势轨迹中的 token;负优势轨迹不蒸馏;再以响应内几何均值归一化消除整体尺度偏移。
真正新意不是提出新的奖励模型或新的 teacher rollout,而是把教师的局部 token 偏好改写成对 RL 梯度的选择性信用重分配器。其中“负样本 reset”是最有辨识度、且实验上最关键的设计;反向比率和几何归一化属于对既有 importance weighting / PPO 类思想的针对性组合。
关键结果在 DAPO-17K 训练、Qwen3-8B-GRPO 教师下,跨家族学生 DSQW-1.5B 的十项数学平均 Pass@1 为 40.00,高于 RL 的 36.86、OPD 的 35.27;同家族 Qwen3-4B 为 58.96,高于 RL 的 57.40、OPD 的 55.97。移除负样本 reset 后,两种学生的平均成绩分别下降 6.398.81 点。
可信度中等。 主结果跨三个学生模型、含同家族和跨家族设置,且关键组件有消融;但实验集中在单一教师、单一训练集与二元正确性奖励,未报告重复试验方差,也未直接验证教师在每条轨迹上的实际正确性。
相关性RLHF/RLVR 与 LLM 推理后训练高度相关;对偏好优化中的细粒度 credit assignment 有直接启发。对 Diffusion/VLM 没有直接实证,但“仅在成功轨迹上条件化教师指导”的原则可迁移,具体 token 比率形式不能直接照搬。
建议精读。 若目标是把 RL 与教师蒸馏结合、尤其关心跨家族 reasoning distillation,应重点读第 3 节、消融和附录限制。若仅寻找新的 RL 算法,需谨慎:该方法的收益高度依赖教师概率可得、可验证奖励及教师强于学生等前提。

Figure 1|第 2 页

Figure 1|第 2 页。 Figure 1: Overview of Distilled RL. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。

2. 方法论拆解

2.1 问题与已有路线的缺口

作者试图修补的不是“RL 完全没有 token 级信号”,而是一个更具体的矛盾:在结果奖励驱动的 on-policy RL 中,同一条回答的优势值通常被分配给其中所有 token;而在 OPD 中,学生又会被要求在访问到的每个状态模仿教师分布。前者有任务目标但信用分配粗,后者有稠密监督却可能把教师偏好无差别地压过任务奖励。

理解本文所需的三条路线如下:

  1. GRPO / 结果奖励 RL
    对同一 prompt 采样一组回答,以组内标准化的二元正确性奖励构造响应级优势 (A_i),再用策略概率比率更新学生。优点是训练轨迹来自当前学生,且目标直接对齐可验证正确性;缺点是每个 token 共用同一个响应级优势,无法判断哪些推理步骤真正促成成功或失败。

  2. OPD(on-policy distillation)
    同样沿学生自己生成的轨迹查询教师,但最小化学生与教师 token 分布之间的 KL 散度。它减少了传统离线蒸馏的状态分布偏移,却仍是无条件模仿:即使一条学生轨迹最终失败,也会把该路径上的教师局部偏好作为学习目标。

  3. OPD + RL 的线性混合
    直觉上可同时保留任务奖励与教师监督,但作者报告其训练后期仍会回落。作者解释为 KL 项较快将策略拉入一个分布匹配的局部区域,后续 RL 信号难以继续推动改进。
    分析者判断: 这是一种与实验曲线描述一致的解释,但现有材料没有隔离验证“局部最优”是唯一机制;也可能与 KL 权重、学习率、tokenization 差异或奖励尺度交互有关。

本文的核心立场是:教师不应成为一个独立、全局的 imitation target,而应在任务结果已经表明轨迹有价值时,作为 token 层面的相对偏好信号,重分配 RL 更新强度。

2.2 核心机制与流程

训练时,对每个 prompt (q),旧学生策略 (\pi_{\theta_{\text{old}}}) 采样 (G=8) 个响应 (o_i)。每个响应获得二元正确性奖励 (R_i),经组内标准化后形成优势 (A_i)。教师不生成完整答案,而是在学生已生成的每个前缀上为实际采到的 token 打分。

方法由三个连续动作组成:

  1. 按教师—旧学生的相对概率构造 token 权重。
  2. 只让这个权重作用于正优势响应。
  3. 在一条响应内重新归一化权重,使其只改变 token 间相对更新力度,而不整体放大或缩小该响应。

论文的策略目标为:

[ J_{\text{Distilled RL}}(\theta)

\mathbb{E}\left[ \frac{1}{G}\sum_{i=1}^{G} \frac{1}{|o_i|}\sum_{t=1}^{|o_i|} \min\left( r_{i,t}(\theta)w_{i,t}A_i,, \mathrm{clip}(r_{i,t}(\theta),1-\epsilon_{\text{low}},1+\epsilon_{\text{high}})w_{i,t}A_i \right) \right]. ]

其中学生策略比率为:

[ r_{i,t}(\theta)

\frac{\pi_\theta(o_{i,t}\mid q,o_{i,<t})} {\pi_{\theta_{\text{old}}}(o_{i,t}\mid q,o_{i,<t})}. ]

它与 PPO/GRPO 中常见的 clipped policy ratio 作用相同:限制一次更新相对旧策略的偏移。这里真正的新部分是 (w_{i,t}):它不是额外损失项,而是直接乘到原有 RL 优势上。

教师相对旧学生的反向重要性比率为:

[ \rho_{i,t}

\frac{\pi_{\text{teacher}}(o_{i,t}\mid q,o_{i,<t})} {\pi_{\theta_{\text{old}}}(o_{i,t}\mid q,o_{i,<t})}, \qquad \bar{\rho}_{i,t}

\mathrm{clip}(\rho_{i,t},1/\epsilon_\rho,\epsilon_\rho). ]

  • (\rho_{i,t}>1):在同一学生前缀下,教师比旧学生更偏好实际采到的 token。
  • (\rho_{i,t}<1):教师相对更不偏好该 token。
  • 论文将 (\epsilon_\rho) 设为 3,因此比率被裁剪到 ([1/3,3])。

随后进行响应级几何归一化:

[ \tilde{\rho}_{i,t}

\frac{\bar{\rho}{i,t}} {\exp\left( \frac{1}{|o_i|}\sum{s=1}^{|o_i|}\log \bar{\rho}_{i,s} \right)}. ]

分母是该响应中裁剪后比率的几何均值。其角色是让一条响应所有 (\tilde{\rho}_{i,t}) 的几何均值为 1:教师若整体上都不喜欢学生的措辞或 token 分布,不会因此让整条成功响应的更新全部缩小;保留下来的只是“在这条响应内部,教师更偏好哪些 token”的相对排序。

最后定义有效权重:

[ w_{i,t}

\begin{cases} \tilde{\rho}_{i,t}, & A_i>0,\ 1, & A_i\leq0. \end{cases} ]

这意味着:

  • 成功/正优势轨迹: 教师偏好的 token 获得更强正向更新,教师不偏好的 token 获得较弱正向更新。
  • 失败/负优势轨迹: 完全退回原始 RL;不让教师比率参与惩罚幅度。

其隐含因果链是:结果奖励先判断一条轨迹是否总体值得强化;教师再在成功轨迹内提供局部方向;几何归一化阻止“教师与学生整体概率尺度不同”被错误解释为 token 质量差异。

2.3 关键设计与创新判断

  1. 教师条件化的反向 importance weighting

    • 解决什么: 把教师知识嵌进策略梯度,而非另加 KL 蒸馏损失。
    • 为何可能有效: 学生仍在自身访问的状态上学习,且只有教师相对更认可的 token 获得更高更新强度。
    • 必要性证据: 论文比较了 Distilled RL 与 OPD、RL、OPD+RL,主表显示前者更优;但没有提供“改用其他 token-level teacher signal”或“仅保留比率不做 RL coupling”的完整对照。
    • 创新判断: 方向上是已有重要性采样和 on-policy distillation 的重新组合;创新点在于把 ratio 的功能从分布校正改为条件式 RL 信用重分配。
  2. 负样本 reset

    • 解决什么: 在负优势轨迹上,若教师喜欢某 token,直接加权会放大其负梯度,反而让学生远离教师偏好。
    • 为何可能有效: 它避免把“回答整体错”误解为“每个局部教师偏好都应被惩罚”。
    • 必要性证据: 最强。表 4 中移除该模块后,DSQW-1.5B 和 Qwen3-4B 的平均数学成绩分别降低 6.39 和 8.81 点;降幅显著大于移除几何归一化。
    • 创新判断: 设计简单,但与目标函数的符号结构直接对应,是本文最值得复用的判断规则。
  3. 序列级几何归一化

    • 解决什么: 教师和学生整体概率分布不匹配时,逐 token 比率连乘会随长度产生系统性缩放,使成功响应整体被过度压低或放大。
    • 为何可能有效: 在响应内保留相对偏好,移除整体平均尺度。
    • 必要性证据: 有支持但较弱:移除后 DSQW-1.5B 的平均数学成绩下降 1.24 点、Qwen3-4B 下降 1.47 点。
    • 创新判断: 属于有明确概率建模动机的稳定化设计;但它也意味着方法主动丢弃“教师整体是否认可该响应”的信息,这个取舍未被单独比较。
  4. 不进行教师完整 rollout

    • 解决什么: 降低教师采样成本,避免把训练变成 teacher-generated SFT。
    • 为何可能有效: 只需教师提供 teacher-forced token likelihood,即可沿学生自身轨迹实施指导。
    • 必要性证据: 没有成本曲线、吞吐量或同等预算下的比较,故只能确认其接口形式较节省教师生成,不足以确认端到端训练更高效。
    • 创新判断: 是实用工程约束,也是后文最重要的可靠性限制来源。

2.4 可迁移的方法论

对后续 RLHF / RLVR / LLM 工作,最可迁移的不是公式本身,而是以下原则:

  • 把教师当作条件化的局部信号,而非永远正确的目标分布。 对任何有明确成功标签、偏好胜负或 verifier reward 的任务,都可先按全局回报筛选值得强化的轨迹,再决定教师信号是否参与。
  • 显式检查“梯度符号翻转”。 本文负样本 reset 的价值来自一个通用事实:正向偏好权重乘到负优势上,可能会产生与直觉相反的更新。对 VLM 偏好优化、diffusion reward fine-tuning 或 process reward 设计,也应先做这种符号审计。
  • 分离相对 token/step 偏好与整轨迹置信度。 几何归一化适合希望保留局部排序、消除跨模型尺度差异的情形;但若教师整体置信度本身有价值,应改为双通道建模,而不是一概归一化。
  • 迁移到 Diffusion 的风险。 Diffusion 的时间步、噪声层级和生成轨迹并不等价于离散自回归 token;概率密度比的可计算性、数值稳定性和“正/负样本”定义均需重建。不能直接把 token ratio 替换为 denoising-step ratio。
  • 迁移到 VLM 的风险。 多模态 token 与视觉编码器状态可能使 teacher/student tokenizer、视觉表征空间和条件概率不可直接对齐。若模型异构,ratio 可能掺入表示接口差异而不只是偏好差异。

3. 关键证据与实验审计

证据一:跨学生模型的主结果(表 2、表 3)

展示了什么 → 支持什么 → 仍不能证明什么

论文在同一 DAPO-17K 训练设定下,以 Qwen3-8B-GRPO 为教师,在 DSQW-1.5B、Qwen3-4B、Qwen3-1.7B 上比较 base、OPD、GRPO、OPD+RL 与 Distilled RL。

最具代表性的数字是:

  • 跨家族 DSQW-1.5B:十项数学基准平均 Pass@1 从 base 的 31.70 提升到 Distilled RL 的 40.00;高于 RL 的 36.86、OPD 的 35.27、OPD+RL 的 36.54。
  • 同家族 Qwen3-4B:平均从 46.33 提升到 58.96;高于 RL 的 57.40、OPD 的 55.97、OPD+RL 的 56.38。
  • Qwen3-1.7B:Distilled RL 为 46.37,高于 OPD 45.21、RL 44.76、OPD+RL 44.89。
  • 在表 3 的知识密集评测中,DSQW-1.5B 的 MMLU-Pro 为 36.25,略低于 OPD 的 37.50,但 SuperGPQA 为 22.20,略高于 OPD 的 21.00 和 RL 的 20.60;Qwen3-4B 上分别为 74.46 和 39.60,为该表中最高值。

这些结果直接支持:在作者所选教师、训练集、奖励和三种学生初始化下,该目标函数通常优于所实现的 RL、OPD 与固定系数 OPD+RL,且跨家族 DSQW-1.5B 上的相对收益更大。

它们不能证明

  • Distilled RL 对任意教师—学生组合都更稳健,尤其不能证明对 tokenizer 不兼容、教师局部弱于学生或奖励噪声更高的场景也有效。
  • 表 3 中所有“泛化”结论都成立:MMLU-Pro 并非每个学生、每个 baseline 上都明显占优,且 SuperGPQA 使用固定 500 题子集。
  • 差异具有统计显著性。文中没有报告多随机种子均值、标准差、置信区间或显著性检验。
  • 比较已完全公平。作者称所有方法共用 prompt distribution、rollout budget、优化日程和评测协议,但 OPD 的 KL 系数为 (10^{-2})、OPD+RL mixing coefficient 为 1.0;没有看到针对各 baseline 的充分超参数敏感性或 compute-matched sweep。

证据二:负样本 reset 与几何归一化的消融(表 4)

展示了什么 → 支持什么 → 仍不能证明什么

表 4 对 DSQW-1.5B 和 Qwen3-4B 分别移除两个核心组件。

  • 移除负样本 reset后,DSQW-1.5B 的五项竞赛数学平均由完整方法的 40.00 降至 33.61,Qwen3-4B 由 58.96 降至 50.15;对应下降 6.39 与 8.81 点。
  • 移除几何归一化后,平均分别为 38.76 与 57.49;下降 1.24 与 1.47 点。
  • 在知识评测上,去掉负样本 reset 后,DSQW-1.5B 的 MMLU-Pro/SuperGPQA 为 34.10/18.80,Qwen3-4B 为 71.43/34.80,也低于完整方法的 36.25/22.20 与 74.46/39.60。

直接支持:在该实现中,负样本 reset 是性能不可缺少的组件;几何归一化也有一致但较小的增益。它与作者关于负优势下权重符号效应的数学分析相吻合。

仍不能证明:负样本上的教师信息必然有害。更精确的结论是,“将当前 ratio 直接乘到负优势 policy-gradient 项”在这些设置中有害。若改用教师正确性门控、置信度折扣、反事实 teacher rollout 或对负样本使用不同形式的校正,结论可能不同。

消融的另一个不足是没有报告模块交互:例如只使用 reset、不使用反向 ratio 的结果,或对负样本采用零权重、截断负权重、教师能力门控等替代方案。因而“reset 是唯一正确做法”尚未建立。

证据三:熵控制案例与训练动态(Figure 2–6 的文本描述)

展示了什么 → 支持什么 → 仍不能证明什么

作者构造一个由学生自身温度调节而来的教师:学生熵大于 0.5 时用温度 0.8 的尖锐教师,否则用温度 1.2 的平滑教师。文本称学生熵会快速移向阈值区域,并围绕阈值波动;移除负样本 reset 后,熵无法跟随目标区域。

直接支持:在这个刻意构造、可控的分布属性任务中,Distilled RL 的更新可改变学生熵,并且该改变方向与教师温度设定一致。它为“方法不仅重放结果奖励,也可注入教师分布属性”提供了最小机制证据。

不能证明:方法已将教师的事实知识、复杂推理策略或不可由 reward 得到的语义能力可靠地传给学生。熵是一个低维、直接可测且由教师温度显式操控的统计量;从熵跟踪推到“获得此前不可用的新知识”是作者主张,证据强度有限。

关于 Figure 2、3、5,文本称 OPD 早期快速改善后饱和或下降、RL 改善较慢但持续、OPD+RL 后期下降、Distilled RL 的 reward、entropy、长度与平均 Pass@1 更稳定。由于没有直接视觉检查图形,也没有提取到逐 step 数值、误差带或重复运行信息,这些只能作为趋势性辅助证据,不能据此量化训练稳定性或确认曲线差异的统计可靠性。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

  • 被直接支持的核心结论: 在固定的 Qwen3-8B-GRPO 教师、DAPO-17K、二元 correctness reward 和三个指定学生模型下,Distilled RL 的最终 benchmark 分数通常高于论文实现的 GRPO、OPD 与 OPD+RL;负样本 reset 对该性能贡献很大。
  • 有合理机制支持、但尚未被充分证明的结论: 几何归一化确实通过保留相对权重而去掉全局尺度,且消融有小幅收益;但尚未证明它是跨长度、跨 tokenizer 或跨教师概率校准时最优的归一化方案。
  • 仅与结果一致的较强解释: “OPD 的根本瓶颈是 KL 局部最优”“Distilled RL 能传递学生原本没有的新知识”“跨家族蒸馏更鲁棒”。这些解释合理,但缺少教师能力校验、多教师/多族群重复、过程级语义分析和统计测试。
  • 证据集中度偏高: 全部主实验依赖同一个 Qwen3-8B-GRPO 教师和同一 DAPO-17K 训练来源。所谓“within-family / cross-family”是两类学生初始化的比较,而非教师、数据、奖励与实现生态的系统性泛化。

4.2 主要局限与失败条件

  1. 教师是否真的会解题没有被直接验证
    作者明确承认只查询教师对学生 token 的条件概率,而不从教师采样完整回答。因此在一条学生成功轨迹上,教师仍可能对整体问题无解、局部偏好也可能误导。
    影响:机制解释、泛化与部署安全。 “强教师”是全局假设,不能替代 prompt 级 competence assessment。

  2. 只蒸馏正优势轨迹会限制知识注入范围
    方法把负优势响应完全退回 RL。这样避免了错误方向,但也意味着学生完全失败、尚未产生任何成功轨迹时,教师信号几乎不能帮其跨越探索门槛。
    影响:能力边界与样本效率。 对稀疏奖励、难题或低能力学生,最需要教师时反而缺少可用的正轨迹载体。

  3. 二元 outcome reward 仍是粗粒度的外部裁判
    Distilled RL 重分配的是已有正样本内的 token 更新,而非真正估计 token 的因果贡献。一个正确回答中也可能包含冗余、偶然正确或不可泛化的推理步骤。
    影响:机制解释与奖励投机风险。 它改善了更新权重的分辨率,不等于解决了 process-level credit assignment。

  4. 缺少方差、污染与评测协议审计
    文中报告单组数值,没有 seed 方差或置信区间;竞赛题、DAPO-17K、预训练语料及教师训练语料之间的污染关系未在提取材料中系统讨论;Pass@1 使用 32 次采样、temperature 0.1 的具体聚合方式也值得更清晰说明。
    影响:结果可信度与可复现性。

  5. 工程成本和接口可用性未量化
    每个学生 token 前缀都需要教师概率,实践中要求可访问 teacher logits 或至少目标 token likelihood。封闭 API 常不提供这一接口;长响应最高 8192 token 时,教师前向开销可能显著。
    影响:工程部署。 没有吞吐、显存、总 FLOPs 或同等算力收益数据,不能判断相较 OPD/RL 的性价比。

4.3 最有价值的下一步验证

  1. 教师能力门控实验

    • 验证什么: 对每个 prompt 定期执行 teacher rollout 或 verifier 检查,并与“不做门控”的 Distilled RL 比较。
    • 为何重要: 这直接检验论文最关键却未满足的前提:教师在学生成功轨迹对应任务上确实可靠。
    • 会改变判断的结果: 若门控显著提高跨家族表现或降低失败率,说明当前方法受教师局部失配制约;若无差异,才更支持只靠 token likelihood 即足够。
  2. 低成功率与稀疏奖励区间的学习曲线

    • 验证什么: 按初始 Pass@1 分桶,特别测试几乎无正优势轨迹的学生或困难任务,并与 teacher-generated SFT、OPD、探索增强 RL 比较。
    • 为何重要: 这决定方法是“强化已有成功模式”的工具,还是能真正帮助学生进入新能力区域的知识转移方法。
    • 会改变判断的结果: 若在低成功率区间无收益,论文应被定位为 reward-conditioned refinement,而非广义 knowledge transfer。
  3. 多教师、多 tokenization、计算匹配的复现实验

    • 验证什么: 更换教师家族、不同规模差距、不同校准质量和 tokenizer 兼容性;同时报告 wall-clock、teacher forward cost、多 seed 方差。
    • 为何重要: 该方法的 ratio 直接依赖两个模型的条件概率,跨家族鲁棒性与性价比是其最大卖点。
    • 会改变判断的结果: 若收益只在共享 tokenizer 或特定 Qwen 教师下成立,应收窄“cross-family robustness”的表述;若在多教师下仍稳定,则其方法价值显著增强。

4.4 最终复用结论

  • 最值得借鉴: “先由任务回报决定是否接受教师指导,再由教师提供局部偏好”的两层门控思想;它比将 KL 蒸馏无条件叠加到 RL 更符合优化符号与任务目标。
  • 应优先复用: 负优势轨迹的梯度符号审计。任何将偏好、置信度或 ratio 乘入优势函数的算法,都应先验证负回报时是否会反向惩罚理想行为。
  • 不要照搬: 在未验证教师能力、没有可比条件概率接口、或学生成功率极低时,不应直接采用“正样本才蒸馏”的硬门控;它可能静默丢失最需要的指导。
  • 适用场景: 有可靠 verifier/outcome reward、学生已能产生一定比例成功轨迹、教师 logits 可访问、且目标是提高数学/代码式推理等可验证任务的 on-policy post-training。
  • 路线建议: 值得纳入 LLM RLHF/RLVR 后训练的实验路线,优先作为“条件化教师重加权”基线;不宜在现阶段直接作为通用跨模态或 Diffusion 蒸馏方案的默认选择。

5. 必要概念与文献地图

必要概念

  • On-policy training(在策略训练):训练样本由当前或旧版本学生策略生成,而非固定离线数据;优点是更贴近推理时会访问的状态,代价是探索质量决定了可学习内容的上限。
  • GRPO(Group Relative Policy Optimization):对同一 prompt 的多个 rollout 用组内相对奖励构造优势,不依赖单独价值网络。本文以其作为 RL 基座。
  • 优势值 (A_i):表示一条响应相对同组其他响应的好坏;本文中来自组标准化的二元 correctness reward,并被分配到该响应全部 token。
  • OPD(On-Policy Distillation):沿学生自己生成的前缀,让学生分布接近教师分布的蒸馏范式;减少 exposure bias,但标准 KL 目标通常不区分轨迹最终是否成功。
  • 反向重要性比率:本文的 (\pi_{\text{teacher}}/\pi_{\theta_{\text{old}}}),衡量教师相对旧学生对同一已采样 token 的偏好。它不同于常规策略优化里“新策略/旧策略”的更新比率。
  • 负样本 reset:当响应优势非正时令教师权重为 1,使更新退回基础 RL,避免 teacher-preferred token 因负优势被加重惩罚。
  • 几何均值归一化:在单条自回归响应内把 token 权重除以其几何均值,使权重保留相对差异而不改变整体尺度。
  • Pass@k:从多次采样中至少出现一个正确答案的概率型评测;它同时受单样本质量、采样多样性和评测聚合方式影响,不能单独解释为确定性推理能力。

关键前作

  • Schulman et al., 2017,PPO:提供 clipped policy-ratio 的稳定策略优化框架;本文的外层更新形式直接沿用这一类约束思路。
  • Shao et al., 2024,DeepSeekMath / GRPO:提供无需 critic 的组相对优势训练范式,是本文的 RL 主干与 binary correctness reward 的直接上下文。
  • Gu et al., 2024,MiniLLM:代表基于 student-generated trajectories 的 on-policy distillation;本文将其类 KL 模仿路线作为主要比较对象。
  • Agarwal et al., 2024,On-policy Distillation of Language Models:系统化阐释从学生自生成错误中学习的 OPD 视角;本文的贡献可理解为对这一无条件 token 蒸馏目标加上 reward-conditioned gating。
  • Xu et al., 2025,KDRL:论文引用的 RL 与知识蒸馏统一后训练路线;与本文同样试图连接两类信号,但 Distilled RL 的差异在于教师信号进入 RL 梯度权重,而非作为独立 KL 型目标。