On-Policy Delta Distillation
论文元数据
- Authors: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
- Publication date: 2026-07-16T00:00:00.000Z
- arXiv: https://arxiv.org/abs/2607.15161
- PDF: https://arxiv.org/pdf/2607.15161
- Project: 未提供
- Code: https://github.com/naver-ai/opd2
- 本次阅读输入: 文本回退 + 已定位图像
论文标题:On-Policy Delta Distillation(OPD2)
阅读范围与证据边界
- 本解读基于论文的完整 PDF 文本提取稿(含正文、公式、表格转写、图注与参考文献),属于文本回退(text fallback)输入;没有直接检查原始 PDF 页面。
- 因此,本文未直接检视 PDF 的页面布局、颜色编码、曲线几何形态、字体/空间关系,以及文本提取或图注中未保留的图表细节。对 Figure 1–4 的讨论仅依据正文与 caption,不将其当作视觉语义证据。
- 下文严格区分:作者主张是论文提出的机制解释;论文直接证据是其报告的表格、训练设置和消融结果;分析者判断则是基于这些材料对因果解释、泛化和复用价值的审计。
- 附录提供了主要训练与评测配置,但未提供原始逐样本结果、随机种子、方差/置信区间、完整实现或独立复现;故对“稳定性”“泛化性”“机制正确性”的判断应保持有限。
- 论文的核心任务是 LLM 推理后训练中的 on-policy distillation,和 RLHF / 偏好优化存在方法论邻接,但它不是一个直接训练奖励模型、收集人类偏好或优化扩散模型的工作。
1. 一页速览:值不值得看
| 维度 | 判断 |
|---|---|
| 问题 | 常规 On-Policy Distillation(OPD)以“教师与学生对已采样 token 的 log 概率差”作奖励。作者认为该信号混入了教师原有的文体、自然语言偏好及与推理无关的能力,尤其会在强推理学生上造成退化或不稳定。 |
| 一句话方法 | 用同一教师的“推理微调后模型”与“微调前 base 模型”的 token-level log-prob 差值作为“推理调优增量”信号,再只在该增量与常规 OPD 方向一致时更新学生。 |
| 真正新意 | 新意不在 on-policy rollout、token reward 或 RL-style policy gradient 本身,而在把教师—base 的差分 (R^\Delta) 作为主导 reward,并用 centered advantage 与 sign-agreement gate 把它限制在不偏离教师分布的更新方向内。它与 ExOPD 同样使用 teacher-base,但不是对教师输出做外推。 |
| 关键结果 | 在 Qwen3 1.7B/4B/8B 的非思考与思考模式、Gemma4-E4B-it 上,作者报告 OPD2 大多优于 OPD 与 ExOPD。例如,Qwen3-8B 非思考数学平均分为 71.6,优于 ExOPD 的 67.8;Gemma4 数学平均分从原始 60.6 提升至 67.8。 |
| 可信度 | 中等。 跨模型、跨数学/代码/科学领域且含消融,证据覆盖面不错;但关键机制“delta 专门提取推理知识”主要由 token 词统计和人工构造错误例子支撑,缺少更直接的因果验证、方差报告和外部复现。 |
| 相关性 | 对 LLM 推理后训练、OPD、基于教师轨迹的 post-training 高相关;对 RLHF 的启发在于“奖励应隔离目标能力变化而非复制完整教师偏好”。对 Diffusion/VLM 没有直接实验,迁移只能视作待验证假设。 |
| 建议 | 精读(若在做 LLM on-policy post-training / 蒸馏)。最值得读的是 Eq. 5–9 的 reward 构造、Table 8 消融和 Gemma4 结果;若关注的是标准 RLHF、DPO 或 Diffusion RL,则应按需参考其“相对教师变化”的奖励设计思想。 |

Figure 1|第 2 页。 Figure 1: Comparison of On-Policy Distillation (OPD) and our OPD2. While conventional on-policy distillation trains students to follow the teacher’s outputs, our OPD2 utilizes the delta signal, the difference between the teacher and its base model, to focus on the knowledge of the learning trajectory required for reasoning capability. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。
2. 方法论拆解
2.1 问题与已有路线的缺口
作者针对的不是“怎样让学生模仿教师”这一一般蒸馏问题,而是更具体的问题:在学生自己的 rollout 轨迹上做 token-level 蒸馏时,如何使学习信号更聚焦于教师后训练获得的推理能力,同时避免把无关的先验偏好也当作目标。
理解 OPD2 所需的已有路线可压缩为四类:
-
Sequence-KD / 教师答案 SFT
学生直接学习教师生成的完整轨迹或答案。其问题是训练时的前缀来自教师、推理时却来自学生,存在 exposure bias;学生犯错后到达的状态未必被训练覆盖。 -
标准 OPD
对学生自己采样的 token,教师给出 dense token-level score。优点是监督落在学生真实访问的状态上;但其 reward 同时取决于教师和学生,奖励大小受二者校准、分布差和已有能力差异影响。 -
ExOPD
同样调用教师的 base checkpoint,但目标是以系数 (\lambda>1) 放大教师相对 base 的差异,从而让学生“超出教师”。OPD2 与它的共同前提是:教师的 base 模型可得,且该 base 是该教师后训练前的合理对照;差别在于 OPD2 不把外推后的教师分布当目标,而把 teacher-base 的差当学习信号。 -
RL / GRPO 式后训练实现框架
OPD2 沿用 on-policy、token reward 和 policy-gradient 风格训练,但不需要外部可验证 reward 或奖励模型。其有效性仍依赖 rollout、采样温度、奖励缩放、优势估计和优化稳定性。
作者的核心诊断是:常规 OPD 的 [ R_t^{\text{OPD}} = \log \pi^*(y_t\mid x,y_{<t})
- \log \pi_\theta(y_t\mid x,y_{<t}) ] 并不等价于“教师因推理后训练而新增的知识”。它把“教师偏好该 token”与“学生当前不偏好该 token”混在一起;若学生和教师的 log-prob 尺度或错误模式不同,某些错误推理 token 可能获得方向不理想的奖励。
这个诊断有合理性,但其强度不能高估:它说明标准 OPD reward 的确包含学生项,并不能自动证明教师—base 差分就是纯净或充分的“推理知识”。
2.2 核心机制与流程
OPD2 的训练流程可概括为:
- 对输入问题 (x),学生 (\pi_\theta) 生成自己的 rollout (y)。
- 在每个已采样位置 ((x,y_{<t})),前向计算:
- 推理微调后的教师 (\pi^*);
- 同一教师谱系、后训练前的 base 模型 (\pi_{\text{base}}^*);
- 学生 (\pi_\theta)。
- 计算教师相对 base 的 token-level 差分信号。
- 对差分信号和标准 OPD 信号分别做 expectation centering。
- 仅当二者 advantage 同号时,保留 delta advantage;否则将该 token 的 OPD2 reward 置零。
- 用保留下来的 reward 乘以学生已采样 token 的 (\nabla_\theta\log\pi_\theta) 更新参数。
最关键的三个公式如下。
(1) Delta signal:把“后训练造成的变化”显式化
[ R_t^\Delta = \log\pi^*(y_t\mid x,y_{<t})
\log\pi^*{\text{base}}(y_t\mid x,y{<t}) ]
- (\pi^*):指令/推理调优后的教师。
- (\pi^*_{\text{base}}):该教师的 base checkpoint。
- (y_t):学生在自身 rollout 中实际采样的 token。
- 角色:奖励那些在教师后训练后概率上升的 token,压制那些后训练后概率下降的 token。
- 必要假设:teacher 与 base 之间的主要差异可解释为目标推理调优,而非数据、tokenizer、架构、训练配方或其他能力变化;且二者 token 概率具备可比性。
这比“教师—学生”差分更像一个训练干预的对照:它固定教师谱系,只观察后训练前后变化。但它仍只是 checkpoint 差分,而不是对某一推理能力的严格因果归因。
(2) Centering:把 token reward 变成相对于学生当前分布的 advantage
[ A_t^\Delta = R_t^\Delta - \mathbb{E}{\tilde y_t\sim\pi\theta} \left[ \log \pi^*(\tilde y_t\mid x,y_{<t})
\log \pi^*{\text{base}}(\tilde y_t\mid x,y{<t}) \right] ]
论文同样对标准 OPD reward 构造 (A_t^{\text{OPD}})。实际实现中,期望只在学生分布 top-1024 token 上计算,以节省显存。
- 角色:移除对 action/token 不敏感的偏置,避免 delta reward 的整体均值或尺度直接驱动更新。
- 为什么需要:原始 (R^\Delta) 不含学生项;若直接最大化,理论上可能推向 token 概率的尖锐 one-hot 解,而不是在教师分布附近收敛。
- 风险:top-k 近似会改变真实期望;对长尾 token、不同模型规模及不同温度的偏差没有单独报告。
(3) Sign-agreement gate:以常规 OPD 约束 delta 更新
[ A_t^{\text{D2}} = \begin{cases} A_t^\Delta, & A_t^\Delta A_t^{\text{OPD}} > 0\ 0, & \text{otherwise} \end{cases} ]
最终使用 [ \nabla_\theta J_{\text{OPD2}}
\mathbb{E} \left[ \sum_t A_t^{\text{D2}} \nabla_\theta\log\pi_\theta(y_t\mid x,y_{<t}) \right]. ]
- 角色:只有当“delta 建议的更新方向”与“向教师靠近的标准 OPD 方向”一致时,才允许更新。
- 作者主张:这能避免学生只追逐 teacher-base 增量而偏离教师,并使 (\pi_\theta=\pi^*) 成为停止更新的点。
- 分析者判断:这是 OPD2 实用性最重要、也最保守的设计。它实际上把方法从“纯 delta distillation”变成“由 delta 决定幅度、由 OPD 决定许可方向的交集更新”。因此,报告中的提升不能简单归因于 delta 本身,也可能部分来自这项截断式正则化。
2.3 关键设计与创新判断
| 设计 | 解决什么 | 为什么可能有效 | 证据是否显示必要 | 创新判断 |
|---|---|---|---|---|
| teacher − base 的 (R^\Delta) | 常规 OPD 把教师偏好与学生能力差混合 | 同源 checkpoint 的差分能抵消部分预训练共性,突出后训练后被重加权的 token | 有中等支持。 Table 8 中把 delta 替换为 OPD signal 是性能下降最大的消融 | 该差分视角有明确方法新意;但“delta=推理知识”的语义解释仍是较强假设 |
| advantage centering | 原始 delta reward 不含学生项,可能缺乏合适收敛点 | 去除学生分布下的平均 reward,使更新关注相对优势 | 支持较弱且不一致。 消融有时不降、个别列甚至上升 | 是标准 policy-gradient / advantage 思路在此目标上的合理工程化 |
| sign-agreement condition | 防止 delta 驱动学生向教师不认同的方向漂移 | 只取两种信号同号的更新,形成保守约束 | 部分支持。 消融影响通常小于去掉 delta,但在不同模式/领域有波动 | 是很有价值的稳定性约束,不是全新范式 |
| 仅用学生 rollout 的 token 训练 | 处理训练—推理分布错位 | 学生会在自身错误前缀下获得教师/base 的局部比较 | 本文没有与 sequence-KD 或 off-policy KD 的直接同预算对照 | 是 OPD 框架固有特征,不属于 OPD2 新意 |
| 短期训练、最终 step 汇报 | 减少过训练,保持后训练效率 | 图 4 的文字说明称 OPD/ExOPD 早期达到峰值后可能回落,OPD2 保持更高 | 有轨迹图描述支持,但没有逐 run 方差、最优 checkpoint 比较 | 实验选择与工程策略,而非核心方法贡献 |
特别值得注意的是,Table 8 的消融并未形成一个在所有领域都严格单调的故事。以 Qwen3-1.7B 为例,去除 agreement condition 后,非思考数学为 55.8,高于 OPD2 的 54.6;去掉 centering 后,思考数学为 63.1,高于 OPD2 的 62.7。作者可以合理地说 delta 是最主要成分,但不能据此证明 condition 与 centering 在每个设置中都必不可少,或已达到最优组合。
2.4 可迁移的方法论
对当前 LLM / RLHF 方向,最可迁移的不是 OPD2 的完整公式,而是三项方法论原则:
-
把“目标能力变化”与“完整教师分布”分离。
若可获得严格同谱系的 pre/post checkpoints,可考虑以相对变化构造辅助训练信号。例如,对 reasoning、tool-use、格式服从等特定后训练阶段,比较教师后训练前后的 token preference。
前提是 checkpoint 差异清晰、tokenizer 完全一致、训练干预可追溯。风险是差分可能编码风格、拒答倾向、数据污染或训练配方变化,而不只是目标能力。 -
把能力导向信号放在安全约束之内。
OPD2 的 sign gate 表明:即使某一增量信号看似有意义,也未必应无条件优化。将其与保守 KL、教师一致性、验证 reward 或多目标约束相交,通常比单独放大更稳妥。
对 RLHF,可将“能力增益 reward”作为 advantage reweighting 或 gated auxiliary objective,而非替换偏好/安全目标。 -
优先审计 token reward 与正确性是否对齐。
作者用人工构造错误推理示例检查 reward 对错误 token 的方向,这个思想可迁移;但正式评估应升级为大规模、自动验证、保留真实 rollout 分布的 token-level attribution 审计,而不能只靠少数示例。
对 Diffusion 的迁移是概念性而非已证实的:可设想用 fine-tuned denoiser 与 base denoiser 的 score/noise-prediction 差分,突出某种偏好训练或编辑训练所带来的改变;但 diffusion 的时间步耦合、连续动作空间、classifier-free guidance 和质量/多样性权衡与自回归 token reward 显著不同,不能直接套用 Eq. 8。对 VLM,同样可尝试使用视觉语言后训练前后差分,但应单独处理视觉编码器是否变化、跨模态对齐退化和幻觉指标,本文没有直接证据。
3. 关键证据与实验审计
证据一:跨 Qwen3 模型规模、模式与领域的主结果
展示了什么 → 在 Qwen3 1.7B、4B、8B 上,作者比较原始模型、OPD、ExOPD 与 OPD2;评测覆盖 7 个数学、4 个代码、3 个科学基准,采用 pass@1 并按基准进行多次重复平均。
支持什么 → OPD2 在报告的 Qwen3 平均分中普遍最佳,并且在强基线的 thinking mode 下仍多数优于原模型和两种 OPD 基线。
仍不能证明什么 → 不能证明增益来自“推理知识的纯 delta 转移”,不能证明对未报告模型家族、自然语言任务、长上下文任务、对齐/安全任务或不同训练预算都成立。
最具代表性的结果有:
- Qwen3-8B 非思考数学:原始 46.9,OPD 65.9,ExOPD 67.8,OPD2 71.6。该结果说明在一个原始能力相对弱、可提升空间较大的模式中,OPD2 的最终平均分明显领先。
- Qwen3-8B 思考数学:原始 73.7,OPD 72.2,ExOPD 73.6,OPD2 75.9。这个设置更重要,因为标准 OPD 出现退化,OPD2 仍有 +2.2 分提升;至少表明其不是仅靠“弱学生蒸馏”获益。
- Qwen3-1.7B 思考代码:原始 29.3,OPD 32.4,ExOPD 37.1,OPD2 40.4。作者的主张在代码领域也有支持,且 OPD2 对小模型的提升较显著。
公平性与混杂因素:
- OPD、ExOPD、OPD2 使用相同的 student rollout、100 training steps、AdamW、学习率、温度、最大生成长度和 reward 缩放;这使方法间比较具备较好的内部可比性。
- 训练数据是 OpenMathReasoning、OpenScienceReasoning-2、OpenCodeReasoning 的问题,以 1:1:1 混合;论文说明丢弃了数据集自带 reasoning traces 与答案,并称每个问题最多使用一次。这样降低了直接拟合标注轨迹的可能性。
- 但论文未充分交代各方法实际看到的具体问题子集、随机种子、每个结果的标准差/置信区间、评测 prompt 与解码细节,也未报告训练数据与评测集之间的 contamination 审计。因此小幅差异,特别是 1–2 分的平均差,统计稳健性仍不足。
- 100 steps、少于约 30k 样本且不到一轮训练是有意设计的短后训练方案。它支持“短期有效”,但不支持“更长训练同样稳定”或“同等 token / GPU 预算下最优”。
证据二:Gemma4 的跨模型族结果,以及它暴露的边界
展示了什么 → 在 Gemma4-E4B-it 的 thinking 设置中,OPD2 数学平均分为 67.8,高于原始 60.6、OPD 58.9、ExOPD 65.3;科学平均分为 48.8,高于原始 47.0。
支持什么 → OPD2 的收益不完全局限于 Qwen3;在另一教师—base 谱系中,它至少能显著改善数学,并比普通 OPD 更能保住能力。
仍不能证明什么 → 不能证明跨架构、跨 tokenizer 或广泛跨模型族的普适泛化;Gemma4 只提供单个 E4B 学生、单个教师对和思考模式。
Gemma4 同时是论文最重要的反例证据:
- Gemma4 代码平均分:原始 55.2,OPD 36.9,ExOPD 45.1,OPD2 49.5。OPD2 虽优于其他蒸馏方法,却仍低于不训练的原始模型 5.7 分。
- 这直接削弱了“OPD2 能在不牺牲整体能力的情况下提高强推理模型”的强表述。更严谨的结论应是:OPD2 在该设置中显著缓解了常规 OPD 的灾难性退化,但没有保证所有领域非退化。
- 作者将其解释为 Gemma4 原始 coding 能力已很强。这是合理假说,但现有实验无法区分:是 ceiling effect、训练数据的域失配、teacher/base 差分在代码上不合适、奖励门控不足,还是评测噪声造成。
证据三:Table 8 消融与 reward 机制分析
展示了什么 → 用标准 OPD advantage 替换 delta advantage,会使 Qwen3-1.7B 六个“模式×领域”汇总结果均下降;去掉 condition 或 centering 的影响较小且不一致。
支持什么 → 在作者选择的该模型、训练时长和数据配比下,delta signal 是 OPD2 性能差异的主要贡献项。
仍不能证明什么 → 不能证明 delta 具有作者赋予的语义解释,也不能证明 sign gate 和 centering 的理论必要性、最佳性或跨规模稳定性。
具体而言,OPD2 在非思考的数学/代码/科学为 54.6/29.4/38.8;将 (A^\Delta) 换为 (A^{\text{OPD}}) 后变为 50.5/22.5/35.9。思考模式则从 62.7/40.4/43.5 降至 57.4/32.1/41.3。代码降幅最大,说明该信号对该实验环境中的 code reasoning 可能尤其关键。
但消融设计有三个限制:
- “No delta signal” 本质上把方法替换成基于 (A^{\text{OPD}}) 的版本,改变了核心 reward;它证明 delta 与结果相关,不隔离“teacher-base 对照”与“具体 reward 公式”的各自贡献。
- 没有报告仅使用 (A^\Delta) 且采用其他稳定化策略、或用连续权重代替硬门控的更完整对照,因此难以判断 Eq. 8 是否为最有效的组合。
- 消融只在一个 Qwen3-1.7B 配置上报告。考虑到 Gemma4 代码退化,最需要的恰恰是跨模型族、强模型和不同 domain mix 的消融。
关于 Figure 2–3,文本与图注报告 delta 更强调 hence、however、instead 等连接词,并在三条人工构造的错误推理中更一致地压低错误部分。它们提供了解释性线索,不是机制定论:词汇类别与真实推理质量并非一一对应;少量固定、由外部 LLM 生成再人工整理的错误轨迹,也不代表真实学生 rollout 上的错误分布。尤其不能在未直接查看图像颜色或 token 标注几何的前提下,把图的视觉呈现描述为额外证据。
4. 批判性判断与复用建议
4.1 证据强度
总体判断:中等。
被直接支持较好的结论:
- 在作者报告的短期 on-policy distillation 设置中,OPD2 在多数 Qwen3 数学、代码、科学平均指标上优于 OPD 和 ExOPD。
- OPD2 在 Gemma4 数学与科学上优于本文比较方法,且在 Gemma4 代码上比 OPD、ExOPD 更少退化。
- delta signal 的替换是作者所报告消融中影响最大的一项。
- 方法有明确额外开销:相对 OPD 的 wall-clock time,在 Qwen3 上约增加 24–28%,Gemma4-E4B 上增加 8%;其成本与 ExOPD 接近。
仅与结果一致、但尚未被证明的结论:
- teacher—base delta 专门代表或主要代表“推理调优知识”。
- delta 对错误推理 token 的 reward 对齐比 OPD 更可靠,且这种局部对齐就是基准提升的原因。
- sign agreement 是保证不损伤教师一致性或维持收敛点的充分机制。
- OPD2 可以普遍避免强模型后训练时的能力损失。Gemma4 代码结果已表明这不成立为无条件命题。
- 方法可自然推广至 VLM、Diffusion 或标准 RLHF。论文没有这些任务的实证。
4.2 主要局限与失败条件
-
“差分即推理知识”的归因过强
teacher 与 base 的差分包含整个后训练过程造成的全部变化:指令跟随、格式偏好、拒答、风格、数据混合及潜在的能力遗忘,不只包含推理。
影响:机制解释与泛化。 即使指标提升,仍不能确认模型学到的是作者定义的“reasoning trajectory”。 -
需要可得、可比且高质量的 teacher-base 配对
OPD2 需要教师的 base checkpoint;实际闭源教师或多阶段、持续预训练、架构变化的模型往往不具备这一条件。若 base 和 teacher tokenizer、训练语料、架构或对齐阶段差异复杂,log-prob 差的含义会变弱。
影响:工程可用性与可复现性。 -
Gemma4 代码能力仍明显退化
OPD2 并非能力保持的保证器:55.2 降至 49.5。
影响:部署与泛化。 在多能力模型上,平均分提升可能掩盖关键能力下降;实际应用需要 domain-specific retention gate,而非只看总体均值。 -
统计报告不足,难评估小增益的可靠性
论文说明 benchmark 分数按多次 repetition 平均,但未报告方差、置信区间、种子数、显著性检验或每次训练的波动。
影响:证据强度与可复现性。 尤其在某些思考模式下差距仅约 1–2 分时,难判断是否稳定。 -
机制验证依赖小规模语言表面证据
word cloud、词频 shift 与三条人工整理的错误示例只能说明模型打分行为存在差异,不能验证语义正确性、长链推理因果性或对抗性错误下的表现。
影响:机制解释。 reward 更喜欢逻辑连接词,不等于更会推理;压制“perhaps”等词也可能意外压低合理的不确定性表达。
4.3 最有价值的下一步验证
-
在真实 rollout 上做 token-level correctness calibration 审计
要验证:在可自动验证的数学/代码任务中,(R^\Delta)、(A^\Delta)、(A^{\text{OPD}}) 与“该 token/步骤是否导致最终可验证正确解”的相关性和校准度。
为何重要:这将直接检验作者的机制主张,而不只是观察最终 pass@1。
会改变判断的结果:若 delta 在真实错误步骤上系统更能给出负向更新、且优势在多模型中稳定,机制可信度会上升;若只有表面词类差异而与可验证正确性无关,则应把 OPD2 视为经验性 reward reweighting。 -
做能力保持矩阵与 Pareto 前沿,而非只报领域均分
要验证:在训练目标域外评估通用知识、指令跟随、安全、长上下文、代码与多语言,并绘制“目标推理增益—原能力损失—计算成本”前沿。
为何重要:Gemma4 代码退化说明最终平均分不足以支持部署判断。
会改变判断的结果:若 OPD2 可在多数非目标能力上维持或改善,才可支持其“稳健 post-training”定位;若频繁出现隐性回退,则应只把它作为窄域专项训练方法。 -
跨训练阶段与替代对照的因果消融
要验证:比较 base、仅 SFT 后 checkpoint、RL 后 checkpoint、不同 instruction-tuning 阶段,以及纯 delta、连续 gate、KL gate、ExOPD 等多种约束。
为何重要:可区分“任何相对 checkpoint 差分都有效”与“特定 reasoning-tuning delta 有效”。
会改变判断的结果:如果收益只在精确匹配的 reasoning 后训练阶段出现,论文的语义解释更可信;若任意差分或简单正则都可获得相近收益,则真正贡献更可能是通用稳定化技巧。
4.4 最终复用结论
- 值得借鉴: 使用同一模型谱系的 pre/post checkpoint 差分,显式构造“目标训练阶段新增偏好”的辅助信号;这比无差别蒸馏完整教师分布更有针对性。
- 值得借鉴: 不把能力导向 reward 单独放大,而让它受教师一致性、KL、验证 reward 或 sign agreement 等保守约束控制。
- 不要照搬: 不应默认 teacher-base 差分就是“推理知识”,也不应因为它在数学 pass@1 上提升就忽略代码、通识、安全或风格能力回退。
- 适合场景: 有开源且版本关系明确的 teacher/base 对、目标是短周期推理蒸馏、并能够部署多域回归评测的 LLM 后训练项目。
- 路线建议: 建议将 OPD2 纳入 LLM on-policy distillation 的候选基线与设计库,而非直接作为默认训练配方;对 RLHF、VLM 和 Diffusion,应先把“相对后训练变化 + 受限更新”的原则做小规模消融验证。
5. 必要概念与文献地图
必要概念
- On-Policy Distillation(OPD):学生在自己的生成前缀上采样,教师对已采样 token 提供 dense 监督;重点是让训练覆盖学生真实会进入的状态。
- Knowledge Distillation(KD):通过模仿教师的输出分布或生成序列训练学生。传统 KD 更常直接最小化教师与学生分布间的交叉熵或 KL。
- Exposure Bias:训练时依赖正确/教师前缀,推理时依赖自身前缀造成的分布错位;OPD 试图在学生自身轨迹上缓解此问题。
- Teacher-base 差分:比较同一教师后训练前后对 token 的 log 概率,用于表征该训练阶段对预测偏好的改变。
- Token-level reward / advantage:对每个实际采样 token 给更新权重;advantage 是相对当前策略期望回报的偏差,可移除不影响 action 选择的常数偏置。
- Sign agreement gate:只有两个训练信号的方向一致时才更新。OPD2 用它避免 delta 信号把学生推向与常规教师蒸馏冲突的方向。
- Pass@1:单次生成的成功率;论文以多次独立重复的 pass@1 均值评估多个基准,不是 best-of-k。
- 能力保持(capability retention):后训练不仅要提升目标任务,也要防止原有强项退化;Gemma4 代码结果说明这是 OPD2 的实际风险点。
关键前作
-
Hinton, Vinyals, Dean (2015), Distilling the Knowledge in a Neural Network
经典知识蒸馏框架;OPD2 的教师—学生概率比较建立在这一蒸馏思想上,但将其放到学生自身 rollout 与 token-level reward 中。 -
Agarwal et al. (2024), On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
OPD 的核心代表工作,提出在学生自生成轨迹上从教师获得监督;本文的直接方法基础。 -
Yang et al. (2026), Learning Beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation(ExOPD)
与本文最接近:同样使用 teacher-base,但通过外推教师信号推动学生超越教师;OPD2 则把 teacher-base 差分作为主 reward,并用 agreement condition 约束更新。 -
Qwen Team (2025), Qwen3 Technical Report
本文 Qwen3 实验模型与 reasoning 后训练语境的来源,也是其非思考/思考模式划分的基础。 -
Gemma Team (2026), Gemma 4 Technical Report
本文用于检验跨模型族有效性的第二个模型家族来源;Gemma4 的代码退化也是评估 OPD2 泛化边界的关键证据。