Pass the Baton: Trajectory-Relayed On-Policy Distillation

论文元数据


论文标题:Pass the Baton:轨迹接力式在线策略蒸馏(Trajectory-Relayed On-Policy Distillation)

阅读范围与证据边界

  • 本解读的唯一输入是该论文 PDF 的全文文本提取结果(含可提取的正文、公式、表格文字、图注与附录文本);这是一次文本回退(text fallback)输入,并非对原始 PDF 的直接视觉审阅。
  • 下文明确区分:作者主张指论文的解释与结论;论文直接证据指文中报告的实验设置、数值、消融和案例;分析者判断则是基于这些材料对因果、泛化与复用价值的审计,不应被视为作者已证明的事实。
  • 我没有直接检查 PDF 页面布局、颜色、曲线几何、视觉空间关系,或文本提取与图注中未保留的图/表细节。因此不会据此声称“从图中看出”趋势,也不会补造不可得的子图、置信区间、误差条、表格格式或视觉证据。
  • 可见材料覆盖主文、附录 A–F、算法和主要结果表;但没有独立复现实验、原始日志、逐样本结果、随机种子重复、统计显著性检验或外部基准复核。因此,性能差异可作为论文报告的直接结果,但不足以单独确证方法机制、稳健性或广泛可迁移性。
  • 论文聚焦 Qwen3-4B 教师向 Qwen3 0.6B/1.7B 非思考学生的数学推理蒸馏;对通用 LLM、不同模型族、代码、代理或真实生产环境的结论,均应视为尚未验证。

1. 一页速览:值不值得看

项目判断
问题在线策略蒸馏(OPD)让学生在自身访问到的前缀上获得教师 token 级监督,但学生若早期走偏,后续会形成很长的错误推理续写。作者称其为“前缀失败(prefix failure)”:这些状态既消耗训练 token,也可能给出低价值甚至误导性的蒸馏信号。这个问题对小模型数学推理蒸馏有现实意义。
一句话方法Relay-OPD 用“教师最想输出反思/转向词、而学生 top- 候选中没有反思词”的无标签条件定位接力点;教师短暂接管并写出有限段落来纠偏,再交还学生继续生成,随后在混合的 relay trajectory 上做逆 KL 风格的在线蒸馏。
真正新意最有价值的创新不是“教师与学生交替生成”本身,而是把方向性分歧具体化为可在线计算的 handoff trigger,并配合有限 接力预算,试图只在早期、局部、疑似走偏的位置注入教师上下文。单引擎 speculative decoding 是高质量工程实现,但不是核心学习原理。
关键结果在 1.7B 学生、8 个数学基准上,作者报告 Relay-OPD 平均准确率为 46.96,较 OPD 的 41.23 高 5.73 个百分点,较 FastOPD 的 45.47 高 1.49 个百分点;平均训练轨迹长度为 2,296 token,较 OPD 的 4,658 少 50.7%。0.6B 上为 31.04,对 OPD 的 28.03 提升 3.01 个百分点,训练长度下降 63.9%。
可信度中等。 同一教师—学生体系、两种学生尺度、八个数学测评、关键预算/目标消融共同支持“在该设定中有效”;但方法的触发信号依赖人工指定反思 token,缺乏跨模型族、跨任务和多随机种子统计,也没有直接证明触发点等价于真实推理失败。
相关性LLM 后训练、OPD、强到弱推理蒸馏直接相关;对 RLHF 的启发主要在于“基于状态的局部干预、而非均匀奖励/截断”。对 Diffusion 与 VLM 没有直接实证,但“早期错误会劫持后续轨迹”的诊断可迁移为研究问题。
建议精读。 若正在做 reasoning distillation、trajectory intervention 或 token-level policy optimization,值得读方法与消融;若目标是通用 RLHF、Diffusion 或 VLM,则应把它作为一个具有启发性的 LLM 数学推理案例,而非可直接套用的通法。

Figure 1|第 1 页

Figure 1|第 1 页。 Figure 1: (a) A Relay-OPD case: at the detected handoff trigger, the teacher prefers the reflection token (But, 74.4%) while the student would continue along the current direction (So, 50.6%); a brief teacher leg corrects the reasoning and the student resumes to the correct answer. (b) Difference between OPD and Relay-OPD. (c) Overall performance. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。

2. 方法论拆解

2.1 问题与已有路线的缺口

标准 OPD 的优点是监督位于学生实际访问的前缀分布上,而不是纯教师离线轨迹上。论文采用的单样本逆 KL 优势为:

其中 是学生前缀, 是生成轨迹时冻结的旧学生策略, 是教师策略。若教师在该前缀上比旧学生更偏好已采样 token ,则优势为正,训练会提高当前学生对该 token 的概率。

作者要修补的失败点是:OPD 的“在学生分布上监督”也意味着它会进入学生已偏离正确方向的长前缀。此时,后续 token 即便仍被教师打分,也未必构成有效的、可恢复的学习轨迹。论文并没有把“低教师概率”直接当作错误标记,而是关心一个更窄的问题:教师是否倾向于立即反思和改向,而学生是否仍倾向于沿原方向续写

理解本文所需的既有路线可压缩为四类:

  1. 固定长度截断:ESR / FastOPD。 通过提前截断训练轨迹,舍弃后段 token。其优点是简单且节省计算;局限是截断位置不依赖实际推理状态,也不提供“如何从错误前缀恢复”的示范。
  2. 离线轨迹重写:TRD。 学生先生成完整解答,教师事后在重写提示下修订。论文的批评是教师重写时拥有原始学生轨迹,而训练/推理时学生不拥有该额外上下文,且重写文本可能留下“经复审后修订”式痕迹。
  3. token 级混合:SKD。 依据教师—学生分布的一般一致性,接受或替换学生 token。Relay-OPD 的差异是:它只在特定“反思 vs. 延续”的方向性不一致处切换,而非把任意分布差异都视为接管理由。
  4. 教师离线数据上的 SFT/KD。 这些路线主要绕开学生错误轨迹,但牺牲了对学生自身状态分布的贴合;本文试图保留 on-policy 性质,同时局部修正最有害的前缀。

分析者判断: 论文的关键假设并非“教师与学生分布不同”——这在强弱模型间很常见——而是“教师首选反思 token、学生 top- 中没有反思 token”是有用的错误方向代理变量。这个代理变量非常具体、成本低,但语义覆盖较窄:许多错误推理不会以 ButWaitHowever 等词触发,许多正确推理也可能使用这些词进行正常自检。

2.2 核心机制与流程

触发器:以反思 token 捕捉“教师想转向、学生想延续”

是反思 token 集合。论文附录列出的基础词包括 WaitButHmmActuallyHoldHoweverYetOhAlternativelyNoAhOopsWell,并包含大小写及前导空格变体。

对当前前缀 ,教师最可能的下一个 token 为:

学生旧策略的 top- 支持集为:

接力触发条件为:

它的含义是:教师最想先说一个反思/纠偏词,而学生的前 个候选甚至没有任何反思词。 实际上控制触发敏感度:较小 更容易判定学生“没有反思意图”,较大 则更保守。

作者将这一条件称为无需答案标签、过程标签、验证器或奖励模型的 handoff trigger。这里应保持严格:论文直接证据证明该条件可被计算、并在给出的数学实验中与性能提升相关;它并未证明每个触发位置都是真实错误,也未证明未触发的位置就不存在错误。

Relay trajectory:教师局部接棒,学生继续

Relay-OPD 的预算为

  • :一条轨迹最多触发多少次教师接管;
  • :每次教师接管后,额外生成多少个段落;
  • 反思起始 token 本身计入教师腿(teacher leg);
  • 段落以 \n\n 划分,而不是使用固定 token 数。作者报告其设定中的平均段落长度约为 23.2 token。

生成从学生腿开始。若 且尚未耗尽 ,教师先强制写入 ,再补足 段教师文本;随后,若预算仍有余量,学生从新前缀恢复生成。若第 次教师腿结束,当前 rollout 立即终止。于是得到含学生 token 与教师 token 的 relay trajectory

这一设计含有两个相互制衡的目标:

  • 尽早用教师的局部纠偏阻断错误前缀的自回归放大;
  • 控制教师腿数量和长度,避免训练轨迹过度漂移为教师分布,从而失去 OPD 对学生状态分布的优势。

作者的预实验支持“局部、早期”的设计:在 128 个 DAPO-Math-17K 英文样本上,仅替换触发点处的一个反思 token(报告的教师 token 占比为 0.35%)时,mean@4 从 27.73 提升到 34.96;固定教师接管长度 时,推迟到更晚的有效触发点会使准确率从 41.99 降到 33.98、再降到 29.49。它支持干预时机重要,但样本量和设置均较窄,不能独立确证一般性的因果规律。

优化目标:在真实生成的 relay token 上做逆 KL 风格更新

对 relay 前缀 ,作者定义:

并用当前学生相对旧学生的概率比:

最终优化 PPO 式裁剪目标:

变量 是轨迹中实际生成出的 token:它可以来自学生腿,也可以来自教师腿。作者的选择意味着教师腿不只是“给后续学生续写提供更好上下文”,其 token 本身也直接参与学生更新。

这里的必要假设是:在被教师短暂修正后的前缀上,教师对实际 relay token 的偏好差可构成有效训练信号。论文以消融支持“使用实际 relay token 优于用学生草稿 token 或教师前向 KL 分布拟合”,但不能据此证明逆 KL 的 mode-seeking 性就是唯一机制;多个目标之间也同时改变了 token 来源、目标形式与潜在的优化动态。

单引擎实现:把状态切换嵌入 speculative decoding

工程上,学生充当 draft model,教师充当 target model。学生腿中目标策略等于旧学生策略,因此草稿必然接受;教师腿中则按标准 speculative sampling 接受或拒绝学生草稿。教师腿首个 token 是 handoff trigger 中的 ,直接输出而不做验证。

作者主张是这种实现与两个独立生成管线的 relay 过程在分布上等价,并可复用教师验证时得到的 logits 来计算教师 argmax 与触发器,因而没有额外触发计算成本。
分析者判断: “无额外 logits 成本”不等于“无系统成本”。真实吞吐还会受块内状态转换、被丢弃的学生草稿、KV cache、不同模型并行部署、触发频率与实现细节影响。文本中没有提供 wall-clock 吞吐、显存、每 token 成本或端到端训练时间对比,不能把轨迹更短直接等价为训练更快。

2.3 关键设计与创新判断

  1. 方向性 trigger 而非泛化分布差异

    • 解决什么:避免 SKD 那种“教师也接受学生延续 token,因此错误模式持续”的情况。
    • 为什么可能有效:反思词可作为明显的语言行为标记,捕捉教师准备中断当前链条的瞬间。
    • 必要性证据: 的平均准确率为 46.96,高于 的 44.27、 的 43.14,以及等价于不选择性干预的 / OPD 的 41.23。
    • 创新判断:是本文最明确的方法创新;但它是一个启发式、语言与 tokenizer 相关的代理信号,不是通用错误检测器。
  2. 有限 relay budget

    • 解决什么:避免教师持续接管导致轨迹脱离学生政策,同时把纠偏资源放在早期。
    • 为什么可能有效:错误前缀越长,教师也更受错误上下文约束;过多教师 token 则削弱 on-policy 属性。
    • 必要性证据:在 1.7B 实验中, 的平均准确率分别为 44.31、45.56、45.81、46.96、47.10、46.47; 分别为 46.25、46.96、45.94、44.01。
    • 创新判断:将早停和教师纠偏整合为状态驱动预算控制,设计合理;不过 略高于默认 ,说明默认选择不是该组实验中的唯一最优点。
  3. 教师腿后的学生恢复生成

    • 解决什么:把教师纠偏转化为学生在修正后上下文中的继续推理,而非把整条解答交给教师。
    • 为什么可能有效:学生需要学习“被纠正后如何继续”,而不是只学习教师独立解答。
    • 必要性证据:在均设 的消融中,Trigger-Stop 的平均分为 43.48,带 教师腿的 Relay-OPD 为 46.25,差 2.77 点。
    • 创新判断:该消融较直接地支持教师腿优于动态截断;但它同时改变“是否提供教师 token”和“轨迹上下文”,无法细分是反思 token、解释内容、后续前缀,还是长度差异贡献最大。
  4. 在实际 relay token 上优化

    • 解决什么:避免把教师腿位置的训练统一变成教师全分布拟合,保留对已发生纠偏轨迹的 token-level 信号。
    • 为什么可能有效:作者认为单样本逆 KL 更有选择性,能强调教师在失败前缀上的纠正 token。
    • 必要性证据:主配置的 Relay Token 目标为 46.96,学生草稿 token 版本为 44.56,教师 top-128 前向 KL 版本为 44.08。
    • 创新判断:实验证据支持该目标组合在当前设置下更好,但“mode-seeking 因而选择性吸收正确信号”的机制解释仍是作者推断,尚缺逐 token 梯度、错误类型或校准分析。

2.4 可迁移的方法论

对用户关注方向,最可迁移的不是反思词表本身,而是下面四个抽象原则:

  • 把轨迹干预建立在状态变化信号上。 对 LLM/RLHF,可把“教师想改向、学生未意识到”的可观测冲突扩展为 verifier 分歧、过程奖励突变、工具执行失败、答案约束违例或多样本分支不一致。前提是信号能在生成中低成本获得;风险是触发器错误会制造不必要的教师依赖。
  • 将教师干预限制为局部且可预算的恢复片段。 这比全轨迹重写更接近“从错误状态回到可学习状态”的问题设定。对长 CoT、带工具轨迹或层级规划均有启发;但应验证介入后状态是否真的回到学生能自主延续的分布。
  • 评估“质量—轨迹长度—教师占比”的联合前沿。 论文把准确率与训练/推理长度一起报告,这是值得保留的实验范式。迁移时还应增加 wall-clock、教师调用次数、显存、失败触发率及外部验证成本。
  • 对 Diffusion/VLM 的迁移属于研究假设,而非现成方案。 Diffusion 没有自然的“下一个反思词”;若要类比,需要定义反映生成方向偏移的状态信号,例如中间 latent 评估、条件一致性或多模态 critic 分歧。VLM 可尝试用视觉 grounding 失败、区域—文本不一致或工具验证失败作 trigger,但本文没有任何相关实验支持。

3. 关键证据与实验审计

证据一:主结果——在两种学生规模、八个数学基准上的性能与长度

展示了什么 → 使用 Qwen3-4B-Instruct-2507 教师、Qwen3-0.6B/1.7B-Non-Thinking 学生,训练数据为 DAPO-Math-17K 英文子集;评测 AIME 2024/2025/2026、MATH500、AMC 2023、OlympiadBench、HMMT Feb 2026、HMMT Nov 2025。1.7B 的 Relay-OPD 平均准确率为 46.96,OPD 为 41.23,FastOPD 为 45.47;训练轨迹平均长度分别为 2,296、4,658、2,709 token。
支持什么 → 在作者的模型、数据、训练预算和评测协议下,Relay-OPD 同时优于标准 OPD 与选出的最优 FastOPD 截断配置,并且对应更短训练轨迹。八个基准上均至少达到第二名,说明结果不是单一 benchmark 的偶然收益。
仍不能证明什么 → 不能证明它普遍优于所有 trajectory intervention 方法,也不能证明提速比例、泛化性或机制解释适用于其他教师—学生差距、模型家族、数据规模和非数学任务。

实验协议的可比性有若干积极点:在线蒸馏方法均为 1 epoch、最大响应 16,384 token、温度 1.0、top-$p=1.0;FastOPD 比较了 1,024 至 8,192 的截断长度,并报告其中最强的 4,096;评测采样预算也明确给出——AIME、AMC、HMMT 每题 32 次,MATH500 与 OlympiadBench 每题 4 次。

但公平性仍有限:

  • 最佳 checkpoint 选择可能引入选择偏差。 表中每种方法报告不同 step 的最佳 checkpoint,例如 1.7B Relay-OPD 为 step 35、OPD 为 step 55、FastOPD 为 step 45。若未说明验证集选择、搜索次数及相同 checkpoint 选择机制,最终分数可能含有不同程度的调参收益。
  • GRPO 的比较不能直接等价。 附录表明 GRPO 每 prompt rollout 数为 8,而在线蒸馏方法为 1;即便训练 epoch、GPU 数相同,其有效采样量与优化信号不同。因此 Relay-OPD 对 GRPO 的优势或劣势不宜作纯算法比较。
  • 训练长度不是完整成本账。 作者报告 token 长度减少,但未报告教师验证、触发检测、草稿拒绝和调度带来的实际耗时与硬件成本。它有力支持“生成 token 更少”,并不足以直接支持“端到端训练成本更低同等比例”。
  • 数学基准污染与时间问题未被审计。 AIME 2026、HMMT 2026 等较新数据降低了一部分历史训练污染担忧,但论文没有提供教师/学生训练语料排除、泄漏测试或 benchmark contamination 审计。

证据二:教师腿与训练目标消融

展示了什么 → 在 1.7B 学生上,固定 时,Trigger-Stop 的平均准确率为 43.48,带 教师腿的 Relay-OPD 为 46.25;完整配置的实际 relay token 目标为 46.96,高于 Student Draft Token 的 44.56 和 Teacher FKL(top-)的 44.08。
支持什么 → 在当前实验配置中,动态触发后加入一小段教师纠偏,优于仅在触发时停止;在教师腿位置直接基于实际生成 relay token 做逆 KL 风格更新,也优于文中实现的两种替代目标。
仍不能证明什么 → 不能隔离“教师腿长度”“教师起始反思 token”“修正内容”“终止条件”和“教师 token 被直接优化”各自的边际作用;也不能证明教师 FKL 的较差表现来自其 mode-covering 属性,而非 top-、优化稳定性、学习率或实现细节。

这一组证据是全文最有价值的机制验证之一,因为 Trigger-Stop 对照排除了“任何动态早停都足够”的简单解释。仍有两个缺口:

  1. 没有给出随机种子方差、置信区间或逐题配对统计,2.77 点和 2.40–2.88 点目标差距是否稳定,现有信息不足以判断。
  2. “Student Draft Token”与“Relay Token”不仅目标 token 不同,训练中所依赖的上下文、采样/替换事件与梯度分布也可能不同,因此该消融是有信息量的系统级比较,而非纯粹的损失函数因果辨识。

证据三:触发敏感度与早期局部干预论据

展示了什么 → 对 1.7B, 的平均准确率分别为 44.27、46.96、43.14、41.23; 降至 44.01,较 的 46.96 更低。预实验还报告:单反思 token 替换时教师 token 比例仅 0.35%,准确率由 27.73 升至 34.96;推迟固定 的接管会降低准确率。
支持什么 → 选择性触发和有限接力预算在该设置中优于不加选择地回到 OPD,也优于更频繁或更长的教师接管;“适度干预”比无限扩张教师腿更符合结果。
仍不能证明什么 → 不能证明 是普适阈值,也不能证明触发器检测的是前缀失败本身而非某个恰好与数学解题风格有关的语言模式;预实验的 128 样本结果尤其不应外推为稳定定律。

作者报告训练过程中教师 token 比例约从 13% 快速下降,并在约 20 steps 后稳定在 2%–3%;预算耗尽轨迹比例也从约 75%–85% 下降至约 50%–60%。这与“学生逐渐少犯需要接管的前缀错误”一致,但不是直接证明:同样可能来自学生风格变化、反思词频率变化、触发器阈值与分布漂移,或预算相关的选择效应。

关于失败模式,附录给出一个有解释力但只能算案例级的证据:学生在水果题中把“15 个苹果后余 5 RM”错误地与“再买 1 芒果和 1 木瓜,需 9 RM”兼容,仍沿 So 继续;教师首选 But,随后指出预算矛盾,学生恢复并得到正确答案 15。该案例支持机制的可理解性,不构成触发准确率、召回率或总体因果证据。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

被较直接支持的结论:

  • 在指定 Qwen3 强弱模型对、DAPO-Math-17K 英文训练集、八个数学推理基准和作者实现下,Relay-OPD 的主结果优于 OPD 与所选 FastOPD 配置。
  • 该配置的训练轨迹 token 长度低于 OPD,并且在文中选取的三个测试集上,推理响应长度低于 FastOPD:AIME 2025 为 14.9k 对 18.1k,AIME 2026 为 15.6k 对 18.2k,HMMT Feb 2026 为 14.9k 对 20.8k。
  • 教师腿与实际 relay-token 优化在对应消融中具有额外收益,且过大预算不利。

仅“与实验结果一致”、尚未被直接证明的结论:

  • 触发器准确检测了真实的“推理方向失败”。
  • 教师接管能因果地减少错误监督,而不是仅通过改变 token 分布、缩短轨迹或改变有效训练难度来获益。
  • 反思词方向分歧优于更一般的模型不确定性、KL 分歧、verifier、过程奖励或答案约束等触发器。
  • speculative decoding 单引擎在实际训练集群上确实带来端到端吞吐或成本优势。
  • Relay-OPD 能推广到代码、工具调用、通用对话、VLM、Diffusion,或教师—学生能力差较小的设定。

4.2 主要局限与失败条件

  1. 触发器语义窄且 tokenizer/语言依赖强。
    反思词表是人工指定的英语词及其格式变体。它影响泛化与可复现性:不同语言、模板、推理风格、tokenizer 或模型若不以显性“Wait/But”表达纠错,触发器可能漏检;反过来,正常自检也可能被误触发。

  2. “方向分歧 = 错误前缀”没有直接标注验证。
    论文没有报告触发点相对人工过程标注、答案验证、外部 verifier 或反事实分支搜索的 precision/recall。它影响机制解释:性能提升不能自动证明检测到了“错误”,可能只是检测到一种有利于教师插入的文体模式。

  3. 实验域高度集中于数学与单一 Qwen3 系列。
    教师固定为 Qwen3-4B-Instruct-2507,学生是 0.6B 和 1.7B Non-Thinking,训练数据是 DAPO-Math-17K 英文子集。它影响泛化:不同能力差、不同对齐方式、不同语言或开放式任务可能没有相同的教师—学生 continuation asymmetry。论文自己也承认,教师优势缩小时收益预计会降低。

  4. 训练效率论证不完整。
    轨迹长度减少是明确结果,但没有端到端吞吐、GPU-hours、teacher forward 次数、显存、通信开销或 cost-per-quality 指标。它影响效率与工程部署:短轨迹可能被更频繁的教师计算、状态切换或 speculative rejection 抵消。

  5. 统计与复现证据不足。
    文本中没有多种子方差、显著性检验、训练稳定性曲线的数值导出、完整 checkpoint 选择流程,亦没有独立复现。它影响结果可信度:特别是 0.62–1.49 点级别的相对 baseline 差异,现有信息不足以判断其稳健程度。

4.3 最有价值的下一步验证

  1. 验证触发器到底检测到了什么。
    对大量触发与未触发前缀,用答案验证、人工过程标注或受控反事实续写标记“已走偏、仍可恢复、正确但自检、错误但未触发”等类别;报告 precision、recall、校准与不同错误类型的覆盖。若触发器对真实错误的精度低、或大量关键错误未触发,将显著削弱“状态驱动纠偏”的核心解释。

  2. 做跨模型、跨语言、跨任务的受控泛化。
    至少覆盖不同模型族、不同教师—学生能力差、非英语数学、代码/工具轨迹与开放式推理;比较固定词表、自动诱导 token 集、logit margin、verifier 信号和过程奖励信号。若只有当前 Qwen3 数学对有效,则应将方法定位为专用 heuristics,而非通用 OPD 机制。

  3. 报告完整的质量—成本前沿。
    在相同质量目标或相同 GPU-hour 下,报告端到端训练时间、吞吐、教师调用量、显存、token 接受/拒绝率、触发频率与多随机种子误差。若 Relay-OPD 的 token 节省不能转换为真实成本收益,工程贡献需重新定价;若仍保持优势,其实用价值将显著增强。

4.4 最终复用结论

  • 最值得借鉴: 将 trajectory intervention 从“固定位置截断”改为“由当前状态触发的局部恢复”,并将教师干预限制为有明确预算的短片段。这一结构适合探索长推理轨迹中错误会累积、但全程教师接管过贵的场景。
  • 可直接复用的实验范式: 同时报告质量、训练轨迹长度、推理长度、教师 token 比例、预算耗尽率与触发频率;仅比较最终准确率不足以判断这类方法是否值得部署。
  • 不要照搬: 不应未经验证把英文反思词表 或默认 移植到其他模型/任务。它们是本文实验中的有效超参数,不是理论常数。
  • 对 RLHF/后训练路线的建议: 可纳入“状态条件化教师干预”候选路线,但先做小规模 trigger quality audit,再与 verifier/PRM/奖励分歧触发器进行公平比较;不宜直接替代现有可靠奖励或验证机制。
  • 对 Diffusion/VLM 的建议: 暂不建议直接采用。应先定义与“反思—续写分歧”功能等价的中间状态诊断信号,并验证局部纠正后的状态是否仍由学生模型可控。
  • 最终结论: 值得纳入 LLM 推理蒸馏的后续技术路线,定位为一个有清晰工程可实现性、初步实证扎实、但触发机制仍需严格验证的 trajectory-repair 方法。

5. 必要概念与文献地图

必要概念

  • 在线策略蒸馏(On-Policy Distillation, OPD): 学生先按自身策略生成,教师在这些学生访问到的前缀上提供 token 级监督;目标是减少离线教师轨迹与学生实际推理状态之间的分布错配。
  • 前缀失败(Prefix Failure): 学生在较早位置进入错误推理方向,后续自回归生成持续条件化于错误前缀,使偏差累积,并可能降低蒸馏监督价值。
  • 逆 KL / 单样本优势: 本文使用教师与旧学生对实际 token 的对数概率差形成优势。它偏向强化教师相对更认可的已采样 token,而非全面拟合教师分布。
  • 反思 token 集 用于表示“暂停、否定、改向”语言行为的一组 token。本文把其作为廉价的、无需过程标注的方向转折代理。
  • Handoff trigger: 当教师 top-1 是反思 token、而学生 top- 中无反思 token 时触发教师接管的规则;它是 Relay-OPD 的核心状态信号。
  • Relay trajectory / teacher leg: 由学生腿与短教师腿交替组成的训练轨迹。教师腿负责局部纠偏,之后尽可能把生成控制权还给学生。
  • Relay budget 限制最多教师接管次数, 限制每次教师腿的额外段落数;用于平衡纠偏能力与 on-policy 性。
  • Speculative decoding: 小模型先提出草稿,大模型验证/修正以加速目标模型采样。本文用它统一实现学生腿和教师腿的状态切换。

关键前作

  • Agarwal et al., 2024, On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes OPD 的基础设定;本文继承其在学生访问状态上蒸馏的思想,并针对错误前缀提出轨迹级干预。
  • Lu & Thinking Machines Lab, 2025, On-Policy Distillation 本文标准 OPD 基线及单样本逆 KL 式 token-level 优势的重要直接来源。
  • Xu et al., 2025, Speculative Knowledge Distillation SKD 通过 speculative decoding 混合师生 token;Relay-OPD 将其作为对比,主张一般分布一致性不足以检测“应改向”的状态。
  • Ziheng et al., 2026, Less Is More: Early Stopping Rollout for On-Policy Distillation;Zhang et al., 2026, Fast and Effective On-Policy Distillation from Reasoning Prefixes 代表固定长度短轨迹路线;Relay-OPD 的主要比较对象之一,差异在于其接管/终止位置由状态驱动。
  • Jiang et al., 2026, Trajectory-Refined Distillation 代表离线重写学生轨迹的修复路线;本文借其突出 relay 的在线纠偏、共享前缀与减少重写伪迹的设计取向。