Multi-Turn On-Policy Distillation with Prefix Replay

论文元数据


论文标题:Multi-Turn On-Policy Distillation with Prefix Replay

阅读范围与证据边界

  • 输入范围: 本报告基于论文的完整文本提取稿(含正文、公式、图表标题、表格文字与参考文献)撰写;这是一个文本回退(text fallback)输入,不是对原始 PDF 的直接视觉审阅。
  • 不可见范围:未直接检查 PDF 的页面布局、颜色、曲线几何、坐标轴视觉尺度、图中连线/空间关系,以及文本提取或 caption 未保留的图表细节;因此不会把图表的视觉印象当作证据,也不补造不可用的 figure/table 信息。
  • 证据标注: 文中会区分“作者主张”(论文的解释与结论)、“论文直接证据”(给出的公式、设置、表格数值、caption 与实验描述)和“分析者判断”(基于这些材料的审计与推断)。
  • 材料限制: 提取稿含主要正文与引用列表,但没有可执行代码、原始实验日志、随机种子、多次运行方差、附录中可能存在的额外细节或可交互环境。因此,关于统计稳健性、实现复现难度、真实成本和因果机制,只能作有限判断。
  • 范围提醒: 本文属于多轮 agentic LLM 的蒸馏/后训练方法,不是 RLHF 的偏好建模或扩散模型工作;对 RLHF 的价值主要在“离线复用轨迹、在策略监督与教师可靠性之间折中”的方法论层面。

1. 一页速览:值不值得看

项目判断
问题多轮工具使用任务中的 on-policy distillation(OPD)通常要让学生在在线环境中反复 rollout,再在其到达的历史上查询教师;这既昂贵,又要求训练期间维持 Python、搜索等环境。论文试图把这部分训练改造成可离线复用的流程。
一句话方法ReOPD 将教师已有的多轮轨迹作为教师强制前缀离线回放;学生只在被抽中的当前步骤生成动作,并沿自己的 token 上下文接受教师分布的 KL 蒸馏;再以 偏向早期步骤。
真正新意最值得注意的不是“离线轨迹重放”本身,而是把多轮 OPD 表述为“学生状态覆盖”与“教师在该历史上是否可靠”之间的双侧分布偏移。工程实现则是一个非常简洁、较粗粒度的深度衰减采样策略。
关键结果数学 + Python 工具环境中,Qwen3-4B 学生、Qwen3-8B 教师时,ReOPD 平均准确率为 53.7,OPD 为 51.0;搜索任务中,两者基本持平,如 4B 教师时为 40.5 vs. 40.6。作者还报告训练时零工具调用,单 rollout/step 至少快
可信度中等。 方法定义清楚,实验覆盖两种环境、不同师生规模以及若干诊断实验;但核心“教师可靠性”并未被直接测量,主要由深度、前缀来源和最终准确率间接支撑,且缺少方差、显著性与更广泛环境验证。
相关性对 LLM agent 后训练、工具使用、轨迹蒸馏和 RL rollout 复用直接相关;对当前 RLHF 研究有启发,但它并未学习人类偏好、奖励模型或直接优化偏好目标。对 Diffusion/VLM 没有直接实验。
建议精读。 若目标是将昂贵 agent 环境的 RL/rollout 产物转化为可离线蒸馏资源,本文的“前缀分布设计”值得吸收;若只需普通单轮 LLM 蒸馏,增量价值较有限。

Figure 1|第 1 页

Figure 1|第 1 页。 Figure 1: ReOPD keeps the benefits of on-policy distillation while removing environment in- teraction. ReOPD matches or improves OPD accuracy, but trains much faster per step and eliminates tool calls during training by replaying teacher-recorded prefixes instead of executing fresh environment rollouts. The student/teacher models are Qwen3-4B-Instruct-2507 and Qwen3-8B, respectively. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。

2. 方法论拆解

2.1 问题与已有路线的缺口

本文讨论的不是普通的 sequence-level SFT,而是带环境反馈的多轮 agent 蒸馏。一个 interaction step 包含:模型选择动作、环境返回观察;历史可写为

理解本文只需抓住四条路线:

  1. 教师轨迹 SFT / 离线蒸馏。
    学生在教师生成的完整前缀上学习,训练便宜、监督稠密;但部署时学生一旦早期犯错,会走到训练中没见过的历史,产生典型 exposure bias / covariate shift。

  2. 完全在线 OPD。
    学生在活环境中自己 rollout,教师在学生抵达的历史上提供 token 级目标。它改善“学生到底会去哪里”的覆盖问题,但每轮更新均需环境交互、工具调用和教师推理,成本高且多环境部署复杂。

  3. 直接把教师轨迹当作离线前缀。
    这消除了环境调用,但又回到教师前缀与学生实际历史不一致的问题。论文的关键不是否认这一偏差,而是承认其存在并按步骤深度重新分配训练质量。

  4. “越 on-policy 越好”的默认直觉。
    本文的核心反驳是:学生生成历史虽更贴近学生部署分布,但教师未必能在这些偏离其支持域的历史上给出可靠的改进目标。对多轮交互而言,教师目标本身也可能因历史偏移而失效。

因此,作者将问题从“是否 on-policy”改写为:应在什么历史前缀分布上询问教师、训练学生,才能平衡学生相关性与教师可靠性?

2.2 核心机制与流程

ReOPD 的训练单位是教师轨迹中的一个位置,而非完整的新 rollout。

  1. 先获得教师轨迹池
    论文的理想场景是:教师先通过 GRPO 在环境中训练,其 on-policy rollout 已自然包含动作和环境观察;这些数据可直接复用,不需要为学生蒸馏再额外收集。

  2. 从某条教师轨迹选择监督步骤
    截至该步的前缀 完全来自教师记录:之前的动作 与观察 都不由学生执行,也不会重新请求环境。

  3. 学生只在当前步骤自由生成动作。
    给定教师前缀,学生从 生成动作 token;教师在相同前缀和学生已生成 token 条件下输出分布,形成 token 级 KL 监督。
    因而,“on-policy”的含义被严格缩小为:当前被监督动作内部的 token 上下文来自学生;它不是整段多轮轨迹均由学生在真实环境中生成。

  4. 用按步位置递减的采样权重选择训练位置。
    默认使用 ,其中 时接近均匀步骤训练; 越小,训练越集中在较早步骤。

论文的实际蒸馏损失可概括为:

其中:

  • 是收集前缀的分布;在 ReOPD 的离线池中,作者取 ,即教师交互历史的占用分布;
  • 承载可靠性/位置权重;实践中即
  • 是沿学生生成动作 token 累加的 KL;
  • 是基础步权重,作者默认取均匀,避免与 混淆。

这一定义说明:ReOPD 并不把学生真实环境占用分布直接采样出来,而是用教师支持的前缀加上“当前动作 on-policy + 深度重加权”来近似它。

论文的理论中心是对理想目标与实际 replay 目标差距的分解:

它包含两个项:

  • :训练前缀分布与学生实际会到达分布之间的差异,即学生占用偏移
  • :教师分布相对不可得的理想改进目标 的误差,即教师可靠性偏移

作者主张: 完全 student-on-policy 能压低第一项,却不保证第二项;完全教师前缀则相反。
分析者判断: 这个分解在概念上有价值,但它首先是一个带不可观测量的上界,而非可直接优化或被实验完全验证的机制定理。尤其 都不可得,后续用“教师支持域”和步骤深度作为代理,属于合理但未被严格证明的建模替代。

2.3 关键设计与创新判断

  1. 教师强制前缀 + 当前步骤学生采样。

    • 解决什么:避免每个学生更新都重新执行环境与工具。
    • 为什么可能有效:在当前动作内保留学生自己产生 token 上下文,使 KL 目标针对学生的局部行为;同时让此前环境观察保持可回放。
    • 必要性证据:论文展示了与在线 OPD 接近或更好的最终准确率和显著速度收益,但没有消融“只教师前缀 SFT、无当前动作采样的 token-KL”与该设计的直接差别。
    • 创新判断:是把已有 on-policy distillation 的局部思想迁移到多轮 agent 轨迹的结构化组合,工程价值高,概念新颖性中等。
  2. 双侧偏移:学生相关性 vs. 教师可靠性。

    • 解决什么:解释为什么在线 OPD 不总优于较教师化的 roll-in。
    • 为什么可能有效:学生历史与教师支持域可能同时偏移,二者无法被单一“on-policy 程度”概括。
    • 必要性证据:搜索环境中 ReOPD 与 OPD 持平、数学环境中较大教师—学生差距下 ReOPD 更好,以及前缀源消融,均与该解释一致。
    • 创新判断:这是论文最有价值的抽象;但“可靠性”没有独立可测定义,实验主要验证预测一致性,而非直接验证因果链条。
  3. 从精确密度比到步深度衰减。
    作者先给出理想化的 bridge:

    再以学生/教师在教师动作上的累积似然比近似权重,并将其简化为

    • 解决什么:避免高方差、逐历史的密度比估计。
    • 为什么可能有效:若教师动作在学生下平均概率较低,累积比会随深度下降,深度成为前缀偏离程度的廉价代理。
    • 必要性证据:作者报告图 4 中经验权重与步索引紧密相关,图 5 中偏向前段的采样更有效。
    • 创新判断:从理论 bridge 到单参数 schedule 的落地简洁,但也极粗糙;同一深度的不同轨迹可能具有完全不同的学生—教师偏差,深度不能替代逐样本可靠性估计。
  4. 把教师 RL rollout 视作可复用资产。

    • 解决什么:降低“先训强教师、再训学生”管线的额外环境成本。
    • 直接证据:表 7 中,来自教师 RL 训练期的混合 checkpoint 轨迹与最终教师重新采样轨迹,蒸馏后平均数学准确率分别为 53.7 与 53.4。
    • 创新判断:此点对实际基础设施很重要,但依赖教师 rollout 已记录完整观察、可回放、并与学生任务分布匹配;并非所有黑盒工具、动态 Web 环境或隐私受限系统都满足。

2.4 可迁移的方法论

对用户关注的 RLHF / LLM / VLM / Diffusion 工作,最值得迁移的是原则而非 本身:

  • 将“训练数据来自谁”与“监督者在哪些上下文可靠”分开建模。
    在偏好优化、RLAIF、过程监督或多模型蒸馏中,不能只问样本是否贴近当前策略,也应问评审器、教师或奖励模型是否在这些样本上可靠。
    风险是:可靠性若无独立校准集或不确定性模型,容易沦为事后解释。

  • 复用昂贵在线后训练的轨迹副产物。
    对工具 agent、可验证推理或昂贵模拟器,训练主模型时的 rollout 可以成为后续小模型、专家模型或多任务学生的离线训练池。
    前提是:记录完整状态/观察、工具版本、提示模板与教师分布或可再查询接口;否则离线回放不具备可复现性。

  • 用“状态深度/轨迹位置”作为简单 curriculum。
    若误差确实随多步交互累积,优先训练低偏移早期状态可能比均匀采样更稳。
    风险是:复杂任务的后段可能承载真正关键的决策,过强衰减会使学生学不会收尾、恢复、工具错误处理与长程规划。

  • 对 VLM 与 Diffusion 的有限类比。
    VLM 多轮工具代理可以直接采用“视觉/工具观察前缀 + 当前动作蒸馏”的结构;扩散模型则没有与文本 agent 完全同构的多轮环境历史,不能直接照搬。若要迁移到 diffusion post-training,更合理的对象是多阶段生成、编辑链或交互式采样过程中的状态分布与 evaluator 可靠性,而非简单将 diffusion timestep 等同于本文的 interaction step。

3. 关键证据与实验审计

证据一:数学工具推理中,ReOPD 在多个师生规模下优于在线 OPD

展示了什么 → 六个数学 benchmark 上,Qwen3-4B 学生在不同教师规模下,ReOPD 平均表现高于 OPD:4B 教师为 57.2 vs. 55.1,8B 教师为 53.7 vs. 51.0,30B-A3B 教师为 52.5 vs. 51.1;30B-A3B 教师蒸馏到 8B 学生时为 56.8 vs. 56.5。
支持什么 → 在该 Python 工具环境与该训练配方下,教师前缀回放配合早期步骤偏置至少没有破坏 OPD,并且在较大师生差距时可能更有利。
仍不能证明什么 → 它不能单独证明优势确由“教师在学生历史上不可靠”造成,亦不能证明该结论可泛化到任意工具、任务长度、模型家族或训练预算。

实验设置有若干可取之处:

  • OPD 与 ReOPD 使用相同教师目标、batch size、更新步数,论文称唯一区别是前缀分布;这使主比较在设计意图上较公平。
  • 数学评估覆盖 AIME24、AIME25、AMC23、Minerva、OlympiadBench、MATH500,共 1,547 题;对单一 benchmark 的偶然性有一定缓解。
  • 对不同教师/学生规模做了重复比较,结果方向大致一致。

但证据仍有重要缺口:

  • 文中没有报告多随机种子均值、标准差、置信区间或显著性检验。尤其 0.3、1.4 分等小差异不能据此确认稳健。
  • 教师规模、能力和训练动态同时变化;“师生差距更大”并没有由独立、连续、可控的能力刻度验证。
  • GRPO 教师使用的 6.4K prompt 与学生 OPD/ReOPD 蒸馏 prompt 相同。论文区分训练和评估集,但从提取文本无法判断是否存在提示、轨迹或工具行为层面的泄漏风险。
  • 数学环境允许 16 次工具调用、评估带多次采样平均;最终分数同时受工具使用策略、采样预算和答案格式影响,不能纯粹等同于语言推理能力提升。

证据二:搜索环境中,ReOPD 与 OPD 基本持平

展示了什么 → 搜索环境中,4B 教师时 ReOPD 平均 40.5、OPD 40.6;8B 教师时为 39.0、39.1。
支持什么 → ReOPD 不必在所有场景优于 OPD;在作者所称教师对学生历史仍可靠的环境中,离线 replay 可大致保住在线 OPD 的效果。
仍不能证明什么 → “教师可靠”是造成持平的原因仍是解释而非被独立测量的事实;也不能说明 ReOPD 对搜索 agent 的所有关键能力都等价,例如故障恢复、索引变化适应或实时网页工具使用。

这里的反例式结果反而提高了作者叙事的可信度:论文没有宣称 ReOPD 在每个环境绝对胜出。搜索训练使用 2018 Wikipedia dump、E5 检索器和 top-3 passage,环境相对静态、可控,也更容易被离线轨迹覆盖。

不过,静态检索环境与真实浏览器、API、代码执行环境差异很大。论文将“搜索中教师可靠”归于两个占用分布接近,但该结论未通过直接估计历史距离、教师校准误差或教师错误率来验证。

证据三:深度偏置与前缀来源的诊断实验

展示了什么 → 作者报告:训练更多采样早期 chunk 的学生表现更好;在 sweep 中,中等衰减优于 的均匀采样。另一个实验固定 Qwen3-8B 教师目标、4B 学生,只改变前缀生成器,教师自身生成的前缀最好,更强的 32B 前缀反而更差。
支持什么 → 这与“较深前缀更易偏离学生可达历史”“教师在自身支持域内更可靠”的假说一致,也排除了“更强前缀生成器必更好”的简单能力解释。
仍不能证明什么 → 它不能证明深度本身是因果变量,也不能证明前缀来源导致差异完全经由教师条件分布可靠性传递;更强前缀可能同时改变轨迹长度、动作格式、工具使用频率、难度组成或 token 分布。

前缀来源实验是本文最接近机制验证的部分:保持教师 target 不变,仅改变 prefix generator,方向上确实检验了“教师支持域”而非“前缀模型越强越好”。

但仍有两点限制:

  • 文本显示的仅是最终 benchmark 数值与图表 caption;没有前缀之间的可量化距离、教师 token probability、校准曲线或错误类别分析。
  • 作者默认 并称其跨任务使用;虽然这减轻了逐任务过拟合担忧,但并不能排除在同一开发流程中试验过更多未报告值的可能性。现有信息不足以判断调参预算与选择过程。

效率证据:零学生训练期工具调用与至少 rollout 加速

展示了什么 → 图 1 caption 和实验描述称:ReOPD 训练时不调用工具;在数学和搜索环境中,相对 OPD 每 rollout/step 至少快 。图 8 还计入“先由教师一次性重采样前缀”的代价后,报告仍超过
支持什么 → 对需要持续部署 Python 执行器、检索服务或多个异构环境的蒸馏流程,ReOPD 能将学生训练阶段与环境生命周期解耦,具有明显运营价值。
仍不能证明什么 → 它不能证明完整端到端成本在所有系统中都降低:轨迹存储、教师 logprob 查询、数据序列化、环境状态复现、离线池维护和首次教师采样成本在真实部署中可能很高。

论文直接给出:OPD 在数学场景依赖 32 个并行 process,在搜索场景需部署占用 80GB GPU memory 的检索资源;ReOPD 学生训练无需这些在线环境资源。这个工程差异是真实且重要的,但具体时间比受实现、硬件、并发配置和工具延迟高度影响,不宜将 当成通用性能常数。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

被论文直接支持得较好的结论:

  • 在所用 Qwen3、Python 数学和静态搜索环境中,ReOPD 可以用离线教师轨迹取代学生训练期间的在线环境调用。
  • 在报告的主设置中,ReOPD 在数学任务优于 OPD、在搜索任务接近 OPD。
  • 对该实现,早期步骤倾斜采样与较好的最终表现相关。
  • 复用教师 GRPO rollout 作为 prefix pool 的结果接近使用最终教师单独采样的 pool。

仅“与结果一致”、尚未被充分证明的结论:

  • 教师—学生能力差距扩大时,教师可靠性偏移必然主导;
  • 深度是普适且充分的可靠性代理;
  • 是由理论 bridge 自然导出的、而非针对当前实验足够好的一种 heuristic;
  • 来自教师自身支持域的历史一定比更强模型前缀更适于蒸馏;
  • 多环境离线池的可扩展性会在更多异构、动态、长程环境中保持。

尤其要区分:论文的上界证明说明“若理想目标、教师可靠性误差与分布距离按定义成立,则目标差可被两项控制”;实验并未直接观测理想目标 或可靠性误差 。因此理论分解提供了有用的语言和设计框架,但不是对实际因果机制的完整实证证明。

4.2 主要局限与失败条件

  1. “教师可靠性”不可观测,深度代理过粗。
    影响:机制解释与泛化。
    实际可靠性取决于具体任务、工具返回、错误类型和教师校准,而不是只取决于第几步。同一深度可同时包含安全的常规状态与极端 OOD 状态;按 统一降权无法区分二者。

  2. 学生并非真正多轮 on-policy。
    影响:泛化与部署能力。
    只有被监督的当前动作 token 来自学生,之前动作与全部观察均由教师回放。若学生部署时早期动作改变了工具返回、网页内容、代码状态或环境分支,ReOPD 没有在这些真实分叉上训练恢复能力。

  3. 核心比较缺少统计不确定性。
    影响:结果可信度。
    文本中未见多个种子、方差或显著性分析;小幅平均分变化难与随机采样、评估解码、环境随机性区分。论文中部分“略优”结论应谨慎解读。

  4. 实验环境较窄且具有稳定、可记录的状态。
    影响:工程部署与外推。
    Python 工具和固定 Wikipedia 检索适合回放;实时 Web、权限相关 API、数据库写入、非确定性模拟器或成本受限的外部服务,可能无法完整重建教师历史或安全地重放。

  5. 轨迹池质量与覆盖决定上限。
    影响:可复现性与能力上限。
    作者自己承认 pool 覆盖和质量约束学生能学什么。若教师 RL rollout 集中在易题、短轨迹或少数成功模式,早期步骤加权还可能进一步压低罕见长程错误恢复状态的训练比例。

  6. 理论与实现之间存在较大跳跃。
    影响:新颖性与机制完整性。
    理论上讨论逐历史、逐步的几何 bridge 与密度比;实现最终采用跨位置的单参数 。这不是轻微近似:前者重塑同一步内的历史分布,后者只改变不同深度的样本量。论文对此有解释,但尚未比较更细粒度、低方差的 data-dependent reliability estimator。

4.3 最有价值的下一步验证

  1. 直接验证教师可靠性而不是只验证最终准确率。
    要验证什么:在学生 roll-in、教师 roll-in、混合 roll-in 和不同深度上,测量教师目标对一个更可靠参照的误差,例如验证器正确率、专家轨迹、强评审器一致性或校准误差。
    为何重要:这是双侧偏移论证中最关键、目前不可观测的项。
    会改变判断的结果:若教师在学生诱导历史上仍保持同等可靠,ReOPD 的胜因更可能是普通 curriculum/regularization,而非可靠性折中。

  2. 与逐轨迹自适应权重公平比较。
    要验证什么:比较深度 schedule、基于 teacher-student logprob gap 的样本级权重、基于不确定性的 teacher target 过滤,以及无加权 replay。
    为何重要:可判断步骤索引是否足够、何时应使用更细粒度 proxy。
    会改变判断的结果:若样本级可靠性估计稳定显著优于 ,则本文最可复用的贡献应被理解为“可靠性建模”,而非具体 step-decay。

  3. 测试真实动态与长程环境中的恢复能力。
    要验证什么:在状态会变、工具失败、网页/API 返回扰动、长 horizon 和分支错误恢复场景,比较 ReOPD、OPD 与混合训练。
    为何重要:这决定离线前缀能否替代在线环境,而不仅是在静态 benchmark 上保分。
    会改变判断的结果:若 ReOPD 在学生早期偏离后明显崩溃,则应将其定位为“高效的稳定环境蒸馏器”,而非通用多轮 on-policy distillation 替代方案。

4.4 最终复用结论

  • 最值得借鉴: 把昂贵 RL/agent rollout 看作可复用数据资产;记录完整“提示—动作—环境观察”轨迹,并在后续蒸馏中将环境依赖从学生训练阶段剥离。
  • 最值得借鉴: 在任何多步后训练中显式区分“当前策略会到达的状态”和“教师/奖励器/评审器在这些状态上的可信度”,避免把 on-policy 当作无条件正确的准则。
  • 不要照搬: 不应默认所有任务使用固定 或单调的 。应先检查长程末端是否承担关键决策,并在验证集或可靠性估计上选择 schedule。
  • 适合的场景: 已拥有高质量教师 rollout、环境昂贵但可记录、环境反馈稳定可回放、学生需学习工具调用或交互格式、且在线 OPD 基础设施成本高的 LLM agent 管线。
  • 不适合直接采用的场景: 高动态、强状态依赖、无法保存观察、在线安全约束严格、需要训练学生从自身早期错误中恢复的环境。
  • 路线建议: 应纳入后续 agent post-training 技术路线,定位为“离线轨迹蒸馏 + 可靠性/覆盖折中”的候选模块;但在真正替换在线 OPD 前,必须补做可靠性测量、长程扰动和多随机种子验证。

5. 必要概念与文献地图

必要概念

  • On-policy distillation(OPD): 在当前学生策略产生的上下文上,由教师提供稠密 token 分布监督;它不同于只对完成答案给标量回报的 RL。
  • 教师强制前缀(teacher-forced prefix): 当前步骤之前的动作和观察全部沿教师记录轨迹回放,而不由学生重新执行。
  • 历史占用分布(occupancy distribution): 策略与环境交互后,在第 步抵达不同历史 的概率分布;本文将其作为多轮训练数据分布的核心对象。
  • 学生占用偏移: 训练前缀分布与学生实际部署时会遇到的历史分布之间的差异;传统 off-policy 蒸馏通常受此影响。
  • 教师可靠性偏移: 教师在远离自身支持域的历史上给出的条件分布,可能不再是理想改进目标的可靠近似。本文用它解释全量学生 roll-in 的潜在问题。
  • 几何 bridge 分布: 在学生占用分布与教师占用分布间取折中的目标分布;它是论文理论上的分布设计对象。
  • prefix likelihood ratio: 教师记录动作在学生与教师下的累计概率比;论文将其视为更精确、但高方差的重加权信号。
  • step-decay schedule: 按交互深度减少训练采样概率;它是对逐前缀可靠性权重的低成本代理,而非直接测量。

关键前作

  • Ross, Gordon, and Bagnell (2011), DAgger。
    提供行为克隆的 covariate shift 与 learner-induced state distribution 的经典框架;本文将类似问题延伸到“学生覆盖”与“教师在该覆盖上的可靠性”同时存在的情形。

  • Agarwal et al. (2024), On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
    是本文 OPD 背景的重要来源:学生在自生成内容上接受教师监督。ReOPD 的区别是多轮环境、离线教师前缀以及不再追求完全学生 roll-in。

  • Gu et al. (2024), MiniLLM。
    代表 LLM 蒸馏中的 on-policy / 反向 KL 思路。本文沿用“教师给稠密分布监督”的方向,但将注意力从单轮 token 生成转向交互历史的来源。

  • Shao et al. (2024), DeepSeekMath / GRPO。
    论文用 GRPO 训练教师,并复用其 rollout。与本文的关系是数据生产基础设施,而不是 ReOPD 的优化目标:ReOPD 不估计回报或优势,仍以教师条件分布为监督。

  • Wang et al. (2026), Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
    论文将其作为与“双重 exposure bias”相近的近期脉络;二者都提示教师轨迹监督与学生生成上下文之间存在张力。根据本文提供材料,二者具体方法差异未作充分展开,不能据此断言谁更一般或更优。