ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

论文元数据


论文标题:ShortOPD:用短到长的在策略蒸馏恢复剪枝 LLM

阅读范围与证据边界

  • 输入材料: 本报告基于论文 arXiv:2607.13124v1 的完整 PDF 文本提取稿(含正文、附录、表格文本、图注与参考文献)撰写,属于 文本回退(text fallback)输入
  • 未直接检查 PDF 视觉证据: 我没有直接检查 PDF 页面布局、颜色、曲线几何形状、柱图比例、图中空间关系,以及提取文本和图注中未保留的图表细节。因此,下文对 Figure 2/4/5/6/7 的判断仅依据作者正文、图注和可提取数值,不把它们表述为已视觉核验的结论。
  • 证据层级: “作者主张”指论文的解释与推广;“论文直接证据”仅指所报告的设置、表格数值、图注和附录结果;“分析者判断”则单独标明,不将有限实验自动提升为普适因果结论。
  • 材料缺失的影响: 文本中存在部分图形本体和可能未完全结构化的表格信息缺失;没有外部复现实验、代码执行记录、方差/置信区间或多随机种子数据。因此,关于效率、机制和泛化的判断均应视为单论文、单类压缩设定下的证据。
  • 版本状态: 首页标注为 “Work in Progress”,且为 arXiv v1。结论在同行评审、代码审计和独立复现前不宜作为稳定工程事实。

1. 一页速览:值不值得看

维度判断
问题结构化剪枝后的 LLM 在多选式识别基准上可能保留能力,却会在自由生成中严重退化;尤其是数学、代码和开放式生成中,模型会产生重复后缀或失去正确轨迹的首选排名。这直接影响“剪枝模型是否可部署”的判断。
一句话方法在策略蒸馏(OPD)中,让剪枝学生在自身生成轨迹上接受原始未剪枝模型的逐 token 分布监督;再用检测到的末尾重复率、有效长度和干净截断率,闭环地把采样长度预算从短逐步调回长。
真正新意OPD 本身不是新提出的;实质增量是把“剪枝后早期在策略 rollout 被低信息重复后缀浪费”的诊断,转化为一个重复门控、截断感知的 rollout horizon 控制器。其余部分——BI 深度剪枝、冻结自教师、token-level KD、EMA 平滑——主要是已有组件的有针对性组合。
关键结果在 Qwen3-4B-Instruct 剪去约 25% 参数的主设定中,ShortOPD 的八任务归一化平均分为 48.46,高于未恢复剪枝模型 5.71、SFT 21.19、SeqKD 28.60 和离线 token KD 30.52;三轮训练升至 55.41,仍低于原模型 75.17
效率结果在作者的效率对比中,ShortOPD 使用 250M rollout tokens、8.5 小时;固定 2048 horizon 为 337M、11.1 小时,固定 8192 为 869M、35.9 小时。三者平均分约为 48.5、49.6、50.2,ShortOPD 与固定长 horizon 相差 1.7 分。
可信度中等。 主对比、信号控制、域消融和效率对比形成了相互支持的证据链;但核心实验集中于一个 Qwen3-4B 系列、BI 深度剪枝约 25% 的“可恢复”区间,缺少多种子统计、不同压缩器和更大模型的验证。
相关性LLM 后训练、蒸馏、压缩恢复、on-policy 训练高度相关;对用户重点关注的 RLHF / Diffusion 是方法论上的间接相关:它说明在严重能力退化、稀疏奖励难以起效时,密集教师分布信号与自生成状态可能比结果奖励更有效。
建议按需精读,推荐给做 LLM 压缩恢复或 on-policy distillation 的工作。 若目标是直接推进 Diffusion RLHF,本论文不是直接方法来源;但“先识别低信息轨迹区域、再按状态质量自适应分配在线采样预算”的思路值得迁移和验证。

2. 方法论拆解

2.1 问题与已有路线的缺口

作者讨论的不是“如何首次剪枝”,而是:已完成结构化剪枝后,怎样把自由生成能力恢复到可用程度。

论文的出发点有两层。

第一,传统剪枝评估偏向多选题或候选答案似然评分,例如 MMLU、HellaSwag。这类评估要求模型对给定文本赋高分,但不要求模型从自身解码分布中稳定地产生该文本。作者用 Qwen3-4B-Instruct 删除 4 层的例子说明:贪心生成的 pass@1 会显著下降,但增加采样次数后 pass@k 上升。例如 GSM8K 上,剪枝模型从 k=1 的 49.0 上升到 k=64 的 91.2,略高于未剪枝教师贪心生成的 88.1。

  • 作者主张: 正确轨迹并未完全被剪枝抹除,而是被“降级”到较低概率区域;恢复的关键是把它们重新提升到模型实际解码会选中的位置。
  • 论文直接证据: 多任务 best-of-k 随 k 增长提高,GSM8K 在高 k 超过教师贪心分数。
  • 分析者判断: 这支持“至少部分正确轨迹仍在学生分布中”的说法,但不能证明所有能力退化都是“排序下降而非表示丢失”。MATH、代码和开放式任务即使 k=64 仍远低于教师,尤其 HumanEval 为 20.1 对 75.0,说明大量能力仍可能是概率质量不足、搜索难度太高或表示损坏的混合结果。

第二,作者认为普通离线恢复信号存在 train–inference mismatch:

  1. SFT: 用人工答案训练,既不在学生错误状态上训练,也不保留教师的软分布信息。
  2. SeqKD: 用教师生成的固定回复训练,保留教师输出但仍是离线轨迹。
  3. 离线 token KD: 对固定文本匹配教师 logits,有密集信号但仍不覆盖剪枝学生自身会走到的错误前缀。
  4. RLVR: 在学生自身状态上训练,但数学/代码正确性奖励稀疏;若剪枝模型几乎从不采出正确答案,强化信号很弱。
  5. OPD: 在学生实际采样的前缀上,让冻结的原始模型给每个 token 提供分布监督,同时满足“on-policy”和“dense signal”。

ShortOPD 要修补的特定失败点,则是 OPD 早期可能将大量计算花在重复尾巴上。作者报告,在约 25% 剪枝的设置中,早期大量 rollout 以重复后缀结束;这些重复 token 上教师与学生的广义 JSD 很低,教师 NLL 也极低。按其解释,这意味着教师也倾向继续当前重复模式,蒸馏梯度小,继续延长该尾巴的边际训练价值有限。

这一诊断是论文最值得关注的前提:不是“长 rollout 天然不好”,而是学生尚未恢复时,长 rollout 过早进入教师与学生已经局部一致的退化区域。

2.2 核心机制与流程

整体流程可分为“压缩—在策略蒸馏—预算控制”三部分。

1. 剪枝与教师—学生初始化

原始 Qwen3-4B-Instruct-2507 有 36 个 Transformer block。作者在 100 篇 PG-19 文档上计算 Block Influence(BI),删除最低 BI 的 9 层,即原始编号 25–33 的层,保留 27 层,参数减少约 25%。

BI 的定义为:

[ \mathrm{BI}i = 1-\mathbb{E}{X,t}\left[ \frac{X_{i,t}^{\top}X_{i+1,t}} {|X_{i,t}|2|X{i+1,t}|_2} \right]. ]

其中 (X_{i,t}) 是 token (t) 进入第 (i) 层时的隐藏状态。若某层输入、输出隐藏状态余弦相似度高,BI 较低,作者将其视为该层对表示改变较小、可优先删除。

  • 角色: 这是实验中产生受损学生 (\pi_\theta) 的结构化剪枝算子。
  • 必要假设: 低 BI 层确实更冗余,且删层后模型仍处于可恢复区间。
  • 边界: 作者自己承认 ShortOPD 的目标函数并不依赖 BI;但本文证据几乎都来自 BI 深度剪枝,因此不能据此认定对宽度剪枝、量化、稀疏化或更激进压缩同样有效。

2. OPD:在学生自己访问的状态上蒸馏

给定 prompt (x),学生先从自身策略采样回复:

[ y \sim \pi_\theta(\cdot\mid x). ]

冻结教师 (\pi_T) 再对同一条学生轨迹评分。学生在每个已生成前缀 ((x,y_{<t})) 上匹配教师的下一个 token 分布:

[ \mathcal{L}_{\mathrm{OPD}}(\theta)

\mathbb{E}{x} \mathbb{E}{y\sim\pi_\theta(\cdot\mid x)} \left[ \frac{1}{|y|} \sum_{t=1}^{|y|} D_\alpha\big( \pi_T(\cdot\mid x,y_{<t}), \pi_\theta(\cdot\mid x,y_{<t}) \big) \right]. ]

这里 (D_\alpha) 是广义 Jensen–Shannon divergence。实现上,作者使用教师 top-100 logits 加一个聚合 tail bin,(\alpha=0.5),并对重要性权重裁剪至 2.0。

  • 角色: 通过学生自己会产生的错误前缀,修正下一个 token 的局部概率排序。
  • 为什么不是普通 KD: 普通 KD 在外部给定的教师或数据集前缀上训练;OPD 的状态分布由当前剪枝学生生成,更接近实际推理时会遇到的轨迹。
  • 关键假设: 原始模型在学生的退化前缀上仍能提供有用、稳定的教师分布。若学生已偏离到教师也不应被视为有效任务状态的区域,或教师本身会认可错误循环,则 OPD 的纠错能力可能受限。

3. ShortOPD:由生成质量控制 rollout horizon

OPD 的采样长度预算记为 (H_s)。ShortOPD 不改动当前 batch 上的蒸馏损失,也不直接屏蔽重复 token;它只决定下一步采样最多生成多长。

对每条 rollout,控制器检测三个量:

  • (a_i):是否存在严重的末尾周期性重复;
  • (b_i):是否在没有严重重复时恰好耗尽当前长度预算;
  • (\ell_i):有效长度,即检测到重复后缀时的可用前缀长度;没有循环时为完整生成长度。

批次统计及其 EMA 为:

[ r_s=\frac{1}{B}\sum_i a_i,\qquad q_s=\frac{1}{B}\sum_i b_i,\qquad L_s=\frac{1}{B}\sum_i \ell_i. ]

其中 (r_s) 是重复率,(q_s) 是“干净截断率”,(L_s) 是平均有效长度。经 EMA 平滑后,控制器按以下规则更新目标长度:

[ H_s^*= \begin{cases} \min(H_s,\lambda\bar L_s), & \bar r_s>\rho_{\text{high}}\ \gamma_\uparrow H_s, & \bar r_s<\rho_{\text{low}}\ \land\ \bar q_s>\tau\ H_s, & \text{其他情况}. \end{cases} ]

再通过第二层 EMA、上下界裁剪和 16 token 对齐得到 (H_{s+1})。

  • 缩短条件: 只有高重复率才能触发缩短;单纯回答短并不会导致预算下降。
  • 增长条件: 重复率低,且大量没有重复的样本恰好撞到上限,说明当前 horizon 成为约束,才允许增长。
  • 优先级: 高重复优先于截断信号,避免学生仍在循环时因“到达上限”被误判为应扩容。
  • 本文实际参数: 初始预算 2048,范围 [1024, 2048];(\rho_{\text{low}}=0.20)、(\rho_{\text{high}}=0.45)、(\tau=0.10),长度余量 (\lambda=1.15),增长因子 1.25。

重复检测仅看最后 512 个有效 token,枚举周期 1–10;要求周期模式到达回复末端、满足至少三周期和最小尾长等条件。这样做是为了避免把回答内部正常的重复结构误作为失效循环。

2.3 关键设计与创新判断

设计解决什么为什么可能有效证据与创新判断
在策略学生 rollout训练时不覆盖学生实际错误前缀的问题直接在推理会出现的状态纠正 token 分布主表中 ShortOPD 明显高于 SeqKD 与离线 KD;这是 OPD 已有原则在剪枝恢复上的有力应用,而非从零提出的新蒸馏范式。
密集教师分布而非稀疏奖励严重剪枝模型很少产生可获奖的正确结果即使轨迹最终错误,每个 token 仍有教师目标GSM8K-only 对比中,PPO 0.23、GRPO 1.59、ShortOPD 37.76。该结果支持稀疏奖励在此初始状态下不足,但仅覆盖一个数学任务和作者的 RLVR 实现。
重复门控的短到长 horizon长 rollout 早期反复进入低信号重复尾巴把预算留给可用前缀,恢复后再扩展长输出能力作者报告重复 warm-up 缩短、token 和时间下降,且最终分数接近固定 horizon。控制思想是本文最清晰的新组件。
有效长度而非平均生成长度正常短回答不应被当作“应缩短”的证据用循环起点区分“已完成的短回答”和“失效尾巴”逻辑上合理;但缺少与更简单启发式——如仅按 EOS 率、仅按重复率、或固定 curriculum——的充分对照。
多域 prompt mixtureOPD 只修复学生实际访问且训练数据覆盖的状态区域数学、代码、一般指令 prompt 会塑造不同的 on-policy state distributionleave-one-domain-out 结果很强:去数学后 GSM8K 62.70→8.04,MATH 42.00→6.00;去代码后 HumanEval 43.90→0.61。它更像“覆盖需求”的证据,而不是跨域泛化的证据。

2.4 可迁移的方法论

对 RLHF / Diffusion / VLM / LLM 的可迁移价值主要不在“把 ShortOPD 原样搬过去”,而在以下四个设计原则。

  1. 训练预算应对状态质量敏感,而不是只对全局 step 或平均 loss 敏感。
    在 on-policy RL、preference optimization 或 diffusion trajectory optimization 中,可能也存在低价值状态区:重复文本、明显不可逆的图像噪声轨迹、无效工具调用、已经偏离可评分区域的推理链。若这些状态的教师/奖励模型信号接近饱和,固定长 rollout 会浪费计算。
    风险: 不能把“低 loss”直接等同于“无信息”;论文自己也强调缩短门由独立的重复检测触发,而不是由 loss 触发。迁移时应有独立、可审计的退化检测器。

  2. 在严重受损或低成功率初始策略上,密集 shaping 信号可能先于稀疏 outcome reward。
    对压缩模型,正确答案罕见使 RLVR 几乎没有正样本。类似地,Diffusion RLHF 若初始样本极差,仅依赖终局偏好奖励可能不稳定;可考虑教师 score、token/latent-level consistency 或分阶段奖励。
    风险: 教师分布也可能保守地认可坏局部状态,造成“把教师的局部错误稳定下来”,正如本文重复循环中教师 NLL 极低所显示的现象。

  3. 区分训练状态分布与离线标注分布。
    离线 SFT/KD 的固定响应不能充分代表推理中真实出现的错误前缀。对 VLM 和 LLM 后训练,这支持以受控方式引入模型自生成轨迹,再在其上做偏好、校正或蒸馏。
    迁移前提: 必须有可用的教师、验证器或偏好模型来判断这些 off-distribution 轨迹;否则 on-policy 可能只是放大模型自己的错误状态。

  4. 训练数据的“prompt 覆盖”是能力恢复的一部分。
    本文的域消融表明,没有数学/代码提示,就很难恢复对应能力。这对任何 post-training 都是实用提醒:若目标能力是特定的生成模式,应让训练时状态访问覆盖该模式,而不能仅依赖通用 instruction mixture。
    风险: 这可能降低“无标签、通用恢复”的吸引力;虽然无需答案标签,但仍需精心设计 prompt 分布。

3. 关键证据与实验审计

证据一:主生成恢复对比

展示了什么 → 在同一个约 25% BI 深度剪枝的 Qwen3-4B-Instruct 上,一轮训练后,ShortOPD 的八任务归一化平均分为 48.46;未恢复剪枝为 5.71,SFT 为 21.19,SeqKD 为 28.60,离线 KD 为 30.52,教师为 75.17。
支持什么 → 在作者设定下,“学生自身状态 + 密集教师分布”的组合,比固定离线序列上的监督或蒸馏更有效地恢复自由生成。
仍不能证明什么 → 不能证明 ShortOPD 对所有结构化剪枝方法、压缩比例、模型尺寸或任务类型都优于离线恢复;也不能将 48.46 解释为恢复了原模型的通用能力,因为它仅为教师平均分的 64.5%。

分任务看,ShortOPD 的收益不是仅集中于 GSM8K:GSM8K 62.70、MATH-500 42.00、HumanEval 43.90、MBPP 49.81;开放式任务中的 Alpaca、QA、Summarization、MT-Bench 分别为 4.68、2.04、7.94、4.28(1–10 judge score)。这使“并非纯数学技巧”的作者说法有一定依据。

但公平性仍有两个注意点:

  • 各方法共享同一 prompt 分布与一个 epoch 的步数,且论文清楚定义了 SFT、SeqKD、KD 的信号差异,这一点较好。
  • 但 on-policy 方法和离线方法的实际 token 消耗、教师计算量、有效上下文长度及优化动态并不天然等价。论文声称“matched budgets”,但从文本可见的设置不足以完全核验总 FLOPs、wall-clock 或每种方法获得的监督 token 是否严格匹配。
  • 开放式任务由 GPT-5.5 评判,独立于 Qwen 教师是优点;但论文没有在提取文本中给出 judge prompt、位置偏差控制、重复评判方差或人工验证,因此这些分数的细粒度差异不宜过度解读。

证据二:短到长控制器的效率—质量权衡

展示了什么 → 固定 2048、ShortOPD、固定 8192 三种 horizon 下,八任务平均分分别约为 49.6、48.5、50.2;对应 rollout token 分别为 337M、250M、869M,训练时间为 11.1、8.5、35.9 小时。作者还报告,ShortOPD 在早期将预算由 2048 缩到 1024,并在干净截断占主导后恢复。
支持什么 → 在该模型、数据、温度和最大长度设置下,自适应缩短早期 rollout 可显著减少 token 与时间,而不造成明显的最终主指标损失。
仍不能证明什么 → 不能证明重复检测是实现节省的唯一必要机制,也不能证明其在不同硬件、不同 batch/并行策略、不同长度分布下仍有相同比例的节省。

最可信的部分是:固定 8192 比固定 2048 多消耗约 2.6 倍 rollout token 和超过 3 倍训练时间,却只多 0.6 Avg;这足以说明该实验中的长 horizon 存在明显边际收益递减。

较弱的部分是机制归因。论文将效率收益归因为“重复后缀是低信息”。其直接支持来自:重复后缀上的平均教师—学生 JSD 为 0.0014,而普通 token 为 0.051;教师 NLL 为 (3\times10^{-5}),普通 token 为 0.68;以及附录中在分布一致处 JSD 梯度趋零的推导。这个论证说明实现的蒸馏目标在这些状态上可能缺少局部梯度,但仍不等价于证明这些 token 对训练完全无用,也不能排除短 horizon 通过其他优化效应获益。

证据三:信号轴与数据域消融

展示了什么 → 在 GSM8K-only、相同 prompt、batch 和一轮 step 预算下,PPO-RLVR 为 0.23,GRPO-RLVR 为 1.59,ShortOPD 为 37.76;此外,去掉数学 prompt 后 GSM8K/MATH 从 62.70/42.00 降至 8.04/6.00,去掉代码后 HumanEval/MBPP 降至 0.61/2.33。
支持什么 → 在极低成功率剪枝初始化下,密集教师信号可比稀疏正确性奖励更有启动能力;同时,on-policy 恢复高度依赖目标能力的 prompt 覆盖。
仍不能证明什么 → 不能证明 PPO/GRPO 本质上不适合压缩恢复,也不能证明领域数据不可替代;更强的奖励塑形、课程学习、更多采样、不同 KL 约束或更长训练可能改变结果。

这组实验对论文最重要的实践结论——“不要只把 generic prompt mixture 当成无关细节”——提供了相当直接的支持。但其外延也应收窄:它显示的是在该训练步数和该压缩点上,删除对应 prompt 域会损害对应能力恢复,而不是对“能力完全没有跨域迁移”的证明。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

被较直接支持的结论:

  • 在 Qwen3-4B-Instruct 的约 25% BI 深度剪枝设定中,ShortOPD 优于文中列出的 SFT、SeqKD、离线 KD 和 GSM8K-only RLVR 基线。
  • 动态 horizon 在作者效率对比中显著减少了 rollout token 和训练时间,同时维持了接近固定 2048/8192 的平均生成分数。
  • 训练 prompt 的领域覆盖会强烈影响相应领域的恢复结果。
  • 多选候选似然与自由生成恢复不等价:附录中 SFT/KD 的 held-out 多选均分较高,而 ShortOPD 的自由生成更强;SFT-init ShortOPD 可同时提高两类指标。

仅与结果一致、尚未被充分证明的结论:

  • “正确能力只是被降级而未消失”是有力解释,但不是全任务、全压缩强度下的机制定论。
  • “重复后缀低信息,因此应减少训练预算”有局部 JSD/NLL 和效率结果支持;但缺少直接比较来确认控制器优于更简单的长度课程、loss-free 固定短训练后切长、或其他退化检测器。
  • “ShortOPD 应成为结构化压缩后的默认恢复步骤”超出了当前实验覆盖。作者仅测试一种主要模型家族、一种主要剪枝族和有限压缩区间。

4.2 主要局限与失败条件

  1. 外部有效性窄:仅验证 BI 深度剪枝、Qwen3-4B 家族和约 25% 参数删除。
    这影响泛化与工程部署。作者在附录中显示,删层更深后模型会进入 incoherent token sequence 区域,重复率甚至可能下降,因为不再形成 n-gram loop。此时 ShortOPD 的重复控制信号可能失灵或产生误导。

  2. 机制变量与方法变量没有充分解耦。
    这影响机制解释与新颖性判断。ShortOPD 同时包含在策略轨迹、密集 JSD 蒸馏、重复检测、有效长度估计、双 EMA 和控制逻辑。主实验能证明完整配方有效,却不足以严格证明“重复门控 + 有效长度”是比简单 short-to-long curriculum 更必要的设计。

  3. 缺乏多种子方差、显著性或训练稳定性报告。
    这影响可复现性与结果可靠性。尤其主表中若干开放式 judge 分数、控制器的 1–2 Avg 差距,以及效率收益是否跨运行稳定,现有文本不足以判断。

  4. 评测的自由生成与真实部署任务仍有距离。
    这影响工程部署与泛化。数学和代码有相对客观指标,但开放式任务依赖 LLM judge;论文未显示长对话、多轮指令、真实用户分布、毒性/安全、极端长上下文或工具调用场景。

  5. 教师计算成本和部署收益没有完整闭环。
    这影响效率结论。ShortOPD 的训练过程需要冻结的原始未剪枝教师逐 token 评分。论文展示了相对 rollout 时间节省,但未完整量化教师前向、显存、通信、训练总能耗,以及训练成本需要多少推理节省才能回本。

4.3 最有价值的下一步验证

  1. 做严格的“控制器归因”消融。
    要验证:ShortOPD 是否优于固定的 1024→2048 curriculum、只按重复率缩短、只按 EOS/截断率增长、随机预算、以及用简单 n-gram heuristic 的控制器。
    为何重要:这决定本文的新颖贡献究竟是“动态长度控制本身”,还是更一般的早期短 rollout curriculum。
    会改变判断的结果:若简单固定 curriculum 达到相同质量—成本前沿,复杂循环检测和有效长度精炼的必要性将显著下降。

  2. 跨压缩器、模型规模和退化模式验证。
    要验证:在宽度剪枝、层合并、量化、稀疏化,以及 1B/7B/更大模型上,先测退化模式,再判断是否适用 ShortOPD。
    为何重要:本文方法依赖“可恢复前缀 + 可检测的末端重复”这一状态结构。
    会改变判断的结果:若在非循环型退化或不同压缩器上无效,方法应被定位为“针对循环型剪枝退化的恢复器”,而非通用 post-compression recipe。

  3. 以同等端到端训练成本比较密集蒸馏、RLVR 和混合目标。
    要验证:控制教师 forward、rollout 数、token 数和 wall-clock 后,稀疏奖励、过程奖励、教师蒸馏、SFT-init OPD 的最优组合。
    为何重要:作者已在附录显示 SFT-init ShortOPD 同时恢复多选与生成,这提示“离线识别恢复”和“在线生成恢复”可能互补而非替代。
    会改变判断的结果:若混合目标在相同预算下稳定优于纯 ShortOPD,则“OPD 是默认恢复步骤”的结论应改为分阶段或双目标恢复策略。

4.4 最终复用结论

  • 最值得借鉴: 在模型已被压缩且自生成质量严重退化时,优先检查“学生会访问哪些错误前缀”,不要仅在离线黄金文本上做蒸馏;这比单纯继续 SFT 更贴近生成失效机制。
  • 最值得复用的组件: 将 rollout 预算控制建立在可解释的状态质量指标上。本文的“高重复才缩短、低重复且干净截断才增长”是比“按平均长度调节”更稳健的控制模板。
  • 不要照搬: 不应未经验证就把末尾 n-gram 周期检测、512-token 窗口、阈值 0.20/0.45、预算 [1024, 2048] 或 top-100+tail JSD 迁移到其他模型、语言、VLM 或 Diffusion 轨迹。
  • 适用场景: 有一个可访问的高质量原始教师;压缩学生尚保留部分可用轨迹;训练预算被在线采样成本主导;且退化可以通过某种独立指标识别。
  • 路线建议: 对 LLM 压缩恢复,值得纳入后续技术路线并优先复现其主对比与控制器消融;对 Diffusion/RLHF,建议仅把它作为“自适应 on-policy 数据预算 + 密集指导信号”的设计参考,而不是直接采用 ShortOPD 名义或实现。

5. 必要概念与文献地图

必要概念

  1. 结构化剪枝(structured pruning)
    删除完整 Transformer 层、头、通道或成组参数,通常仍能使用标准稠密矩阵计算;与非结构化稀疏相比更容易获得实际硬件加速。

  2. Block Influence(BI)
    以某层输入输出隐藏状态的平均余弦相似度衡量其变化程度;低 BI 层被视为较冗余并优先删去。本文把它作为产生剪枝学生的工具,而非 ShortOPD 的必要组成。

  3. 自由生成与候选似然评分的差异
    多选题可通过对固定选项计算 likelihood 完成;自由生成要求模型在逐 token 自回归解码中把正确轨迹排到高概率。两者对剪枝损伤和恢复信号的敏感性不同。

  4. 在策略蒸馏(On-Policy Distillation, OPD)
    学生从自身分布生成,教师在这些学生轨迹上提供 token-level 分布目标。其目标是减少训练状态与实际推理状态的分布失配。

  5. 离策略 / 教师强制蒸馏
    在固定数据或教师生成序列的前缀上训练。它可以有效学习外部文本似然,但未必修复学生生成时会出现的错误前缀。

  6. 广义 Jensen–Shannon divergence(广义 JSD)
    教师与学生分布的有界、对称式折中散度。本文取 (\alpha=0.5),并用 top-100 logits 和一个 tail bin 近似词表分布;这也意味着 tail 内部差异不可见。

  7. 稀疏奖励 RLVR
    用可验证结果(如数学最终答案正确)作为强化学习奖励。其优势是目标直接,但在学生几乎不能产生成功样本时,初期有效信号可能极少。

  8. 有效长度、重复率与干净截断率
    有效长度指去除严重末尾循环后的可用前缀;重复率用于识别应缩短预算的退化状态;干净截断率表示没有循环但达到当前上限的样本比例,用于判断是否应增加预算。

关键前作

  • ShortGPT(Men et al., ACL Findings 2025)
    本文的 BI 深度剪枝来源。ShortOPD 继承其“某些层可删”的压缩设定,但把重点从剪枝本身转到生成能力的训练后恢复。

  • On-Policy Distillation of Language Models(Agarwal et al., ICLR 2024)
    本文 OPD 的核心方法基础:在学生自生成状态上做密集教师蒸馏。ShortOPD 的增量在于为受损剪枝学生加入 rollout horizon 控制。

  • MiniLLM(Gu et al., ICLR 2024)
    代表语言模型在策略蒸馏和散度选择的相关路线。本文讨论 forward KL、reverse KL 与广义 JSD 的取舍,但没有系统比较这些散度在剪枝恢复中的全部效果。

  • Sequence-Level Knowledge Distillation(Kim & Rush, EMNLP 2016)
    代表用固定教师序列进行蒸馏的离策略路线。本文的 SeqKD 基线用它来检验:仅有教师答案而没有学生状态是否足以恢复自由生成。

  • Vision-OPD(Yuan et al., arXiv 2026)
    论文将其视为 OPD 在多模态模型上的先例。它与本文共同强调从学生自身生成状态获得学习信号,但本文处理的是结构剪枝后的 LLM 恢复,而非视觉细粒度理解。