Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
论文元数据
- Authors: Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang
- Publication date: 2026-07-27T00:00:00.000Z
- arXiv: https://arxiv.org/abs/2607.24731
- PDF: https://arxiv.org/pdf/2607.24731
- Project: https://rethinking-cfg-opd.github.io
- Code: https://github.com/rethinking-cfg-opd/Rethinking-CFG-OPD
- 本次阅读输入: 文本回退 + 已定位图像
论文标题:Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
阅读范围与证据边界
- 输入范围: 本解读基于论文的完整 PDF 文本提取稿(含正文、可提取公式、表格文本、图注、附录与参考文献),属于文本回退(text fallback)输入。
- 未直接视觉审阅: 我未直接检查 PDF 的页面布局、颜色、曲线几何、图像细节、视觉对齐关系,也未检查文本提取或图注中未保留的图/表细节。因此下文对图 1–9 的描述只依据作者正文和图注,不将其当作独立视觉证据。
- 证据层级: “作者主张”指论文提出的机制解释;“论文直接证据”限于文中报告的实验设置、指标和数值;“分析者判断”则评估这些证据实际支持到何种程度。
- 材料边界: 文本包含附录实验细节,但未提供代码、训练日志、原始生成视频、每个指标的置信区间/多随机种子结果,以及图像或视频的可直接视觉核验材料。因此,关于优化动力学普适性、定性质量和实际部署收益的结论应保持保守。
- 总体定位: 这不是 RLHF 论文,而是一篇与偏好优化相邻的 Diffusion 后训练/蒸馏工作;其主要价值在于指出:当 teacher/student 的条件信息不对称时,CFG 组合层上的蒸馏目标可能产生不可辨识监督与部署时 CFG 尺度脆弱性。
1. 一页速览:值不值得看
| 项目 | 判断 |
|---|---|
| 问题 | 在保留正、负两条 CFG 分支的 diffusion on-policy distillation(OPD)中,若只匹配组合后的 guided velocity,是否会遗漏分支级错误,并在 teacher 持有学生不可见条件信息时导致失效?这是实际 dense-to-sparse 视频控制蒸馏中的问题。 |
| 一句话方法 | 用 Positive–Direction Matching(PDM)替代仅匹配 CFG 组合输出的 naive OPD:分别匹配正条件预测 与 CFG 条件方向 ,从而消除正、负分支误差相互抵消的自由度。 |
| 真正新意 | 核心新意不是 OPD 或 CFG 本身,而是把 CFG 组合目标的分支不可辨识性明确写出,并将其与“teacher 负分支含有 privileged conditioning”这一条件不对称场景联系起来,提出 Negative Branch Asymmetry(NBA)诊断。PDM 是一个简洁但有针对性的重参数化监督目标。 |
| 关键结果 | 在 pose 视频控制的 设置,naive OPD 从 降至 时,FVD 从 67.44 恶化到 507.70;PDM 对应从 58.65 到 60.97。主表中,PDM 在 pose/depth/scribble 的多数控制指标上优于 naive OPD,并通常优于 IBM。 |
| 可信度 | 中等。 代数上的不可辨识性成立,受控实验与视频控制实验方向一致;但“privileged negative conditioning 导致 NBA”的机制主要来自有限场景的经验观察,缺少多模型、多数据和统计重复验证。 |
| 相关性 | 对 Diffusion 后训练、教师-学生条件不对称、控制生成、CFG 保留型蒸馏高度相关;对传统 RLHF、LLM/VLM preference optimization 没有直接方法迁移,但“在组合输出之前施加可辨识监督”的原则具有一般价值。 |
| 建议 | 精读。 若你的路线涉及 diffusion OPD、控制条件压缩、CFG 训练/部署尺度不一致,本文值得看方法与实验;若只关心 reward-model RLHF 或语言模型对齐,可按需参考其目标设计思想。 |

Figure 1|第 1 页。 Figure 1: Naive CFG-based OPD suffers from branch ambiguity. Matching only the CFG- composed prediction allows positive and negative branch errors to cancel, creating infinitely many degenerate solutions. Our branch-aware objective, Positive–Direction Matching (PDM), resolves this ambiguity by separately constraining the positive prediction and the CFG conditional direction, restoring identifiable supervision and robust distillation across guidance scales. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。
2. 方法论拆解
2.1 问题与已有路线的缺口
论文研究的并不是把 CFG 烘焙进单输出、少步采样器的常规 diffusion distillation,而是另一类更容易被忽略的设置:
- student 沿自身生成轨迹访问状态;
- teacher 在这些 student-visited states 上提供局部去噪/velocity 监督;
- teacher 与 student 都保留原模型的 CFG 接口,因而均有正条件分支与负条件分支;
- 部署时可重新选择 CFG scale 。
在这一设置下,常规做法是直接匹配 teacher 与 student 的 CFG 组合速度:
其中 是正条件预测, 是负条件或 null-condition 预测, 为推理时 guidance scale。
论文指出,若 teacher 与 student 都输出两个分支,训练损失只约束组合结果,未必约束分支本身。定义分支误差:
naive CFG-based OPD 的点式目标是:
因此,零损失只要求:
即:
这说明存在无穷多组非零 能使组合误差为零。论文直接证据之前的部分是代数事实:组合层监督在分支层面确实不可辨识。 但不可辨识不自动等于优化失败:如果两个分支的条件相同或高度耦合,共享参数更新仍可能让两种误差一起下降。
作者认为真正的缺口发生在 teacher/student 的条件信息不对称时。典型例子是:
- teacher 正分支:文本 加稠密控制或参考图;
- student 正分支:文本 加稀疏控制,或仅文本;
- teacher 负分支:null text,但仍保留稠密控制/参考图;
- student 负分支:null text,且缺少上述附加信息。
此时 student 无法直接重现 teacher 的负分支目标。作者把 naive objective 下“正分支误差下降、负分支误差持续上升”的现象称为 Negative Branch Asymmetry(NBA)。其关键不是“推理 scale 改变时性能下降”本身,而是相对 teacher 或 branch-aware student 出现的额外、异常的 scale 敏感性。
需要区分:作者并未证明 privileged negative conditioning 是 NBA 的充分必要条件;论文展示的是两个对照案例和一个视频控制应用,支持它是一个重要触发条件。
2.2 核心机制与流程
PDM 的设计逻辑是:不要在 CFG 组合之后才匹配,而应在组合之前分别约束能唯一决定两个分支的量。
作者定义模型 的 CFG conditional direction:
PDM 的点式蒸馏损失为:
其中 是 direction matching 权重。
这个目标的作用分两层:
- 第一项锚定正分支,使 student 直接接近 teacher 的目标条件预测;
- 第二项匹配正、负分支间的方向差,使 student 保留 teacher 对 CFG 的响应结构。
在 时,若 PDM 损失为零,则先有 ,再由 得到 。因此,PDM 将 naive loss 的分支级多解问题变成唯一零损失解。
完整 OPD 仍是在 student 自己访问的去噪状态上计算,只是替换点式损失:
这里 吸收了 timestep、参数化和 solver 相关权重;论文使用 velocity prediction,但作者称思路可等价推广到 noise、score 或 flow parameterization。这个推广在形式上合理,但具体优化性质是否保持,论文没有直接实验验证。
论文还使用了一个关键对照:Independent Branch Matching(IBM):
IBM 同样消除了分支间交叉抵消,但直接独立匹配两条分支;PDM 则匹配“正预测 + 条件方向”。因此,IBM 用来回答“收益来自 branch-aware supervision 本身,还是来自 PDM 的特殊参数化”。
在 dense-to-sparse video control 中,作者还引入截断的 on-policy supervision horizon。若整条轨迹有 个状态,只监督前 个:
student 仍然完成完整去噪 rollout,但 teacher 只在早期 个状态上求值。作者使用 、完整轨迹 ,将 teacher 计算成本显著降低。
2.3 关键设计与创新判断
-
把 CFG 组合误差拆解为分支误差。
- 解决什么:揭示只在 上匹配会遗漏 与 的单独约束。
- 为什么可能有效:它直接暴露线性组合中的 cancellation direction。
- 必要性证据:代数上明确成立;在 privileged conditioning 实验中,branch-error trajectory 与预测一致。
- 创新判断:这是本文最清晰、也最可迁移的分析贡献。
-
以“privileged negative conditioning”界定危险场景。
- 解决什么:避免把所有 CFG 组合蒸馏一概判定为不可靠。
- 为什么可能有效:当 teacher 负分支保留 student 不可见的参考/控制条件时,负分支误差不再容易与正分支同步下降。
- 必要性证据:文本渲染共享 null-text 条件时,naive OPD 未显示额外 scale 脆弱性;参考条件与视频稠密-稀疏控制时,作者报告了相反趋势。
- 创新判断:经验上合理,但目前更像一项有解释力的经验条件,而非完整理论判别准则。
-
Positive–Direction Matching。
- 解决什么:在不直接硬匹配负分支绝对值的前提下,让两分支均受约束。
- 为什么可能有效: 与 构成一组可重构的坐标。
- 必要性证据:PDM 与 IBM 都改善,表明“分支感知”本身很重要;PDM 相较 IBM 的额外优势在主结果中存在,但理论原因未被证明。
- 创新判断:方法十分简洁,实质是监督坐标系选择;其工程价值可能大于算法复杂度。
-
早期状态截断监督。
- 解决什么:视频 OPD 中逐步 teacher 求值成本高。
- 为什么可能有效:早期 trajectory state 已能提供足够校正信号。
- 必要性证据:在 pose-only ablation 中, 取得较好控制精度,显著快于 。
- 创新判断:有用的训练预算发现,但不是本文关于 CFG/NBA 的核心创新,且只在单一视频任务上验证。
2.4 可迁移的方法论
对 Diffusion/RLHF 后训练路线,最有价值的不是直接套用 PDM 公式,而是以下原则:
- 避免只监督可部署系统的最终线性组合。 若模型内部仍保留多个可独立变化的分支、adapter、控制流或 condition channel,只匹配最终合成输出可能留下不可辨识方向。应先问:零总误差是否意味着每个可部署组件都正确?
- 把“训练组合权重”与“部署组合权重”分离审计。 本文中训练采用固定 ,部署可变 。任何包含 guidance weight、reward mixture、多条件融合系数或 sampling temperature 的系统,都应测试权重外推。
- 在有 privileged teacher context 时,审计每条条件路径。 teacher 具备额外图像、视频、检索结果、密集标注或工具上下文时,学生可能通过其他通道补偿损失,而非真正学习目标能力。
- 为 OPD/RLHF 的组合奖励设计可辨识监督。 在偏好优化或多奖励训练中,若只监督加权 reward,不能据此说明每个目标都获得改善。可借鉴“主目标 + 差分/方向约束”的思路,但需要结合 reward scale、偏好冲突和梯度噪声重新推导。
迁移风险也很明确:PDM 依赖可访问的 、 以及明确的 CFG 结构。对于已将 CFG 蒸馏成单输出模型、没有保留双分支接口的 LCM/DMD 类模型,本文方法不能直接使用。对于 LLM/VLM,正负分支也未必对应可线性组合的网络预测,不能机械类比。
3. 关键证据与实验审计
证据一:共享与特权负条件下的分支误差动力学
展示了什么 → 支持什么 → 仍不能证明什么
作者在两个图像蒸馏案例中追踪 与 :
- 文本渲染:teacher/student 都使用相同 prompt 和相同 null-text 负条件;
- reference-conditioned style distillation:teacher 的正、负分支都保留参考图,text-only student 则没有参考图。
论文报告:在共享负条件的文本渲染中,positive-only、naive 与 PDM 都呈现两个分支误差共同下降;在特权参考条件中,positive-only 与 naive matching 都降低正分支误差,却提高负分支误差,PDM 则抑制负分支持续恶化。
支持什么: 该实验直接支持“在作者所选条件不对称设置中,naive 目标可以伴随 antagonistic branch-error dynamics;PDM 能改变这种轨迹”的经验结论。positive-only ablation 尤其有用,因为它说明不只是 CFG 组合项本身,正分支导向的更新也可能与负分支目标冲突。
仍不能证明什么:
- 不能证明所有 privileged conditioning 都会产生 NBA,或共享条件一定安全;
- 未报告不同随机种子、方差、显著性检验与完整曲线数值,无法判断现象稳定程度;
- 参考条件实验仅有六种占位风格、每种四个训练示例、12 个 held-out prompts,本质上是小规模定性 case study,不能据此估计真实风格迁移能力;
- 文本提取提供的是图注和作者叙述,不能独立核验图 2 的曲线形态或图 3 的图像质量。
证据二:dense-to-sparse 视频控制主结果
展示了什么 → 支持什么 → 仍不能证明什么
作者使用 Wan2.1-VACE-1.3B 的 LoRA 微调,teacher 接收每帧稠密 pose/depth/scribble control,student 只接收四个 keyframe(索引为 0、20、40、60,其中 0 为 reference image)。训练集约 24K clips,测试为 600 clips;所有方法训练预算和 student architecture 相同,主表在 评估。
与 naive OPD 相比,PDM 在三类控制上均提升了主要控制指标:
- Pose: PDM 的全帧 MPJPE 为 4.13,优于 naive 的 4.43;全帧 PCK@0.1 为 82.48,高于 naive 的 80.28。PDM FVD 为 62.77,低于 naive 的 65.12。
- Depth: PDM 的 CORR 为 91.24,高于 naive 的 90.58;全帧 RMSE 为 11.95,低于 naive 的 12.39;SI-RMSE 为 10.31,低于 naive 的 10.69。PDM FVD 为 60.60,优于 naive 的 72.20。
- Scribble: PDM 的全帧 F1 为 76.22,优于 naive 的 75.00;PDM FVD 为 50.53,优于 naive 的 59.95。
PDM 通常也优于 SFT 与 off-policy teacher matching;IBM 多数情况下也好于 naive,说明收益并非只来自 PDM 的具体公式。
支持什么: 在给定 Wan-VACE、OpenHumanVid 构造和固定训练预算下,branch-aware OPD 对 dense-to-sparse control transfer 有实际收益;收益不仅体现在 CFG scale 改变后,也体现在训练 scale 本身。
仍不能证明什么:
- 公平性在论文描述层面较好:同一 base model、LoRA、训练步数与硬件设置;但 OPD、SFT 与 off-policy 的每步 teacher 计算量、总 wall-clock 和调参预算并未被完整对齐展示。PDM 的效果是否部分来自更丰富的 teacher target,而不是单纯“更好的目标结构”,不能完全排除。
- 控制质量指标依赖从生成视频重新提取 pose、depth、scribble。它们衡量生成输出与控制信号的一致性,但不直接保证语义真实感、长程运动合理性或人类偏好。
- FID/FVD 的改善并不自动证明“视频质量”全面提升;尤其 FVD 的计算对数据量、采样与特征分布敏感,且没有置信区间。
- 仅在一个模型家族、一个视频控制接口、三种结构控制模态验证,泛化到图像编辑、文生图、音频扩散或不同 CFG schema 仍属未知。
证据三:CFG scale 外推与效率消融
展示了什么 → 支持什么 → 仍不能证明什么
在 pose-only scale sweep 中,所有模型以 训练:
- naive OPD 在 时 FVD 为 67.44,到 时为 134.09,到 时升至 507.70;
- IBM 对应 FVD 为 53.83、56.85、71.17;
- PDM 对应 FVD 为 58.65、55.85、60.97。
控制指标也呈相同方向:naive 在 时全帧 MPJPE 为 8.98、PCK@0.1 为 69.14;PDM 分别为 4.48 与 81.72。
效率消融中,PDM 的 的每 step 训练时间约为 23、38、69、132、790 秒。 在 keyframe MPJPE(2.75)与 keyframe PCK@0.1(91.66)上是被报告设置中的最佳值; 并未更好。
支持什么: 对该 pose-only 测试协议,naive loss 的性能对部署 CFG scale 高度敏感,PDM/IBM 显著更稳健;教师监督无需覆盖全部 50 个去噪状态才能得到好的控制指标。
仍不能证明什么:
- scale sweep 只报告 pose-only 模型;不能直接将表 3 与三模态主表横向比较,作者也明确指出训练协议不同。
- 在 时 CFG 退化为正分支输出,这与论文机制非常一致,但仍不足以证明所有退化均由 NBA 因果导致;同时改变 也会改变 teacher 本身的生成行为。作者通过文本渲染对照排除了部分“teacher 固有 CFG 依赖”的解释,但未在视频任务中完整报告 teacher scale sweep。
- 的结论是特定算力-质量折中,不应解释成“扩散 OPD 普遍只需早期八步监督”。不同 sampler、步骤数、任务与模型容量可能改变最优 。
4. 批判性判断与复用建议
4.1 证据强度
总体:中等。
强支持部分:
- CFG-composed matching 在分支级存在零损失多解,这是明确的线性代数结论;
- PDM 和 IBM 都消除了该特定的分支交叉补偿自由度;
- 在论文的视频控制设置中,PDM/IBM 对 off-scale CFG 变化的稳健性明显优于 naive OPD,数值差距足够大。
中等支持部分:
- privileged negative conditioning 是 NBA 的重要经验触发条件;
- PDM 比 IBM 更好的原因是“positive–direction parameterization”而不只是随机波动或 task-specific weighting。
弱支持或未充分支持部分:
- NBA 是否可成为任意多条件 diffusion distillation 的通用诊断理论;
- PDM 的优势是否能泛化到不同 diffusion parameterization、不同 CFG schema、不同 teacher/student capacity gap;
- PDM 改善定性生成质量和风格保持的程度。论文提供图注与案例描述,但本输入未包含可直接视觉检查的证据,且小样本 case study 不能替代定量评估。
4.2 主要局限与失败条件
-
触发条件尚未被系统刻画。
论文提出共享负条件与特权负条件的对比,但条件不对称程度、teacher/student capacity、条件注入位置、共享参数结构和 都可能共同影响结果。影响:机制解释与泛化性。 -
PDM 相对 IBM 的理论优势没有闭环。
作者承认二者在非退化权重下具有相同的分支级零损失解,PDM 的更好表现目前只是经验事实。PDM 的正-方向坐标为何带来更优优化路径、是否与 、梯度尺度或网络参数共享有关,未被分析。影响:新颖性解释与复用选择。 -
reference-conditioned 机制案例规模很小。
六类风格、24 个训练 demonstrations、12 个 held-out prompts,且评估是定性的。它适合作为现象示例,不足以证明一般的 style distillation 成功或失败率。影响:机制外推与定性结论。 -
没有统计稳健性报告。
主表和消融没有多 seed、标准差、置信区间或显著性测试。对多个指标、小幅改进(如部分 PDM/IBM 差异)不能过度解读。影响:结果可靠性与方法排序。 -
评价指标可能与最终质量不完全一致。
pose/depth/scribble 都是从生成视频重新提取控制信号;FID/FVD 是分布特征指标。它们无法充分覆盖 prompt fidelity、主体一致性、复杂运动、时序语义、主观自然度和安全性。影响:工程部署判断。
4.3 最有价值的下一步验证
-
做条件不对称程度的连续扫描。
要验证什么:逐步移除 teacher 负分支中的参考/控制信息,或逐步向 student 提供部分信息,测量 branch-error dynamics 与 off-scale degradation 的关系。
为何重要:这能把“共享 vs 特权”的二元故事升级为可预测的触发规律。
什么结果会改变判断:若 NBA 在无明显特权负条件时同样频繁发生,或强特权条件下仍稳定,则当前机制解释需要修正。 -
在多模型、多任务、多 CFG schema 上复现,并报告多 seed。
要验证什么:至少覆盖 image editing、text-to-image control、video control 以及不同网络/parameterization。
为何重要:当前证据主要集中于 FLUX.2 与 Wan-VACE 风格的设置。
什么结果会改变判断:若 PDM 的优势只在特定 VACE 接口或特定 guidance scale 出现,应将其定位为工程策略而非普适 OPD 原则。 -
分析 PDM 与 IBM 的优化几何。
要验证什么:比较两者对各分支梯度范数、梯度夹角、条件通道参数更新及 敏感性的影响。
为何重要:二者具有相同零损失解却有不同实验表现,是论文最值得补足的理论缺口。
什么结果会改变判断:若经归一化权重、梯度平衡后 IBM 追平 PDM,则 PDM 的独特价值可能主要是隐式重加权,而非方向表示本身。
4.4 最终复用结论
- 应借鉴:先检查监督目标的可辨识性。 如果最终目标是多个内部预测的线性或非线性合成,训练损失不能只在合成结果上为零;需要确认内部自由度不会在部署条件变化后暴露。
- 应借鉴:将训练/部署 guidance 或组合权重作为单独泛化维度。 不要只在 上报告最佳结果;至少测一个低 guidance、训练 guidance 与一个高 guidance。
- 可优先尝试:在保留 CFG 双分支且 teacher/student 控制条件不对称的 diffusion OPD 中实现 PDM 与 IBM。 IBM 应作为必要 baseline,因为它能区分“分支监督是否有用”和“PDM 参数化是否有额外价值”。
- 不要照搬:不要把 PDM 当作所有 diffusion distillation 的默认损失。 若 student 已经是 CFG-free 单输出模型、negative branch 不可访问、或部署中不改变 guidance,本文的核心失败模式未必存在。
- 路线建议:纳入后续 Diffusion 后训练工具箱,但定位为“CFG 分支结构审计 + 条件不对称蒸馏策略”,而非替代 RLHF 或通用 preference optimization 的主线方法。
5. 必要概念与文献地图
必要概念
- Classifier-Free Guidance(CFG): 对同一 diffusion model 分别计算正条件与负/空条件预测,再用 guidance scale 线性组合,以强化条件遵循。本文的关键在于 CFG 通常保留两个独立分支,而非天然只有一个输出。
- Velocity prediction: 扩散或流模型的一种预测参数化。本文用 表示局部去噪/速度预测;作者称其结论在等价的 noise、score、flow 参数化下可迁移,但未逐一验证。
- On-policy distillation(OPD): student 在自己的生成轨迹上采样状态,teacher 在同一状态给出局部监督。它减少 teacher/student state-distribution mismatch,但通常要付出较高 teacher 推理成本。
- Privileged conditioning: teacher 拥有 student 在训练或推理中不可访问的额外条件,例如稠密控制帧、参考图或其他辅助输入。
- Branch ambiguity: 只监督 时,不同的 组合能产生同样的组合误差,故无法由 loss 唯一确定两条分支是否正确。
- Negative Branch Asymmetry(NBA): 本文定义的经验性失败模式:在特权负条件下,naive CFG matching 使正分支误差降低、负分支误差上升,且这种补偿在 改变时暴露为额外性能退化。
- Positive–Direction Matching(PDM): 分别匹配正分支 和条件方向 的 branch-aware OPD 目标;其零损失意味着两个分支均匹配。
- Dense-to-sparse control: teacher 使用每帧控制信号,student 只使用少数关键帧控制的知识转移设置;本文的实际应用任务。
关键前作
-
Ho & Salimans, 2022, Classifier-Free Diffusion Guidance.
CFG 的基础定义来源;本文的问题正是由保留正、负 CFG 分支并在推理时可调 所产生。 -
Jiang et al., 2026, D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models.
代表使用 privileged context 的 diffusion OPD 路线,也是本文参考条件蒸馏场景的重要背景。 -
Li et al., 2026, DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models.
提供本文文本渲染设置和 OPD 可归约为 prediction matching 的直接背景;本文进一步质疑 CFG 组合 prediction matching 的分支层含义。 -
Fang et al., 2026, Flow-OPD: On-Policy Distillation for Flow Matching Models.
代表保留 flow/diffusion 局部预测并进行 on-policy 稠密监督的相关路线;本文的 branch-aware 目标可看作对这类框架在 CFG 下的补充。 -
Luo et al., 2023, Latent Consistency Models;Yin et al., 2024, One-Step Diffusion with Distribution Matching Distillation.
它们常将 CFG-composed teacher field 蒸馏为单 student output,旨在少步生成;这与本文保留双分支、保留部署时 guidance 可调性的设置不同,因此不会直接面对同一种 branch ambiguity。