Registers Matter for Pixel-Space Diffusion Transformers
论文元数据
- Authors: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
- Publication date: 2026-07-06T00:00:00.000Z
- arXiv: https://arxiv.org/abs/2605.16147
- PDF: https://arxiv.org/pdf/2605.16147
- Project: https://quickjkee.github.io/registers-project-page/
- Code: https://github.com/quickjkee/register-guidance
- 本次阅读输入: 文本回退
论文标题:Registers Matter for Pixel-Space Diffusion Transformers
阅读范围与证据边界
- 输入材料: 本报告基于论文
arXiv:2605.16147v2的完整 PDF 文本抽取结果撰写,覆盖正文、参考文献、附录文字、表格中的可抽取数值及部分图注。 - 文本回退输入: 这是一次**文本回退(text fallback)**阅读;我没有直接检查 PDF 页面布局、颜色、曲线几何、图像视觉质量、注意力图的空间形状,或任何未被抽取文本与图注保留的图/表细节。
- 证据分层: 文中“作者主张”指论文提出的机制解释;“论文直接证据”仅指其报告的 FID、消融、token norm、TV ratio、线性 probe 等结果;“分析者判断”是对这些证据覆盖范围、混杂因素和可复用性的审计,不能与实验事实混同。
- 材料限制: 虽然抽取文本包含主要表格、附录和图注,但大量图的数值坐标、视觉样本细节及图表排版关系不可可靠复原。因此,本报告不以“看图确认”的方式判断生成样本是否更真实、更连贯,也不从不可见的曲线形状推导额外结论。
- 结论适用域: 核心实证主要是 ImageNet 类条件 pixel-space DiT/JiT,补充了少量 latent-space 模型和预训练文生图模型的内部 token-norm 分析;它不是对开放域文生图、视频扩散或任意 DiT 的普适证明。
1. 一页速览:值不值得看
| 维度 | 判断 |
|---|---|
| 问题 | Pixel-space Diffusion Transformer(pDiT)直接在像素空间建模,避免 VAE/RAE 表征瓶颈,但中间特征更高维、更嘈杂,训练与采样质量难以提升。论文问:为 ViT 设计的 register token 能否帮助 DiT,以及为何 pixel-space 特别受益。 |
| 一句话方法 | 在 patch token 序列中加入不直接参与扩散损失的可学习 register token,并在推理时把“带 register”和“去掉 register”的同一模型预测之差当作额外引导方向,得到 Register Guidance(RG)。 |
| 真正新意 | 贡献不只是“给 DiT 加几个 token”:一是指出 DiT 即使没有 ViT 式 patch-token outlier,register 仍可改善 pixel-space DiT;二是将 register 解释为同时承担高范数“sink”和全局语义载体;三是通过 register dropout 让单模型可切换有/无 register,从而构造较对齐的 guidance 对。 |
| 关键结果 | ImageNet 256×256 上,JiT-B/16 从 CFG 的 FID 3.71 降至 RG 3.46、RG+CFG 3.32;JiT-L/16 为 2.47 → 2.18 → 2.16;JiT-H/16 为 1.90 → 1.85 → 1.80。pDiT-B/16 加 register 后,600 epoch FID 从 4.80 降至 3.80;pDiT-L/16 为 2.80 → 2.47。 |
| 可信度 | 中等。 受控的 ImageNet 多尺度、分辨率、register 位置/数量和 RG 超参消融较完整,且报告了负结果;但核心机制仍主要是相关性证据,缺少直接因果干预与跨数据集、开放域文生图端到端验证。 |
| 相关性 | 对 Diffusion / pixel-space DiT / flow matching / guidance 高度相关;对 RLHF 没有直接关系。对 VLM/LLM 的直接方法价值有限,但“无损失约束的辅助 token 充当全局状态槽位或范数 sink”的机制假说可启发多模态 Transformer 设计。 |
| 建议 | 精读。 若在做 pixel-space DiT、JiT/MeanFlow、辅助条件 token、representation alignment 或采样 guidance,这篇提供了可立即验证的结构与训练方案。若只关注 RLHF 或通用 LLM 后训练,则按需参考其 token-role 分离与弱模型引导思路即可。 |
总体结论: 这是一篇较有价值的“结构诊断 + 工程落地”论文。最值得吸收的不是“register 必然有用”的泛化口号,而是一个更具体的设计原则:在 pixel-space DiT 中,为不受逐 patch 去噪损失直接约束的辅助 token 留出容量,并在语义结构已开始形成的中后层才启用它们;如果要将有/无该容量的预测差用于引导,则必须在训练中显式对齐两种运行模式。
2. 方法论拆解
2.1 问题与已有路线的缺口
论文从 ViT register 的既有动机出发,但试图说明其在 DiT 中的作用不同。
-
ViT register:修复 patch-token outlier。
Vision Transformers Need Registers的原始论点是:自监督 ViT 中少数 patch token 会出现异常高范数,常与不良注意力图、低信息背景区域相关;额外 register 为全局信息提供专用槽位,从而减少 patch token 被挪作全局汇聚节点的压力。 -
DiT / flow matching:所有 patch token 都被扩散目标约束。
在论文的 pDiT 设置中,图像被分块成 patch token,模型在 ImageNet 上采用 flow matching 与 x-prediction。作者认为,patch token 全部参与预测损失,因而不像判别式 ViT 那样容易长期充当不服务于局部预测的“异常槽位”。 -
已有 pixel-space DiT 中的附加条件 token。
JiT 等设计会把重复的类别嵌入作为 in-context token 与图像 token 一起处理。作者的关键问题是:这些 token 的收益究竟来自“额外类别条件”,还是来自它们客观上提供了类似 register 的自由状态容量? -
CFG / AutoGuidance 的缺口。
CFG 用条件与无条件预测的差来加强条件;AutoGuidance 则需要一个较弱模型。后者的困难是“弱模型”常需人工选择、且与强模型可能失配。论文提出:去掉 register 的同一网络分支可作为强模型的弱对应物,但前提是两种模式必须被联合训练并对齐。
作者主张,pixel-space pDiT 的中间特征比 latent-space 模型更高范数、更不平滑,因此更需要额外 token 承担一部分全局/高幅值表征负担。论文直接证据是 feature norm、TV ratio 和 FID 的并行变化;但“高范数导致表示质量差,register 通过搬运全局信息而改善生成”的因果链仍是解释性假说,并未被完全隔离验证。
2.2 核心机制与流程
A. Register token:为 DiT 提供不直接受像素损失约束的状态槽位
设图像 patch token 为 (x_{\text{patch}}),加入 (K) 个可学习 register (r_1,\ldots,r_K),模型输入变为:
[ x = [r_1,\ldots,r_K, x_{\text{patch}}]. ]
register 与 patch token 共同参与 Transformer 的 self-attention 和 MLP,但 register 本身不对应输出图像 patch,因而不直接承受每个 patch 的 flow/diffusion 监督。
论文将此机制解释为两种功能的并存:
- norm sink: 少量 register 获得高范数,承接高幅值激活;
- global information carrier: 一些中低范数 register 在线性 probe 中具有较高的类别预测精度,并被作者解释为承载全局或区域语义。
该解释的必要假设是:token 范数、线性 probe 准确率和中间特征空间平滑性确实分别对应“sink”“语义信息”“表示质量”。前两者是可测代理指标,但都不是对因果功能的直接证明。
B. 延迟插入:只在较深层启用 register
对于 12 层 pDiT-B/16,作者发现 register 从第 4 层引入、持续到第 11 层更有效,而从第 0 层一路使用的表现接近或不如无 register 基线。
这一设计的逻辑是:
- 早层主要处理局部噪声与低级信号,尚未形成足够的语义结构;
- 过早引入 register,可能使它们吸收无信息或不稳定信号;
- 中后层的 register 才能形成“全局语义载体 + norm sink”的分工;
- 因此应把 register 作为一种后段表征组织机制,而非输入层就固定存在的通用 token。
论文直接给出位置、数量和 FID 消融,但“早层缺乏语义结构”主要由第 5 block 的线性 probe 支撑,尚未通过例如冻结、替换、信息互信息或受控特征注入实验严格证明。
C. Register Guidance(RG)
对当前样本 (z)、时间 (t)、条件 (y),模型分别给出带/不带 register 的重建或预测:
[ x_r = \mathrm{net}(z,t,y,\mathrm{regs}=True), \qquad x_{nr} = \mathrm{net}(z,t,y,\mathrm{regs}=False). ]
在 flow-matching 参数化下,论文将其转换为速度:
[ v_r = \frac{x_r-z}{1-t}, \qquad v_{nr} = \frac{x_{nr}-z}{1-t}. ]
RG 的采样方向为:
[ v_{\mathrm{RG}} = v_{nr} + w_{\mathrm{rg}}(v_r-v_{nr}). ]
其中:
- (v_{nr}) 是去掉 register 的“较弱版本”预测;
- (v_r-v_{nr}) 被视为 register 所带来的结构与细节改善方向;
- (w_{\mathrm{rg}}) 控制放大程度。
与 CFG 组合时:
[ v = v_u + w_{\mathrm{cfg}}(v_r-v_u) + w_{\mathrm{rg}}(v_r-v_{nr}), ]
其中 (v_u) 是 null-label 下、带 register 的无条件预测。作者主张 CFG 主要增强类别条件,RG 主要增强 register 关联的结构与视觉细节,二者可互补。
D. 为 RG 训练单一双模式模型
若“有 register”和“无 register”来自两个独立训练模型,二者预测差可能包含模型失配,而不只是 register 的作用。论文报告在高 guidance scale 下会出现 artifacts。
为此,训练时以概率 (p) 整体丢弃所有 register:
[ \mathrm{use_regs} \sim \mathrm{Bernoulli}(1-p), ]
[ z=tx+(1-t)\epsilon,\qquad v=\frac{x-z}{1-t}, ]
[ \mathcal{L}=\left|v-\hat v(z,t,\mathrm{use_regs})\right|_2^2. ]
这使一个模型同时支持有/无 register 的前向路径。论文在从头训练中发现较小 (p) 可保留有-register 基线质量并让 RG 可用;微调预训练 JiT 时使用更高的 (p=0.3)。
关键不是 dropout 本身,而是它把 RG 的反事实比较变成了共享参数下的条件消融。这比两个独立模型相减更合理,但仍增加了训练和采样上的超参、计算与稳定性负担。
2.3 关键设计与创新判断
| 设计 | 解决什么 | 为什么可能有效 | 证据是否足够 | 创新性质 |
|---|---|---|---|---|
| 在 pDiT 中加入 register | 为全局/高幅值状态提供不直接受 patch loss 约束的容量 | 让 patch token 更专注局部去噪,辅助 token 承担部分全局组织或高范数激活 | 多规模、分辨率、空间的 FID 与 norm/TV 证据支持“有效”;功能解释仍不充分 | 将 ViT register 系统化迁移到 DiT,并识别其不同工作条件 |
| 中后层才启用 register | 避免早层 register 传播无语义信号 | 只有表征形成后,register 才能有可汇聚的全局信息 | 位置消融强;语义形成时机的解释偏推断 | 重要的实用结构结论 |
| 使用较多 register(如 32 个) | pixel-space pDiT 可能需要更大辅助容量 | 更高维、更嘈杂的像素空间需要更多可分工的额外 token | 仅在给定架构和预算下验证,未报告容量归一化的广泛比较 | 工程性配置发现,不是独立新机制 |
| register dropout | 构造同一网络的有/无 register 对照预测 | 共享参数减少弱/强模型不对齐,使 RG 更稳定 | 两模型 vs 单模型的结果支持;未系统量化预测对齐程度 | 将条件 dropout 用于 register-guidance 的合理组合 |
| RG + CFG | 放大 register 提供的改善方向,同时保留类别引导 | 两个差分方向可能编码不同因素 | ImageNet FID 一致改善;视觉“结构改善”只由图注和作者描述支持 | 是 AutoGuidance 的特定、可操作弱模型构造 |
2.4 可迁移的方法论
对 pixel-space Diffusion / DiT
最直接可迁移,建议按以下优先级验证:
-
延迟插入的辅助 token。
不应默认在全部层加入 token。先在中间层或中后层启用,并用 no-token / all-layer / late-layer 三组对照验证。论文在 pDiT-B/16 中显示,4–11 层明显优于 0–11 层。 -
把附加条件 token 当作结构容量,而不只当条件输入。
如果模型将 class、text、style、control 等 token 与 image token 同序列处理,这些 token 可能不只是传递条件,也可能承担 register-like 功能。应通过 token norm、消融附加信息、冻结/置换 token 内容等实验拆开“条件信息收益”和“额外无损失槽位收益”。 -
以单模型反事实分支做 guidance。
若模型包含可开关模块、adapter、context token 或处理路径,可用共享参数的“完整配置 − 简化配置”差作为引导候选,但必须在训练阶段使两种模式都可运行;否则差分很可能是模型不对齐而非可控质量方向。 -
用内部表征诊断配合最终生成指标。
token norm、TV、空间相关性衰减等代理指标可帮助定位问题发生在何层、何种噪声阶段,但它们只能作为诊断证据,不能代替 FID、偏好评价、下游任务或人类质量评测。
对 VLM / LLM / RLHF
- 可借鉴: 在多模态或长上下文 Transformer 中,某些不直接受 token-level 监督约束的 token 可能成为全局状态、注意力 sink 或信息缓存。可将其视为显式设计空间,而不是仅把 special token 当格式符。
- 不可直接照搬: 本文没有偏好数据、奖励模型、PPO/DPO/GRPO 或 RLHF 实验,因此不能推出 register 对对齐、偏好优化或安全性有帮助。
- 风险: LLM/VLM 中高范数 token 可能与位置偏置、KV cache、padding、RoPE、掩码策略或数据分布耦合;仅观察到 norm outlier,不足以证明应加 register,亦不足以证明其会改善能力。
3. 关键证据与实验审计
证据一:register 对 pixel-space DiT 的 FID 改善
论文在 ImageNet 256×256 上报告 pDiT 多尺寸结果。600 epoch 时:
- pDiT-B/16:无 register FID 4.80,带 register 3.80,in-context conditioning 3.71;
- pDiT-L/16:2.80 → 2.47,in-context 为 2.47;
- pDiT-H/16:2.35 → 2.02,in-context 为 1.90。
对 PixelDiT-XL/16,80 epoch 为 2.74 → 2.24,120 epoch 为 2.25 → 2.12;在 ImageNet 512×512 上,pDiT B/L/H 也报告了同向改善。
展示了什么 → 在作者的 pDiT/JiT 风格训练设置、ImageNet 类条件生成与多个模型规模/分辨率下,加入 register 通常降低 FID。
支持什么 → register 是 pixel-space DiT 中值得尝试的有效结构改动,且该收益不是仅由一个小模型、单一训练时长或单一分辨率驱动。
仍不能证明什么 → 这不能证明 register 的作用是“吸收 outlier”或“传递全局语义”,也不能证明它会迁移到 COCO、开放域文生图、不同 tokenization、不同 flow/diffusion objective 或不同计算预算。
公平性审计:
- 论文称 pDiT 以 JiT 配置为基础,仅移除 in-context conditioning 并加入 register,比较设计大体合理。
- 但 extract 中没有完整训练数据增广、采样步数、FLOPs、随机种子、FID 样本量、置信区间或跨 seed 方差。FID 差异为 0.1–0.3 时,统计稳健性无法从现有材料确认。
- “in-context token 的大部分收益来自 register-like 行为而非类别信息”是强解释。表 1 显示 pure register 与 in-context 的性能接近或后者略优,但未构造严格的信息等价对照,例如随机类别 token、同维随机 token、冻结 token 或保持 token 数而移除类别可辨信息。因此该归因尚不充分。
证据二:pixel-space 的收益显著大于 latent-space
表 2 报告不同表征空间的 FID。Base size:
- RAE-space:带 register 7.48,未带 6.58,变差;
- VAE-space:9.40 vs 10.40,改善;
- pixel-space:5.30 vs 7.39,改善最大。
Large size 同样呈现:RAE 4.44 vs 3.91,变差;VAE 2.38 vs 2.53,小幅改善;pixel 2.69 vs 3.52,改善较大。附录又用相同 pDiT backbone 在 RAE/VAE/pixel 空间比较,趋势相近。
展示了什么 → 在作者选取的 RAE、VAE、pixel 三类空间及额外共享-backbone 对照下,register 的 FID 收益集中在 pixel-space,RAE-space 甚至有负收益。
支持什么 → “是否使用 register”应视表征空间和中间表征难度而定;它不是一般 DiT 的无条件增益模块。
仍不能证明什么 → 不能仅凭 TV 或 token norm 断定 pixel-space 更受益的唯一原因是“更嘈杂、需要更强正则化”。空间维度、预训练 encoder、训练稳定性、patch size、模型容量、目标参数化和优化超参都可能共同造成差异。
这一组证据是全文最有价值的边界条件:论文没有把 register 包装成 universal improvement,而是报告 RAE-space 的负结果。对工程决策而言,这比单纯追求最佳 FID 更有用。
证据三:Register Guidance 与单模型 register dropout
固定 (p=0.05) 的 JiT-B/16 消融中,作者报告:
- CFG baseline FID 3.80;
- RG 最优 FID 3.60,最佳 (w_{\mathrm{rg}}=3.5);
- CFG+RG 最优 FID 3.47,最佳设置约为 (w_{\mathrm{rg}}=1.8,w_{\mathrm{cfg}}=2.0)。
改变训练时 register-drop 概率时,表 4 显示:
- (p=0):RG FID 13.13、RG+CFG 8.02,说明未训练无-register 分支时差分不可用;
- (p=0.03):RG 3.46、RG+CFG 3.32,为表中最佳;
- (p=0.1):RG 4.55、RG+CFG 3.85,较差。
跨规模的表 5 也显示 RG 和/或 RG+CFG 优于 CFG,例如 B/32 为 4.12 → 4.01 → 3.69,L/32 为 2.69 → 2.47 → 2.41。
展示了什么 → 同一模型通过 register dropout 支持两种模式后,RG 可改善 FID;与 CFG 组合时,在所报告配置中进一步降低 FID。
支持什么 → “有/无 register 差”可作为有用的采样方向;训练中显式覆盖无-register 模式是该方向可用的关键条件。
仍不能证明什么 → 它不能证明 RG 普遍提升感知质量、语义忠实度或多样性,也不能证明 RG 的方向纯粹表示“结构改善”。FID 改善可能伴随类别分布、纹理统计或采样超参的变化,且文本抽取不足以独立审计视觉样本和失败类型。
成本审计:
- RG 至少需要有/无 register 两次条件前向;RG+CFG 还需要无条件前向。论文自己承认最佳 RG+CFG 增加 function evaluations、降低采样速度。
- 若是预训练模型,作者使用 50 epoch、学习率 (2\times10^{-5})、(p=0.3) 微调以启用 RG。这不是零成本 inference trick。
- (p)、(w_{\mathrm{rg}})、CFG scale 和引导时间区间共同构成新超参数面;若没有自动选择或跨任务稳健性测试,部署复杂度不可忽略。
4. 批判性判断与复用建议
4.1 证据强度
总体判断:中等偏强的工程证据,中等偏弱的机制证据。
被较直接支持的结论:
- 在作者报告的 ImageNet pixel-space DiT/JiT 配置中,register 通常降低 FID;
- register 的收益在 pixel-space 大于 VAE/RAE latent-space,且 RAE-space 可变差;
- register 延迟至较深层、增加数量,在 pDiT-B/16 消融中更有效;
- 若要用 RG,训练时必须让无-register 分支可用;(p=0) 的原始模型无法产生有用 RG;
- 在所报告配置中,RG+CFG 可以优于单独 CFG。
仅与结果一致、但尚未证明的结论:
- register 高范数 token 是“必要的 norm sink”,并因而导致 FID 改善;
- 低范数且高线性 probe 准确率的 register 必然编码“全局语义”;
- feature TV 更低必然是生成质量提升的主要中介;
- JiT 的 in-context conditioning 的主要收益来自 register-like 容量,而非额外类别信息;
- 文生图模型中的 text token 出现高范数 outlier,就意味着其在功能上等价于 register。
论文将多个观察指标连成了一个富有启发性的机制故事,但当前更接近“有解释力的工作假说”,尚不是可排他验证的因果模型。
4.2 主要局限与失败条件
-
机制归因没有被充分隔离。
高范数、TV 平滑、线性 probe 和 FID 同向变化,不代表前者导致后者。缺少针对 sink token 的定向干预:例如只裁剪高范数 register、保留 token 数但打断其注意力、交换 sink/semantic register、控制范数而不改变内容。
影响: 机制解释、新颖性与跨架构泛化。 -
外部泛化有限。
主要训练实验集中于 ImageNet 类条件生成;文生图部分主要是对 FLUX、SD3.5、Qwen-Image、Z-Image、PixArt-α 的 token norm 分析,没有在这些模型上端到端加入 register 或验证 RG。
影响: 开放域文生图、文本条件、多模态模型和真实部署的泛化。 -
FID 是核心但不充分。
论文大量使用 FID,未从可见文本中发现多 seed 方差、置信区间、precision/recall、文本/类别一致性、人类偏好或多样性审计。RG 可能在降低 FID 的同时牺牲覆盖度,现有材料不足以判断。
影响: 生成质量的全面性与结论稳定性。 -
RG 的速度和调参成本较高。
最优 RG+CFG 需额外网络评估,且要选择 register-drop 概率、RG scale、CFG scale 与生效时间区间。论文已明确承认采样速度受限。
影响: 工程部署、实时采样、性价比比较。 -
“文本 token 即 implicit register”的表述偏强。
文生图模型的文本 token 本就承担条件信息;它们不参与像素损失、出现高范数,并不自动意味着其因果角色与纯 register 相同。不同文本编码器、cross-attention/联合 attention、padding、序列长度和训练配方都是混杂变量。
影响: 对大规模文生图和 VLM 架构的迁移判断。
4.3 最有价值的下一步验证
-
做 register 功能的因果消融。
- 验证什么: FID 改善究竟来自额外 token 容量、token 高范数、全局语义聚合,还是单纯的参数/序列长度变化。
- 为何重要: 这是全文核心机制的缺口。
- 改变判断的结果: 若随机 token、冻结 token、范数裁剪 token 或同参数量 MLP adapter 都获得相同增益,则“register-specific sink/semantic mechanism”应明显降级;若仅保留完整 register 功能有效,机制可信度上升。
-
在开放域文生图上做端到端训练或微调验证。
- 验证什么: 对 text-to-image DiT,显式 register、文本 token 置换/掩码和 RG 是否仍改善质量、忠实度、组合性与多样性。
- 为何重要: 当前文生图证据仅是内部 norm 观察。
- 改变判断的结果: 若跨多个文本条件架构稳定有效,论文可从 ImageNet 特定技巧提升为更一般的 DiT 设计原则;若无效,则应把结论限定为 class-conditional pixel DiT。
-
报告质量—速度—覆盖度完整 Pareto 曲线。
- 验证什么: 在相同 NFE、相同墙钟时间、相同参数/FLOPs 下,register、RG、CFG、RG+CFG 对 FID、precision/recall、类别一致性和人评的影响。
- 为何重要: RG 的额外前向可能使“更低 FID”不等价于更优系统。
- 改变判断的结果: 若固定预算下仍优于增大模型、增加采样步数或使用标准 CFG,RG 才具备强工程价值;否则它更适合离线高质量采样。
4.4 最终复用结论
- 值得直接借鉴: 在 pixel-space DiT 中,将少量辅助 token 视为中后层的表征组织模块,而非仅作为条件载体;优先测试“第 (k) 层后插入 + 多个 token”的组合,而不是全层注入。
- 值得借鉴: 若需要一个可控的弱模型来做 guidance,可把同一网络的模块关闭态作为候选,但训练中必须显式覆盖完整/简化两种模式;论文的 register dropout 是一个清晰的实现模板。
- 不要照搬: 不要仅因看到 token norm outlier 就认为需要 register,也不要把低 TV 或高线性 probe 当作生成改善的充分证据。
- 不要照搬: 不要在没有速度预算和自动调参方案时直接采用 RG+CFG;它的采样成本、超参和模型重训练需求可能超过收益。
- 技术路线判断: 对 pixel-space / flow-matching DiT,建议纳入短期实验路线,优先做结构插入层、token 数量、等计算量基线和 fixed-NFE 评估;对 RLHF、VLM/LLM 后训练,不建议直接纳入主路线,但可将“辅助 token 的功能分工与反事实 guidance”作为机制研究假设保留。
5. 必要概念与文献地图
必要概念
-
Register token
附加到 patch token 序列、与其共同经过 Transformer 的可学习 token;它通常不直接对应图像 patch 输出或 patch-level 损失。本文认为其可同时承担高范数 sink 与全局信息载体。 -
Pixel-space DiT
直接在 RGB 像素空间进行扩散/flow 建模的 Diffusion Transformer,不依赖先压缩到 latent 的 VAE/RAE。优点是避免表征编码器限制,代价是高维、细粒度、训练难度更高。 -
Latent-space diffusion / VAE-space / RAE-space
先把图像映射到低维或预训练表征空间,再在该空间生成。本文报告 register 在 VAE-space 只有较小收益,在 DINOv2 RAE-space 可退化。 -
Flow matching 与 x-prediction
论文使用 (z=tx+(1-t)\epsilon) 的插值路径,并让模型预测从噪声状态朝数据状态移动的速度或等价 x-prediction。RG 通过两种模型配置下预测速度的差构造额外引导方向。 -
Classifier-Free Guidance(CFG)
用条件预测与无条件预测的差放大条件信息。本文将其与 RG 相加,主张两者分别强调类别条件与 register 带来的结构/细节方向。 -
AutoGuidance
以较弱模型而非无条件模型提供引导方向的思路。本文的 RG 是其特例:去除 register 的同模型分支充当弱模型。 -
Token norm outlier / norm sink
少数 token 的特征范数远高于其他 token 的现象。本文的观察是:无 register 的 DiT patch token 没有明显 outlier;加 register 后,高范数主要出现在 register 中。 -
Total Variation(TV)与中间特征平滑性
TV 衡量相邻空间位置的变化幅度。本文将中间 token feature map 的 TV ratio(带 register / 不带 register)低于 1 解释为特征更平滑,尤其在高噪声阶段;这是代理诊断指标,不等同于最终视觉质量。
关键前作
-
Darcet et al., “Vision Transformers Need Registers” (2023)
本文的直接起点:提出 ViT register 用于缓解 patch-token outlier 与不良注意力图。本文的差异是认为 DiT 没有同样的 patch outlier,却仍可从 register 获益。 -
Peebles & Xie, “Scalable Diffusion Models with Transformers” (DiT, 2023)
奠定以 Transformer 替代 U-Net 进行扩散建模的基本路线,是本文讨论 image DiT token 表征的架构背景。 -
Ma et al., “SiT: Exploring Flow and Diffusion-Based Generative Models with Scalable Interpolant Transformers” (2024)
提供 latent-space flow/diffusion Transformer 对照。本文用 SiT 支撑“register 并非所有扩散空间都同样有效”的论点。 -
Li & He, “Back to Basics: Let Denoising Generative Models Denoise” (JiT, 2025)
本文 RG 与大量主实验建立在 JiT 风格的 in-context class conditioning 与训练配置上。论文进一步主张 JiT 的附加条件 token 部分具有 register-like 作用。 -
Karras et al., “Guiding a Diffusion Model with a Bad Version of Itself” (AutoGuidance, 2024)
提供“以较弱模型差分作为质量引导”的基础思想。本文的实质扩展是用同一 register-drop 模型的无-register 分支,避免人为设计弱模型及两个独立模型的不对齐。