Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

论文元数据

  • Authors: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
  • Publication date: 2026-07-14T00:00:00.000Z
  • arXiv: https://arxiv.org/abs/2607.12395
  • PDF: https://arxiv.org/pdf/2607.12395
  • Project: 未提供
  • Code: 未提供
  • 本次阅读输入: 文本回退

论文标题:Ring-Zero:将 Zero RL 扩展至万亿参数以诱发涌现式推理

阅读范围与证据边界

  • 输入材料: 本报告基于论文 arXiv:2607.12395v1 的完整 PDF 文本抽取结果,涵盖正文、表格转写、图注、附录节选与参考文献;输入模式为文本回退(text fallback)
  • 未直接视觉检查 PDF: 我没有直接检查 PDF 页面的版式、颜色、曲线几何、图中坐标细节、子图相对位置,或文本抽取与图注中没有保留的图表细节。因此,下文对图表只依据正文叙述、图注和可提取的数值,不据此推断视觉趋势的精确幅度或统计显著性。
  • 证据分层: “作者主张”指论文自己的机制解释或宏观结论;“论文直接证据”指表中分数、训练配置、消融描述和案例;“分析者判断”则明确标为本报告的评估,不能视为论文已证明的结论。
  • 材料缺口: 文本中未见代码、完整训练数据组成及许可、模型权重、逐题预测、评测脚本、随机种子、方差/置信区间、完整 judge 输出和独立复现实验。因此,关于训练稳定性、泛化性、CoT 可读性及“涌现认知策略”的结论应限于作者实验条件。
  • 隐含限制: 虽然论文呈现了部分图表文本、图注与案例,但对不可用的图表视觉细节、未转写表格单元、颜色编码和曲线局部变化,本报告不作补全或臆测。

1. 一页速览:值不值得看

维度判断
问题如何在不使用人工标注 CoT 的前提下,将带可验证奖励的强化学习(RLVR / zero RL)稳定扩展到万亿参数 MoE 模型,并同时避免推理链无限变长、训练—推理引擎数值失配与固定推理预算的问题。这个问题对大规模推理模型后训练直接重要。
一句话方法用“先激发、再压缩、后持续优化、最后分档控制深度”的四阶段流水线:第一阶段以 token-level 的裁剪重要性采样激发长 CoT;自蒸馏筛短正确轨迹并重置训练;第二阶段改 sample-level loss 控制长度;第三阶段按难度和 4k/16k/64k(文中主表高档标为 128k)预算训练多档推理模式。
真正新意方法本体更像一组针对超大规模异策略 RL 的务实组合:训练端 logits 参与 importance ratio、关键位置 FP32、CoT 压缩自蒸馏、长度归一化切换与分档训练。真正有价值的是把这些环节置于 1T 规模的统一系统性验证;“涌现认知行为”是观察性叙事,尚非严格机制创新。
关键结果Ring-2.5-1T-Zero 第一阶段在 AIME 2024/2025/2026 为 89.1/83.3/84.2;第二阶段为 93.5/91.6/92.5,配合 Yarn=2 时为 94.1/92.3/93.2。在共同答对的 AIME 子集上,作者报告其 CoT 平均 6,368 tokens,低于四个比较模型的 14,115–17,220
可信度中等。 训练流程、模型规模、GPU 数和若干关键消融给得较具体,且 104B 对照支持“规模更有效”的经验结论;但关键主张主要来自单一模型家族、内部训练/数据条件和 LLM-as-a-Judge,缺少多随机种子、公开可复现实验与更严格的控制。
相关性对当前关注的 RLHF/RLVR 与 LLM 推理后训练高度直接相关,尤其适合关注异策略 rollout—training 架构、长 CoT 长度偏置、奖励设计和推理预算路由;对 Diffusion 或 VLM 没有直接实验支撑。
建议按需精读,重点读第 3、4.3、4.4、5 节。 若目标是搭建大规模 RLVR 系统或处理 token 长度膨胀,这篇值得拆解;若目标是获得可直接复制的开源 recipe,则应等待代码、数据与独立复现,不能把它当作已验证的通用配方。

2. 方法论拆解

2.1 问题与已有路线的缺口

论文修补的不是“数学奖励如何设计”本身,而是 zero RL 从小规模走向万亿模型时的四类耦合问题:

  1. 冷启动与稀有推理 token。 基座模型初始很少生成显式、长链的推理过程;若沿用普通 PPO/GRPO 风格的保守更新,难以把低概率但正确的推理 token 拉升出来。
  2. 异策略系统数值失配。 rollout 由 SGLang 生成、梯度由 Megatron 计算;浮点精度与 kernel 差异会使同一权重下的 logits 不完全一致。作者认为,在放大低概率 token 梯度时,这个微小偏差会被 importance ratio 放大并导致崩溃。
  3. 长度偏置。 第一阶段的 token-level 累加目标,使长正确序列累积更大梯度;它有利于早期诱发 CoT,却会驱动无差别的长度增长。
  4. 单一推理预算。 高能力模型如果只训练一种长输出模式,会在简单题上浪费 token;如果全局压短,又可能损失难题能力。

与本文最相关的已有路线可压缩为四类:

  • DeepSeekMath / GRPO: 使用组内相对奖励、避免独立 critic,是本文 advantage 估计的基础。
  • DeepSeek-R1 / R1-Zero: 证明从基座模型直接做 RLVR 可以出现推理行为;本文将问题转向万亿规模的稳定训练与 CoT 质量。
  • DAPO、CISPO、GSPO 等策略优化: 处理低概率 token、裁剪和熵稳定性的不同折中。本文在 flash 模型上比较它们,并选择裁剪重要性采样路线。
  • 长度惩罚或长度归一化: 既有工作以 reward penalty 或归一化处理冗长。本文的差异在于先允许长度增长以诱发推理,再通过自蒸馏和 sample-level loss 回收效率。

分析者判断:这些问题确实是长上下文、异策略 RLVR 的核心工程难点,但论文将其包装为“只需少数简单改动”的表述较强。系统稳定通常仍依赖模型实现、并行拓扑、数据课程、采样器和奖励器等大量未公开条件。

2.2 核心机制与流程

整体流程为四步,目标是把“探索推理能力”“压缩冗余 CoT”“稳定持续优化”“按预算路由”拆开处理。

阶段一:用 token-level 裁剪重要性采样诱发推理

输入为问题 (q),rollout 引擎对每题生成 (G=16) 个回答 (o_i)。奖励由答案正确性和格式奖励组成:

[ r_i=r_{\text{acc},i}+r_{\text{format},i}. ]

其中格式奖励要求 <answer>...</answer> 的完整闭合;早期 correctness 使用规则匹配,后期改由 Qwen3-Next-80B-A3B-Instruct 作二值裁判。

核心策略梯度写作:

[ J(\theta)=\mathbb{E}\left[ \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \operatorname{sg}(\hat{\rho}{i,t}), \hat A{i,t}, \log \pi_\theta^M(o_{i,t}\mid q,o_{i,<t}) \right]. ]

  • (\hat A_{i,t}) 是 GRPO 风格的组归一化 reward advantage;
  • (\pi_\theta^M) 是训练端 Megatron 的当前策略;
  • (\hat\rho) 是裁剪后的重要性比率;
  • sg 表示对比率停止梯度,但仍允许 token 的对数概率项反传。

论文的关键做法是:

[ \rho_{i,t} = \frac{\pi_\theta^M(o_{i,t}\mid q,o_{i,<t})} {\pi_{\theta_{\text{old}}}^S(o_{i,t}\mid q,o_{i,<t})}, \qquad \hat\rho_{i,t}=\operatorname{clip}(\rho_{i,t},\epsilon_{\text{low}},\epsilon_{\text{high}}). ]

作者实际只设上界 (\epsilon_{\text{high}}=5.0),不设下界。它的角色不是新的 reward,而是让 ratio 的分子来自真实参与反传的训练引擎 logits,分母来自旧 rollout 策略,从而显式反映两套引擎的概率差异。第一阶段再加 KL 正则,防止策略过快偏离参考模型。

这里的必要假设是:训练引擎和 rollout 引擎的分布差异主要是可由该 ratio 修正的数值/实现差异,而不是更深层的数据管道、缓存状态或采样逻辑不一致。

中间步骤:自蒸馏压缩并“重置”训练状态

从第一阶段专家策略的多个 rollout 中,先选取最短的正确轨迹,再让模型自评并删去冗余段落,得到压缩 CoT 数据。随后用这些轨迹对原始 base model 做 SFT:

[ L_{\text{self-distillation}}(\theta)= -\mathbb{E}{q,o} \left[ \sum{t=1}^{|o|} \log \pi_\theta(o_t\mid q,o_{<t}) \right]. ]

作者把这一步同时解释为:

  • 保留第一阶段已发现的有效推理模式;
  • 清除循环论证、过长验证等冗余;
  • 从 base model 重新出发做监督拟合,以消除训练—推理引擎差异累计造成的不稳定状态。

后一点是重要但尚未被严格隔离验证的机制解释:SFT 重置可能确实有稳定作用,也可能同时受益于数据筛选、分布改变、优化器状态重置等混杂因素。

阶段二:改为 sample-level loss 做长期优化

第二阶段保留 ratio correction 和裁剪,但用 (1/|o_i|) 对每个样本的 token 项归一化:

[ L_{\text{II}}(\theta)= -\mathbb{E}\left[ \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \operatorname{sg}(\hat\rho_{i,t})\hat A_{i,t} \log\pi_\theta(o_{i,t}\mid q,o_{i,<t}) \right]. ]

这使每条回答、而非每个 token,具有相近的总梯度量级。作者同时移除 KL,理由是蒸馏后的模型已是稳定起点,继续 KL 会限制探索。

方法上的核心逻辑是:第一阶段故意利用 token-level 偏置“造出”可见推理链,第二阶段取消该偏置,防止模型仅靠多生成 token 获得更多更新信号。

阶段三:按难度分档训练自适应推理深度

训练集被划为低、中、高难度 (D_k),每档有独立系统提示 (p_k) 和 token 上限。低/中/高档正文分别为 4k、16k、64k;主结果表中高档又标为 TT=128k、Yarn=2,文本存在表述不一致,不能据此确定最终高档训练窗口。

[ L_{\text{III}}(\theta)= -\sum_{k\in{l,m,h}} \mathbb E_{q\sim D_k,o_i\sim\pi(\cdot\mid p_k,q)} \left[ \sum_i\frac{1}{|o_i|}\sum_t \operatorname{sg}(\hat\rho_{i,t})\hat A_{i,t} \log \pi_\theta(o_{i,t}\mid p_k,q,o_{i,<t}) \right]. ]

它把“分配多少 test-time compute”部分交给 prompt 与长度预算控制。作者承认多档联合训练带来负迁移:第三阶段高档能力略低于第二阶段峰值。

配套系统优化

  • 主体以 BF16 计算,但将 attention softmax 和 LM head 放在 FP32,降低指数化 softmax 对微小 logit 偏差的放大。
  • 对 MLA 层采用 all-to-all context parallel;对 Lightning Attention 层采用 AllGather,以替换标准 ring attention 的串行通信链路。
  • 论文声称这些并行改动与 ring attention 数学等价、产生相同梯度;当前文本没有提供独立的数值误差、吞吐、扩展效率或跨实现验证数据。

2.3 关键设计与创新判断

设计解决什么为什么可能有效证据是否显示必要创新判断
训练端分子、rollout 端分母的 ratio correctionMegatron 与 SGLang 的概率失配导致异策略更新崩溃让梯度使用与训练前向一致的 logits,减少伪 off-policy 差异flash 消融中,baseline 约 800 step 崩溃、IcePop 约 2700 step 后失败、作者方法保持稳定;但仅单设置、单模型族对这一具体双引擎架构很实用;更像系统级校正,而非普适的策略梯度新范式
第一阶段 token-level loss + KL从 base model 激发低概率长推理,同时维持熵与分布稳定长轨迹获得更大累计学习信号;KL 抑制策略骤变有/无 KL 的曲线叙述支持稳定性差异;但 token-level、KL、课程和 ratio correction 并未完全正交隔离合理的训练阶段化设计,成分大多已有
最短正确轨迹 + 自评过滤的自蒸馏压缩冗余 CoT,并为后续 RL 提供稳定起点选择正确且短的轨迹会改变示范分布,降低长度惯性主表显示蒸馏后分数提升;但没有与“仅重训”“仅筛最短”“仅自评过滤”等拆分对照具有实际价值,但必要性和各子步骤贡献尚未证明
sample-level loss抑制无差别的 token 膨胀每条样本而非每个 token 的梯度总量近似固定flash 消融显示 sequence length 更平,且第二阶段成绩继续提升已知归一化思想在 zero RL 时序中的正确使用是本文较清晰的工程洞见
分档 prompt + 长度预算训练同一模型兼顾短题效率和难题深推理通过条件化训练学习预算—任务难度的对应低/中/高模式显示 token 与准确率的折中;但第三阶段高档落后第二阶段,且难度划分标准不清是有用的产品化控制接口,不足以证明模型真正学会自动难度识别

2.4 可迁移的方法论

对 RLHF/RLVR 与 LLM 推理后训练,最可迁移的不是“万亿模型必然涌现复杂认知”,而是下列设计原则:

  1. 把探索期和效率期拆开优化。 早期允许较长轨迹探索,后期再将 objective 改为长度中性或显式预算敏感的形式。迁移前提是任务存在可靠的结果奖励,且能承受早期较高 rollout 成本;风险是“短正确轨迹”筛选会偏向易题、模板化策略或奖励投机。
  2. 异策略 RL 先做数值一致性审计。 若 rollout 和训练来自不同引擎、精度或 kernel,直接套用标准 ratio 可能不够。应在上大规模训练前记录同一 batch 的 logits/log-prob 差异、ratio 分布、熵与崩溃阈值。风险是本文的校正依赖 Megatron/SGLang 具体接口,不能不加验证地移植到其他框架。
  3. 奖励格式应包含终止语义。 文中 Format B 要求完整闭合标签及 EOS,避免模型在答案后追加无意义 token 而获益。这可迁移到工具调用、结构化输出和 agent trajectory,但严格格式奖励可能诱发“格式正确、语义错误”的投机,因此必须与任务正确性分开监控。
  4. 将推理预算作为条件变量,而非只做全局截断。 分档训练可迁移到不同延迟/SLA 档位的推理服务。前提是训练时的分档定义与部署问题难度和预算分布相近;风险是共同训练产生负迁移,且 prompt 控制不等同于模型能可靠地自适应分配计算。
  5. 对 Diffusion/VLM 的迁移有限。 “阶段性探索—压缩—继续优化”的框架可能迁移,但本文依赖 token-level CoT、可验证数学答案、语言格式奖励、LLM judge 和序列长度;不能直接推出对 diffusion preference optimization 或 VLM reasoning 同样成立。

3. 关键证据与实验审计

证据一:万亿模型在数学基准上优于同族 104B 模型,并经多阶段训练持续提高

展示了什么 → 在七个数学基准上,1T MoE(63B activated)明显高于 104B MoE(7.4B activated)。第一阶段 1T 模型在 AIME 2024/2025/2026 得分为 89.1/83.3/84.2,而 flash 第一阶段为 71.2/63.5/65.3;第二阶段 1T 达 93.5/91.6/92.5。
支持什么 → 在作者的 Ling-2.5 基座、训练课程、奖励和系统配置下,更大模型容量与更高的 zero-RL 数学推理上限、样本效率相一致;自蒸馏和第二阶段 RL 与更好的最终 pass@1 相一致。
仍不能证明什么 → 不能证明参数规模是唯一因果因素,也不能证明“1T 是 zero RL 有效的基本前提”。文中只有两个规模点,且 MoE 总参数与激活参数都不同;没有控制相同 FLOPs、相同激活参数、相同 token 预算或多种模型家族。与闭源 frontier 模型的横向比较也不完全公平:训练数据、提示、推理预算、版本和评测环境不可见。

审计重点:

  • 训练运行于 320×H200 GPU,使用 Megatron 训练、SGLang rollout、Areal 编排;这说明实验规模真实且工程成本极高,但也使独立复现门槛很高。
  • 所有基准报告为 temperature=0.6、top-k=0.95 下,64 次运行的 pass@1 平均值。这是降低采样噪声的合理尝试,但文本未给出标准差、置信区间、题目级差异或是否对各模型使用同等 token 上限。
  • 七项均为数学推理任务。它能支撑“数学 RLVR”结论,不能外推至通用知识、代码、工具使用、长程 agent、VLM 或真实交互任务。
  • 作者报告第三阶段的 High 模式反而低于第二阶段峰值,并归因于高质量超长轨迹不足和多档负迁移。这一负结果削弱了“自适应深度无代价”的隐含叙事,反而是论文较可信的诚实边界。

证据二:ratio correction 与 KL 对 flash 模型训练稳定性的重要性

展示了什么 → 图 5 的文字说明称,去掉 KL 后 training–rollout log-prob gap 发散、entropy 崩塌、reward 下跌;图 6 称标准 ratio baseline 在约 800 step 崩溃,IcePop 约 2700 step 后也失败,而作者的训练端 numerator 校正保持稳定。
支持什么 → 在作者的异策略双引擎设置和低概率 token 放大策略下,KL 与训练—推理 ratio correction 是防止训练崩溃的关键稳定器。
仍不能证明什么 → 无法证明校正方案在不同框架、模型精度、采样器、上下文长度或更大规模上是必要且充分的;没有数值表、重复试验、误差条、wall-clock 成本及不同随机种子,不能量化稳定性改善的幅度和可靠性。

审计重点:

  • 比较 GRPO、CISPO、DAPO、GSPO 时,作者称 base model、学习率和训练数据相同,只改变 policy gradient 形式;这是较好的隔离设计。
  • 不过所有详细消融都在 Ling-2.5-flash-Base 上完成。论文据此指导 1T 训练是合理的工程策略,但不能替代 1T 级别的直接消融。
  • 作者称其校正“无需阈值调参且节省计算时间”,但当前文本没有给出吞吐、通信、额外前向、显存或总训练成本数字,因此效率收益现有信息不足以判断。
  • FP32 attention softmax 和 LM head 的混精策略有很强工程合理性,但没有与其他精度策略的对照结果;它更像可信的实现建议,而不是已被完整实验证明的独立贡献。

证据三:CoT “质量”框架的可读性、可蒸馏性与 token 效率结果

展示了什么 → 作者用 LLM judge 在 AIME 2024–2026 共 90 题上将其 CoT 与四个基线两两比较;图中提取到对 Qwen3.5-397B、Kimi K2.6、GLM-5.1、MiniMax M2.7 的胜/平/负分别为 64/22/4、72/15/3、76/14/10、78/12/10。用 100K 条轨迹蒸馏到 Qwen2.5-32B 和 Llama3.3-70B-Instruct 时,Ring-Zero 蒸馏结果为 78.4/74.5,DeepSeek-R1 蒸馏为 72.6/70.0;在五模型均答对的子集上,平均 CoT token 为 6,368。
支持什么 → 在作者所选 judge、提示词、题集和蒸馏配置下,Ring-Zero 轨迹呈现出更强的 judge 偏好、较好的下游蒸馏结果和更少的正确解 token。
仍不能证明什么 → 不能证明这些轨迹具有更高的真实可解释性、更可靠的因果推理或普遍更强的教学价值。LLM judge 与被评 CoT 的风格偏好、长度、格式和已知模型特征可能耦合;“在共同答对题目上更短”也不等于在全体题目上效率更高。

审计重点:

  • Comprehensibility 定义存在构念混合。 judge 同时评估逻辑连贯、因果显式和“无幻觉”,后者已接近正确性/事实性,而非纯可读性。虽然提示明确要求不以最终答案正确性为中心,但中间步骤正确与逻辑可读难以完全分离。
  • Reproducibility 指标实际是蒸馏有效性。 它衡量弱模型能否从轨迹中获得性能,而不是传统意义上他人是否能再现模型生成过程。作为“轨迹训练信号质量”是合理代理,但命名过强。
  • 效率比较条件相对有利但仍有价值。 只在五个模型都做对的题上比较,可避免“错误短答案看似高效”;但它会排除模型最难的失败题,也未把总 token、拒答、截断率和 pass@k 纳入统一成本—性能曲线。
  • 论文未报告 judge 模型、温度、重复采样、judge 一致性或人工评审校准。故“clear advantages”应理解为作者评价协议下的结果,而非已被人类偏好研究确认的结论。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

直接支持较强的部分:

  • 在 Ling-2.5 的 104B 与 1T 两个基座上,本文流水线可以取得较强数学 pass@1,且后续蒸馏、第二阶段 RL 与更高分数共同出现。
  • 在作者 flash 训练设置中,KL、ratio correction、严格终止格式和 token/sample-level loss 的切换,与训练稳定性和长度行为显著相关。
  • 第三阶段确实展示了明确的性能—token 预算折中:Low 模式平均 2,353 token,Medium 为 8,085,High 为 20,817;对应数学基准性能也随预算变化。

仅与结果一致、尚未证明的部分:

  • “1T 规模验证 bitter lesson,手工启发式因而冗余”:现有对比不足以排除数据、架构、预算和实现的影响;而论文自身仍使用人工设计的奖励、格式约束、课程、ratio 修正和分档提示。
  • “发现阶段后必然进入 sharpening 阶段”:作者以 pass@1024 早期上升后饱和、pass@1 持续提升作为证据。这是合理解释,但 pass@1024 的饱和还可能由采样预算、题集饱和、奖励分布改变或评测上限造成。
  • “结构化格式、并行推理、自检、拟人化和 context anxiety 是高级认知策略”:文本提供案例,证明模型会生成这些表面模式;不能证明它们在内部对应稳定的规划机制,也不能证明它们提高正确率。尤其“context anxiety”本身是错误风险信号,而非能力证据。

4.2 主要局限与失败条件

  1. 可复现性不足,影响机制解释与工程部署。
    缺少公开权重、训练数据明细、样本筛选比例、题目难度划分、完整超参、软件版本、代码和统计结果。对于 320×H200 的训练,任何未披露实现细节都可能成为决定性因素;论文不能仅凭“分享实验细节”就称为可复现路径。

  2. 规模结论只基于两点,影响泛化与因果归因。
    104B 与 1T 之间差异不只在总参数,也在 activated 参数、可能的 MoE 路由特性与基础能力。没有中间尺度、等计算量或跨家族比较,因此“规模决定能力上限”“1T 是基本前提”应降级为该系列模型上的经验观察。

  3. CoT 质量评估依赖模型裁判,影响证据可靠性。
    论文定义的 comprehensibility 包含“无幻觉”,reproducibility 是蒸馏后的 benchmark 分数,二者都可能受到评测模型、风格、数据污染或答案泄漏影响。没有人工盲评、多个 judge、校准研究或 judge 与人类一致性,无法确认它测到的是人类可读性而非格式偏好。

  4. 奖励与数据分布可能诱发特定行为,影响“自然涌现”叙事。
    训练中使用 /<answer> 格式奖励、逐步扩展长度窗口、难度课程、短正确轨迹筛选及 LLM judge。这些人工选择均会塑造输出格式、自检频率和压缩风格。因此,观察到结构化 CoT 不等于它完全“不需要手工设计”。

  5. 任务覆盖狭窄且高档模式已有负迁移,影响产品化泛化。
    所有主评测均为数学题。第三阶段的 High 模式没有超过第二阶段峰值,作者亦承认多档训练和超长数据不足导致能力损失。若迁移到开放问答、代码、工具调用或有噪声奖励的任务,长度—正确性—稳定性的折中可能明显不同。

4.3 最有价值的下一步验证

  1. 做可控的规模—计算曲线。
    验证什么:在同模型族至少 4–6 个尺度上,控制预训练能力、激活参数、训练 token、rollout FLOPs 与数据课程,比较 zero RL 的样本效率和最终上限。
    为何重要:这是“规模决定 zero RL 上限”的核心因果主张。
    会改变判断的结果:若中等模型在等计算或更优数据配置下追平 1T,则论文的规模叙事需显著降级。

  2. 对四阶段流水线做正交消融与多种子重复。
    验证什么:分别移除 ratio correction、KL、最短正确轨迹选择、自评过滤、从 base 重置、sample-level loss、分档训练;报告至少多个种子的崩溃率、reward、pass@1、pass@k、总 token、wall-clock 和成本。
    为何重要:当前多个模块同时改变,无法确定真正必要的最小组合。
    会改变判断的结果:若仅 ratio correction 或仅数据重置即可取得类似效果,则“完整四阶段方案”的复用优先级应下降。

  3. 用人类盲评和反事实轨迹评估 CoT 质量。
    验证什么:在匿名、长度匹配的轨迹上,让数学背景评审区分可读性、正确性、可教学性与可验证性;同时测试删去结构标签或交换冗余段落后,蒸馏收益是否仍存在。
    为何重要:它能区分真实推理质量、格式化表达和 judge 偏好。
    会改变判断的结果:若人类偏好或蒸馏优势消失,则“高质量 CoT”应收缩为特定 LLM judge 下的格式/压缩优势。

4.4 最终复用结论

  • 最值得借鉴: 将“激发长推理”和“控制推理成本”视为不同优化阶段。先用能促进探索的目标启动,再用轨迹压缩与 sample-level 归一化消除长度惯性,具有明确的工程可操作性。
  • 优先验证再采用: 在任何 Megatron/SGLang 或类似异策略系统中,先检查训练端与 rollout 端的 log-prob/ratio 差异。本文的 ratio correction 与关键 FP32 路径值得作为稳定性诊断方案,而不是盲目当作默认算法。
  • 不要照搬: 不要把“最短正确轨迹”直接等同于最优教学轨迹,也不要把模型的自言自语、拟人化、分支搜索或临近截断时的猜测当作可靠认知能力。它们至少需要与正确率、校准和失败率建立因果联系。
  • 适用场景: 有高置信可验证奖励、长文本 rollout 成本高、模型/系统规模足够大、并且可接受阶段式训练的数学、逻辑、约束求解类 RLVR 任务。
  • 技术路线判断: 建议将本文纳入“大规模 LLM RLVR 稳定化与 CoT 成本控制”的参考路线,而非作为“zero RL 已普遍超越人工设计”或“涌现 CoT 已可解释”的定论。

5. 必要概念与文献地图

必要概念

  • RLVR(Reinforcement Learning with Verifiable Rewards): 奖励可由规则、求解器或较可靠判定器验证的强化学习。本文早期用规则匹配,后期数学答案转由 LLM judge 判定,因此严格说后期不再完全是纯确定性验证。
  • Zero RL / R1-Zero 风格训练: 不先使用人工标注 CoT 做 SFT,而从预训练 base model 直接以 RL 激发推理行为。它不意味着没有人类设计:奖励、格式、数据课程和优化器仍由人设计。
  • GRPO(Group Relative Policy Optimization): 同一问题采样多个回答,用组内相对 reward 构造 advantage,避免额外训练 critic。本文的 advantage 建立在这一思路上。
  • 重要性采样比率(importance ratio): 衡量当前训练策略与生成 rollout 的旧策略在某 token 上的概率比,用于异策略更新。本文将训练端概率放入分子,以应对训练/rollout 引擎数值不一致。
  • Token-level 与 sample-level loss: 前者让长回答累积更多梯度,利于早期推理链扩张但有长度偏置;后者按序列长度归一化,使不同长度样本的总体更新权重更接近。
  • 自蒸馏(self-distillation): 用同一模型较强版本的输出训练基础版本。本文不是直接复制所有输出,而是选最短正确轨迹并二次过滤,因而同时改变能力、风格和长度分布。
  • 训练—推理引擎失配: 同一权重在不同框架、精度和 kernel 下可输出不同 logits;在 importance ratio 与低概率 token 梯度放大下,微小误差可能被累积放大。
  • Pass@1 / Pass@1024: pass@1 衡量单次采样正确率;pass@1024 衡量 1024 次采样至少一次答对的概率。本文用二者不同的训练动态支持“先 discovery、后 sharpening”的解释,但该解释不是唯一可能。

关键前作

  • Shao et al., 2024,DeepSeekMath: 引入 GRPO,为本文的组相对 advantage 和数学 RLVR 背景提供直接基础。
  • Guo et al., 2025,DeepSeek-R1: 证明基座模型可直接通过纯 RL 诱发推理行为,是本文 zero RL 范式及“无需人工 CoT”主张的最关键前作。
  • Yu et al., 2025,DAPO: 代表面向大规模 LLM RL 的稳定化策略优化路线;本文将其与 GRPO、CISPO、GSPO 在 flash 模型上比较。
  • MiniMax, 2025,MiniMax-M1: 本文采用的 clipped importance-sampling policy gradient 与低概率 token 放大思路的重要来源。
  • Yue et al., 2025a,关于 RL 是否扩展 reasoning boundary: 为本文使用 pass@1024 与 pass@1 区分“discovery / sharpening”阶段提供直接问题框架;本文给出支持顺序两阶段的实验解释,但尚未完成决定性因果检验。