Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
论文元数据
- Authors: Junyao Yang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Ruhan Wang, Xiangxin Zhou, Kishan Panaganti, Haitao Mi, Leowei Liang
- Publication date: 2026-07-21T00:00:00.000Z
- arXiv: https://arxiv.org/abs/2607.18722
- PDF: https://arxiv.org/pdf/2607.18722
- Project: https://jyyang26.github.io/stable_async_analysis/
- Code: https://github.com/jyyang26/SAT
- 本次阅读输入: 文本回退 + 已定位图像
论文标题:Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
阅读范围与证据边界
- 本解读基于论文的全文文本提取(含可提取正文、公式、图表标题/图注、表格文字和参考文献),属于
文本回退(text fallback)输入;我未直接检查 PDF 原始页面。 - 因此,以下对 Figure 1–9、Table 1–10 的讨论只依据提取出的文字、数值和图注;未直接检查 PDF 页面布局、颜色、曲线视觉几何、图中相对位置,或文本/图注未保留的图表细节。
- 文中“作者主张”指论文的机制解释或结论;“论文直接证据”指其给出的单次运行结果、表格、日志描述及形式化命题;“分析者判断”是基于这些材料对证据强度、混杂因素和复用价值的评估。
- 附录提供了较充分的公式、超参数与单次运行记录,但缺少多随机种子、置信区间、跨模型/跨任务复现,以及对真实全词表策略散度的直接测量。因此,本文可以评估其在报告系统中的可信效果,不能将其提升为对异步 RL 普适稳定性的充分证明。
- 文本提取中部分公式排版受损;本文只保留理解方法所必需且能可靠恢复的公式,不据此臆测缺失符号或未保留的视觉证据。
1. 一页速览:值不值得看
| 维度 | 判断 |
|---|---|
| 问题 | 异步 LLM RL 用独立 rollout 与训练资源提升吞吐,但 rollout 行为策略与当前训练策略之间会产生异质、长尾的失配。固定 PPO clip 半径无法同时对大多数低失配 token 保持学习能力、对高失配尾部收紧更新。 |
| 一句话方法 | SAT(Staleness-Adaptive Trust Region)把已计算的采样 log importance ratio 当作逐 token 的失配代理,在每个 batch 的高失配尾部,仅收缩会进一步把 ratio 推离 的那一侧 PPO clip 边界。 |
| 真正新意 | 核心不是提出新的 RL 目标,而是将 PPO 的固定 clip 半径改为“按 batch 分位数、按失配符号、仅对外向更新收缩”的局部自适应边界。其形式化价值在于证明该修改相对 PPO 具有区间包含与逐点悲观性;系统层面还与 MoE routing replay(R3)组合。 |
| 关键结果 | 在 Qwen3-30B-A3B-Base、数学 RL、配置 lag 的单次运行网格中,SAT-GSPO+R3 的 AIME24 avg@8 分别为 35.83 和 34.79,高于表中 DPPO 的 33.96/32.71、GSPO 的 32.25/31.46;后两种固定 clip 基线的 lag-8 运行被标记为后期 collapse。 |
| 可信度 | 中等偏低。 方法的局部数学性质是直接且清楚的;但效果证据仅来自单模型、单数据/任务族、两个系统 lag、每配置单 seed,且采用训练过程中的 best checkpoint 指标。 |
| 相关性 | 对 LLM RLHF/RLVR 的异步后训练直接相关,特别是 rollout 服务与训练框架分离、MoE 路由或数值差异造成 train–inference mismatch 的场景;对 Diffusion RLHF 和 VLM RLHF 只有“基于失配风险的自适应更新约束”这一抽象层面的迁移价值。 |
| 建议 | 按需精读,值得复用其中的诊断与局部 clip 设计。 若在做大规模异步 LLM RL、尤其是 MoE RLVR,建议读方法、实验设置和局限;若目标是建立强理论信任域保证或获得通用稳定器,证据尚不足。 |

Figure 1|第 3 页。 Figure 1 Batch-wise asynchronous RL. Rollout and optimization run on decoupled resources with periodic weight broadcast, so one in-flight batch is typically trained at a configured lag of n policy versions. This is the setting behind µb,t, π(j), and db,t. With full notation table shown in Appendix A, synchronous RL and fully Asynchronous RL workflows can be found in Appendix B.1 and Appendix B.2, respectively. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。
2. 方法论拆解
2.1 问题与已有路线的缺口
作者处理的不是一般意义上的“PPO 不稳定”,而是批式异步 RL 中 rollout 时行为策略 与当前训练策略 的实际失配具有 token 级异质性。
论文将采样 token 的 importance ratio 写为:
并分解为:
这里 是 rollout checkpoint 对应的训练端版本。作者主张:配置上的 lag 只是粗粒度系统标签,真正进入 loss 的是 ;它同时混入策略版本落后、推理/训练 kernel、低精度计算和 MoE routing 等效应。
理解本文只需把握四条已有路线:
-
PPO / GRPO:固定裁剪。
PPO 的 sampled clipped surrogate 约束的是被采样动作上的局部梯度,不是整个词表分布的硬 trust region。固定 对所有 token 一视同仁,无法针对异步训练中重尾失配分布分配不同保守程度。 -
TRPO / 全策略散度约束:理论参照而非本文实现。
作者利用有限时域 policy-improvement bound 说明:若能对所有动作施加 ratio envelope,便可控制 state-wise TV divergence;但 SAT 不具备这样的全动作约束,只是在 PPO 同一 surrogate 层级工作。 -
DPPO:按采样 DTV 调整边界。
DPPO 保留“仅阻断外向更新”的方向性逻辑,但其阈值与采样 token 概率有关。SAT 的差异是:以当前 batch 的观测失配尾部来确定激活边界,而非固定 DTV 阈值。 -
R3:解决 MoE routing 一致性,而非直接改 clip。
R3 重放 rollout 的 Top-K expert routing mask,使训练端沿 rollout 路由分支前向计算。它针对实现失配的一部分,SAT 则针对已暴露出来的高失配更新尾部;二者理论上可互补。
关键缺口可概括为:固定 clip 对“可靠 bulk”和“高风险 tail”没有区别,而根据配置 lag 做统一调参又无法覆盖实际 token 失配的系统异质性。
2.2 核心机制与流程
SAT 是 PPO/GRPO/GSPO 裁剪模块的替换件,不重新定义 reward、advantage 或主优化目标。流程如下:
-
取得已存在的失配分数。
对每个 active token,计算 ,并使用 stop-gradient 得到 。该值只控制 clip 边界,不被优化器通过该路径反传。 -
用 batch 内分位数识别高失配尾部。
对当前 batch 的 求经验分布,并定义阈值 为 分位数。文中取 ,即严格门控 时理论上最多选择前约 10% 的 active positions,平局会使实际比例更小。 -
将超阈值失配映射为收缩系数。
使用 Hill 型核函数:
当 时 ;当 时 ;而越远离阈值,收缩越强。这里的 是按 的正负拆分后的幅度,而非单纯的 。
- 按 ratio 偏离方向,仅收缩一侧边界。
若 ,即采样 ratio 已高于 ,SAT 只收缩上边界;若 ,只收缩下边界。定义:
非尾部 token 或 时 ,完全退化回基线 PPO clip。
- 代回原 clipped surrogate。
对 GSPO,论文将 token ratio 替换为长度归一化的 sequence ratio ,并将该 response 的标量分数广播给其 active tokens。作者明确指出:这时关于 clip 区间和 surrogate 的局部结论仍成立,但不能再把该 sequence-ratio proxy 直接解释成 token-level DTV。
这套设计的因果直觉是:当 ratio 已偏离 且优势方向会使偏离进一步扩大时,高失配样本更早失去梯度;当更新把 ratio 拉回行为策略时,SAT 不增加阻碍。
作者的理论支点是有限时域下:
但关键边界必须保留:该式说明全策略 TV divergence 会影响近似误差项;SAT 只观测一个 sampled action 的 并修改 sampled surrogate,没有直接控制该 TV 项,更不保证每次更新的真实性能提升。
2.3 关键设计与创新判断
| 设计 | 解决什么 | 为什么可能有效 | 必要性证据与创新判断 |
|---|---|---|---|
| batch 内 $ | d | $ 的 90% 分位数门控 | 固定绝对阈值不能适应不同训练阶段、不同运行条件的失配尺度 |
| 正负号分离的单侧收缩 | 避免同时削弱将 ratio 拉回 的更新 | 保留 PPO 的“外向裁剪、回拉放行”方向逻辑 | Proposition 4.1 直接证明局部更新差异只发生在新拦截的外向 band;这是本文最清晰、最具可解释性的设计。 |
| Hill kernel 收缩 | 让越异常的失配获得越强保守度 | 连续、单调、计算便宜,避免硬 mask 的突变 | 文中固定指数为 2,未给核函数或指数敏感性比较;新意主要在“失配尾部驱动边界”,而不是该核函数本身。 |
| 从 token SAT 扩展至 GSPO | 适配序列级 ratio 的 RLVR 训练配方 | sequence-level ratio 平滑单 token 波动,可与 SAT 组合 | SAT-GSPO+R3 是最佳组合,但组合实验不能分辨 SAT、GSPO 与 R3 的独立因果贡献。 |
| 与 R3 组合 | 减少 MoE routing 导致的一部分实现失配 | R3 降低暴露的 mismatch,SAT 收缩剩余风险尾部 | 论文直接展示组合性能更好,但没有对 的可识别分解;“互补”是与数据一致的解释,不是已证实的唯一机制。 |
2.4 可迁移的方法论
对当前 RLHF / LLM 后训练工作,最值得迁移的不是直接复制 SAT 的公式,而是以下四点:
-
将“系统 lag”与“优化器实际看到的失配”分离记录。
不应仅汇报权重广播周期、队列深度或版本差;至少应记录 token/sequence ratio、其尾部分位数、极端值和随训练的轨迹。前提是 rollout log-prob 的定义、支持集和训练端重算方式清楚一致。 -
让约束强度随风险分布而不是样本平均值变化。
在异步 LLM RL 中,可把 clip、sample weighting、mask 或 replay policy 设计为对相对异常的失配样本更保守。风险是 batch-relative 阈值不控制绝对失配:当整个 batch 都严重漂移时,仍有约 90% token 未被额外收缩。 -
保留“外向/回拉”更新的不对称性。
对 ratio 已离开行为策略的样本,抑制继续远离的梯度;对拉回参考策略的更新保持较少干预。这一结构可迁移到 token-level PPO、sequence-level ratio、甚至其他 importance-weighted RL 目标,但必须重新检查其优势符号、ratio 定义与梯度方向是否等价。 -
把系统一致性修复与优化器稳健化分层。
R3 类机制修复 rollout/train 前向不一致;SAT 类机制限制观测到的危险更新。二者可组合,但不能用后者替代前者。若可消除实现失配,应优先修复采样行为分布记录、数值一致性和 MoE routing,而非只依赖更严的 clipping。
对 Diffusion RLHF 的迁移仅限抽象思路:若采样策略与优化策略版本异步、且可构造可靠的 per-sample importance/mismatch 分数,可考虑风险自适应约束。但 diffusion trajectory 的连续动作、噪声时间步、score parameterization 与离散 token ratio 不同,本文不足以支持“直接使用 SAT 即可稳定 Diffusion RLHF”的结论。
对 VLM RLHF,若视觉编码、图像预处理或多模态路由导致 rollout/train 不一致,SAT 的诊断框架有潜力;但本文没有 VLM 实验,视觉输入引入的失配机制也未验证。
3. 关键证据与实验审计
证据一:高 lag 下的失配增长与训练 collapse 叙事
展示了什么 → 支持什么 → 仍不能证明什么
文本中 Figure 2、Figure 3 的描述称:在相同优化器、数据、奖励与模型设置下,GRPO 的 lag=8 相比 lag=1 出现更高的 train–rollout log-prob mismatch 和 KL 诊断;lag=8 的 AIME24 先接近 0.34,后在 step 449 左右跌至约 0.14。
→ 支持该报告系统中“更大配置 lag 与失配尖峰、后期性能退化同时出现”的经验背景。
→ 不能证明 lag 是唯一因果因素,也不能证明 的尾部本身是 collapse 的充分原因;二者可能共同受未记录的训练动态、MoE 路由、评估噪声或优化状态影响。
审计判断:
- 比较在同一 batch-wise asynchronous regime 的 lag 1/8 内进行,避免了直接混合同步与异步范式,这是合理控制。
- 但只比较两个 lag,不能得到阈值规律、单调关系或对 fully asynchronous streaming queue 的外推。
- 作者称图中高 lag 的 mismatch 有 heavy-tailed spikes;由于这里未直接视觉检查曲线形态,能确认的仅是文本报告的数值范围和作者描述,不能独立验证“重尾”形状。
- 该证据说明需要稳定器,却不单独证明 SAT 优于所有可能的稳定化方法。
证据二:Table 1 的主性能网格
展示了什么 → 支持什么 → 仍不能证明什么
Table 1 报告 Qwen3-30B-A3B-Base 上多个 GRPO/GSPO/DPPO/SAT 与 R3/TIS 组合。在 lag=1/8,SAT-GSPO+R3 的最佳观测 AIME24 avg@8 为 35.83/34.79;DPPO 为 33.96/32.71;SAT-GSPO 为 34.17/32.71;GSPO+R3 为 34.00/33.13。
→ 支持在该单一模型、数学数据和实现栈上,SAT-GSPO+R3 是作者报告网格中的最优组合,并且其 lag=8 数值未被标记为随后 collapse。
→ 不能证明 SAT 对所有 base objective、模型规模、任务类型、种子或系统实现都稳定;也不能由最优组合直接推导“SAT 单独造成了全部提升”。
最关键的直接数字是:
| 方法 | AIME24 avg@8,lag=1 | AIME24 avg@8,lag=8 | 表中 ,lag=1/8 |
|---|---|---|---|
| GRPO | 31.25 | 30.17(后续 collapse) | 0.0103 / 0.0110 |
| GSPO | 32.25 | 31.46(后续 collapse) | 0.0097 / 0.0109 |
| DPPO | 33.96 | 32.71 | 0.0108 / 0.0118 |
| SAT-GSPO | 34.17 | 32.71 | 0.0095 / 0.0107 |
| GSPO + R3 | 34.00 | 33.13 | 0.0091 / 0.0158 |
| SAT-GSPO + R3 | 35.83 | 34.79 | 0.0056 / 0.0076 |
审计判断:
- 公平性较好但不充分。 作者说明所有比较共享优化器、数据、奖励、基础 clip radius、模型和 lag,仅改变 stabilizer;这有利于横向比较。
- 预算和选择性报告风险仍在。 Table 1 是训练窗口内的 best-observed checkpoint,不是固定末端 checkpoint;同时又用末 epoch mismatch 汇报 。对于有 collapse 的运行,best score 与最终稳定性不是同一时间点,容易使“性能”和“稳定性”看起来比实际更一致。
- 统计不足。 附录明确每个 cell 是单 seed,且没有置信区间。AIME24 仅 30 题,虽然每次评估有 16 samples/problem、记录值平均四次评估,但这不能替代独立训练种子。
- 指标语义需谨慎。 文中主表标题和正文对
AIME24 avg@8、pass@1的命名不完全一致;提取文本显示附录称其为 best-observed AIME24 pass@1。无论具体命名,读者不应把表中数值与未说明的标准 AIME 协议直接横比。
证据三:SAT 的局部几何命题与 R3 互补解释
展示了什么 → 支持什么 → 仍不能证明什么
Proposition 4.1 证明:对给定 sampled token,SAT clip interval 包含于 PPO interval;SAT surrogate 不大于 PPO surrogate;二者梯度差仅出现在 newly clipped 的单侧外向 band。R3 组合的结果则显示部分组合有更低记录 mismatch 和更高 benchmark 分数。
→ 前者直接支持 SAT 作为 PPO sampled surrogate 的保守局部修改;后者与“routing replay 降低一部分失配、SAT 压缩风险尾部”的互补解释一致。
→ 不能证明 SAT 对整个 vocabulary 的 policy divergence 更小,不能证明训练轨迹的全局性能下界更好,也不能识别 R3 的收益是否完全来自 routing mismatch。
这是论文最可靠的证据层次:数学命题的结论与其明确前提相匹配。特别是,SAT 并没有被夸大为硬 trust region;作者也承认它只在 sampled surrogate 层面工作。
但需要区分:
- “SAT 对 PPO 逐点悲观”是形式化直接证据;
- “因此训练更稳定”仍是经验性作者主张,要依赖有限实验;
- “SAT-GSPO+R3 的低 解释了性能提升”是分析性解释,因为 不是全策略 DTV,也不构成因果中介验证。
4. 批判性判断与复用建议
4.1 证据强度
总体判断:中等。
被较直接支持的结论:
- SAT 确实是一个可实现的、计算成本很低的 PPO/GRPO/GSPO clip 修改:每 batch 增加一个分位数计算和少量逐元素操作。
- 在停止梯度的 clip 边界视角下,SAT interval 不会扩大 PPO interval,并只额外截断特定方向、特定高失配样本的梯度。
- 在作者报告的 Qwen3 MoE 异步数学 RL 网格中,SAT-GSPO+R3 获得了最高的观测 AIME24 分数,并未被标记为后续 collapse。
仅与结果一致、但尚未被证明的结论:
- 尾部是异步训练不稳定的主要机制,而非伴随现象。
- SAT 的高 lag 收益来自“精确控制 staleness”,而不是额外正则化、组合调参、checkpoint 选择或特定 MoE 工程条件。
- SAT 可以广泛稳定异步 RL,或在任意 lag 上保持更好性能。
- 更低的记录 等价于更小的真实全策略 TV/KL 散度,或必然带来更高回报。
4.2 主要局限与失败条件
-
采样 log-ratio 不是全策略散度,也不是纯版本年龄。
影响:机制解释与泛化。
只对应一个被采样动作,缺少行为概率质量权重;极罕见动作可有巨大 ratio,却几乎不改变总概率质量。同时它混合策略更新失配与实现失配,不能把 SAT 的效果归因给其中某一种来源。 -
batch-relative 90% 分位数不控制绝对风险。
影响:稳定性保证与部署。
若整个 batch 已严重漂移,SAT 仍主要额外收缩相对最极端的尾部;其余 token 可能处于高绝对失配但未触发门控。作者也明确承认,它不保证随 configured lag 增大而单调更严格。 -
单 seed、单模型、单数学任务,统计外推极弱。
影响:可复现性与泛化。
每个配置只跑一次;没有训练 seed 方差,也没有跨模型、跨任务、不同 reward verifier、不同数据混合或不同异步实现的复验。35.83 对 34.00 或 33.96 的差距在此设置中值得关注,但不足以给出稳健显著性结论。 -
组合最优掩盖了组件因果贡献。
影响:工程部署与方法归因。
最强结果是 SAT+GSPO+R3,而 R3 会改变 MoE routing 一致性,GSPO 会改变 ratio/KL 粒度。论文有部分单组件和组合网格,但没有完整的多 seed 因子分析,不能严格分配三者各自贡献或交互作用。 -
评价协议与 checkpoint 选择限制“稳定性”解释。
影响:证据解释。
主指标取 best-observed checkpoint;而 collapse 在之后才标注。一个方法可以短暂达到高分后恶化,另一个方法则可能最终稳定。若目标是生产训练稳定性,应增加固定训练预算末端分数、训练曲线面积、collapse 概率和恢复能力,而不是主要依赖 best checkpoint。
4.3 最有价值的下一步验证
-
多 seed、固定末端与风险曲线联合评估。
验证什么:在至少 3–5 个独立训练 seed 下,比较 best checkpoint、固定末端、collapse 发生率和训练过程 AUC。
为何重要:可区分真实稳定性改进与单次随机轨迹、评估噪声或 checkpoint luck。
什么结果会改变判断:若 SAT 的均值优势消失或方差显著增大,应将其定位为特定 run 的启发式;若在 lag=8 等高压条件下显著降低 collapse 率,可信度会明显提高。 -
绝对失配控制与 proxy 对照消融。
验证什么:比较 batch quantile、固定 阈值、真实/近似 probability-mass-weighted DTV、KL proxy、版本年龄和随机尾部收缩。
为何重要:这是检验“staleness-adaptive”机制是否必要的核心。
什么结果会改变判断:若随机尾部收缩或简单固定阈值同样有效,则 SAT 的特异机制价值下降;若更贴近全策略质量的 proxy 稳定优于 ,则应替换当前代理。 -
跨系统与跨范式复验。
验证什么:在 dense LLM、不同 MoE router、不同 rollout engine、不同异步队列方式,以及至少一个非数学 RLVR 任务上运行 SAT;同时分别测试有/无 R3。
为何重要:可判断它是在 Qwen3+SGLang+Megatron+MoE 特殊栈上修补问题,还是有可移植的异步 RL 价值。
什么结果会改变判断:若只在 R3 已启用的当前 MoE 堆栈有效,应将 SAT 定位为局部工程补丁;若跨实现稳定复现,才值得成为通用后训练组件。
4.4 最终复用结论
- 最值得借鉴: 将 rollout–train mismatch 作为训练一等诊断量,并报告其分布尾部而不仅是平均 lag;这比只看吞吐和版本广播间隔更贴近优化器实际输入。
- 可直接尝试的实现: 在现有 PPO/GRPO/GSPO 中,为 detached 的 batch 高分位 token 施加单侧、外向的 adaptive clip contraction;必须保留 disable 后与基线 loss bit-identical 的测试。
- 不要照搬的部分: 不要把 解释为真实 TV divergence、KL 或纯粹 staleness,也不要因为 SAT 具有局部悲观性就宣称有全策略 trust-region 保证。
- 适用场景: 异步 rollout/training 解耦、采样 log-prob 可可靠记录、并且训练日志显示 ratio/mismatch 有异质长尾或高 lag collapse 的 LLM RLVR 系统;MoE routing 不一致时应优先配合或先评估类似 R3 的系统修复。
- 路线建议: 值得纳入“可开关的稳定性实验分支”,而不是未经多 seed 验证就设为默认基础算法。对于 Diffusion/VLM RLHF,应先重建与其采样过程匹配的失配度量和方向性约束,再考虑迁移 SAT 的结构。
5. 必要概念与文献地图
必要概念
-
行为策略 与目标策略
是实际生成 rollout 的策略分布, 是当前用于优化的训练策略;异步训练使两者不再相同。 -
importance ratio 与 log-ratio
它们刻画同一采样动作在当前策略和行为策略下的相对概率。本文以 detached 作为观测失配风险分数,而不是将其等同于完整分布散度。 -
configured lag 与 realized mismatch
前者是权重广播间隔或版本差等系统配置;后者是 token 实际看到的 分布。论文的基本立场是前者不能充分代表后者。 -
PPO clipping 的方向不对称性
PPO 主要阻止会让 ratio 更远离 的外向更新,允许将 ratio 拉回行为策略的回拉更新;SAT 保留这一结构。 -
Total Variation(TV)divergence
衡量两个完整动作分布的概率质量差异。论文用它连接有限时域 policy-improvement bound 与理想 all-action ratio envelope,但 SAT 并不直接测量或约束它。 -
sampled surrogate 与 hard trust region 的区别
PPO/SAT 只作用于样本动作的目标函数和梯度;真正 hard trust region 需要对全部动作或完整策略分布施加约束。混淆二者会夸大理论结论。 -
GSPO 的 sequence-level ratio
GSPO 使用长度归一化的响应级 ratio,而不是逐 token ratio。它可降低局部 token 波动,但 token 偏差可能在序列平均中相互抵消,因此其与 token-level DTV 的关系更弱。 -
R3(Rollout Routing Replay)
在 MoE 中重放 rollout 时的 Top-K router mask,以减少 rollout/train 经过不同专家路径造成的实现失配;它修复的是部分系统一致性,而非直接充当 clip 规则。
关键前作
-
Schulman et al., PPO(2017)
SAT 的直接基础:固定 clip 的 sampled surrogate。本文的核心改动是将固定半径变为对高失配尾部的单侧自适应半径。 -
Schulman et al., TRPO(2015)
提供 trust-region 与策略散度约束的理论背景。本文借其思想说明为何全策略散度重要,同时强调 PPO/SAT 不是 TRPO 式硬约束。 -
Kakade & Langford(2002)
有限时域 policy-improvement 分析的理论谱系来源。论文据此引入回报改进下界中的累计 TV divergence 误差项。 -
Qi et al., DPPO(2026),“Rethinking the Trust Region in LLM Reinforcement Learning”
本文最重要的方法对照之一。DPPO 同样保持方向性约束,但基于采样 DTV 判别和概率相关的阈值;SAT 改用当前 batch 失配尾部分位数来设定有效 clip 边界。 -
Ma et al., R3(2025),“Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers”
本文最重要的系统互补机制。R3 面向 MoE routing 一致性,SAT 面向仍然暴露给优化器的高失配更新尾部;论文的最佳结果来自二者与 GSPO 的组合。