SLPO: Scaling Latent Reasoning via a Surrogate Policy

论文元数据


论文标题:SLPO:通过替代策略扩展潜变量推理(Scaling Latent Reasoning via a Surrogate Policy)

阅读范围与证据边界

  • 本解读的输入是论文 PDF 的完整文本提取(含正文、表格文本、图注、参考文献与附录文本),属于文本回退 input(文本回退输入);我没有直接检查 PDF 的页面布局、颜色、曲线几何、图中空间关系,或提取文本/图注未保留的图表细节。
  • 文中“作者主张”指论文的解释与结论;“论文直接证据”限于已提取的公式、实验设置、表中数字、图注和正文描述;“分析者判断”则是基于这些材料对机制、证据强度和可复用性的推断。
  • 文本保留了图 1–10 的标题、部分坐标轴文字及正文解释,但不能据此声称已视觉核验柱状高度、曲线走势、颜色编码、误差条形态或版面结构。涉及这些内容时,下文只采用作者提供的文字和可辨识数值。
  • 附录提供了较多训练与评测细节,但没有看到原始代码运行记录、随机种子分布、置信区间、完整逐样本结果或外部复现实验。因此,性能提升可视为论文内实验支持,尚不能升级为对广泛模型、任务或真实部署的普适结论。
  • 论文主要覆盖小学数学推理、较小规模的 GPT-2 124M 与 Llama-3.2 1B/3B 设置;对开放式推理、更大模型、多模态任务和长期稳定性的判断均应保持保守。

1. 一页速览:值不值得看

维度判断
问题连续潜变量推理把中间计算放在隐藏状态而非语言 token 中,可能更短、更便宜;但它没有可直接用于 policy gradient 的逐步动作概率,且通常使用固定思考步数,因此难以像显式 CoT 一样用可验证结果奖励(RLVR)做测试时扩展。
一句话方法SLPO 用 MC-dropout 多次前向传播构造潜状态转移的经验高斯“替代似然”,再把它、答案 token 似然和停止时刻似然合入同一个优势加权 RL 目标;另以“不同截断长度是否答对”预训练停止头,使潜推理长度可由结果奖励调节。
真正新意核心不是首次对潜推理做 RL,而是为任意直接递归隐藏状态的自回归潜轨迹提供一个与词表概率脱钩的、可微的转移打分代理,并将可学习停止策略纳入同一 rollout 目标。RLOO/GRPO、MC-dropout、二元正确性奖励和高斯密度本身均非新组件。
关键结果在 Llama-3.2-1B 的 CODI 上,平均确定性准确率从 54.59 升至 54.95,平均 Pass@16 从 60.63 升至 62.18;软潜变量 3B 设置中,AIME 2025 Pass@1/32 从 LEPO 的 0.96/16.67 提至 3.33/20.00。提升并非每个基准、指标都压倒所有基线。
可信度中等。 同一初始化上的前后比较、不同 backbone 和 RLOO/GRPO 的覆盖提供了正面证据;但任务集中在数学、绝对增益常较小,替代密度并非真实 dropout 轨迹密度,且缺少多种资源控制、统计显著性和独立复现。
相关性对“RLHF/RLVR 如何作用于非离散、连续内部计算”高度相关;对 Diffusion-RLHF 是概念上的可迁移思路,而非可直接套用的算法,因为 diffusion trajectory 的随机过程、密度建模与停止接口不同。
建议精读。 值得重点读第 4 节、附录 A.2–A.5 与第 7 节:它提供了把 outcome reward 接到 latent trajectory 上的一种具体接口。但不应把它当作“latent RL 已被严格解决”的定论。

Figure 1|第 1 页

Figure 1|第 1 页。 Figure 1: SLPO brings outcome-reward RL to latent reasoning and enables latent test-time scaling. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。

2. 方法论拆解

2.1 问题与已有路线的缺口

作者针对的不是“如何让模型在隐藏层思考”这一已有问题,而是:如何让潜变量推理也能接受末端正确性奖励,并让奖励同时调整推理内容与测试时计算长度。

理解该缺口只需区分四条路线:

  1. 显式 CoT + RLVR。
    显式 CoT 的每一步是从词表分布采样的 token。完整轨迹的对数概率可以写成各 reasoning token 与答案 token 的对数概率之和,因此可用优势函数 做 policy gradient。其代价是每个中间步骤都要自回归生成语言 token。

  2. 连续 latent reasoning。
    以 COCONUT、CODI 为代表的方法让中间步骤成为隐藏状态 ,绕过词表分布。这样可压缩显式推理,但状态转移 通常没有显式动作概率,不能直接照搬 token-policy RL。

  3. 既有潜推理训练大多停留在模仿阶段。
    COCONUT 通过课程式压缩、CODI 通过自蒸馏,把显式 CoT 的某种表示迁移到连续空间;它们多数采用固定 latent budget。作者的判断是:这限制了模型把额外计算分配给难题的能力。

  4. 已有 latent-policy/RL 路线不完全覆盖目标场景。
    LEPO、Latent-GRPO 或 CoLaR 等方法通常仍依赖软 token、词表概率、embedding mixture 或特定高斯头。SLPO 的定位是面向“直接传播普通隐藏状态”的向量递归潜推理器。这个定位合理,但“任意 autoregressive latent reasoner 都适用”的外延仍需更多架构验证。

因此,作者将障碍拆成两个接口缺失:

  • 连续 latent transition 缺少可训练的轨迹级 likelihood;
  • 固定长度的 latent rollout 缺少可由奖励塑形的 stop/continue 决策。

2.2 核心机制与流程

SLPO 的训练分为两个阶段:先为停止策略做 correctness-supervised cold start,再用 outcome-reward RL 联合优化 latent transition、答案生成和停止时刻。

(1)停止头:把“何时停止”变成概率策略

作者在每个 latent state 上加一个 stopping head:

其中 是停止头, 是当前状态停止潜推理的概率。对每道训练题,模型先以 dropout 采样 条最长到 的潜轨迹;对于每条轨迹的每个候选截断长度 ,立即从该 latent prefix 解码最终答案并用可验证奖励判断正误。

为第 条轨迹上“在该步停止能答对”的长度集合。若 ,则首次在 停止的概率为:

停止头的 cold-start 损失是最大化停在任一有效长度上的概率:

它的角色是提供一个可学习的变长计算接口。其必要假设是:在训练时,某条固定采样 latent trajectory 的某个 prefix 能否生成正确答案,能够为未来的停止决策提供有用监督。该假设并不等价于“最早正确 prefix 就是最优停止点”,因为不同 dropout rollout、不同解码随机性和泛化样本上都可能变化。

(2)替代转移似然:为连续状态提供 reward-weighted score

对于给定 prefix ,作者在训练中使用 个独立 dropout mask 进行前向计算,得到潜在下一状态样本:

然后计算经验均值 与逐维方差 ,并把已经采样得到的真实 latent state 放进一个对角高斯代理:

这里最重要的技术事实是:这不是 MC-dropout 真实诱导分布的精确密度。它是一个surrogate policy density:用当前网络在多次 dropout 前向下的局部均值、方差,为已采样 latent transition 赋予一个可导的标量分数。采样状态本身 stop-gradient,梯度只通过重新计算的当前策略统计量传播。

(3)联合 rollout 目标:内容、答案、计算长度一起收奖励信用

在自适应停止后,一条 rollout 表示为 。其替代对数似然由三部分相加:

再用二元结果奖励 与优势 形成:

因果链条是:答对的 rollout 获得正优势,因而其 latent transition 代理分数、答案 token 概率和相应停止时刻概率都会被增强;答错轨迹则相反。作者使用 RLOO 或 GRPO 来构造 baseline/优势。

推理时不再枚举全部候选长度:逐步生成 latent state,若停止概率首次超过验证集选定阈值即停止,并据该 prefix 解码答案。训练中使用的“所有 prefix 解码”只服务于停止头冷启动,不是最终推理流程。

2.3 关键设计与创新判断

关键设计解决的问题为什么可能有效论文是否证明其必要性创新判断
MC-dropout 经验高斯替代密度连续 hidden transition 没有 token-level log-probability多次随机前向提供局部波动尺度;对已采样状态的偏离进行可导打分仅有 sweep 与跨 RLOO/GRPO 结果;没有与其他连续密度代理、全协方差、flow 或 score surrogate 的系统比较本文最核心的方法贡献;高斯近似本身常规,但用作 latent rollout policy interface 的组合有明确针对性
correctness-supervised stop-gate cold start固定 latent budget 无法自适应计算把“该 prefix 能否答对”转化为可监督的停止时间分布有难度-长度相关性与平均长度表格,但没有移除 cold start、仅 RL 学停止、或不同停止标签构造的直接消融实用且必要性直觉强,但实证隔离不足
把 transition、answer、stop likelihood 合到同一 RL objective只优化答案 token 会弱化 latent 内容和计算分配的信用同一结果奖励可同时强化成功的状态路径和停止位置没有逐项移除三项的损失分解消融合理的联合建模,而非单独的新优化器
对 COCONUT/CODI 进行插件式后训练证明不需重训潜变量架构若相同 recipe 能提升不同 latent 来源模型,说明接口具有一定通用性覆盖两类 latent backbone 与软 token transfer,但规模和任务窄具有工程迁移价值;“架构无关”仍是待验证主张
在 soft-token latent inference 中使用 SLPO测试代理目标是否不只适配 hidden-state recurrence把 latent state 换为 soft embedding,沿用 reward-weighted surrogate3B 上某些指标不胜 LEPO,例如 GSM8K/MATH500 的 P@32有价值的范围扩展,但不能证明统一优越性

2.4 可迁移的方法论

对 Diffusion / RLHF / VLM / LLM 工作,SLPO 最可迁移的不是其具体高斯式,而是三个建模原则:

  • 先补齐“优化接口”,再谈 outcome reward。
    如果中间过程不是离散 token、没有自然的 log-probability,就不能直接把 GRPO/PPO 套上去。需要明确:采样对象是什么、怎样给已采样轨迹构造可微 score、梯度对什么路径传播。该原则对连续 latent planner、soft token、diffusion latent trajectory 都直接相关。

  • 将计算分配显式建模为策略变量。
    停止头把“推理多少步”从固定超参数转为可被结果奖励影响的决策。对可变 denoising step、adaptive diffusion solver、VLM 的视觉 token 预算或多阶段推理预算都有启发。

  • 将 surrogate 的统计假设当作一等公民。
    SLPO 使用局部、逐维独立的高斯代理;这对高维、强相关隐藏状态是强假设。迁移到 diffusion 时,必须重新判断时间相关性、噪声调度、真实采样分布和 surrogate bias,不能照搬对角协方差。

  • 先做廉价的可验证域验证。
    论文选择数学正确率作为二元奖励,因此结果清晰。迁移到开放问答、偏好模型或 VLM 时,奖励噪声和 reward hacking 风险更大;停止策略甚至可能学会迎合脆弱 judge,而不是真正改善内部推理。

直接迁移的风险是:扩散模型通常已定义前向/逆向噪声过程,潜轨迹的概率语义与 dropout-induced hidden recurrence 并不同;VLM 还会引入视觉输入变化、数据污染和多模态 judge 偏差。因此,SLPO 应被视为“连续中间过程如何接 outcome reward”的候选范式,不是 diffusion RLHF 的现成替代方案。

3. 关键证据与实验审计

证据一:同一 latent backbone 上的主结果(表 1)

展示了什么 → 支持什么 → 仍不能证明什么

  • 展示了什么:
    在 GSM8K、GSM-Hard、MultiArith 上,COCONUT 与 CODI 加 SLPO 后,多数 Acc、Pass@8、Pass@16 均提高。
    例如 Llama-3.2-1B 的 CODI:GSM8K 从 Acc 55.22、P@16 67.48 到 55.27、70.28;GSM-Hard 从 12.82、15.63 到 13.20、16.77;MultiArith 从 95.52、98.79 到 96.38、99.48。平均 Acc 从 54.59 到 54.95,平均 P@16 从 60.63 到 62.18。
    更弱的 Llama-3.2-1B COCONUT 平均 Acc 从 22.29 到 25.01,平均 P@16 从 37.06 到 41.38,增幅更明显。

  • 支持什么:
    在作者选择的 latent backbone、数学训练数据和 MC-dropout 采样协议下,SLPO 与更高的多样本成功率一致;它并非只提升单个模型或单一数据集。对弱初始化的 COCONUT 增益更大,也符合“结果奖励帮助突破模仿初始化”的叙事。

  • 仍不能证明什么:
    这些结果不能证明 surrogate density 是无偏 policy gradient,也不能证明提升主要来自 latent transition term 而非答案 token 训练、stop head、额外训练预算或阈值调参。文中没有报告多随机种子方差、显著性检验,也没有统一训练预算下的“继续 SFT / 仅训练停止头 / 仅答案 RL”对照。

审计判断:

  • 比较的主要优势是同一个公开 checkpoint 的 +SLPO 前后对照,而非只挑选不同论文里的数字。
  • 但基线公平性仍有限:表 2 中 DART、Latent-SFT 的数字来自原论文;不同方法的训练数据、训练预算、latent budget 与实现质量并不完全统一。
  • Pass@ 的改善发生在 MC-dropout 的独立 stochastic rollout 下;这恰好是 SLPO 的探索机制,因此它说明“在这个抽样机制中更易找到正确轨迹”,不应直接等同于单次稳定推理能力。
  • 确定性 Acc 的增长往往较小,特别是 CODI 1B 的平均绝对增益仅 0.36 个百分点;因此“显著提升 latent reasoning 本体”的表述应谨慎。

证据二:可变长度与难度相关(表 2、图 7 的文本与图注)

展示了什么 → 支持什么 → 仍不能证明什么

  • 展示了什么:
    在 GPT-2 上,COCONUT+SLPO 的平均 latent length 约为 6.03,接近原固定预算 6;CODI+SLPO 约为 11.74,明显更长。Llama-3.2-1B 上,CODI+SLPO 的平均长度为 5.79,低于固定 6,而 COCONUT+SLPO 为 7.63。
    作者对 GSM8K 的难度分桶,以 定义难度,报告潜长度与难度的 Pearson 相关为验证集 、测试集

  • 支持什么:
    学到的 gate 没有退化成全局固定步数;在作者的 GSM8K 分桶协议下,更难样本平均获得更长的 latent computation。这支持“自适应长度确实发生”的较弱结论。

  • 仍不能证明什么:
    是弱到中等相关,不足以证明 gate 精确识别了内在问题难度,也不能证明长度变化是准确率提升的原因。难度由同一模型的 acc@32 估计,可能与 rollout stochasticity、答案格式、数据类型和模型能力纠缠。

审计判断:

  • 文本和图注明确给出了相关系数、分桶与标准误说明,证据比纯定性描述更好。
  • 但没有直接证据表明“同一题增加一步”导致正确率上升,也没有计算成本—准确率 Pareto 曲线、总 FLOPs、wall-clock latency 或停止错误案例。
  • 对 CODI 而言,平均长度在某些设定中上升、另一些中下降,说明 adaptive compute 不应被简化为“越长越好”;这反而是合理现象,但论文尚未系统解释何时缩短、何时延长最有效。

证据三:跨优化器与 soft latent transfer(表 3、表 4、表 5)

展示了什么 → 支持什么 → 仍不能证明什么

  • 展示了什么:
    在 COCONUT/CODI 上交换 RLOO 与 GRPO 后,两种优化器多数 Pass@ 接近。例如 CODI 的 GSM8K:RLOO 为 P@1/P@8/P@16 = 42.76/54.13/56.71,GRPO 为 44.35/54.06/56.18。
    soft-token 1B 上,SLPO 在 GSM8K 得到 Acc 46.70、P@32 82.03,优于 GRPO 的 45.56、87.57 在 Acc 上但不在 P@32 上;MATH500 得到 27.20、71.60。软潜变量 3B 上,SLPO 在 AIME 2025 达到 P@1 3.33、P@32 20.00,优于表中其他方法;但 GSM8K 和 MATH500 的 P@32 分别为 95.30、82.00,低于若干对照。

  • 支持什么:
    替代 transition likelihood 没有明显绑定到 RLOO;它可在至少一个 soft-token 接口中运行。尤其 AIME 2025 上的提升说明该方法可能更有利于困难、可从更多 latent computation 获益的设置。

  • 仍不能证明什么:
    不能证明 SLPO 对所有 vector-based latent mechanism 通用或优于词表路由方法。软潜变量实验明确存在 trade-off:SLPO 的平均长度也更长,例如 1B MATH500 长度 642.32,高于多项比较方法,性能收益可能部分反映额外计算,而非更高样本效率。

审计判断:

  • 这是论文较有价值的外推证据,因为它改变了 RL estimator 和 latent interface。
  • 但 1B/3B 仍属中小模型;没有同等计算预算的 controlled comparison。若 SLPO 使用更长 rollout,则应同时报告性能对长度、生成 token、GPU 时间或总 forward passes 的归一化结果。
  • 作者称 更敏感,且增大 提升 Pass@2;这符合更多并行样本提高 coverage 的常识。它不足以单独证明 surrogate 质量高,反而提示一部分收益可能来自更大 rollout group 的搜索效应。

4. 批判性判断与复用建议

4.1 证据强度

总体判断:中等。

被直接支持的结论:

  • 在论文报告的数学任务、模型规模、训练协议与 MC-dropout 设置中,SLPO 后训练通常优于对应 COCONUT/CODI 初始化,尤其在 Pass@ 上。
  • 论文确实定义了一个可微、可计算的潜状态转移代理,并可将其与 token answer likelihood、停止概率纳入 reward-weighted objective。
  • learned stopping gate 与作者定义的样本难度呈正相关,并且不会始终输出固定长度。
  • 该 recipe 可在 RLOO/GRPO 两种 estimator 和一个 soft-token latent interface 中执行。

仅与结果一致、尚未被证明的结论:

  • 替代高斯密度是否提供了对真实 latent policy 的正确或低偏差信用分配;
  • 性能增益主要是否来自 surrogate transition learning,而非停止头、额外训练、答案 token 梯度、rollout 数量或阈值选择;
  • latent geometry 的“更大步间余弦距离 + 更低有效秩”是否意味着更有效、更任务相关或更具因果性的推理;
  • “latent test-time scaling”是否已在广泛意义上成立。当前证据更准确地说是:在 MC-dropout 并行采样和有限数学基准下,成功率随多个 latent rollout 增加而上升,且 gate 会调整长度。

4.2 主要局限与失败条件

  1. 替代密度的统计与优化偏差未被量化。
    对角高斯由 个 dropout forward 的样本均值、方差估计,而 dropout 诱导的真实状态分布可能高度非高斯、跨维相关且多模态。该局限直接影响机制解释与优化正确性:训练信号究竟在优化什么,尚不清楚。

  2. 关键模块没有充分的因果消融。
    文中未见对“去掉 surrogate term”“去掉答案 token likelihood”“冻结 stop head”“随机停止”“只做 stopping cold start”“不同 stop label”的系统拆分。它影响机制解释与新颖性判断:不能确定哪一部分是核心收益来源。

  3. 计算公平性与效率证据不足。
    训练时每步需 次 dropout forward,并以 rollout 估优势;软 latent 还使用最长 32-step block。论文报告 reasoning length,却没有端到端训练成本、推理延迟、吞吐、显存或等算力对照。它影响效率与工程部署结论。

  4. 任务与模型覆盖较窄。
    主实验是 GSM8K-Aug 训练和小学数学类测试,backbone 主要为 124M 与 1B,软潜实验扩到 3B。没有开放式文本推理、代码、科学问答、多模态或更大模型。它影响泛化性,特别是作者提出的“any autoregressive latent reasoner”表述。

  5. 停止策略监督可能带有选择和分布偏差。
    cold start 的标签来自当前 backbone 对同一 sampled trajectory 的各个 prefix 解码是否正确;这既依赖 rollout,也依赖答案解析与二元 verifier。若正确答案恰好早出现、解析规则脆弱、或训练题存在模式记忆,gate 可能学习到数据集特有长度偏好。它影响可复现性与部署稳健性

  6. latent geometry 分析是描述性相关,不是机制证据。
    文本称 SLPO 后步间距离上升、prefix effective rank 降低;但这些表征统计没有与成功/失败、因果干预或性能增益做严格连接。它影响机制解释,不能把“低秩”自动解释为“更聚焦的推理”。

4.3 最有价值的下一步验证

  1. 做三项损失的严格因子消融。
    要验证:latent surrogate、answer likelihood、stop likelihood 各自贡献多少。
    为何重要:这是判断 SLPO 是否真解决连续 latent credit assignment 的核心。
    改变结论的结果:若只训练停止头或答案项即可复现大部分增益,则 surrogate policy 的核心地位需要下调;反之,若替代项在受控预算下稳定贡献,则机制可信度上升。

  2. 进行等训练/推理算力的 Pareto 比较。
    要验证:在相同 GPU 时间、forward 次数、最大 latency 或 latent-step 预算下,SLPO 与继续 SFT、GRPO、LEPO、固定长度 latent reasoning 的准确率和 Pass@
    为何重要:当前方法可能以更多 dropout 重算、更多 group rollout 或更长长度换取收益。
    改变结论的结果:若等算力下优势消失,则其主要价值是有效但昂贵的搜索;若仍胜出,才更有资格称为效率改进。

  3. 验证 surrogate 的分布假设与跨域稳健性。
    要验证:比较 diagonal Gaussian、full/low-rank covariance、mixture/flow/score-based surrogate,并扩展到开放式推理、较大模型与至少一个多模态 latent setting。
    为何重要:这可检验“替代密度”是普适接口还是当前小规模数学设定的偶然近似。
    改变结论的结果:若简单高斯只在少数任务有效,论文应被定位为特定工程技巧;若多种结构和领域都受益,其一般方法论价值才更强。

4.4 最终复用结论

  • 最值得借鉴: 将连续内部轨迹的“可优化概率接口”单独建模,而不是假设所有 RL 都必须经由 vocabulary logits。对于 latent diffusion、soft token 或 hidden-state planner,这是一条非常实用的研究起点。
  • 可直接复用: 先用 correctness/performance-at-prefix 构造停止策略 cold start,再允许 outcome reward 调整 stop/continue;这一两阶段设计比从随机停止策略直接做稀疏奖励 RL 更稳妥。
  • 不要照搬: 对角高斯 surrogate、MC-dropout 作为唯一探索源、 和阈值扫描都属于任务相关实现选择,必须重新做统计与计算成本验证。
  • 适用场景: 有明确可验证终局奖励、可生成或采样中间连续状态、且希望动态分配推理/采样预算的封闭任务,如数学、程序验证、结构化规划或部分可评测的生成流程。
  • 路线建议: 应将 SLPO 纳入后续 RLHF / latent-reasoning 技术路线,定位为“连续轨迹 outcome optimization 的候选基线与接口设计”,而不是直接作为可生产化的通用解决方案。

5. 必要概念与文献地图

必要概念

  • 显式 Chain-of-Thought(CoT): 模型以自然语言 token 显式生成中间推理步骤。其优势是每一步有标准 token probability,便于 RL;代价是序列长、生成慢。
  • 潜变量/连续推理(latent reasoning): 用隐藏状态或连续 embedding 作为中间思考步骤,而不把每一步转换成文本。它可能压缩计算,但中间状态通常缺少可直接解释或赋予 likelihood 的离散动作接口。
  • RLVR(Reinforcement Learning with Verifiable Rewards): 用可自动验证的结果奖励,如数学答案是否正确,来优化策略。它比主观偏好奖励更明确,但仍可能受到奖励定义和答案解析限制。
  • Policy gradient 与 advantage: 对采样轨迹按奖励相对基线的优势 加权,提高高回报行为的对数概率、降低低回报行为的对数概率。
  • RLOO(REINFORCE Leave-One-Out): 用同题其他 sampled rollout 的回报作为 baseline,降低 policy-gradient 方差。
  • GRPO(Group Relative Policy Optimization): 在同一问题的一组输出中构造相对奖励/优势的优化方法;本文把它作为可替换的 outcome-RL estimator。
  • MC-dropout: 推理或训练时保持 dropout,借由不同 mask 产生随机预测/轨迹。本文既用它制造 latent rollout 的探索,也用它估计 surrogate Gaussian 的局部统计量。
  • Pass@ 对同一道题生成 个独立样本,只要至少一个正确就记为成功。它度量并行采样的 coverage,不等同于单次 deterministic accuracy。

关键前作

  • Hao et al., COCONUT, 2025: 将语言推理压缩为连续 latent space,是本文主要的 hidden-state latent backbone 之一;SLPO 在其公开 checkpoint 上追加训练。
  • Shen et al., CODI, 2025: 通过自蒸馏把 CoT 压缩到连续空间,是本文第二个主 backbone;论文的重要结果之一是 CODI+SLPO 的多样本成功率提升。
  • Shao et al., DeepSeekMath / GRPO, 2024: 提供 group-relative outcome optimization 的代表性思路;本文的贡献不在 GRPO 本身,而在为连续 latent trajectory 构造可接入这类优化器的代理 likelihood。
  • Huang et al., RLOO, 2025: 提供 leave-one-out advantage 估计;本文通过比较 RLOO 与 GRPO,主张其 surrogate 不依赖某个特定 outcome-RL estimator。
  • Zhou et al., LEPO, 2026: 同样探索 latent reasoning policy optimization,但依赖 soft-token/词表相关接口;本文以此凸显其对直接 hidden-state recurrence 的不同定位,并在 soft latent setting 中将其作为主要比较对象。