Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
论文元数据
- Authors: Md Tanvirul Alam
- Publication date: 2026-07-22T00:00:00.000Z
- arXiv: https://arxiv.org/abs/2607.19790
- PDF: https://arxiv.org/pdf/2607.19790
- Project: https://maveryn.github.io/trace/
- Code: https://github.com/maveryn/trace
- 本次阅读输入: 文本回退 + 已定位图像
论文标题:TRACE:面向多领域视觉推理的分类学引导环境
阅读范围与证据边界
- 输入材料: 本解读基于论文的完整 PDF 文本抽取结果,包括正文、附录中的文字、表格数值、图注及部分图中文字;输入模式为文本回退(text fallback)。
- 不可见范围: 我没有直接检查 PDF 的页面布局、颜色、曲线几何、图形视觉构成、空间细节,也无法核实文本抽取未保留的图表内容、子图细节、字体/对比度、真实渲染质量或视觉歧义。因此不会把图注和文字描述扩展为“已看图”的结论。
- 证据区分: “作者主张”指论文对 TRACE 设计及外部迁移效果的解释;“论文直接证据”限于文中报告的任务数量、训练配置、表格分数、置信区间和作者声明的验证流程;“分析者判断”是基于这些材料对因果归因、泛化和复用价值的审计。
- 材料缺失的影响: 文本中虽包含附录、任务样例及完整参考文献,但未提供代码执行记录、数据发布包、训练日志、独立复现实验或多随机种子训练结果。因而可判断其方法设计与报告结果,但不足以独立验证数据质量、视觉可读性、实际训练稳定性及实现一致性。
- 结论边界: 论文较有力地表明“该固定 TRACE 混合物与 Qwen2.5-VL 上的外部评测提升相关”;现有证据不足以证明具体哪类任务、渲染因素或 RLVR 设计导致提升,也不足以证明它对任意真实图像分布均可泛化。
1. 一页速览:值不值得看
| 项目 | 快速判断 |
|---|---|
| 问题 | VLM 的 RLVR 需要同时满足视觉接地、答案可精确验证、覆盖足够广且可复现的训练环境。现有大规模数据混合往往奖励异构、任务粒度不一致;程序化环境则常局限于单一视觉语法或少数任务。 |
| 一句话方法 | TRACE 将一个视觉 RL 任务显式拆成“场景语法 + 可执行任务程序 + 答案模式 + 奖励契约 ”,从共同语义状态生成图像、问题、答案、验证器与可回放轨迹,并以任务程序而非样本或提示词变体作为采样单位。 |
| 真正新意 | 不是单纯再造一批合成视觉题,而是把任务身份边界、查询变量、语义生成和仅渲染变化系统分开,服务于均衡采样、精确验证、分析与复现。RLVR/GRPO、程序生成、规则验证本身都不是新组件。 |
| 关键结果 | 在同一批 64,000 个 TRACE 样本上训练 Qwen2.5-VL:3B 外部 24 基准宏平均从 提升至 ,增 点;7B 从 至 ,增 点。7B 的 24 个基准均为正增益。 |
| 可信度 | 中等。 外部评测覆盖广、同一评测协议和配对 bootstrap 增强了“有迁移提升”的可信度;但每个模型规模仅一次训练,缺少混合物消融和独立训练重复,无法做强因果归因。 |
| 相关性 | 对 VLM RLVR / 可验证合成数据 / 多领域训练混合设计直接相关;对 Diffusion-RLHF 没有直接实验,但“程序单元化、奖励契约、语义—渲染因素解耦”的设计思想可迁移。 |
| 建议 | 精读。 若目标是构建可审计、可扩展的视觉推理 RL 环境,这篇论文的任务建模框架值得复用;若只关心某个具体 RL 算法或真实视觉数据上的 SOTA,则不应把它视为充分证据。 |

Figure 1|第 2 页。 Figure 1: Representative instances from the 11 visual domains in TRACE, spanning charts, games, ge- ometry, graphs, icons, illustrations, pages, physics, puzzles, symbolic notation, and three-dimensional scenes. 图像按 caption/版面候选定位并从原 PDF 页面渲染;本报告的分析性结论仍以正文与 caption 为依据,未将未执行的视觉模型审阅伪装为视觉证据。
2. 方法论拆解
2.1 问题与已有路线的缺口
作者瞄准的不是“如何生成更多视觉样本”这一泛问题,而是一个更具体的训练基础设施问题:怎样定义一个稳定、可验证、不会因提示词或渲染小变化而被错误切碎的视觉 RL 任务单元。
理解本文只需抓住四条已有路线:
-
真实数据混合式多模态 RL。
Visual-RFT、Vision-R1、Vero 等将既有多源数据集组合起来,并按照答案格式路由奖励。其优势是覆盖真实视觉分布;缺点是任务来源、粒度、数据质量、训练预算和奖励格式天然异构。作者认为这使“一个任务被采样多少”“某类能力是否被过度计权”难以明确控制。 -
单域程序化视觉环境。
Jigsaw-R1、VisualSphinx、Sphinx、Game-RL、TRON 等提供可执行生成与规则验证,优势是答案精确、样本近乎无限、可控;缺点通常是视觉语法或任务家族较窄。TRACE 试图把这种可验证性扩展到图表、游戏、几何、图、页面、物理、三维场景等 11 个域。 -
结构化视觉推理基准。
CLEVR 和 Task Me Anything 使用场景图、功能程序或任务计划来构造问题。TRACE 的推进点是:结构不仅用于出题和评测,还被定义为 RL 训练的采样、奖励、回放和统计单元。 -
数据选择/混合优化。
既有工作常对来源比例、难度或高价值样本进行选择;TRACE 先解决“源内到底什么算同一个任务”的问题。作者的立场是:若任务边界不稳定,任何按任务均衡的混合或课程设计都可能失真。
核心缺口可概括为:现有工作要么有广度但缺少统一可控的任务单位,要么有精确生成但缺少多领域结构化组织。TRACE 的贡献主要是提出一套可执行的中间层,而不是证明其任务库已覆盖视觉推理本身。
2.2 核心机制与流程
任务层级:域、场景语法、任务
TRACE 使用如下层级:
- Domain(视觉域):用于报告和混合平衡,例如图表、游戏、几何、图、图标、页面、物理、谜题、符号和三维场景。它不是直接采样单位,也不等同于一种推理能力。
- Scene grammar(场景语法):定义可生成的对象词表、关系、布局家族、可见支架和渲染规则,即“什么样的语义状态可以被画出来”。
- Task(任务):将场景语法与一个可执行计算、答案模式、奖励契约绑定。它定义“模型要基于该视觉状态算什么、答案应如何格式化和验证”。
作者将任务表示为:
其中:
- :场景语法;
- :任务程序,规定候选对象如何形成、操作数角色、中间计算、终止算子和结果输出;
- :答案模式,如整数、规范数值、字符串、选项字母;
- :奖励契约,包括答案归一化与评分行为。
这个表示的关键不是公式形式,而是其任务同一性判定:若改变了候选集合的构造、逻辑算子、推导规则、场景语法或评分契约,就应视为新任务;若只改“最大还是最小”、某个颜色名称或某个类别标签,则可能只是同一任务中的有界查询变量。
例如,论文区分:
- “最大 IQR”与“最小 IQR”:同一任务下的不同查询;
- “数形状”与“数形状且颜色满足条件”:谓词元数和选集改变,是新任务;
- AND 改成 inclusive OR:中间集合操作改变,是新任务;
- 同一种极值计算换到另一场景语法:仍是新任务;
- 版式、调色板、字体、非答案相关上下文变化:只是渲染变化。
这套边界规则的直接作用是防止两类偏差:
- 过拆分: 将每个颜色、方向或提示词措辞视为新任务,导致同一程序在均匀任务采样中被重复加权;
- 过合并: 将不同中间操作归为同一任务,掩盖真正不同的推理过程和奖励行为。
从共同语义状态生成实例
单个实例被写为:
其中 为渲染图像, 为提示词, 为类型化答案, 为绑定后的实例评分器, 为可回放轨迹。
其生成过程为:
变量的角色如下:
- 是场景语义状态;
- 是随机种子;
- 分别控制语义、渲染和提示相关的生成选择;
- 是任务内部的有界查询变量;
- 是验证器状态;
- 记录状态、查询、执行结果、渲染决策和验证状态。
这一设计的因果链条是:先构造可执行的语义世界,再在该状态上运行任务程序得到答案和验证状态,随后独立地把同一状态渲染成图像和问题。 因此答案不依赖于“看图后人工标注”,而由程序执行产生;同时,渲染变化理论上不应改变任务答案。
这对于 RLVR 特别关键:奖励并非由一个额外的 VLM judge 或人工标签近似给出,而是由任务级奖励契约对模型答案进行类型感知的精确比对。论文支持四种答案接口:整数、规范数值、字符串和选项字母。
RLVR 设置
训练使用 GRPO。模型可生成任意推理轨迹,但输出必须以仅含所需键的 JSON 对象结束。奖励为:
其中:
- :经类型归一化后答案是否完全正确;
- :回复是否以合法 JSON 且包含恰当键结束。
因此 的奖励来自任务正确性, 用于约束可解析输出接口。这个比例避免格式奖励主导正确性,但仍会使模型学习输出形式;它不是过程奖励,也不直接监督中间推理是否正确。
训练数据为 1,000 个任务各生成 64 个实例,共 64,000 条;每次更新采样 128 个 prompt、每个 prompt 生成 8 个回复,500 次更新相当于一次打乱后的训练数据遍历,累计 512,000 个采样回复。两种规模均使用全参数 BF16 训练、学习率 、8 张 H100 80GB。
2.3 关键设计与创新判断
-
以任务程序而非提示词或样本作为混合采样单位
- 解决什么:避免拥有更多查询变体、类别词或模板的任务在训练中被隐式过采样。
- 为什么可能有效:在均匀任务采样下,训练权重更接近“作者认为独立的推理程序”而不是“可列举的文本变体数量”。
- 必要性证据:概念上合理,论文也明确说明 317 个多查询任务产生 1,475 个查询变体却不改变任务采样概率;但没有直接做“按实例/模板采样 vs 按任务采样”的对照。
- 创新判断:这是本文最具辨识度的设计,属于训练数据结构与采样语义的创新,而非新的 RL 优化器。
-
场景语法与任务程序解耦
- 解决什么:同一个视觉构造可承载多个推理目标,避免为每种问题重复建渲染器;同时使同一计算结构可在不同视觉域比较。
- 为什么可能有效:通过复用场景语法,任务数量增长不必与视觉资产/渲染代码重复增长同步。论文报告 277 个场景语法对应 1,000 个任务,平均每语法 3.61 个任务。
- 必要性证据:工程复用和可分析性有直接描述,但没有资源消耗、维护成本或泛化收益的消融。
- 创新判断:与 CLEVR 式场景—程序思想同源;新意主要在于将其提升为 RL 环境的正式操作边界。
-
共同语义状态驱动图像、提示、答案、验证器和回放轨迹
- 解决什么:减少图文不一致、答案漂移和验证器与渲染器各自实现造成的错误。
- 为什么可能有效:所有答案相关对象都源于同一状态,实例可由种子和轨迹重建。
- 必要性证据:论文描述了唯一答案、图文一致性、确定性回放、可见性/碰撞/对比度检查,并称每任务抽样人工检查语义清晰度和可读性;但未报告这些检查的失败率、人工审核协议或跨审核者一致性。
- 创新判断:是可靠性工程上的强设计,但其实际质量仍依赖具体渲染器和任务实现。
-
语义变化与答案保持渲染变化分层
- 解决什么:让训练变化能分别覆盖“答案真实改变”与“视觉表面改变但答案不变”。
- 为什么可能有效:可将调色板、字体、布局、相机、材料、噪声等因素纳入数据增强,而不破坏奖励正确性。
- 必要性证据:论文定义了层级不变量,图注也说明展示过主题、字体、布局、上下文、栅格噪声等示例;但基于文本回退输入,不能判断这些视觉变化幅度、是否真的困难、是否存在泄漏线索。
- 创新判断:这比普通“随机增强”更具可审计性,不过尚未证明它比常规视觉增强更有效。
-
跨 24 外部基准的统一评估协议
- 解决什么:避免仅用环境内 holdout 证明“在同一程序分布上变好”。
- 为什么可能有效:外部测试横跨图表、数学、科学常识、空间、计数、谜题六类,每组四个基准,采用宏平均而非按样本数加权。
- 必要性证据:这是论文最强的实证部分;不过统一评测并不能消除训练重复随机性不足或基准之间可能的概念重叠。
- 创新判断:不是方法新颖点,但显著增强了论文可读性和结论的边界清晰度。
2.4 可迁移的方法论
对用户关注方向,最值得迁移的不是 TRACE 的具体任务库,而是以下设计约束。
-
迁移到 VLM RLVR:将“可验证任务”定义成可执行契约,而非数据行。
适用前提是可从潜在语义状态或结构化源数据推导目标答案。对图表、表格、UI、文档、合成场景、规则谜题、可执行模拟器尤其适合。
风险是:若场景生成器本身引入简单纹理、版式或标签捷径,精确奖励只会精确地强化捷径。 -
迁移到 Diffusion 偏好优化/RL:显式分离语义状态、渲染参数和评估契约。
对可控图像生成,可将对象关系、布局约束、文本条件一致性定义为语义层,将风格、材质、色板、相机等定义为渲染层。这样可构造“语义等价但表面不同”的偏好对或奖励测试。
风险是:扩散模型中的“语义是否保持”往往无法像离散任务答案一样精确验证;不能照搬 TRACE 的二元答案奖励,而应提供结构检查器、约束满足器或经校准的多目标奖励。 -
迁移到 LLM/VLM 数据混合:按程序族或能力单元平衡,而不是按原始样本量平衡。
如果一个数据源有无数模板扩增,而另一个只有少量高价值程序,实例均匀采样会放大模板丰富度。TRACE 的任务—查询—实例三级划分提供了一个实用审计框架。
风险是:任务边界本身是人工定义的。边界设计错误会把作者偏见固化为训练分布。 -
迁移到可靠性与调试:保留可回放实例轨迹。
每个失败样本可回溯语义状态、查询、渲染决策、验证状态和随机种子,有利于区分模型推理失败、渲染不可读、问题模板不清或验证器错误。
风险是:轨迹可回放不等于任务语义天然合理;仍需要针对人类可读性、模型捷径和边界案例做审计。
3. 关键证据与实验审计
证据一:环境内 holdout 提升
展示了什么 → 支持什么 → 仍不能证明什么
论文在每个任务上保留两个未见实例,共 2,000 条 TRACE 验证样本。3B 准确率从 升至 ,增长 点;7B 从 升至 ,增长 点。作者还报告提升分布在多个视觉域、操作族、答案接口和单/多查询任务中。
这直接支持:在固定任务程序、但有新语义状态与新视觉实现的环境内分布中,RLVR 训练确实提高了模型的可验证任务表现。
它不能证明:
- 模型学到了可迁移的“通用视觉推理”,而非更好适应 TRACE 的语法、格式或解题模式;
- 所有任务族均等受益。文中称各域和结构均有提升,但未在正文提供完整的数值分布与统计细节;
- 渲染控制本身贡献了多少泛化,或模型是否利用了程序化图像的固定规律;
- 结果对训练随机种子稳定,因为验证分数主要来自单个训练 run 的终点模型。
值得注意的是,数值答案接口在 3B 上从 到 、增 点,但该接口仅含 51 个任务。它是环境内可学习性的强信号,却也提示某些任务类型可能更易被特定模板、答案格式或程序结构掌握,不能据此推导对自然视觉数学的同等增益。
证据二:24 个外部基准上的宏平均提升
展示了什么 → 支持什么 → 仍不能证明什么
外部评测包含 24 个基准、六个组别,每个 checkpoint 和 decoding seed 评测 32,805 个样本。论文使用三种解码种子,保持评测 prompt、图像预处理边界、parser、scorer 和 VLMEvalKit 版本一致;总分是 24 个基准的非加权均值。
直接结果:
| 模型 | 基座宏平均 | TRACE 后 | 变化 |
|---|---|---|---|
| Qwen2.5-VL-3B | |||
| Qwen2.5-VL-7B |
类别层面,视觉数学增益最大:3B 为 ,7B 为 。单项中 WeMath 提升最大:3B 为 ,7B 为 。7B 在全部 24 项基准上为正均值增益;3B 在 21/24 项上为正,ChartQAPro、TreeBench 和 EvoChart 为负均值变化,其中 EvoChart 的 3B 置信区间为 ,明确排除零。
这支持:TRACE 混合物并非仅改善同一程序分布内的新实例;它与一组覆盖不同视觉格式和评测指标的外部基准提升相关。宏平均也避免大样本基准主导总分,评价设计是合理的。
它仍不能证明:
- TRACE 的某一项设计是提升原因。任务均匀采样、视觉域广度、操作族覆盖、渲染扰动、JSON 格式奖励、GRPO 本身和总训练预算共同变化,未被隔离。
- 提升是否能跨训练种子重复。三种 seed 是解码种子,不是三次独立训练;它们只度量推理采样方差,不度量优化随机性、数据顺序和训练不稳定性。
- 所有“外部”基准对训练分布都同样远。虽非同一数据实例,但不少任务类别与 TRACE 的图表、几何、计数、空间、谜题程序存在概念接近性;论文没有提供系统性的训练—评测任务相似度审计或污染检查。
- 指标提升等价于真实世界视觉能力提升。部分开放式基准沿用模型评分器,且自然图像、复杂文档、开放域感知的覆盖仍有限。
证据三:与其他合成数据 RLVR checkpoint 的 7B 对比
展示了什么 → 支持什么 → 仍不能证明什么
在相同外部评测协议下,TRACE-7B 宏平均为 ;Game-RL 为 ,Sphinx 为 ,PC-GRPO 为 。论文据此报告 TRACE 分别高 、、 点,并称其在六个类别平均中均最高、在 24 项中 21 项得分最高。Vero 以 单列,它基于包含真实图像的 600K 样本、59 数据集的训练混合物,不能与 TRACE 的 64K 程序化样本等价比较。
这支持:在论文选定的公共评估和已发布 checkpoint 组合中,TRACE-7B 的最终性能具有竞争力,且相较几个合成 RLVR checkpoint 更高。
它不能证明 TRACE 的环境结构优于其他系统,因为作者也明确承认各 checkpoint 的数据、优化、模型训练过程与算力不匹配。这是checkpoint outcome comparison,不是控制变量实验。该部分应被视为定位结果,不应作为方法优越性的主证据。
4. 批判性判断与复用建议
4.1 证据强度
总体判断:中等偏强的实证论文,但机制归因偏弱。
被直接支持的部分:
- 作者确实定义并实现了一个包含 1,000 个任务、277 个场景语法、11 个视觉域的程序化环境;文本中给出任务边界、实例流程、答案接口和大量代表性任务描述。
- 在指定设置下,64K TRACE 数据配合 GRPO 提高了 Qwen2.5-VL 3B 与 7B 的环境内表现。
- 在统一的 24 基准评测协议下,两个规模的宏平均均提高,且 7B 的广泛正增益、多个基准的 bootstrap 区间排除零,使“外部评测上有总体收益”的结论具备较好支持。
仅与结果一致、但尚未证明的部分:
- “任务分类学”本身是迁移收益的关键原因;
- 任务均匀采样优于实例级或数据源级采样;
- 11 域的广度或 13 个操作族的覆盖是必要条件;
- 渲染扰动真正提升了抗视觉表面变化的能力;
- TRACE 学到的是普遍视觉推理,而不是对广泛但仍程序化的视觉—符号任务簇的适配。
4.2 主要局限与失败条件
-
缺少独立训练重复,影响统计可靠性与可复现性。
论文每个规模只有一个训练 run;报告的标准差来自三次解码,而不是独立的训练随机性。RL 训练中,初始化、数据顺序、rollout 和优化随机性都可能显著影响最终结果。
影响: 泛化结论的稳健性、工程复现预期。 -
没有混合物和设计因素消融,影响机制解释。
论文无法区分任务定义、均衡采样、域数量、操作覆盖、渲染控制、任务规模、总样本量和奖励格式各自的作用。
影响: 机制解释、后续路线选择。当前只能复用“完整配方”,不能知道最小有效组件。 -
程序化任务的视觉现实性和难度分布未被充分量化。
作者进行了结构检查与人工样本检查,但未给出人类正确率、视觉清晰度量表、歧义率、审核数量/标准或不同渲染 profile 下的难度统计。文本也明确承认程序一致性不等于感知难度一致。
影响: 从合成视觉规律向真实图像、复杂文档和开放域场景的泛化判断。 -
任务边界高度依赖人工分类,可能将设计者偏好编码为训练先验。
“何时算新任务、何时算查询变体”的规则比常见模板计数严谨,但仍不是客观唯一的本体。不同团队可能对谓词变化、推导步骤或场景语法共享作出不同划分。
影响: 新颖性、混合权重、跨项目可比性。 -
外部评测覆盖宽但仍可能与训练能力簇近邻。
图表、视觉数学、空间、计数、谜题等基准与 TRACE 的任务域在能力层面有明显对应。论文没有按“远离程序化训练分布”的程度分层,也缺少真实图像鲁棒性、对抗视觉扰动、开放域多步骤任务等专门测试。
影响: 泛化范围和部署外推。
4.3 最有价值的下一步验证
-
任务单元与采样策略消融
- 要验证什么:固定总 token、总样本数、模型、GRPO 配置,比较任务均匀采样、实例均匀采样、查询变体均匀采样、域均匀采样及数据源式混合。
- 为何重要:这是 TRACE 最核心的结构性主张。
- 改变判断的结果:若任务均匀采样没有稳定优于替代方案,则“taxonomy-guided”更像良好的组织工具,而不是性能关键机制。
-
多训练种子与跨规模/跨基座重复
- 要验证什么:每个设置至少进行多个独立训练 run,并报告训练随机性的均值、方差和置信区间;最好加入非 Qwen 基座。
- 为何重要:当前三解码 seed 不能替代训练重复。
- 改变判断的结果:若收益跨训练种子稳定,外部迁移结论将显著增强;若变化与报告的 – 点同量级,则应下调可信度。
-
程序化—真实视觉距离与捷径审计
- 要验证什么:针对相同任务程序构造不同视觉风格、真实图像/真实文档映射版本、去标签或反捷径版本,并进行人工可读性与模型错误类型审计。
- 为何重要:这能区分模型是否学会任务计算,还是学会程序渲染中的表面统计规律。
- 改变判断的结果:若性能在真实化或抗捷径版本中保持,TRACE 的“可迁移视觉推理”解释更有说服力;若显著坍塌,则应把收益定位为合成视觉—符号任务适配。
4.4 最终复用结论
- 应借鉴:任务身份的显式契约。 用 把场景、计算、答案模式和验证规则拆开,是构建可维护 RL 数据环境的好抽象;特别适用于答案可程序验证的 VLM 任务。
- 应借鉴:语义状态单源化与可回放轨迹。 图像、文本、标签、验证器都从同一语义状态派生,能显著减少工程中最常见的图文错配和标签漂移问题。
- 应借鉴:查询、语义变化、渲染变化的分层。 这对做可控泛化评测、难度课程和合成数据扩增都很实用。
- 不要照搬:将二元精确奖励视为通用 VLM/生成模型解决方案。 TRACE 的成功依赖任务可完全形式化;现实图像理解、开放式描述质量、审美偏好、复杂安全约束通常没有可靠的精确判定器。
- 路线建议:纳入后续技术路线,但定位为“可审计程序化训练环境范式”,而不是已被充分验证的通用视觉推理配方。 若复现,优先先验证任务边界、生成质量、独立训练稳定性和采样消融,再扩大任务库或投入大规模算力。
5. 必要概念与文献地图
必要概念
- RLVR(Reinforcement Learning with Verifiable Rewards):使用可低成本、可客观判定的奖励优化模型。本文中主要是答案是否正确与 JSON 是否合规,而非人工偏好模型打分。
- 场景语法(scene grammar):定义能生成哪些对象、关系、布局和可见结构的规则系统;它描述视觉状态的生成空间,不直接等同于一个问题。
- 任务程序(task program):在场景语义状态上执行的计算过程,包括候选集构造、中间操作、输出绑定与答案生成。
- 奖励契约(reward contract):定义答案如何规范化、如何与目标比较、何时得分的可执行规则。
- 有界查询变量(bounded query variation):不改变任务程序本体、仅改变有限参数的查询变化,例如“最大”改为“最小”。它不应额外提高同一任务的采样权重。
- 语义变化与渲染变化:前者改变对象数量、数值、关系等可能改变答案的状态;后者改变主题、字体、布局、材质、相机或噪声,但按设计保持答案不变。
- GRPO(Group Relative Policy Optimization):针对同一 prompt 的多条采样回复,利用组内相对奖励进行策略优化的方法。本文每个 prompt 采样 8 个回复。
- 配对 item bootstrap 区间:对同一评测样本上 base 与训练后模型的结果进行联合重采样,估计性能差的区间;它量化评测样本不确定性,不量化独立训练 run 的不确定性。
关键前作
- CLEVR(Johnson et al., 2017):以显式场景图和功能程序构建组合视觉推理问题;TRACE 继承“结构化场景 + 可执行问题”的思想,但将其扩展到训练采样和奖励环境。
- Task Me Anything(Zhang et al., 2024):以可扩展 taxonomy、资产、属性、关系和任务计划构建按需视觉基准;TRACE 与其接近,但强调稳定任务身份和 RLVR 环境属性。
- Reasoning Gym(Stojanovski et al., 2025):提供大量文本/符号生成器—验证器环境,展示可执行任务环境对 RLVR 的价值;TRACE 将这一范式扩展到渲染后的视觉状态。
- Game-RL(Tong et al., 2026):从可执行游戏代码合成视觉状态和可验证任务;TRACE 的差异是横跨多个视觉域,并将场景语法和任务目标系统分离。
- Vero(Sarch et al., 2026):使用来自 59 个数据集、含真实图像的 600K 多模态 RL 配方,代表广泛真实数据混合路线;它与 TRACE 的程序化、64K 样本路线形成互补,但因数据和训练设置不匹配,不能作严格优劣比较。