快速导读:提出TraceViT,通过构建语义单调的变换链作为中间目标,并引入任务参考和对象工作空间进行根基化,结合软轨迹对齐,在ARC-AGI基准上实现了紧凑视觉推理模型的领先性能。
TraceViT针对ARC(抽象推理语料库)任务提出了一种新的训练范式:根基化轨迹监督。传统循环视觉模型在迭代过程中会产生一系列中间预测,但训练时仅用最终答案作为监督信号,导致中间步骤缺乏明确的语义目标。TraceViT的核心思路是,既然模型内部已经在做多步推理,为什么不直接告诉它每一步应该“想”到什么中间结果?为此,作者利用程序化任务生成器构建了语义单调的变换链,并通过软轨迹对齐损失将这些中间目标注入训练过程。同时,为了解决中间监督可能破坏输入信息的问题,模型引入了任务参考和对象工作空间两个根基化组件,将任务记忆与迭代状态解耦。
英文题目:TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
论文出处:arXiv 每日论文精选 · arXiv:2607.29586
原始论文:PDF / 论文页面
这篇论文解决什么问题?
ARC任务要求模型从少量示例中推断变换规则,并应用于新的测试输入。这是一个典型的视觉抽象推理问题,考验模型的规则归纳和组合泛化能力。现有的循环视觉模型(如LoopViT)采用迭代推理架构,在多个时间步上反复更新内部状态并输出预测网格。然而,这些模型的训练目标只有一个:最终输出的网格必须与正确答案完全一致。至于中间的迭代过程,模型完全靠自己去摸索。这就好比教学生解题,只检查最终答案,从不看他的解题步骤——学生可能碰巧蒙对,也可能在错误的路径上浪费了大量计算。更关键的是,ARC任务的变换往往可以分解为多个语义清晰的子步骤(如先提取对象、再改变颜色、最后重新排列),直接端到端学习这些复合变换对模型来说难度极大。
核心创新
- 提出根基化轨迹监督(Grounded Trace Supervision)框架,将循环推理的中间迭代与显式的语义中间目标对齐。
- 构建了首个带验证轨迹标注的ARC数据集,通过重写程序化生成器产生语义单调的变换链。
- 设计任务参考和对象工作空间,将任务记忆与计算状态解耦,解决了中间监督可能破坏输入信息的问题。
- 引入软轨迹对齐损失,仅约束中间状态的顺序而非固定步调,增强了模型对迭代步数的灵活性。
方法概览
1. 构建变换链:利用GPT-5.5将程序化任务实现(RE-ARC, ARC-GEN)分解为单步操作,生成语义单调的中间网格序列作为训练目标。2. 根基化循环:引入任务参考(Task Reference)编码所有示例,以及对象工作空间(Object Workspace)通过Slot Attention提取对象中心表示,两者在每次迭代中注入循环核心,将记忆功能外化。3. 软轨迹对齐:使用基于动态规划和soft-min的软轨迹对齐损失,强制中间预测遵循变换链的顺序,但允许模型自由分配迭代步数。
- 变换链构建:利用GPT-5.5将RE-ARC和ARC-GEN的程序化任务实现重写为单步操作序列,生成从输入到输出的一系列语义单调的中间网格。每个中间状态只比前一步多完成一个可识别的子变换,形成清晰的推理轨迹。
- 任务参考模块:通过交叉注意力从少量示例中编码一个紧凑的任务前缀向量,为每次迭代提供静态的任务规则描述。这个设计将“任务是什么”的信息外化,避免在迭代过程中被反复覆盖。
- 对象工作空间:使用Slot Attention从当前网格状态中提取一组对象中心的槽位表示,在迭代间传递动态的场景摘要。每个槽位倾向于绑定到网格中的特定对象,使得中间状态的演变具有可解释性。
- 根基化循环核心:在每次迭代中,循环核心同时接收静态的任务参考和动态的对象工作空间槽位,将“规则记忆”与“当前进展”明确分离。这种解耦是轨迹监督生效的关键前提。
- 软轨迹对齐损失:基于Soft-DTW构建可微的单调对齐损失。计算模型每一步预测与变换链每个里程碑之间的代价矩阵,通过soft-min在单调路径上边缘化,强制中间预测遵循变换链的顺序,但不强制每一步必须精确对应某个里程碑。
- 变化加权机制:在计算对齐代价和最终状态损失时,对网格中实际发生变化的像素赋予更高权重,引导模型关注变换的核心区域而非背景。
- 训练调度:在训练后期逐步降低轨迹监督的权重,让模型在掌握推理模式后获得更大的迭代自由度,避免过度约束。
- 测试时训练:评估时对每个任务进行少量步数的微调,使模型快速适应当前任务的特定规则,这是ARC基准上的标准做法。
逐图理解论文
直觉与失败案例

图3可视化了三个任务上的逐步预测和槽位分配。预测行显示输入和六次迭代的输出逐渐逼近目标;分配行显示八个槽位在每一步关注的对象区域,展示了对象工作空间如何追踪场景中的关键实体。
研究空白

图2给出了完整的方法概览。顶部展示任务参考如何从少量示例中编码任务规则;中部是循环推理核心,每次迭代接收静态的任务参考和动态的对象工作空间槽位;底部展示软轨迹对齐如何计算预测序列与变换链之间的可微匹配代价。
核心结论

表2的消融实验揭示了轨迹监督与根基化组件的交互关系。2×2因子块表明两者必须同时启用才能获得正向收益;下方三行分别验证了变化加权、软对齐和训练调度的必要性。
意义与局限

表3将Oracle准确率分解为覆盖错误和选择错误。正确网格未出现在候选池中的比例远高于排名靠后但存在的情况,说明改进生成质量是当前最紧迫的方向。
实验如何设计?
- 在ARC-AGI-1和ARC-AGI-2两个基准上评估,采用pass@2指标(提交两个预测,任一匹配即算正确)。
- 与LLM方法(如o3、GPT-5)、循环模型(HRM、TRM)和视觉模型(VARC)进行全面对比。
- 通过2×2因子消融实验,分别控制轨迹监督和根基化组件的开关,分析两者的交互作用。
- 对变化加权、软对齐规则、轨迹监督调度等设计选择进行单变量消融。
- 在400个ARC-AGI-1任务上进行Oracle准确率分解,区分候选覆盖错误和选择错误。
关键结果与论文证据
- TraceViT-Large在ARC-AGI-1上达到67.8% pass@2(第6页表1),在紧凑视觉模型中取得领先。
- 同时启用轨迹监督和根基化组件时,模型达到65.5% pass@2;仅用最终状态监督的根基化模型为63.9%,提升1.6个百分点(第6页表2)。
- 单独使用轨迹监督而不启用根基化组件时,性能反而下降,说明两者必须协同工作(第6页表2)。
- 移除变化加权导致pass@2从65.5%降至64.3%,验证了关注变化区域的重要性(第6页表2)。
- 用固定间隔对齐替换软对齐导致pass@2降至64.4%,证明软对齐的灵活性确实有益(第6页表2)。
- 在训练40个epoch后移除轨迹监督导致pass@2降至63.6%,说明后期仍需保持一定程度的轨迹引导(第6页表2)。
- Oracle准确率为76.3%,其中23.8%的任务正确网格未出现在候选池中(覆盖错误),8.5%的任务正确网格排名在3-10之间(选择差距),表明候选生成是主要瓶颈(第7页表3)。
- ARC-AGI-2上性能仅为24.3%,远低于ARC-AGI-1,说明该基准对紧凑视觉模型仍是巨大挑战(第6页表1)。
阅读时需要注意
- 变换链构建依赖程序化任务生成器和GPT-5.5重写,流程复杂且需要人工审核,难以扩展到无程序化来源的任务。
- ARC-AGI-2训练语料仅覆盖891/1000个任务,其余109个任务缺乏程序化来源,限制了方法的覆盖面。
- 候选覆盖错误是主要瓶颈,模型在近四分之一的任务中无法生成正确答案,改进生成多样性比优化投票策略更紧迫。
- 轨迹监督仅在搭配根基化组件时有效,单独使用会损害性能,说明中间监督的设计需要与架构深度协同。
关联工作
- LoopViT是TraceViT的骨干架构,提供了循环视觉推理的基础框架,但仅使用最终状态监督。
- RE-ARC和ARC-GEN为ARC任务提供了程序化生成器和验证器,是变换链构建的源程序,使得大规模轨迹标注成为可能。
- VARC建立了视觉原生ARC求解器的测试时训练和评估协议,TraceViT遵循了这套标准流程。
- Soft-DTW为软轨迹对齐提供了数学基础,使得不可微的序列对齐问题可以在神经网络中端到端优化。
- Slot Attention最初用于对象发现,TraceViT将其改造为对象工作空间,在迭代推理中追踪对象状态。