三分钟导读:SIVA-RL通过基于样本级干预结果(奖励下降幅度)的动态路由机制,将视觉干预分为敏感性对齐和不变性对齐,从而解决现有方法中算子与监督信号不匹配的问题,显著提升多模态大模型的视觉推理能力。
英文题目:SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
论文出处:arXiv 每日论文精选 · arXiv:2607.13931
原始论文:PDF / 论文页面
对应视频标题:SIVA-RL:基于样本级干预结果的动态路由视觉对齐|推荐指数:★★★★★
这篇论文解决什么问题?
现有的视觉干预方法(如PAPO)通常根据干预类型(如黑屏、掩码)预设监督目标,但同一算子在不同样本上产生的效果(如答案是否改变)是异质的,导致监督信号不准确,无法保证模型真正依赖视觉证据。
核心创新
- 提出基于样本级结果的条件监督,替代算子条件监督,解决干预效果异质性问题。
- 设计Token对齐、距离约束的PatchSwap,在破坏局部证据的同时保留全局上下文。
- 实现双方向对齐:大奖励下降对鼓励敏感性(分离),小奖励下降对鼓励不变性(一致性)。
- 兼容GRPO和DAPO等多种RL骨干网络,无需额外采样即可复用干净 rollout 进行重评分。
方法概览
提出SIVA-RL框架,包含三个步骤:(1) 使用Token对齐、距离约束的PatchSwap构建局部视觉干预;(2) 冻结审计策略评估干净-干预对的奖励下降,计算软路由权重;(3) 根据权重将样本路由至敏感性对齐(大下降)或干净锚定的不变性对齐(小下降),并采用双方向边际约束优化。
逐图理解论文
SIVA-RL核心机制概览

SIVA-RL框架包含三步:首先使用Token对齐、距离约束的PatchSwap构建局部视觉干预;其次冻结审计策略评估干净与干预对的奖励下降,计算软路由权重;最后根据权重将样本路由至敏感性或不变性对齐分支。
基于结果的动态路由策略

传统方法基于算子类型分配监督,而SIVA-RL基于结果分配。通过观察奖励下降幅度,大下降样本进入敏感性对齐,鼓励模型输出与干预后图像一致;小下降样本进入不变性对齐,鼓励输出与干净图像一致。
主要实验结果与性能提升

在9个多模态推理基准上,GRPO-3B加SIVA-RL整体准确率达53.89%,提升12.46%;DAPO-7B达63.25%,提升14.98%。视觉依赖子集上,两者分别获得7.63和8.79点绝对增益。
与专有模型及通用VLM对比

SIVA-RL在通用多模态推理、视觉依赖推理及整体性能上,均优于匹配的RL基线。与专有模型、通用多模态VLM及数学专用VLM对比,SIVA-RL在视觉依赖任务中表现尤为突出,证明其有效性。
消融实验:干预构建与路由

消融实验显示,PatchSwap的距离约束显著提升性能。无距离约束时,性能下降。路由策略的逐步加入也带来稳定增益,证明基于结果的动态路由比固定算子监督更有效。
实验与关键结果
- 在9个多模态推理基准(涵盖数学、逻辑、计数、视觉依赖任务)上评估Qwen2.5-VL-3B和7B模型。
- 与专有模型、通用多模态VLM及数学专用VLM进行对比。
- 进行消融实验,分析干预构建、路由策略、超参数敏感性。
- 在医学多模态QA领域进行额外评估。
- 分析训练过程中的路由动态和干预发散情况。
- GRPO-3B + SIVA-RL 在整体平均准确率上达到53.89%,相对基线提升12.46%。(第 7 页)
- DAPO-7B + SIVA-RL 在整体平均准确率上达到63.25%,相对基线提升14.98%。(第 7 页)
- 在视觉依赖推理子集上,GRPO-3B获得+7.63点的绝对增益,DAPO-7B获得+8.79点的绝对增益。(第 7 页)
- SIVA-RL在9个基准中均优于匹配的RL基线,且增益在视觉依赖任务中更大。(第 7 页)
阅读时需要注意
- PatchSwap干预可能无法覆盖所有类型的视觉依赖错误,如密集多实例计数中的过计数问题。
- 干净正确性门控(Clean-correctness gate)仅确保干净图像回答正确,不保证该回答确实基于视觉证据。
- 路由权重依赖于审计策略的采样,可能引入噪声。
- 黑屏图像的正确回答可能掩盖干净图像的错误,不能作为鲁棒视觉推理的证据。
- PatchSwap的超参数(如候选单元格比例η和最小源距离dmin)对性能敏感,需仔细调整。
- 路由机制中的阈值设置(如δsen, δinv)影响敏感性和不变性分支的平衡。
关联工作
- PAPO:对比方法,PAPO基于算子类型分配监督,而SIVA-RL基于结果分配。(第 1 页)
- GRPO:使用的RL骨干网络之一,SIVA-RL在其基础上增加视觉对齐损失。(第 3 页)
- DAPO:使用的RL骨干网络之一,SIVA-RL兼容该框架。(第 3 页)
- R1-VL:相关多模态推理模型,用于对比实验。(第 7 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
SIVA-RL:面向多模态强化学习的敏感性–不变性视觉对齐
Cheng Tang1 Junzhi Ning1 Min Cen1 Wei Li1,2 Xinyi Zeng1,3 Pinxian Zeng5 Rongbin Li1 Qiming Zhu4 Dongzhan Zhou1 Yuqiang Li1 Junjun He1 Yirong Chen1 Ming Hu1 1上海人工智能实验室 2上海交通大学 3四川大学 4香港中文大学(深圳) 5澳门大学
摘要
带可验证奖励的强化学习(RLVR)推动了多模态推理的发展,但答案层面的正确性并不能保证视觉语言模型将其预测建立在视觉证据之上。现有的视觉干预方法对比了原始图像与修改后图像上的策略行为,但监督分配是基于干预类型而非其观察到的效果。这一假设是错误的:相同的算子在不同样本上会产生异质的结果。我们提出了 SIVA-RL,这是一个敏感性–不变性视觉对齐框架,用样本级、基于结果的监督取代了基于算子的正则化。SIVA-RL 通过标记对齐、距离约束的图像内 PatchSwap 构建局部干预。一个冻结的审计策略随后对每对“干净–干预”对进行软路由评分:大幅奖励下降的对驱动敏感性对齐,小幅奖励下降的对驱动干净锚定的不变性对齐,而模糊的对则被降低权重。这种设计将干预构建与监督分配解耦,并且兼容 GRPO 和 DAPO 骨干网络。在涵盖数学、逻辑和视觉依赖任务在内的九个多模态推理基准测试中,SIVA-RL 在所有设置下均使 3B 和 7B 模型的性能优于匹配的 RL 基线。它在视觉依赖推理任务上取得了 8.79 个百分点的提升,并在所有四种基于 GRPO 和 DAPO 的配置中实现了高达 14.9% 的相对整体提升。代码
1 引言
带可验证奖励的强化学习(RLVR)提升了大型语言模型和视觉语言模型的推理能力 Shao et al. (2024); Guo et al. (2025); Huang et al. (2025b); Yao et al. (2025); Meng et al. (2025)。通过优化任务级别的正确性,RLVR 能够激发多步推理,而无需密集的推理轨迹标注。最终答案奖励仅指示预测是否正确,而不指示其获取方式。因此,视觉语言模型可能仅依赖语言先验、答案频率偏差或记忆化的推理模板,而非任务所需的视觉证据,却仍能获得高奖励 Goyal et al. (2017); Agrawal et al. (2018); Niu et al. (2021); Xia et al. (2025)。这种奖励歧义在计数、几何和图表理解等视觉依赖任务中尤为严重。arXiv:2607.13931v1
最近的多模态强化学习方法通过辅助感知信号、视觉信用分配或干净输入与视觉修改输入之间的比较来加强视觉依赖性 Xiao et al. (2025); Huang et al. (2025a); Wang et al. (2026c); Li et al. (2026)。扰动驱动的方法,其中最著名的是 PAPO Wang et al. (2025b),通过对比策略在原始图像和受损图像下的行为来对策略进行正则化。一种常见的设计将干预类型与预定目标绑定:破坏性干预鼓励分离,而轻微或语义保持的变换鼓励一致性 Liu et al. (2026); Li et al. (2025); Zhang et al. (2025b); Gao et al. (2026)。这种基于算子的设计假设相同的视觉算子在不同样本上产生足够相似的效果。
1
第 2 页
(a) (c) (b)
图 1:配对干预审计与 SIVA-RL 概览。(a) 视觉干预导致四种配对结果类别。(b) 黑图、随机掩码和 PatchSwap 干预在所有 906 个干净图像正确回答的样本中,均产生了结果下降和结果稳定的混合情况。(c) SIVA-RL 根据观察到的结果变化,将每个有效配对路由至敏感性对齐或干净锚定一致性方向。
我们的配对干预审计揭示了样本层面的算子–效应异质性。我们从主评估的九个基准中各采样 200 个示例,共获得 1,800 个示例。对于每个干净图像及其干预视图,我们将答案转换分类为结果下降(outcome-drop)、结果稳定(outcome-stable)、反转(reversal)或持续错误(persistent-error)。在 906 个干净图像上回答正确的示例中,黑图、随机掩码和 PatchSwap 干预产生的结果下降率分别为 67.8%、62.9% 和 61.8%。相应的结果稳定率仍然较高,分别为 32.2%、37.1% 和 38.2%。因此,同一算子在同一个干净正确子集中既产生下降结果也产生稳定结果。仅凭干预身份无法规定统一的优化方向(图 1)。
审计支持一个结论:配对结果对于分配基于扰动的监督很有用,但它们无法识别导致预测的视觉证据。大幅度的奖励下降表明策略行为对干预敏感。这种变化可能源于任务相关的证据,也可能源于干预引入的人工伪影。而结果稳定可能反映了无关的修改、冗余的视觉证据,或对语言先验的依赖 Goyal et al. (2017); Agrawal et al. (2018)。因此,我们将配对结果变化视为操作性的路由信号,而非语义不变性、因果归因或视觉定位的证明。
这种异质性提出了本工作的核心问题:当同一算子产生样本层面的异质性结果时,干净–干预配对应如何获得不同的优化方向和强度?我们的关键思想是将干预构建与其训练效应的确定分离开来。大幅下降的配对提供敏感性信号,并接收基于边际边界的分离目标。小幅下降的配对提供结果稳定性信号,并接收保守的、干净锚定的一致性目标。模糊的配对接收很少或没有辅助监督。干净正确性门控将对齐锚定在正确的干净响应上,尽管该门控并不认证该响应确实来自视觉证据。
基于这一原则,我们引入了 SIVA-RL,这是一个用于多模态强化学习的敏感性–不变性视觉对齐框架。SIVA-RL 将干预引导的监督分解为三个阶段:干预构建、样本级结果评估和策略对齐。SIVA-RL 首先通过令牌对齐的、图像内的 PatchSwap 构建局部干预视图。PatchSwap 修改局部视觉内容和空间关系,同时保留大部分未修改区域和整体图像上下文。审计策略随后评估每个干净–干预配对,其干净锚定的奖励变化决定了双方向对齐目标的软路由权重。可靠的的大幅下降配对被分离,有效的低下降配对与其干净对应物进行软对齐,而模糊配对则被降低权重。在此,“不变性”表示有界的、干预条件化的策略一致性,而非修改内容的语义不变性或因果无关性。因此,SIVA-RL 将基于视觉干预的多模态强化学习从算子条件化的正则化转变为样本级、结果条件化的选择性监督。
我们在基于 GRPO 和 DAPO 的多模态强化学习骨干网络上评估 SIVA-RL,涵盖不同模型规模和九个基准,涉及数学、逻辑、计数、多学科以及视觉依赖推理。SIVA-RL 在所有配置下均提升了其对应的强化学习骨干网络的性能。
2
第 3 页
受控消融实验证实了基于结果的软路由的有效性,以及敏感性分支与不变性分支的互补作用。
我们的主要贡献总结如下:
- 诊断干预定义监督中的歧义。 我们表明,相同的视觉干预可以在干净且正确的样本中引发混合的结果下降(outcome-drop)和结果稳定(outcome-stable)行为。此外,低下降样本对并不一定是可靠的不变性信号,因为它们可能源于与任务无关的扰动、冗余证据或语言先验捷径。这一发现促使我们超越由算子定义的监督,转向样本级的效应估计。
- 基于结果的视觉选择性对齐。 我们将基于视觉干预的多模态强化学习表述为一种选择性监督问题。观察到的从干净图像到干预图像奖励下降幅度决定了辅助对齐的方向和强度:大幅下降样本对鼓励敏感性对齐,可靠的低下降样本对接受有界的干净锚定一致性约束,而歧义样本对则被降低权重或跳过。这种设计将干预构建与监督分配分离开来。
- 用于可扩展多模态强化学习的 SIVA-RL。 我们通过令牌对齐的距离受限 PatchSwap、冻结的配对结果估值、干净轨迹重评分以及边际约束的双向对齐来实现上述公式。SIVA-RL 可嵌入 GRPO 和 DAPO,在九个基准测试中持续提升了 3B 和 7B 骨干模型的性能,并在依赖视觉的推理任务中带来了更大的增益。消融实验和训练诊断验证了局部干预、软路由以及敏感性–不变性对齐的作用。
2 相关工作
带可验证奖励的多模态强化学习。带可验证奖励的强化学习(RLVR)提升了大型语言模型和视觉语言模型的推理能力。GRPO 通过组相对优势实现无需评论家(critic-free)的优化。DAPO 在 GRPO 基础上引入了改进的裁剪、动态采样和熵正则化,以支持大规模训练 Shao et al. (2024); Yu et al. (2026)。近期工作通过视觉冷启动数据、规则可验证奖励以及组级或步骤级策略优化,将 RLVR 应用于多模态推理 Huang et al. (2025b); Yao et al. (2025); Meng et al. (2025); Wang et al. (2026a)。这些方法存在一个共同局限:最终答案奖励无法直接提供信号,以表明策略是否将预测建立在任务相关的视觉证据上。SIVA-RL 补充了这些 RLVR 骨干网络。SIVA-RL 通过基于结果的干预对齐增强策略优化,并实现了基于 GRPO 和 DAPO 风格的训练。
视觉感知与干预监督。一方面,研究通过辅助感知奖励、干净–干预策略对比或令牌级和轨迹级视觉信用分配来加强视觉 grounding Xiao et al. (2025); Wang et al. (2025b); Huang et al. (2025a); Wang et al. (2026c); Li et al. (2026)。另一方面,研究引入失真、掩码、混合或其他形式的干预输入,以改善视觉探索、敏感性和鲁棒性 Liu et al. (2026); Li et al. (2025); Zhang et al. (2025b); Gao et al. (2026)。这些方法确立了超越答案正确性的监督价值。然而,其中许多方法根据干预类型确定优化目标,或主要使用干预来重新分配令牌间的视觉信用。SIVA-RL 则评估每个局部干预的样本级行为效应。配对的结果随后决定了监督的方向和强度。这种设计将干预构建与结果估值分离,并将有效样本对软路由至敏感性对齐或有界的干净锚定一致性。
3 方法
3.1 概述与基础强化学习骨干网络
我们考虑一个多模态推理数据集 $\mathcal{D} = \{(q_i, x_i, a^\star_i)\}_{i=1}^N$,其中 $q_i$、$x_i$ 和 $a^\star_i$ 分别表示问题、图像和目标答案。对于每个干净输入, rollout 策略采样一个
3
第 4 页
(a) 视觉干预对构建 (b) 配对结果评估 (c) 双向敏感性—不变性对齐
原始图像 1) RL 问题 $c$ 答案 参考 $x$ … $R_1$ … $c$ … $c$ 验证器 … $\hat{y}_1$ 模型 是 在 $\triangle ABC$ 中, $\hat{y}_2$ $R_2$ … $c$ $= 30^\circ$ $x$ … 组 主干 $\hat{y}_1$ … $A_1$ … $r_1$ … $c$ 和 $D$ 位于 $\angle B$ BE.q … $c$ … $c$ … 估计 答案 … $\hat{y}_2$ $\angle C$ … $R_i$ 如果 $= 60^\circ$, 策略 … $\hat{y}_i$ … $A_2$ … $r_2$ … 验证器 $q$ 什么 是 … $A_3$ … $r_3$ 模型 答案 … $c$ $60^\circ, \angle A$ … … (共享) 验证器 … $\hat{y}_i$ 干净 rollouts $\angle CDE?$ … $A_G$ … $r_G$ … $c$ 局部 PatchSwap(距离约束) 重新评分 干净有效 … $c$ … $\hat{y}_1$ 停止梯度 … $\hat{y}_2$ … 干净
$$ \begin{aligned} & \text{Clean-Anchored rollouts} \\ & \text{anchor)} \\ & \text{gate} \\ & \text{routing} \\ & \text{Log-probs(anchor)} \\ & \text{Yes} \rightarrow \text{auxiliary correct?} \\ & \text{Clean-Anchored loss} \\ & \text{Score under Divergence} \\ & \text{No} \rightarrow \text{skip} \\ & \text{Log-probs(Intervened)} \end{aligned} $$
$$ \begin{aligned} & \text{Score under candidate cells} \\ & \text{distant source cells} \\ & \text{target cells} \\ & \Delta \mathbf{r}_i = R_i(\mathbf{x}_{\text{clean}}) – R_i(\tilde{\mathbf{x}}_{\text{clean}}) \\ & \text{3) Alignment} \\ & \tilde{\mathbf{x}}_{\text{Intervened}} + \text{Policy Update} \end{aligned} $$
Intervened image Question $q$ Outcome-Conditioned Routing Invariance Alignment Sensitivity Alignment
$$ \tilde{\mathbf{x}}_{\text{In } \triangle ABC, \quad \angle B = 60^\circ, \quad \angle C = 30^\circ} $$
invariance sensitivity
$D$ lies on $BE$. Small $\Delta r_i$ Abstain(skip) Large $\Delta r_i$ Small $\Delta r_i$ Large $\Delta r_i$
If $\angle C = 60^\circ$, what is $\angle CDE$?
Clean Pull Together Intervened Clean Pull Apart Intervened
$$ \begin{aligned} & \text{RL objective} + \text{SIVA alignment} + \text{KL regularization} \\ & \text{Weight} \quad 0 \\ & \Delta r_i \\ & \tilde{\mathbf{x}} = (1 – M) \odot \mathbf{x} + M \odot P(\mathbf{x}) \\ & \text{Update Shared Policy } \pi_\theta \end{aligned} $$
图 2:SIVA-RL 概览。上支代表标准的干净图像 RLVR 主干。(a)基于 Token 对齐、距离约束的 PatchSwap 构建局部候选干预 $\tilde{x}_i$。(b)冻结的审计策略执行成对解码,并将干净图像到干预图像奖励下降转化为敏感性和不变性权重。(c)在两种视觉条件下对干净 rollout 响应重新评分。奖励下降较大的样本对需鼓励超过敏感性边界,而有效的低下降样本对则被约束在不变性边界内。
一组 $G$ 个响应, $$y_{i,g} \sim \pi_{\theta_{\text{old}}}(\cdot | q_i, x_i), \quad g = 1, \dots, G. \quad (1)$$
每个响应获得一个可验证奖励 $r_{i,g}$;主干算法随后计算组相对优势 $A_{i,g}$ 以及相应的 Actor 更新。我们将完整的 GRPO 或 DAPO 风格主干目标记为 $\mathcal{L}_{\text{base}}$ Shao et al. (2024); Yu et al. (2026)。主干特定的优势估计、裁剪、过滤和正则化详见附录。
SIVA-RL 保留了干净图像的主干更新,并增加了基于结果的干预对齐目标。如图 2 所示,该框架包含三个组件:(a) 局部干预构建,(b) 基于结果的软路由,以及 (c) 干净锚定的双向对齐。路由分支决定候选干预是增强敏感性、鼓励不变性,还是弃权。对齐分支复用现有的干净 rollout 响应。这种复用避免了在用于结果评估的成对审计之外进行额外的随机采样。
3.2 局部 PatchSwap 构建
给定图像 $x_i$,我们将其像素空间划分为网格 $\Omega_i$,该网格与分块和空间合并后的有效视觉 Token 网格对齐。令 $p_{i,u}$ 表示由 $u \in \Omega_i$ 索引的图像单元。我们首先以比例 $\eta$ 采样候选单元,然后以概率 $\rho$ 选择有效的替换目标:
$$C_i \sim \text{SampleMask}(\Omega_i, \eta), \quad C_{i,u} \in \{0, 1\}, \quad (2)$$ $$B_{i,u} \sim \text{Bernoulli}(\rho), \quad (3)$$ $$T_{i,u} = C_{i,u} B_{i,u}. \quad (4)$$
此处 $C_{i,u} = 1$ 标记单元 $u$ 为可干预;$T_{i,u} = 1$ 标记其为活跃的替换目标。被标记为可干预但未选中的单元在干预中保持不变。
对于每个目标单元 $u$,我们构建一个有效的图像内源集合
$$S_i(u) = \{ v \in \Omega_i : C_{i,v} = 0, \bar{d}_i(u, v) \ge d_{\min} \}, \quad s_i(u) \sim \text{Unif}(S_i(u)), \quad (5)$$
4
第 5 页
其中 $\bar{d}_i(u, v) \in [0, 1]$ 是 $u$ 和 $v$ 之间的归一化网格距离,且 $d_{\min}$ 排除了空间相邻的源。然后组装干预视图为
$$ \tilde{p}_{i,u} = \begin{cases} p_{i,s_i}(u), & T_{i,u} = 1, \\ p_{i,u}, & T_{i,u} = 0, \end{cases} \quad \tilde{x}_i = \text{Assemble } \{\tilde{p}_{i,u}\}_{u \in \Omega_i}. \quad (6) $$
距离约束的图像内 PatchSwap 破坏了局部证据和空间关系,同时保留了图像的全局统计信息和风格。这种构造产生的干预比全局掩码更难,但比完全移除视觉信息破坏性更小。因此,PatchSwap 在不破坏视觉上下文的情况下,揭示了依赖于证据的推理过程。网格分辨率、候选比例 $\eta$、替换概率 $\rho$ 和最小距离 $d_{\min}$ 在附录 A 中指定。
3.3 基于结果的软路由
相同的 PatchSwap 算子在不同样本上可能产生不同的行为效应。因此,SIVA-RL 不赋予构建的干预固定的优化角色。相反,SIVA-RL 使用冻结的审计策略 $\bar{\pi}_\theta$(当前策略的一个无梯度快照)来评估每个干净-干预对。为简洁起见,令 $x^{cl}_i = x_i$ 且 $x^{ci}_i = \tilde{x}_i$。配对采样审计解码和答案评估定义如下:
$$ \hat{y}^{v}_i,m \sim \bar{\pi}_\theta(\cdot | q_i, x^{v}_i), \quad R^{v}_i = \frac{1}{M} \sum_{m=1}^{M} r_{ans}(\hat{y}^{v}_i,m, a^\star_i), \quad v \in \{cl, ci\}, \quad (7) $$
其中 $r_{ans}$ 是用于干预估值的基于答案的验证器,$R^{v}_i$ 是视图 $v$ 的采样审计轨迹上的经验验证器得分。在更新期间,审计策略是固定的,并且没有梯度通过解码的答案或其奖励进行传播。
我们定义干净锚定的有效性门控和观察到的奖励下降为:
$$ b_i = \mathbb{I}[R^{cl}_i \ge \tau_c] \Phi^{cl}_i \Phi^{ci}_i, \quad \Delta_i = R^{cl}_i – R^{ci}_i, \quad (8) $$
其中 $\Phi^{v}_i \in \{0, 1\}$ 表示视图 $v$ 的采样审计输出包含可供答案验证器解析的响应。当 $b_i = 1$ 时,干净-干预对是有效的。干净结果门控防止失败的干净预测贡献虚假的敏感性或不变性信号。为了获得路由权重,我们定义
$$ \text{Ramp}(z; a, b) = \text{clip}\left( \frac{z – a}{b – a}, 0, 1 \right), \quad a < b, \quad (9) $$
并计算
$$ w^{sen}_i = b_i \text{Ramp}(\Delta_i; \delta^{lo}_{sen}, \delta^{hi}_{sen}), \quad (10) $$ $$ w^{inv}_i = b_i \left( 1 – \text{Ramp}(\Delta_i; \delta^{lo}_{inv}, \delta^{hi}_{inv}) \right). $$
敏感性权重随奖励下降单调增加。对于干预改变很小或没有改变的无效对,不变性权重最高。当 $\delta^{hi}_{inv} < \delta^{lo}_{sen}$ 时,两个阈值之间的间隙定义了一个明确的弃权带,其中两个分支都不接收权重。更一般地,不确定的样本接收减少的辅助权重,而不是硬干预标签。第 1 节中的四种结果转换仅作为诊断视角。训练基于经验奖励下降 $\Delta_i$、有效性门控 $b_i$ 以及由此产生的软路由权重进行。
3.4 干净锚定的双向对齐
路由之后,SIVA-RL 重用从干净图像轨迹中采样的每一个响应 $y_{i,g}$。相同的 token 序列在干净和干预视觉条件下,使用可训练策略 $\pi_\theta$ 进行教师强制(teacher-forcing)并重新评分:
$$ \ell^{v}_{i,g,t} = \log \pi_\theta(y_{i,g,t} | q_i, x^v_i, y_{i,g,<t}), \quad v \in \{cl, ci\}. \quad (11) $$
由于路由权重是在输入对级别定义的,因此示例 $i$ 的所有 $G$ 个响应共享相同的 $w^{sen}_i$ 和 $w^{inv}_i$。
5
第 6 页
我们将干净条件似然视为停止梯度锚点。令 $sg[\cdot]$ 表示停止梯度算子。干净锚定令牌差异及其响应级平均值为 $$ z_{i,g,t} = \ell_{cf_{i,g,t}} – sg[\ell_{cli,g,t}], \quad d_{i,g,t} = \exp(z_{i,g,t}) – z_{i,g,t} – 1, $$ $$ D_{i,g} = \frac{1}{|T_{i,g}|} \sum_{t \in T_{i,g}} d_{i,g,t}, \quad (12) $$ 其中 $T_{i,g}$ 表示有效的响应令牌集合。量 $d_{i,g,t}$ 是令牌级干净到干预 KL 散度的非负蒙特卡洛代理。仅评估来自干净回放的令牌,因此 $D_{i,g}$ 近似于全词汇表 KL 散度,而非精确计算它。
SIVA-RL 应用了两个基于边距的目标: $$ L_{sen} = \frac{\sum_{i,g} w_{sen_i} [m_{sen} – D_{i,g}]_+}{\sum_{i,g} w_{sen_i} + \epsilon}, \quad (13) $$ $$ L_{inv} = \frac{\sum_{i,g} w_{inv_i} [D_{i,g} – m_{inv}]_+}{\sum_{i,g} w_{inv_i} + \epsilon}, $$ 其中 $[z]_+ = \max(z, 0)$。对于可靠的“高下降”对,$L_{sen}$ 强制干净策略与干预策略之间的最小散度为 $m_{sen}$。对于有效的“低下降”对,$L_{inv}$ 将该差异约束在 $m_{inv}$ 以下。因此,“双方向”指的是在相同的干净锚定度量下推动分离与拉近距离,而非对称的散度目标。完整的目标函数为
$$ L_{SIVA} = L_{base} + \lambda_{sen}L_{sen} + \lambda_{inv}L_{inv}, \quad (14) $$ 其中 $\lambda_{sen}$ 和 $\lambda_{inv}$ 控制两个辅助分支。将其中任意一个设为零即可恢复相应的单分支变体。所有骨干网络特定的正则化项均被吸收进 $L_{base}$;路由阈值、边距和损失系数报告在附录 A 中。
4 实验
我们在多种多模态 RL 骨干网络和模型规模上评估 SIVA-RL。主要评估涵盖九个基准,涉及数学、逻辑、计数和多学科多模态推理。我们还比较了 SIVA-RL 与专有、通用和数学导向的多模态 VLM 的报告结果。附录 D 提供了额外的医疗领域评估。实验回答以下四个问题:(1) SIVA-RL 是否在不同模型规模下一致地提升其对应的 RL 骨干网络?(2) 在更广泛的多模态推理比较中,生成的模型具有怎样的竞争力?(3) 干预构建和基于结果的软路由对齐如何贡献于最终性能?(4) 相同的 PatchSwap 算子是否在训练期间继续诱导异构的路由行为?
4.1 实验设置
模型与 RL 骨干网络。我们在 GRPO 和 DAPO 风格策略优化骨干网络上使用 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B Bai et al. (2025) Shao et al. (2024); Yu et al. (2026),在 ViRL39K Wang et al. (2026a) 上进行训练。所有骨干网络-规模配置共享相同的训练数据和 SIVA-RL 超参数。对于每种配置,SIVA-RL 通过局部干预构建、基于结果的软路由和双方向对齐(第 3 节)增强相应的 RL 目标。训练应用均匀敏感性预热,随后进行基于结果的软路由双方向对齐。附录 A 提供了优化和验证设置。
基准与指标。遵循先前的感知感知多模态 RL 评估协议 Wang et al. (2025b; 2026c),我们将主要基准套件分为两组。通用多模态推理组包括 Geometry3K (Geo3K) Lu et al. (2021)、MathVista Lu et al. (2024)、We-Math Qiao et al. (2025)、MMK12 Meng et al. (2025) 和 MathVerse Zhang et al. (2024)。视觉依赖组包括 LogicVista Xiao et al. (2024)、Super-CLEVR Li et al. (2023) 的计数子集、MMMU-Pro Yue et al. (2025) 以及 MathVerse Zhang et al. (2024) 的纯视觉子集,记为 MathVerse-V。我们报告每个基准的 Avg@8 准确率 (%)。通用、视觉依赖和总体分数为基准级别的宏平均值。
6
第 7 页
表 1:以 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 为骨干网络,在通用多模态推理、视觉依赖多模态推理及整体性能上的主要结果。$\Delta\%_{rel}$ 表示相对于同规模匹配强化学习基线的相对整体提升幅度。
| Method | General Multimodal Reasoning | | | | | | Vision-Dependent Multimodal Reasoning | | | | Overall | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Geo3k | MathVista | We-Math | MMK12 | MathVerse | AVG | LogicVista | Counting | MMMU-Pro | MathVerseV | AVG | AVG | $\Delta\%_{rel}$ | | GRPO-3B | 28.72 | 59.34 | 58.90 | 57.24 | 55.25 | 51.89 | 38.14 | 55.81 | 25.66 | 52.26 | 42.97 | 47.92 | – | | GRPO-3B + SIVA-RL | 34.26 | 62.12 | 61.92 | 64.63 | 59.66 | 56.52 | 42.42 | 75.19 | 29.12 | 55.68 | 50.60 | 53.89 | +12.46 | | GRPO-7B | 40.18 | 65.48 | 68.12 | 72.26 | 66.51 | 62.51 | 45.62 | 73.94 | 35.17 | 61.71 | 54.11 | 58.78 | – | | GRPO-7B + SIVA-RL | 44.41 | 69.24 | 69.53 | 76.03 | 69.29 | 65.70 | 45.83 | 88.75 | 37.43 | 65.64 | 59.42 | 62.90 | +7.01 | | DAPO-3B | 31.20 | 60.89 | 59.95 | 66.83 | 56.25 | 55.02 | 40.69 | 74.25 | 28.42 | 53.09 | 49.11 | 52.40 | – | | DAPO-3B + SIVA-RL | 37.81 | 61.41 | 62.59 | 68.74 | 61.18 | 58.35 | 43.34 | 80.25 | 30.04 | 58.49 | 53.03 | 55.98 | +6.83 | | DAPO-7B | 35.92 | 61.91 | 58.51 | 75.93 | 55.64 | 57.58 | 37.05 | 90.05 | 29.02 | 51.04 | 51.79 | 55.01 | – | | DAPO-7B + SIVA-RL | 42.95 | 64.09 | 70.50 | 79.68 | 69.73 | 65.39 | 47.23 | 92.25 | 36.94 | 65.91 | 60.58 | 63.25 | +14.98 |
表 2:与专有、通用及数学导向多模态 VLM 的已报告结果对比。粗体和下划线分别表示最佳和第二佳结果;绿色下标表示相对于基础模型的增益。
| Method | Mathematical Multimodal Reasoning | | | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Geo3k | MathVista | We-Math | MathVerse | MathVerseV | MMK12 | AVG | | Proprietary Models | | | | | | | | | GPT-4o OpenAI (2024a) | – | 64.7 | 62.8 | 50.2 | 53.8 | 55.8 | 57.5 | | GPT-4o-mini OpenAI (2024b) | – | 59.9 | 56.3 | 42.3 | 45.1 | 51.9 | 51.1 | | Gemini-2.0-Flash Google DeepMind (2024) | – | 70.4 | 47.4 | 47.8 | 48.7 | 65.2 | 55.9 | | General-Purpose Multimodal VLMs | | | | | | | | | Qwen2.5-VL-72B Bai et al. (2025) | – | 74.2 | 49.1 | 47.3 | 48.6 | 70.5 | 57.9 | | InternVL2.5-8B Chen et al. (2024) | – | 64.9 | 44.9 | 37.0 | 40.2 | 46.8 | 46.8 | | InternVL2.5-78B Chen et al. (2024) | – | 64.9 | 44.9 | 37.0 | 40.2 | 59.8 | 49.4 | | LLaVA-OneVision-7B Li et al. (2024) | – | 58.5 | 44.1 | – | – | – | 51.3 | | LLaVA-OneVision-72B Li et al. (2024) | – | 67.1 | 32.0 | 27.2 | 30.1 | – | 39.1 | | LLaVA-OneVision-1.5-8B An et al. (2025) | – | 69.6 | 61.5 | – | – | – | 65.6 | | LLaVA-Critic-R1-7B Wang et al. (2025a) | 35.4 | 68.7 | 62.6 | 58.9 | 53.1 | 57.4 | 56.0 | | R1-OneVision-7B Yang et al. (2025) | 30.6 | 64.9 | 55.2 | 61.7 | 44.3 | 43.3 | 50.0 | | Math-Specific Multimodal VLMs | | | | | | | | | MM-Eureka-7B Meng et al. (2025) | 36.4 | 59.1 | 45.3 | 57.6 | 56.4 | 60.6 | 52.6 | | MM-Eureka-7B-CPGD Meng et al. (2025) | 37.6 | 64.2 | 64.3 | 63.7 | 59.2 | 64.7 | 59.0 | | ADORA-7B Gui & Ren (2025) | 41.2 | 61.1 | 53.0 | 45.2 | 41.8 | 49.8 | 48.7 | | R1-VL-7B Zhang et al. (2025a) | 31.9 | 63.5 | 56.1 | 42.0 | 43.2 | 55.3 | 48.7 | | VLAA-Thinker-7B Chen et al. (2025) | 24.2 | 67.4 | 65.9 | 47.9 | 52.0 | 63.2 | 53.4 | | VL-Rethinker-7B Wang et al. (2026a) | 33.6 | 61.3 | 66.5 | 64.0 | 60.8 | 59.8 | 57.7 | | RACRO-7B-CRO-GRPO Gou et al. (2025) | 41.4 | 61.7 | 68.9 | 65.7 | 61.7 | 70.5 | 61.7 | | ThinkLite-VL-7B Wang et al. (2026b) | 34.4 | 68.9 | 63.5 | 49.5 | 46.0 | 56.2 | 53.1 | | RL-based Qwen2.5-VL Variants | | | | | | | | | PAPO-3B Wang et al. (2025b) | 31.0 | 61.4 | 60.1 | 57.1 | 54.0 | 57.4 | 53.5 | | VPPO-3B Huang et al. (2025a) | 35.8 | 63.6 | 61.4 | 61.3 | 58.1 | 65.3 | 57.6 | | DVRP-3B Gao et al. (2026) | 34.5 | 65.5 | 60.3 | 57.7 | 54.5 | 61.2 | 55.6 | | PAPO-7B Wang et al. (2025b) | 40.3 | 69.5 | 66.8 | 68.4 | 65.0 | 72.5 | 63.7 | | DVRP-7B Gao et al. (2026) | 43.4 | 70.9 | 67.8 | 68.9 | 65.3 | 74.1 | 65.1 | | Our Models | | | | | | | | | Qwen2.5-VL-3B (base) | 20.6 | 40.6 | 23.9 | 30.9 | 28.2 | 34.8 | 29.8 | | DAPO + SIVA-RL | 37.8 (+17.2) | 61.4 (+20.8) | 62.6 (+38.7) | 61.2 (+30.3) | 58.5 (+30.3) | 68.7 (+33.9) | 58.4 (+28.6) | | GRPO + SIVA-RL | 34.3 (+13.7) | 62.1 (+21.5) | 61.9 (+38.0) | 59.7 (+28.8) | 55.7 (+27.5) | 64.6 (+29.8) | 56.4 (+26.6) | | Qwen2.5-VL-7B (base) | 33.8 | 55.9 | 41.8 | 45.6 | 36.9 | 43.7 | 43.0 | | DAPO + SIVA-RL | 43.0 (+9.2) | 64.1 (+8.2) | 70.5 (+28.7) | 69.7 (+24.1) | 65.9 (+29.0) | 79.7 (+36.0) | 65.5 (+22.5) | | GRPO + SIVA-RL | 44.4 (+10.6) | 69.2 (+13.3) | 69.5 (+27.7) | 69.3 (+23.7) | 65.6 (+28.7) | 76.0 (+32.3) | 65.7 (+22.7) |
外部结果。外部模型的结果取自其原始论文或官方报告,无法获取的条目以“–”表示。不同模型的基准覆盖范围不同,因此基于可用条目计算的平均值仅作为参考,而非严格的统一协议排行榜。附录 A 提供了实现和评估细节。
4.2 主要结果
相对于匹配强化学习骨干网络的提升。SIVA-RL 在表 1 中的四种匹配骨干网络-规模配置中均实现了持续提升。整体绝对增益范围从 3.58 到 8.24 分,相对于匹配强化学习基线的相对提升幅度从 6.83% 到 14.98%。
7
第 8 页
表 3:在 Qwen2.5-VL-3B 上使用 GRPO 进行干预构建和基于结果的对齐的消融实验。PatchSwap w/o dist. 设置 $d_{min} = 0.00$;PatchSwap 表示默认的距离约束构建。$\Delta_{base}$ 表示相对于 GRPO-3B 基线的 Overall AVG 的相对变化。
| Setting | General Multimodal Reasoning | | | | | | | | | Overall | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Geo3k | MathVista | We-Math | MMK12 | MathVerse | LogicVista | Counting | MMMU-Pro | MathVerseV | AVG | $\Delta_{base}$ | | GRPO-3B baseline | 28.72 | 59.34 | 58.90 | 57.24 | 55.25 | 38.14 | 55.81 | 25.66 | 52.26 | 47.92 | – | | Random Mask | 30.95 | 61.38 | 60.09 | 57.39 | 57.14 | 38.67 | 62.56 | 27.11 | 53.95 | 49.92 | +4.17% | | Random Mask + SIVA-RL | 31.47 | 60.40 | 60.01 | 59.42 | 58.20 | 38.93 | 68.62 | 28.11 | 54.95 | 51.12 | +6.68% | | PatchSwap w/o dist. | 30.30 | 58.02 | 59.60 | 52.01 | 56.39 | 38.93 | 63.38 | 26.08 | 52.99 | 48.64 | +1.50% | | PatchSwap w/o dist. + SIVA-RL | 33.96 | 62.64 | 61.28 | 60.38 | 59.00 | 42.20 | 75.38 | 28.30 | 55.66 | 53.20 | +11.02% | | PatchSwap | 31.66 | 59.36 | 60.89 | 55.61 | 58.14 | 40.35 | 64.50 | 27.63 | 55.13 | 50.36 | +5.09% | | PatchSwap + SIVA-RL | 34.26 | 62.12 | 61.92 | 64.63 | 59.66 | 42.42 | 75.19 | 29.12 | 55.68 | 53.89 | +12.46% |
表 4:在 Qwen2.5-VL-3B 上使用 GRPO 骨干网络对基于结果的对齐进行逐步消融实验。所有九个基准测试的完整结果均已报告。$\Delta_{step}$ 是相对于上一行的 Overall AVG 的相对变化,显示了每一步的增量贡献。
| Setting | General Multimodal Reasoning | | | | | | | | | Overall | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Geo3k | MathVista | We-Math | MMK12 | MathVerse | LogicVista | Counting | MMMU-Pro | MathVerseV | AVG | $\Delta_{step}$ | | GRPO-3B baseline | 28.72 | 59.34 | 58.90 | 57.24 | 55.25 | 38.14 | 55.81 | 25.66 | 52.26 | 47.92 | – | | +PatchSwap | 31.66 | 59.36 | 60.89 | 55.61 | 58.14 | 40.35 | 64.50 | 27.63 | 55.13 | 50.36 | +5.09% | | +Hard Sens. | 31.32 | 60.74 | 61.49 | 61.64 | 57.82 | 42.00 | 65.06 | 27.67 | 54.82 | 51.40 | +2.07% | | +Soft Sens. | 32.30 | 63.90 | 59.15 | 62.58 | 56.46 | 39.49 | 71.56 | 27.64 | 53.31 | 51.82 | +2.90% | | +Soft Sens. + Warmup (w/o Inv.) | 34.48 | 61.36 | 62.68 | 61.88 | 58.37 | 40.75 | 71.81 | 27.45 | 55.00 | 52.64 | +1.58% | | +SIVA-RL | 34.26 | 62.12 | 61.92 | 64.63 | 59.66 | 42.42 | 75.19 | 29.12 | 55.68 | 53.89 | +2.37% |
这种增益在 GRPO 和 DAPO 中均成立,且在 3B 和 7B 模型中均成立,表明 SIVA-RL 并不依赖于特定的优化器或模型规模。
在每种匹配的比较中,视觉依赖子集上的提升幅度更大。例如,与通用基准测试上的 +4.63 分相比,GRPO-3B 在视觉依赖基准测试上获得了 +7.63 分的提升;DAPO-7B 也显示出类似的模式,分别为 +8.79 分和 +7.81 分。这表明 SIVA-RL 提供的不仅仅是通用的强化学习增强:当正确的推理依赖于视觉证据时,它特别有效,这与基于结果的敏感性-不变性对齐的目标一致。
与现有模态大语言模型(VLMs)的比较。7B 的 SIVA-RL 模型在报告的 7B 系统中实现了最强的全套平均分数,并在 We-Math、MathVerse、MathVerse-V 和 MMK12 上表现强劲(表 2)。3B 变体与许多更大的模型相比仍具有竞争力。一些外部结果仅涵盖六个基准测试的子集,因此它们的局部平均值仅作为背景参考,而非统一的排行榜。
4.3 消融研究
干预构建。表 3 分解了干预构建和基于结果的对齐的影响。在仅包含构建的变体中,距离约束的 PatchSwap 实现了最高的整体平均分(50.36)。该变体优于随机掩码(49.92)和无约束的 PatchSwap(48.64)。最小源距离避免了过于局部的替换,并比随机掩码保留了更多的视觉上下文。
基于结果的软路由改进了所有三种算子,在使用随机掩码、无约束 PatchSwap 和距离约束 PatchSwap 时分别达到 51.12、53.20 和 53.89。最佳结果结合了 SIVA-RL 与距离约束的 PatchSwap。这种组合展示了干预构建和逐样本结果评估的互补作用。
基于结果的对齐。表 4 在固定使用距离约束的 PatchSwap 的情况下评估了对齐组件。硬敏感性和软敏感性是两种替代的路由策略。与仅使用 PatchSwap(50.36)相比,它们将整体平均分分别提高至 51.40 和 51.82。软敏感性带来的增益表明,结果变化不应被视为二元信号。相反,从干净图像到干预图像的奖励下降幅度提供了更平滑且更可靠的监督强度。当干预导致部分证据损坏而非完全答案翻转时,这种优势最为明显。
8
第 9 页
(a) 敏感性路由率 (b) 不变性路由率 (c) 平均答案-奖励下降 0.40 GRPO-3B DAPO-7B 0.70 DAPO-3B GRPO-7B 0.65 0.35 0.35 0.60 0.30 0.55 rate 0.30 rate 0.50 drop 0.25 0.45 Routing 0.25 Routing Reward 0.20 0.40 0.20 0.35 0.15 0.30 0.10 0.15 0 10 20 30 40 50 60 70 80 90 0 10 20 30 40 50 60 70 80 90 0 10 20 30 40 50 60 70 80 90 阶段内步数 阶段内步数 阶段内步数
图 3:训练期间基于结果的软路由诊断。我们报告了四种骨干网络-规模配置下的敏感性路由率、不变性路由率以及成对答案-奖励的平均下降幅度。
均匀敏感性预热将性能提升至 52.64。因此,早期优化受益于在基于结果的软路由之前稳定的对齐信号。针对干净锚定的低下降样本对进行不变性对齐,构成了完整的 SIVA-RL 目标,并将整体平均值提升至 53.89。这一步骤在视觉依赖子集上带来了 1.85 分的增益。因此,低下降干预并非无信息量;它们提供了有用的干净锚定一致性约束。这些结果支持了稳定敏感性学习与针对有效低下降干预的保守对齐之间的互补作用。
超参数敏感性。图 4 研究了 PatchSwap 干预的强度和空间范围。默认设置 $\eta = 0.6$ 和 $d_{min} = 0.25$ 在报告的各类平均值中产生了最强的整体性能。适度的候选单元格比率平衡了保留原始视觉上下文与修改足够局部证据之间的关系。过于微弱或过于密集的干预会降低基准测试套件中部分任务的性能。适度的源距离约束同样优于无约束替换或过于严格的源选择。
$\eta = 1.0$ 的配置是一种压力测试。当所有单元格均为候选者且没有标准的非候选源剩余时,实现会调用附录 A 中描述的备用源采样规则。因此,$\eta = 1.0$ 的设置旨在探测在极端干预比率下构建过程的鲁棒性,而非默认的源选择机制。
4.4 机制分析
我们考察 SIVA-RL 是否在 200 步预热后仍保持异质监督。我们追踪成对答案-奖励下降幅度以及获得非零敏感性或不变性权重的样本对比例。图 3 显示,在所有四种骨干网络-规模配置中,两个分支均保持活跃。敏感性路由随观察到的奖励下降而增加,而不变性路由在整个训练过程中保持显著水平。因此,相同的 PatchSwap 算子既产生改变答案的样本对,也产生低下降样本对。重要的是,没有任何一个分支坍缩为单一的支配模式:对于视觉脆弱的样本对,敏感性保持不可忽略;而对于大量低下降样本对,不变性被一致地分配。平均奖励下降也保持在中等范围内,而非消失,这表明模型并未简单地学会忽略干预。这种行为支持了 SIVA-RL 背后基于样本的双向路由机制。
5 结论
我们引入了 SIVA-RL,这是一个基于结果的视觉对齐框架,其动机源于视觉干预在样本层面的异质性影响。SIVA-RL 将干预分离
9
第 10 页
来自监督分配的指令。它根据观察到的奖励变化,将每个干净-干预对路由至敏感性对齐或干净锚定的不变性对齐。在基于 GRPO 和 DAPO 的 3B 和 7B 模型上,SIVA-RL 在九个多模态推理基准测试中提升了性能,其中在视觉依赖任务上的提升最为显著。消融实验和训练时诊断验证了局部 PatchSwap、基于结果的软路由以及双向对齐的互补作用。这些结果确立了样本级结果估值作为多模态强化学习中算子定义干预监督的有效替代方案。
参考文献
Aishwarya Agrawal, Dhruv Batra, Devi Parikh, 和 Aniruddha Kembhavi。不要只是假设;看并回答:克服视觉问答中的先验。在 IEEE 计算机视觉与模式识别会议论文集,第 4971–4980 页,2018。
Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu 等人。Llava-onevision-1.5:用于民主化多模态训练的完全开放框架。arXiv 预印本 arXiv:2509.23661,2025。
Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, 和 Junyang Lin。Qwen2.5-VL 技术报告。arXiv 预印本 arXiv:2502.13923,2025。
Hardy Chen, Haoqin Tu, Fali Wang, Hui Liu, Xianfeng Tang, Xinya Du, Yuyin Zhou, 和 Cihang Xie。SFT 还是 RL?对训练类 R1 推理大型视觉语言模型的早期调查。arXiv 预印本 arXiv:2504.11468,2025。
Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu 等人。通过模型、数据和测试时扩展扩展开源多模模型的性能边界。arXiv 预印本 arXiv:2412.05271,2024。
Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, 和 Yu-Gang Jiang。通过增量思考:通过差分视觉推理策略激励强化学习。arXiv 预印本 arXiv:2601.06801,2026。
Google DeepMind。介绍 Gemini 2.0:我们面向代理时代的全新 AI 模型。Google DeepMind 博客,2024 年 12 月。URL https://blog.google/innovation-and-ai/models-and-research/google-deepmind/google-gemini-ai-update-december-2024/。
Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T Kwok, 和 Yu Zhang。用于可扩展多模态推理的推理对齐感知解耦。arXiv 预印本 arXiv:2506.04559,2025。
Yash Goyal, Tejas Khot, Douglas Summers-Stay, Dhruv Batra, 和 Devi Parikh。让 VQA 中的 V 变得重要:提升图像理解在视觉问答中的作用。在 IEEE 计算机视觉与模式识别会议论文集,第 6904–6913 页,2017。
Lujun Gui 和 Qingnan Ren。使用强化学习中的动态优势估计训练推理模型,2025。
Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi 等人。Deepseek-r1:通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948,2025。
Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, 和 Yu Cheng。聚焦多模态强化学习中的令牌感知。arXiv 预印本 arXiv:2510.09285,2025a。
10
第 11 页
Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, and Shaohui Lin. Vision-r1: Incentivizing reasoning capability in multimodal large language models. arXiv preprint arXiv:2503.06749, 2025b.
Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, et al. Llava-onevision: Easy visual task transfer. arXiv preprint arXiv:2408.03326, 2024.
Qiming Li, Tianlun Li, Xiaolong Cheng, Hangyu Li, Ruiyan Gong, Kangning Niu, Kaitao Jiang, and Mu Xu. Prpo: Perception-reinforced policy optimization via token-level dynamic advantage reshaping. arXiv preprint arXiv:2606.08708, 2026.
Yuting Li, Lai Wei, Kaipeng Zheng, Jingyuan Huang, Linghe Kong, Lichao Sun, and Weiran Huang. Vision matters: Simple visual perturbations can boost multimodal math reasoning. arXiv e-prints, pp. arXiv–2506, 2025.
Zhuowan Li, Xingrui Wang, Elias Stengel-Eskin, Adam Kortylewski, Wufei Ma, Benjamin Van Durme, and Alan L Yuille. Super-clevr: A virtual benchmark to diagnose domain robust- ness in visual reasoning. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 14963–14973, 2023.
Xiangyan Liu, Jinjie Ni, Zijian Wu, Chao Du, Longxu Dou, Haonan Wang, Tianyu Pang, and Michael Shieh. Noisyrollout: Reinforcing visual reasoning with data augmentation. Advances in Neural Information Processing Systems, 38:2923–2957, 2026.
Pan Lu, Ran Gong, Shibiao Jiang, Liang Qiu, Siyuan Huang, Xiaodan Liang, and Song-Chun Zhu. Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning. In Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 6774–6786, 2021.
Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai- Wei Chang, Michel Galley, and Jianfeng Gao. Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts. In International Conference on Learning Representations, volume 2024, pp. 23439–23554, 2024.
Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Tiancheng Han, Botian Shi, Wenhai Wang, Junjun He, et al. Mm-eureka: Exploring the frontiers of multi- modal reasoning with rule-based reinforcement learning. arXiv preprint arXiv:2503.07365, 2025.
Yulei Niu, Kaihua Tang, Hanwang Zhang, Zhiwu Lu, Xian-Sheng Hua, and Ji-Rong Wen. Counter- factual vqa: A cause-effect look at language bias. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 12700–12710, 2021.
OpenAI. Hello GPT-4o. OpenAI product announcement, May 2024a. URL https://openai. com/index/hello-gpt-4o/.
OpenAI. GPT-4o mini: Advancing cost-efficient intelligence. OpenAI product announcement, July 2024b. URL https://openai.com/index/ gpt-4o-mini-advancing-cost-efficient-intelligence/.
Runqi Qiao, Qiuna Tan, Guanting Dong, MinhuiWu MinhuiWu, Chong Sun, Xiaoshuai Song, Ji- apeng Wang, Zhuoma Gongque, Shanglin Lei, Yifan Zhang, et al. We-math: Does your large multimodal model achieve human-like mathematical reasoning? In Proceedings of the 63rd An- nual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 20023–20070, 2025.
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al. Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, and Wenhu Chen. Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning. Advances in Neural Information Processing Systems, 38:30865–30891, 2026a.
11
第 12 页
Xiyao Wang, Chunyuan Li, Jianwei Yang, Kai Zhang, Bo Liu, Tianyi Xiong, 和 Furong Huang。 Llava-critic-r1:你的批评模型秘密是一个强大的策略模型。 arXiv 预印本 arXiv:2509.00676,2025a。
Xiyao Wang, Zhengyuan Yang, Chao Feng, Hongjin Lu, Linjie Li, Chung-Ching Lin, Kevin Lin, Furong Huang, 和 Lijuan Wang。 Sota with less:Mcts 引导的样本选择用于数据高效的视觉推理自我改进。 神经信息处理系统进展,38: 118818–118850,2026b。
Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, 和 Xiangxiang Chu。 视觉引导的策略优化用于多模态推理。 arXiv 预印本 arXiv:2604.09349,2026c。
Zhenhailong Wang, Xuehang Guo, Sofia Stoica, Haiyang Xu, Hongru Wang, Hyeonjeong Ha, Xiusi Chen, Yangyi Chen, Ming Yan, Fei Huang, 等人。 感知感知的策略优化用于多模态推理。 arXiv 预印本 arXiv:2507.06448,2025b。
Jiaer Xia, Yuhang Zang, Peng Gao, Sharon Li, 和 Kaiyang Zhou。 Visionary-r1:通过强化学习缓解视觉推理中的捷径。 arXiv 预印本 arXiv:2505.14677,2025。
Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, 和 Enhong Chen。 Perception-r1:通过视觉感知奖励提升多模态大语言模型的推理能力。 arXiv 预印本 arXiv:2506.07218,2025。
Yijia Xiao, Edward Sun, Tianyu Liu, 和 Wei Wang。 Logicvista:视觉上下文中的多模态大语言模型逻辑推理基准。 arXiv 预印本 arXiv:2407.04973,2024。
Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, 等人。 R1-onevision:通过跨模态形式化推进通用多模态推理。 在 IEEE/CVF 国际计算机视觉会议论文集,页码 2376–2385,2025。
Huanjin Yao, Qixiang Yin, Jingyi Zhang, Min Yang, Yibo Wang, Wenhao Wu, Fei Su, Li Shen, Minghui Qiu, Dacheng Tao, 等人。 R1-sharevl:通过 share-grpo 激励多模态大语言模型的推理能力。 arXiv 预印本 arXiv:2505.16673,2025。
Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Lingjun Liu, 等人。 Dapo:一个大规模开源大语言模型强化学习系统。 神经信息处理系统进展,38:113222–113244,2026。
Xiang Yue, Tianyu Zheng, Yuansheng Ni, Yubo Wang, Kai Zhang, Shengbang Tong, Yuxuan Sun, Botao Yu, Ge Zhang, Huan Sun, 等人。 Mmmu-pro:一个更鲁棒的多学科多模态理解基准。 在第 63 届计算语言学协会年会论文集(第一卷:长论文),页码 15134–15186,2025。
Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang, Shijian Lu, 和 Dacheng Tao。 R1-vl:通过逐步组相对策略优化学习使用多模态大语言模型进行推理。 在 IEEE/CVF 国际计算机视觉会议论文集,页码 1859–1869,2025a。
Jusheng Zhang, Kaitong Cai, Yijia Fan, Jian Wang, 和 Keze Wang。 Cf-vlm:反事实视觉语言微调。 arXiv 预印本 arXiv:2506.17267,2025b。
Renrui Zhang, Dongzhi Jiang, Yichi Zhang, Haokun Lin, Ziyu Guo, Pengshuo Qiu, Aojun Zhou, Pan Lu, Kai-Wei Chang, Yu Qiao, 等人。 Mathverse:你的多模态大语言模型真的看到了视觉数学问题中的图表吗? 在欧洲计算机视觉会议,页码 169–186。 Springer,2024。
12
第 13 页
附录内容
A 实现细节 14
A.1 训练配方 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
A.2 SIVA-RL 算法伪代码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
A.3 骨干网络实例化与最终目标 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
B 完整超参数敏感性结果 17
B.1 扫描设置与完整结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
B.2 发现 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
B.2.1 两个调节参数均存在内部最优值 . . . . . . . . . . . . . . . . . . . . 18
B.2.2 在视觉最为重要的地方,构建方式最为关键 . . . . . . . . . . . . . . . . . 18
B.2.3 收益来自路由,而非精细调节的操作符 . . . . . . . . . . . . . . . . . . 18
B.3 讨论与实践建议 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
C 训练动态诊断 19
C.1 奖励-准确率动态 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
C.2 路由分支分离 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
D 额外医学领域评估 21
D.1 设置与结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
D.2 定位注意事项 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
E 定性案例研究 22
E.1 视觉恢复 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
E.2 误导性黑图正确性 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
E.3 仅使用 PatchSwap 的不稳定性(图表) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
E.4 局部几何稳定性 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
E.5 残差失败:密集多实例计数 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
13
第 14 页
表 5:SIVA-RL 的核心训练和 rollout 超参数。
超参数 值
通用训练
骨干模型 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 优化器 / 学习率 / 权重 AdamW-bf16 / 10−6 / 10−2 衰减 最大提示 / 响应长度 4096 / 2048 梯度检查点 启用 奖励信号 带有格式和解析有效性检查的答案准确率标量
Rollout 和评估
每个提示的 Rollouts G = 5(用于训练 rollout) Rollout 温度 / top-p 1.0 / 0.99 干预估值解码 使用 M = 4 次 rollout 进行采样审计解码;温度 0.7,top-p 0.95 验证解码多重性 GRPO: avg@8; DAPO: avg@8
两阶段调度
数学阶段 1 ViRL39K 训练 / MMK12 验证;4 块 GPU;200 步最大值;Patch- Swap 预热,无 SIVA 路由 数学阶段 2 ViRL39K 训练 / MMK12 验证;4 块 GPU;100 步最大值;双 向 SIVA 对齐 医学阶段 1 VQA-RAD SLAKE PathVQA 训练集/验证集;4 块 GPU;200 步最大值;PatchSwap 预热,无 SIVA 路 由 医学阶段 2 VQA-RAD SLAKE PathVQA 训练集 / 验证集;4 块 GPU;100 步最大值;双向 SIVA 对齐
批处理
数学全局 / rollout / 验证 128 / 阶段 1 为 256,阶段 2 为 512 / 512 批次 医学全局 / rollout / 验证 64 / 384 / 256 批次 微批次 更新时为 4,经验计算时为 8
骨干特定 RL 配置
GRPO-骨干 优势估计器 grpo;启用参考-KL 分支;关闭在线 过滤;默认执行器裁剪 DAPO-骨干 优势估计器 dapo;禁用参考-KL 分支;开启在 线过滤,使用准确率过滤器 [0.01, 0.99];低裁剪 0.2, 高裁剪 0.28 KL 惩罚类型 / 系数 低方差 KL / 10−2
A 实现细节
A.1 训练配方
正文侧重于 SIVA-RL 机制;本附录报告了可执行的训练配方。除非另有说明,所有运行均使用 Qwen2.5-VL 骨干、AdamW-bf16、梯度检查点、相同图像的 PatchSwap 干预视图,以及奖励函数的答案准确率组件作为 rans。答案奖励是由评估器返回的标量,而非严格的二元标签。训练采用两阶段调度。阶段 1 是一个 200 步的 PatchSwap 感知分离预热过程,将所有构建的干预对视为敏感性风格扰动,不进行结果路由或不变性对齐。阶段 2 在启用 SIVA-RL 的配对结果估值和双向路由的情况下,再运行 100 步。
14
第 15 页
表 6:SIVA-RL 的 PatchSwap 和结果路由超参数。
超参数 值
PatchSwap 干预视图
视觉单元格大小 28 像素,对应空间合并大小为 2 的 14 像素视觉 patch Patch 来源 满足 dmin 的同图像非候选单元格;如果该来源 集合为空,或没有来源满足距离约束,我们 回退到排除目标单元格以外的同图像单元格 数学候选单元格比例 / 替换 0.6 / 0.75 概率 医学候选单元格比例 / 替换 0.4 / 0.75 概率
结果估值与对齐
干净正确性阈值 τc 0.75 敏感性奖励下降区间 [δsenlow, δsenhigh] = [0.05, 0.5] 不变性奖励下降区间 [δinvlow, δinvhigh] = [0.0, 0.05] 敏感性系数 / 边界 λsen = 0.005, msen = 0.05 不变性系数 / 边界 λinv = 0.001, minv = 0.01
A.2 SIVA-RL 算法伪代码
算法 1 总结了 SIVA-RL 的一个训练步骤。SIVA-RL 与标准的分组 rollout 强化学习更新的区别在于:它将用于策略优化的干净 rollout 与用于干预结果估值的配对审计分开。审计在 M 个采样的 rollout 上平均答案奖励,并确定软路由权重。辅助损失随后在干净和 PatchSwap 视觉条件下对已采样的干净响应进行重新评分。
A.3 骨干网络实例化与最终目标
令 ρi,g,t(θ) 表示正文中定义的干净 rollout 重要性比率,并令
¯ρi,g,t(θ) = exp clip log ρi,g,t(θ), log(1 −ϵlow), log(1 + ϵhigh) (15)
为代码中共享的 actor 损失例程所使用的裁剪比率。随着响应级优势 Ai,g 广播到响应 yi,g 的所有 token,每个 token 的裁剪 actor 损失可以写为
(max(−Ai,gρi,g,t, −Ai,g ¯ρi,g,t) , Ai,g ≥0, ℓPGi,g,t = (16) min(max(−Ai,gρi,g,t, −Ai,g ¯ρi,g,t) , −Ai,gϵdual) , Ai,g < 0.
干净图像的策略梯度项随后为
LPG(θ) = Avgi,g,t ℓPGi,g,t . (17)
这里 ϵlow, ϵhigh 和 ϵdual 表示 actor 损失例程中使用的裁剪超参数。
在我们的实现中,GRPO-backbone 和 DAPO-backbone 共享相同的裁剪 actor 损失例程,主要区别在于优势估计器及相关训练配置。因此,我们实例化 LGbase(θ) = LPG(θ; Agrpo) + βGrefLKL-ref(θ) + βGprcpLprcp(θ) + βGoriLorient(θ) + βGaugLaugent (θ), (18)
以及 LDbase(θ) = LPG(θ; Adapo)+βDrefLKL-ref(θ)+βDprcpLprcp(θ)+βDoriLorient(θ)+βDaugLaugent (θ), (19)
其中 Lprcp 表示在干预视图条件下计算的继承感知分离分支,禁用项通过根据配置将其系数设置为零来省略。阶段 1 预热运行设置 use vac papo=false,因此完整的 SIVA 估值损失和
15
第 16 页
算法 1 SIVA-RL 训练步骤 需要:当前策略 $\pi_\theta$,旧策略 $\pi_{\theta_{\text{old}}}$,审计策略 $\bar{\pi}_\theta$,批次 $B = \{(q_i, x_i, a^\star_i)\}_{i=1}^B$ 需要:组大小 $G$,审计样本数量 $M$,PatchSwap 参数 $(\eta, \rho, d_{\min})$,干净阈值 $\tau_c$, 奖励下降区间,边距 $(m_{\text{sen}}, m_{\text{inv}})$,系数 $(\lambda_{\text{sen}}, \lambda_{\text{inv}})$ 阶段 1:干净分组 rollout 和基础 RL 统计量 1: for each prompt $(q_i, x_i)$ in $B$ do 2: 为 $g = 1, \dots, G$ 采样干净响应 $y_{i,g} \sim \pi_{\theta_{\text{old}}}(\cdot \mid q_i, x_i)$ 3: 计算结果奖励 $R_{i,g}$ 和分组响应优势 $A_{i,g}$ 4: end for 阶段 2:局部干预构建 5: for each image $x_i$ do 6: 在视觉单元格网格上采样候选单元格 $C_i$ 和有效目标 $T_i$ 7: 对于每个目标单元格,首先采样距离至少为 $d_{\min}$ 的同图像非候选源单元格;如果 不存在有效源,则回退到除目标外的所有同图像单元格 8: 构建 PatchSwap 干预视图 $\tilde{x}_i$ 9: end for 阶段 3:基于结果的估值 10: for each pair $(q_i, x_i, \tilde{x}_i)$ do 11: 设置 $x^{\text{cl}}_i = x_i$ 和 $x^{\text{ci}}_i = \tilde{x}_i$ 12: for $v \in \{\text{cl}, \text{ci}\}$ do 13: 在不进行梯度更新的情况下,为 $m = 1, \dots, M$ 采样 $\hat{y}^v_{i,m} \sim \bar{\pi}_\theta(\cdot \mid q_i, x^v_i)$ 14: 计算 $R^v_i = \frac{1}{M} \sum_{m=1}^M r_{\text{ans}}(\hat{y}^v_{i,m}, a^\star_i)$ 15: 计算解析有效性指示符 $\Phi^v_i$ 16: end for 17: 计算有效性门控 $b_i = \mathbb{I}[R^{\text{cl}}_i \ge \tau_c] \Phi^{\text{cl}}_i \Phi^{\text{ci}}_i$ 和下降量 $\Delta_i = R^{\text{cl}}_i – R^{\text{ci}}_i$ 18: 将 $\Delta_i$ 转换为软路由权重 $w^{\text{sen}}_i$ 和 $w^{\text{inv}}_i$ 19: end for 阶段 4:干预视图重新评分和对齐 20: for each sampled response $y_{i,g}$ do 21: 在 $x^{\text{cl}}_i$ 和 $x^{\text{ci}}_i$ 下对相同的 token 序列重新评分 22: 计算采样散度代理 $D_{i,g}$ 23: 累加 $w^{\text{sen}}_i [m_{\text{sen}} – D_{i,g}]_+$ 和 $w^{\text{inv}}_i [D_{i,g} – m_{\text{inv}}]_+$ 24: end for 阶段 5:策略更新 25: 使用 $L_{\text{base}} + \lambda_{\text{sen}}L_{\text{sen}} + \lambda_{\text{inv}}L_{\text{inv}}$ 以及启用的骨干正则化器更新 $\theta$
结果依赖的路由保持非激活状态。预热阶段通过继承的感知分离分支,使用 PatchSwap 干预视图作为敏感性风格的扰动。
在阶段 2 启用 SIVA 后,最终目标函数变为
$L^{\text{SIVA}}_G(\theta) = L^{\text{base}}_G(\theta) + \lambda_{\text{sen}}L_{\text{sen}}(\theta) + \lambda_{\text{inv}}L_{\text{inv}}(\theta)$, (20)
以及 $L^{\text{SIVA}}_D(\theta) = L^{\text{base}}_D(\theta) + \lambda_{\text{sen}}L_{\text{sen}}(\theta) + \lambda_{\text{inv}}L_{\text{inv}}(\theta)$. (21) 因此,SIVA 特定的对齐项在两个骨干家族之间共享。两者都重用相同的干净 rollout 响应,两者都计算相同的基于结果的条件敏感性和低下降一致性损失,并且两者仅通过表 5 和表 6 中总结的骨干配置不同。在整个附录中,我们保持与正文相同的符号:$\lambda_{\text{sen}}$ 和 $\lambda_{\text{inv}}$ 表示敏感性和不变性系数,$m_{\text{sen}}$ 和 $m_{\text{inv}}$ 表示相应的边距,$L_{\text{prcp}}$ 仅指继承的 PAPO 感知分支,而不是 SIVA 特定的项。
16
第 17 页
B 完整超参数敏感性结果
B.1 扫描设置与完整结果
表 7 报告了针对候选单元格比例 $\eta$ 和最小源距离 $d_{min}$ 的完整逐基准扫描结果,这两个参数是局部 PatchSwap 构建的两个调节旋钮。我们将这些扫描结果视为对构建方法为何及在何处重要的测试,而非在表中寻找最佳单元格。
所有扫描均使用 GRPO-3B 主干网络以及附录 A 中的两阶段 SIVA-RL 调度方案。我们采用单因素变化协议隔离每个构建超参数。当变化候选单元格比例 $\eta$ 时,最小源距离固定为其默认值 $d_{min} = 0.25$。当变化 $d_{min}$ 时,候选单元格比例固定为 $\eta = 0.6$。所有其余设置与主配置匹配:替换概率 $\rho$、网格分辨率、路由阈值、边距和损失系数均保持表 5 和表 6 中的值。因此,表 7 中的每个单元格都是在与主要结果相同的 Avg@8 协议下评分的完整训练运行。这些数字可直接与 47.92 的 GRPO-3B 基线进行比较。
我们扫描 $\eta$ 和 $d_{min}$,因为它们控制了局部 PatchSwap 视图的两个独立自由度:多少图像区域有资格被替换,以及替换内容来自多远的位置。候选单元格比例 $\eta$ 设定了干预的空间范围。较小的 $\eta$ 扰动少量单元格,而较大的 $\eta$ 使大部分网格暴露于替换之下。最小源距离 $d_{min}$ 设定了粘贴内容的语义距离。较小的 $d_{min}$ 保持交换的局部性和视觉合理性,而较大的 $d_{min}$ 引入遥远且不相关的结构。替换概率 $\rho$ 和网格分辨率与这两个旋钮相互作用,但它们改变的是干预的强度,而非其空间或语义特征。因此,我们保持 $\rho$ 和网格固定,仅通过主配置报告其设置。
表 7:Qwen2.5-VL-3B 上逐基准的完整超参数消融实验。我们一次变化一个超参数,同时保持其他超参数固定。所有结果均为 Avg@8 准确率(%)。
候选单元格比例扫描 $\eta$ 最小源距离扫描 $d_{min}$ 基准 0.2 0.4 0.6 0.8 1.0 0.00 0.25 0.35 0.75 0.90
通用推理 Geo3k 32.57 33.13 34.26 32.30 33.69 33.96 34.26 34.01 32.82 33.88 MathVista 62.90 62.42 62.12 63.52 61.29 62.64 62.12 63.05 61.12 62.71 We-Math 63.00 62.28 61.92 60.94 62.69 61.28 61.92 62.05 60.83 61.82 MMK12 60.56 59.77 64.63 60.67 59.97 60.38 64.63 61.52 60.52 59.55 MathVerse 58.47 58.90 59.66 57.63 60.09 59.00 59.66 59.68 59.74 59.58 通用平均 55.50 55.30 56.52 55.01 55.55 55.45 56.52 56.06 55.01 55.51 视觉依赖推理 LogicVista 41.08 42.67 42.42 40.80 41.58 42.20 42.42 41.95 42.03 40.97 计数 64.25 67.12 75.19 68.19 75.12 75.38 75.19 67.69 71.12 68.94 MMMU-Pro 27.75 28.27 29.12 28.59 28.06 28.30 29.12 28.27 27.64 28.25 MathVerseV 55.44 55.86 55.68 54.66 56.61 55.66 55.68 57.10 56.16 56.14 视觉平均 47.13 48.48 50.60 48.06 50.34 50.38 50.60 48.75 49.24 48.57
总体平均 51.78 52.27 53.89 51.92 53.23 53.20 53.89 52.81 52.44 52.43
逐列阅读,表 7 显示没有任何单一基准驱动聚合趋势。在整个 $\eta$ 扫描中,总体平均值保持在 2.1 分的区间内,在 $d_{min}$ 扫描中保持在 1.5 分的区间内。逐基准的最优值也是分散的:Geo3k、MathVista 和 MathVerse 的最佳 $\eta$ 各不相同,$d_{min}$ 也是如此。因此,$\eta = 0.6$、$d_{min} = 0.25$ 的聚合最优值是跨基准的稳健折衷,而非针对其中任何一个基准调整的设置。
B.2 发现
有三个趋势尤为突出。
17
第 18 页
B.2.1 两个超参数均存在内部最优值
这两个超参数均不会单调提升性能。候选单元格比例 $\eta$ 在默认值 $\eta = 0.6$ 处达到峰值(总体准确率 53.89),在 $\eta = 0.8$ 时降至 51.92,随后在 $\eta = 1.0$ 时部分恢复至 53.23。最小源距离 $d_{\min}$ 呈现出更清晰的内部峰值:准确率在 $d_{\min} = 0.25$ 时最高(53.89),并随着强制将源图像推得更远而稳步下降(在 0.35、0.75 和 0.90 时分别为 52.81、52.44 和 52.43)。这两种性能曲线均源于第 3.2 节中的构建原理:有效的干预必须足够“强”,以移除局部视觉证据,但又必须足够“弱”,以保持图像处于分布之内。过小的 $d_{\min}$ 会复制近邻重复图像,几乎不扰动证据;过大的 $d_{\min}$ 则会粘贴不相关的远距离图像块,导致图像漂移至任意损坏状态。中间设置平衡了这两种失败模式。这种平衡 regime 正是 SIVA-RL 旨在构建的。
B.2.2 在视觉最为关键的领域,构建方式的影响最大
对这两个超参数的敏感性集中在依赖视觉的组别中。在 $\eta$ 扫描过程中,依赖视觉组的平均准确率变化了 3.5 分(从 47.13 到 50.60),而通用组的平均准确率仅变化了 1.5 分(从 55.01 到 56.52)。计数子集是最极端的情况,随着 $\eta$ 的变化,其准确率波动了约 11 分(从 64.25 到 75.19)。通用推理可以依赖文本结构和语言先验,因此对视觉干预的构建方式 largely insensitive(很大程度上不敏感)。依赖视觉的推理没有这种后备机制,因此构建方式直接决定了可用的学习信号。这种对比佐证了本文的核心前提:当任务真正依赖视觉证据时,视觉干预才变得至关重要。这一模式与我们的主要结果相吻合,即 SIVA-RL 在依赖视觉子集上的增益最大。
B.2.3 增益来自路由,而非精细调节的操作符
表 7 中的每种配置均显著高于 GRPO-3B 基线的 47.92。即使是表现最弱的配置($\eta = 0.2$ 时的 51.78)也将总体平均准确率提升了 3.9 分。有两个配置尤其具有说明性。$\eta = 1.0$ 的压力测试退回到附录 A 中的宽松源规则,但仍达到了 53.23。完全移除距离约束($d_{\min} = 0.00$)仍能达到 53.20,接近调优后的 53.89。因此,SIVA-RL 并不依赖于精确校准的扰动操作符。构建超参数主要控制信息性“干净-干预”对的供给量。而基于结果的软路由(Outcome-Conditioned Routing)则决定如何使用每一对样本。
B.3 讨论与实践建议
对于实践者而言,扫描结果提供了一个简单的配方。从 $\eta = 0.6$ 和 $d_{\min} = 0.25$ 开始,这是总体最优值,并将两者视为粗粒度超参数,而非需要精细搜索的量。由于两种性能曲线的内部区域较为平坦,任何 $\eta \in [0.4, 0.6]$ 和任何 $d_{\min} \in [0.25, 0.35]$ 的设置都能使总体平均准确率保持在最佳值附近约 1 分的范围内。如果必须最小化调优成本,可以将两个超参数固定在默认值,仍能捕获大部分增益。这种容错性在多模态强化学习中尤为重要,因为单个配置的成本高昂,且通常难以负担对构建超参数进行密集网格搜索。
扫描结果还阐明了构建超参数控制什么以及不控制什么。它们设定了“干净-干预”对的供给量和难度,但并不决定如何使用这些对。这一决策属于第 3.3 节中基于结果的软路由。路由器读取每对样本观察到的奖励下降幅度,并将其分配至敏感性对齐分支、不变性对齐分支或两者都不分配。路由器吸收了大量若由固定操作符处理则会传播至训练过程中的变化。这就是为什么即使在不加约束和压力测试的设置下,性能仍能接近调优最优值的原因。构建质量提高了可用信号的上限,而路由决定了策略能达到该上限的多少。
第 19 页
C 训练动力学诊断
我们为数学领域的运行提供了额外的训练动力学诊断。这些图表不用于模型选择。它们使 SIVA-RL 的两阶段行为更加透明。
数学奖励曲线:第 1 阶段和第 2 阶段在同一坐标轴上 0.8
0.7
准确率 0.6 奖励 0.5
GRPO-3B DAPO-3B 0.4 GRPO-7B DAPO-7B
第 1 阶段 第 2 阶段 0.3 50 100 150 200 250 300 训练步数
图 5:两阶段调度下的数学领域奖励-准确率动力学。虚线标记了从 200 步 PatchSwap/PAPO 风格预热到 100 步 SIVA-RL 阶段的过渡,展示了 GRPO-3B、DAPO-3B、GRPO-7B 和 DAPO-7B 的曲线。
C.1 奖励-准确率动力学
路由阶段重新点燃了停滞的预热过程。图 5 在整个训练过程中保持了预期的规模和骨干网络排序:DAPO-7B 领先,其次是 GRPO-7B、DAPO-3B 和 GRPO-3B。在 200 步的预热期间,奖励准确率迅速上升,随后随着均匀 PatchSwap 扰动的饱和而趋于平缓。在过渡到第 2 阶段(虚线)时,每条曲线都恢复了明显的上升趋势,并且较大的模型在切换时显示出可见的阶跃提升。SIVA-RL 阶段期间的持续改进表明,基于结果的软路由提供了均匀预热阶段已经耗尽的学习信号。这种动力学与第 4.3 节中的逐步消融实验相符:在预热基础上添加路由和不变性对齐,使整体平均值从 52.64 提高到 53.89。
骨干网络的排序从第一步到最后一步都是稳定的。两个 7B 模型在奖励准确率上起始于约 0.44,而两个 3B 模型起始于约 0.32。这种 0.10–0.13 的规模差距贯穿两个阶段且从未缩小。在每个规模内,DAPO 骨干网络在大部分训练过程中都高于其 GRPO 对应模型,因此四条曲线保持 DAPO-7B、GRPO-7B、DAPO-3B 和 GRPO-3B 的顺序,互不交叉。
对于最强的模型,预热阶段不仅仅是趋于平缓。DAPO-7B 在第 165 步左右达到约 0.77 的峰值,然后在第 1 阶段/第 2 阶段边界处缓慢下降至约 0.74,这是在长时间均匀扰动下的轻微衰退。切换到基于结果的软路由逆转了这一衰退趋势。DAPO-7B 和 GRPO-7B 都在虚线处发生离散跳跃,随后 GRPO-7B 在第 2 阶段从约 0.69 攀升至 0.74。3B 模型的增长更为渐进,而 DAPO-7B 保持在跳跃后的水平附近。因此,路由主要在预热停滞或衰退的地方发挥作用,而不是在所有配置中均匀地发挥作用。
C.2 路由分支分离
两个路由分支保持活跃且分离。图 6 追踪了第 2 阶段期间两条路由的平均干净到干预分歧度 D。敏感性分支在所有配置中将 D 保持在有界的正值水平,这与推动高…
19
第 20 页
(a) 敏感性路由的平均散度 (b) 不变性路由的平均散度 GRPO-3B DAPO-7B 0.4 0.7 DAPO-3B GRPO-7B 0.6 D 0.3 0.5 0.4 0.2 散度 散度 0.3 平均 0.1 0.2 0.1 0.0 0.0 0 10 20 30 40 50 60 70 80 90 0 10 20 30 40 50 60 70 80 90 阶段局部步数 阶段局部步数
图 6:数学领域 SIVA-RL 阶段的干预散度动态。两个面板分别报告敏感性路由和不变性路由对的平均散度 D。每个面板展示了在 PatchSwap 干预下,重新评分的干净响应在骨干网络和模型规模下的表现。
将成对样本分开。不变性分支在前几步中起始值较高,随后被驱动至较小的不变性边界 $m_{inv}$ 附近,并在剩余的训练过程中保持在该水平。两条路由从未坍缩为单一机制,且敏感性散度在整个过程中始终高于不变性散度。这种分离是双方向目标在训练期间的特征。这种分离证实了第 4.4 节中的机制性主张:相同的 PatchSwap 算子持续生成改变答案的样本和低下降样本,而不是退化为均匀扰动损失。
两个面板具有相似的结构,但处于不同的尺度;请注意不同的 y 轴范围。在敏感性面板中,平滑曲线在所有四种配置下均保持在约 0.05–0.15 的区间内。它们在敏感性边界附近波动,而不是坍缩到其下方。在不变性面板中,起始阶段的瞬态变化是最清晰的信号。DAPO-3B 在阶段 2 开始时进入 $D = 0.23$ 附近,并在大约十五步内被拉低至 0.03–0.05 的区间,其他配置也在此区间稳定下来。这种早期的下降是不变目标作用于低下降样本,并将干净图像到干预图像的一致性收紧至 $m_{inv}$ 的结果。
瞬态变化过后,两条路由之间保持明显的差距。敏感性散度保持在 0.05–0.15 左右,而不变性散度保持在 0.02–0.06 左右,因此敏感性区间在整个阶段 2 中大致高出两到三倍。在训练后期,敏感性曲线向上漂移,GRPO-7B 和 DAPO-3B 在最后几步达到约 0.2。这种向上漂移表明 PatchSwap 持续产生强烈改变答案的样本,而并未耗尽此类样本。未平滑的微弱轨迹在两个面板中均尖峰高达 0.4–0.5。这些爆发是个别高散度批次,软路由权重吸收了这些波动,而未破坏平滑趋势。
20
第 21 页
D 额外的医学领域评估
D.1 设置与结果
这些结果提供了对完整训练配方额外的跨领域评估。与预训练基础模型进行比较,而非经过匹配的医学强化学习基线,因此这些增益不应仅归因于 SIVA-RL 辅助目标。对于 Qwen2.5-VL-3B (base) 和 Qwen2.5-VL-7B (base),VQA-RAD、SLAKE 和 PathVQA 的条目是我们对官方指令检查点的 Avg@8 评估结果。
表 8:跨强化学习骨干网络和 Qwen2.5-VL 模型规模的完整医学多模态问答比较。结果在医学验证集上报告,采用 Avg@8 评估。
| | 域内数据集 | | | 域外数据集 | | | :— | :—: | :—: | :—: | :—: | :—: | | 方法 | VQA-RAD | SLAKE | PathVQA | MedXpertQA | 总体 | | | | | | | | | 专有模型 | | | | | | | Gemini-2.0-flash-lite | 59.4 | 73.1 | 64.9 | – | – | | GPT-4.1-Nano | 61.8 | 73.1 | 70.6 | – | – | | GPT-4o | 63.9 | 71.6 | 75.9 | – | – | | | | | | | | | 通用多模态 VLM | | | | | | | Qwen-VL-Chat | 47.0 | 56.0 | 55.1 | – | – | | Yi-VL-34B | 53.0 | 58.9 | 47.3 | – | – | | LLaVA-v1.6-7B | 52.6 | 57.9 | 47.9 | – | – | | LLaVA-v1.6-13B | 55.8 | 58.9 | 51.9 | – | – | | LLaVA-v1.6-34B | 58.6 | 67.3 | 59.1 | – | – | | LLaVA-v1.5-LLaMA3-8B | 54.2 | 59.4 | 54.1 | – | – | | | | | | | | | 医学多模态 VLM | | | | | | | Med-Flamingo | 45.4 | 43.5 | 54.7 | 22.1 | 41.4 | | RadFM | 50.6 | 34.6 | 38.7 | 23.4 | 36.8 | | LLaVA-Med-7B | 51.4 | 48.6 | 56.8 | 20.8 | 44.4 | | LLaVA Med-LLaMA3-8B | 60.2 | 61.2 | 54.5 | – | – | | PubMedVision-8B | 63.8 | 74.5 | 59.9 | – | – | | HuatuoGPT-Vision-34B | 68.1 | 76.9 | 63.5 | 22.1 | 57.7 | | MedVLThinker-7B | 63.7 | 67.8 | 65.2 | 20.9 | 54.4 | | CAPO-7B | 78.5 | 79.1 | 68.9 | – | – | | | | | | | | | 医学智能体系统 | | | | | | | MedAgents | 65.6 | 67.9 | 63.2 | – | – | | MDAgents | 66.8 | 68.2 | 65.4 | – | – | | AFlow | 67.3 | 68.9 | 66.4 | – | – | | MMedAgent-RL-7B | 71.5 | 76.2 | 72.3 | – | – | | | | | | | | | 我们的模型 | | | | | | | Qwen2.5-VL-3B (base) | 54.6 | 57.9 | 49.2 | 20.7 | 45.6 | | DAPO + SIVA-RL | 62.7 (+8.1) | 68.1 (+10.2) | 66.5 (+17.3) | 23.0 (+2.3) | 55.1 (+9.5) | | GRPO + SIVA-RL | 63.0 (+8.4) | 68.8 (+10.9) | 65.2 (+16.0) | 24.5 (+3.8) | 55.4 (+9.8) | | Qwen2.5-VL-7B (base) | 62.1 | 62.6 | 54.9 | 20.1 | 49.9 | | GRPO + SIVA-RL | 67.1 (+5.0) | 79.9 (+17.3) | 80.7 (+25.8) | 22.3 (+2.2) | 62.5 (+12.6) | | DAPO + SIVA-RL | 67.4 (+5.3) | 72.7 (+10.1) | 77.4 (+22.5) | 22.3 (+2.2) | 60.0 (+10.1) |
D.2 定位的局限性
仅凭医学问答的准确率并不能证明视觉定位能力的提升。医学基准测试通常将图像发现与临床文本、病理学、实验室信息和诊断标签相结合,因此答案的增益可能反映了对非视觉线索利用的改善。更严格证据级别的评估会将视觉上可观察的发现与非视觉证据分开,并检查增益是否
第 22 页
在纯文本、空白图像和感知泄漏(leak-aware)控制下依然稳健。因此,我们将上述医学领域的结果视为跨领域性能的佐证,而非医学视觉定位能力的独立证明。
E 定性案例研究
我们展示定性案例,以阐明主论文中定量提升在样本层面的具体含义。这些案例围绕诊断角色而非视觉吸引力进行组织,分为以下五类:
1. 视觉恢复 2. 误导性黑图正确性 3. 仅使用 PatchSwap 的不稳定性 4. 局部几何稳定性 5. 残差失败
这种结构之所以重要,是因为 SIVA-RL 并不假设每种视觉干预都会产生相同的训练信号。相反,SIVA-RL 通过配对结果的改变来解读扰动:大幅下降提供敏感性监督,小幅下降的配对提供不变性监督,而持续的失败则揭示了当前训练信号之外的局限性。
在诊断基准探测中,随机掩码、PatchSwap 和黑白图像干预均产生了结果下降与结果稳定行为的混合。因此,仅凭扰动算子无法确定是否应将配对样本分离或保持一致。以下示例展示了这种异质性,并显示了 SIVA-RL 未能消除的一种失败模式。它们阐明了 SIVA-RL 的局限性,并指出了未来工作的方向。
22
第 23 页
E.1 视觉恢复
案例 1 — 视觉恢复
任务
基准。MMK12,数据 343。 正确答案。D。 问题。运行视觉程序后, 输出值是多少?
干净图像
SIVA-RL — 恢复了渲染的循环 GRPO 基线 — 视觉读取错误 预测。在干净图像上为 D。 预测。在干净图像上为 B。 保存的回复摘录。模型遵循 保存的回复摘录。模型将更新 从 i = 2 到 i = 5 的循环,使用 读作“A = A + i2 · i”,然后 “A = A + i · i”,产生正确的操 累积了一个错误的序列。 作。
解释
干净 黑色 PatchSwap 结果模式。GRPO B C A SIVA-RL D C D
本案例说明了视觉恢复,而非记忆性答案修正。对于 SIVA-RL,黑图探针仍然错误,因此正确的干净图像预测不能归因于纯文本先验。PatchSwap 的结果保持正确,因为局部替换并未破坏读取循环所需的程序结构。用 SIVA-RL 的术语来说,这种行为正是其目标:在低影响的局部扰动下保持回复不变,同时在图像可用时仍依赖可见的程序。
图 7:视觉恢复案例。SIVA-RL 通过使用渲染的循环纠正了基线的 OCR/程序读取错误,而黑图回复仍然错误。
23
第 24 页
E.2 误导性黑图正确性
案例 2 — 误导性黑图正确性
任务
基准。AI4Math MathVerse, AI4Math MathVerse 1328。 黄金答案。D。 问题。使用平行四边形 MNPR 求 m∠RMN。 选项:A:33, B:38, C:71, D:109。
干净图像 黑图探针
GRPO 基线 — 黑图正确但 干净图失败 SIVA-RL — 仅在可见几何结构下正确 预测结果。干净图:无解析;黑图:D。 保存的回复摘录。在干净图 上,它应用通用的平行四边形事实, 但未得出有效的最终答案; 在黑图上,它仅凭文本猜测出正确 选项。
预测结果。干净图:D;黑图:B。 保存的回复摘录。干净回复利用 可见平行四边形中的相邻/互补角 约束,并选择 D。
解释
此案例说明了为何黑图正确性并非不变性的可靠证据。基线模型仅在移除图表后才变得正确。这种行为更符合答案先验猜测,而非稳健的视觉推理。将此类样本对视为正不变性样本会奖励缺乏视觉支持的行为。SIVA-RL 通过将辅助方向条件化于配对结果和有效性检查,而非仅依赖于干预身份,从而避免了这种失败模式。
图 8:误导性黑图正确性。基线的黑图正确答案并非稳健视觉推理的证据;它掩盖了干净图上的失败。
24
第 25 页
E.3 仅使用 PatchSwap 的不稳定性(图表)
案例 3 — PatchSwap 诊断(图表)
任务 基准。 AI4Math MathVista, AI4Math MathVista 324。 黄金答案。 问题。Web Purple 是否具有最大的曲线下面积?
干净图像 PatchSwap 干预
GRPO 基线 — 仅使用 PatchSwap 失败 SIVA-RL — 在局部替换下保持稳定
预测。干净:否;PatchSwap:是。 预测。干净:否;PatchSwap:否。 保存的回复摘录。干净回复正确比较了Chartreuse和Web Pur- 保存的回复摘录。回复 ple,但PatchSwap回复得出结论认为Web Purple更高。 继续比较曲线值和 局部干预下的面积,保持 正确答案。
解释
两个模型在干净图像和黑色探针上都是正确的。只有PatchSwap暴露了基线的不稳定性。这一结果支持需要使用距离约束的局部干预,而不是仅使用全图移除。 基线在干净图像和黑色图像预测下看似可靠,但局部干预改变了答案。这正是SIVA-RL的PatchSwap构建有用的地方: 它探测模型的决策是否对无关的局部变化稳定,同时保留大部分原始视觉上下文。SIVA-RL的回复在PatchSwap下保持正确。这种 稳定性表明,低下降的一致性信号可以抑制脆弱的局部视觉关联,而无需强制对破坏性的全图移除保持不变。
图 9:PatchSwap 诊断案例。图像内的局部替换揭示了黑色探针未能揭示的基线稳定性差距。
25
第 26 页
E.4 局部几何稳定性
案例 4 — PatchSwap 诊断(几何)
任务 基准。 AI4Math MathVerse, AI4Math MathVerse 1331. 正确答案。C. 问题。求 m∠B。选项: A:29, B:58, C:61, D:122.
干净图像 PatchSwap 干预
GRPO 基线 — 局部几何结构破坏 SIVA-RL — 最终决策一致
预测结果。干净图像:C;PatchSwap:B。 预测结果。干净图像:C;PatchSwap:C。 保存的回答摘录。干净图像的回答使用了圆周角关系, 保存的回答摘录。模型在局部化干预下 但 PatchSwap 的回答将图形视为普通三角形,并切换到了 B。 保持了正确的最终选项,而不是切换到基于三角形的答案。
解读
这个额外的几何案例在符号图表中反映了图表案例的情况。仅凭干净图像上的准确率无法揭示模型是否学到了稳定的几何关系,还是仅仅遵循了脆弱的视觉线索。PatchSwap 暴露了基线对局部图表片段的依赖:答案从正确的弧/角关系切换到了普通三角形的答案。SIVA-RL 保持了决策的固定。当扰动不改变任务相关关系时,这种稳定性正是预期的不变性行为。
图 10:几何领域的额外 PatchSwap 案例。局部化干预揭示了一个在干净图像上不存在的基线错误。
26
第 27 页
E.5 残差失败:密集多实例计数
案例 5 — 残差失败:密集多实例计数
任务基准。BUAADreamer clevr count, 样本 62。正确答案。8。问题。图像中有多少种不同的物品?
干净图像 PatchSwap 干预 黑图探针
扰动视图 — 不稳定的计数
预测。PatchSwap: 15; 黑图: 0; SIVA-RL 干净 — 接近正确 随机掩码: 20。 预测。在干净图像上为 9。 保存的回复摘录。在 Patch- 保存的回复摘录。模型枚举了类似车辆的物体,但双重计数或过度分离视觉上相似的实例,导致多出一个物品。 Swap 和随机掩码下,模型退回到通用的物品计数策略,并对碎片化或重复的视觉证据进行过度计数。
解释
此失败案例标志着当前方法的边界。SIVA-RL 改善了策略对视觉证据的反应能力,但不能保证在具有重叠、视觉上相似实例的密集场景中实现完美的物体个体化。干净图像的预测本身就是错误的,且所有三种扰动视图仍然错误,因此该示例为敏感性或不变性提供的可靠正监督信号很少。此类持续错误的案例激发了对更强物体级计数监督或区域级信用分配的需求,以超越当前基于答案的成对结果信号。
图 11:密集多实例计数中的残差失败。即使在 SIVA-RL 之后,模型仍可能在干净图像上过度计数相似物体,并在局部或全局视觉扰动下变得更加不稳定。
27