TRAPSBench:视觉语言模型内部编码但无法表达认知克制

快速导读:TRAPSBench 通过 1,404 对匹配的 MuJoCo 物理视频对证明:VLM 内部能编码可回答性信号(跨域 AUROC 最高 0.91),但自发弃答率极低(最佳 PECS 仅 0.292),瓶颈在表达而非感知。

TRAPSBench 是首个专门评估视觉语言模型(VLM)在视频物理推理中认知克制能力的基准。它通过 MuJoCo 程序化生成 1,404 对匹配的 control/void 视频对,覆盖遮挡、混沌敏感性、病态问题三类不确定性场景,要求模型在证据充分时作答、证据不足时弃答。论文的核心发现是:VLM 内部表征确实编码了可回答性信号,但输出端存在强烈的弃答抑制,导致自发弃答率极低。

这一发现将研究焦点从'模型是否知道'转向'模型是否愿意承认自己不知道'。论文通过线性探针、激活引导、提示门控分析等机制实验,系统性地揭示了表征与输出之间的鸿沟,并提出了 PECS(Penalized Epistemic Calibration Score)作为统一的评估指标。

英文题目:TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

论文出处:arXiv 每日论文精选 · arXiv:2608.13167

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有物理推理基准如 CLEVRER、IntPhys、PhysBench 只评估预测正确性,不评估证据不足时的选择性弃答。这些基准隐含假设每个问题都有确定答案,因此无法区分'模型答对了'和'模型在不可回答问题上强行作答'。

单图像弃答工作如 CertainlyUncertain、UNK-VQA、VisionTrap 等虽然开始关注弃答行为,但依赖语义篡改生成不可回答样本,且通常需要 logit 访问来评估校准。这些方法无法直接扩展到视频领域,也无法支持黑盒 API 模型的评估。

TRAPSBench 填补了这一空白:它用 MuJoCo 程序化生成无编辑伪影的对比视频对,以纯文本评判支持黑盒 API 评估,并将弃答评估从单图像扩展到视频物理推理。

核心创新

  • TRAPSBench:程序化生成的 1,404 对匹配物理视频基准,覆盖遮挡、混沌、病态问题三类不确定性,无编辑伪影且自标注
  • PECS 指标:结合控制准确率与 Youden's J 的联合指标,同时归零 always-abstain 和 never-abstain 策略
  • 首次证明 VLM 存在表征-输出鸿沟:内部编码可回答性信号(跨域 AUROC 最高 0.91)但输出端抑制弃答
  • 首次将激活引导扩展到视觉认知不确定性,证明单层 void 方向可因果控制弃答行为
  • 发现文本不可能性比视觉信息缺口更易被检测(约 4×),且 CoT 推理对校准的影响因家族而异

方法概览

用 MuJoCo 生成 1,404 对匹配的 control/void 视频对,覆盖三类不确定性:遮挡(N=202)、混沌敏感性(N=500,截断在结果揭晓前)、病态问题(文本侧基线)。提出 PECS = Acc × max(0, AbsRec − FalseAbs),以 Youden's J 惩罚无差别弃答。评估 16 个 VLM(5 个家族)在 Standard/Guided/JSON 三种提示下表现;用线性探针(LR probe)和激活引导(activation steering)做机制分析。

  • 数据生成:使用 MuJoCo 物理引擎生成 1,404 对匹配的 control/void 视频对。Occlusion 场景(N=202)用不透明墙遮挡结果;Chaotic 场景(N=500)在结果揭晓前截断视频,利用混沌系统对初始条件的极端敏感性使点预测不可能;Ill-Posed 场景(N=450)在文本侧引入假前提或不可观测细节。
  • PECS 指标:PECS = Acc × max(0, AbsRec − FalseAbs),其中 Acc 是 control 视频上的准确率,AbsRec 是 void 视频上的弃答召回率,FalseAbs 是 control 视频上的错误弃答率。max(0, ·) 项即 Youden's J,用于惩罚无差别弃答。该指标同时归零 always-abstain 和 never-abstain 策略。
  • 评估协议:16 个 VLM(5 个家族)在 Standard、Guided、JSON 三种提示机制下评估,约 194,000 个评估对,超过 387,000 次 VLM 调用。三模型裁判组(Gemini 3 Flash、Qwen3-VL Instruct、Claude 4.6 Opus)多数投票,Fleiss' κ ≥ 0.84。
  • 机制分析:线性探针(LR probe)在 Qwen3-VL-8B 全 37 层隐藏态上训练逻辑回归,跨数据集迁移测试可回答性信号的泛化性。Cf→Cf 限制(仅在混淆样本上训练和测试)用于排除行为混淆。
  • 激活引导:在层 20(Qwen)/35(Gemma)/28(LLaVA)注入 void 方向(void 与 control 隐藏态均值差归一化向量),α ∈ {0,2,5,10},测试因果控制弃答行为的可能性。
  • 跨架构复现:Gemma 4 E4B 与 LLaVA-NeXT-Video-7B 端到端复现探针与引导结果,验证发现的架构泛化性。
  • 混淆分类学:约 100 个 void 失败样本/模型,标注 hallucinated premise(HP)、invalid inference(II)、epistemic surrender(ES)三类混淆模式,并分析推理轨迹中的 doubt 表达。

逐图理解论文

具体失败案例

具体失败案例
Figure 1: TRAPSBench: answer when evidence is sufficient, abstain when it is not (worked example, seesaw sorter). Top (control): the judge scores the response against the deterministic MuJoCo ground truth. Bottom (void): the video is truncated before the outcome resolves; correct behavior is abstention. A high PECS requires both.

图 1 展示了 TRAPSBench 的核心设计:control 视频有确定答案,void 视频被截断或遮挡,正确行为是弃答。注意 PECS 要求同时满足 control 准确率和 void 弃答率,单一维度的高分不足以获得高 PECS。

研究空白与核心区分

研究空白与核心区分
Figure 2: Six released TRAPSBench pairs with their verbatim questions and ground truths; panel labels name the release scenario (and instance). Top (Occlusion, N=202): an opaque wall blocks the outcome. Bottom (Chaotic, N=500): the video is truncated before the outcome resolves. Control (left) is judged against the MuJoCo ground truth; void (right) should abstain.

图 2 展示了六对发布的 TRAPSBench 样本,包括遮挡和混沌两类场景。注意 control 和 void 视频在视觉上高度相似,仅在关键信息是否可见上存在差异,这排除了编辑伪影的干扰。

表征-输出鸿沟的证明

表征-输出鸿沟的证明
Table 3: LR probe cross-dataset transfer at the best layer per pair, all three families (Cf = Cf→Cf, restricted to confabulated samples; chaotic-split Cf values from the original evaluation, Appendix P).

论文用线性探针和激活引导证明了这个鸿沟。在 Qwen3-VL-8B 的隐藏态上训练逻辑回归,跨数据集迁移的 AUROC 最高达到零点九一,说明内部表征确实编码了可回答性信号。但激活引导实验揭示了输出端的单向抑制:在标准提示下,向隐藏态注入 void 方向几乎不改变弃答率;切换到 Guided 提示后,同样的注入使弃答率从百分之十一跃升到百分之五十四。这说明瓶颈不在感知,而在输出端的提示门控。

最强结论

最强结论
Figure 3: (a) Control accuracy vs. epistemic discrimination J, with iso-PECS contours. Guided prompting (hollow →filled) moves models rightward, yet none reaches the 0.6 contour: the empty upper-right is headroom, not a trade-off (dashed: guided Pareto frontier; Appendix M). (b) All sixteen models lie above the identity line: textual impossibility is detected more readily than visual gaps (3−25× on the chaotic splits, main-family video- native; Table 2).

图 3a 的 iso-PECS 等高线图显示所有模型都位于右上角空白区域之外,说明高 PECS 是 headroom 而非 trade-off。图 3b 显示所有模型都在 identity line 之上,证明文本不可能性比视觉缺口更易被检测。

实验如何设计?

  • 16 个 VLM 覆盖 5 个家族(Gemini、Qwen、GPT、Gemma、LLaVA),包含 Think/No-Think 变体,在 Standard、Guided、JSON 三种提示机制下评估。
  • 三模型裁判组多数投票判定 void 弃答、control 弃答、正确性三个任务,Fleiss' κ 范围 0.84–0.99,一致同意率 88.3–99.5%。
  • 线性探针跨数据集迁移:12 条迁移路径(如 oc→ch、ch→oc、oc→ocip 等),含 confabulated-only(Cf→Cf)限制。
  • 激活引导:8 条源-目标路径,N=50 对/格,α ∈ {0,2,5,10},在 Standard 和 Guided 两种提示下测试。
  • 混淆分类学:约 100 个 void 失败样本/模型,标注 HP/II/ES 及推理轨迹中的 doubt 表达。

关键结果与论文证据

  • 最佳 Standard PECS 仅 0.292(Gemini 2.5 Flash),最佳 Guided PECS 0.568(Gemini 3.1 Pro R-Low),远未达到可靠部署水平(第 5 页)。
  • Guided 提示使 AbsRec 提升 1.4–2.8×(中位 1.9×),准确率变化仅 ±2pp,说明提示门控是低成本高收益的干预手段(第 6 页)。
  • 文本不可能性检测比视觉缺口高 3–25×(主家族视频原生模型,混沌切分),图像模型最高 197×,揭示视觉信息缺口是更隐蔽的盲区(第 6 页)。
  • 线性探针跨数据集 AUROC 最高 0.91(Qwen3-VL-8B,oc→ch ip);Gemma 最高 0.993;LLaVA 最高 1.000,证明内部表征确实编码可回答性信号(第 8 页)。
  • Cf→Cf 限制下探针 AUROC 与全样本基线差异 ≤0.03,排除探针仅学习行为混淆的可能(第 8 页)。
  • 激活引导:Qwen 标准推理下 +α 仅 0→1% 弃答,Guided 下 11→54%(约 40× 差异),证明输出端存在单向弃答抑制(第 8 页)。
  • Occlusion-family 方向跨域引导弃答 75% vs. ch-family 15%(α=10),说明遮挡类不确定性的方向几何更通用(第 8 页)。
  • 87–99% 的混淆为幻觉前提(HP);Qwen3-VL Think 怀疑率最高(24%)但转化最少,说明表达怀疑不等于转化为弃答(第 7 页)。

阅读时需要注意

  • 机制分析仅覆盖三个开源家族(Qwen3-VL-8B、Gemma 4 E4B、LLaVA-NeXT-Video-7B),闭源模型无法探针,表征-输出鸿沟的普遍性有待验证。
  • 提示门控与方向几何是家族特异的,不能泛化到所有架构。
  • 程序化 MuJoCo 场景是简化测试,与真实世界视频存在 sim-to-real 差距。
  • API 模型标识符为未固定别名,评估期间端点侧模型演化无法排除。
  • 最佳层选择在探针迁移中使用了目标数据集标签(仅层选择,非训练),可能引入轻微乐观偏差。

关联工作

  • CLEVRER(Yi et al., 2020)是视频物理推理的经典基准,但不评估证据不足时的弃答。IntPhys(Riochet et al., 2018)和 PhysBench(Chow et al., 2025)同样预设确定性答案。
  • AbstentionBench(Kirichenko et al., 2025)在 NLP 领域提出弃答检测协议,本文改编其协议用于视频领域。
  • CertainlyUncertain(Chandu et al., 2025)提出 CWA 指标但需 logit 访问;本文扩展到视频且纯文本评判,支持黑盒 API。
  • Arditi et al.(2024)的单方向调解拒绝行为是激活引导的理论基础;本文将其扩展到视觉认知不确定性。
  • Burns et al.(2023)和 Marks & Tegmark(2024)证明 LLM 内部编码真值;本文将此发现扩展到视觉不确定性领域。

发表评论