快速导读:当前研究存在一个关键区分:静态空间能力并不等同于动态空间时间推理。现有空间 MLLMs 在静态或室内环境中表现良好,但面对动态场景演变时却束手无策。ViSTR-Bench 填补了这一空白,专注于定性推理,而非数值准确性,从而揭示模型在连续视觉线索处理上的真实短板。
多模态大语言模型(MLLMs)在静态图像理解上已取得显著进展,但在处理动态视频场景时,其空间时间推理能力仍远未成熟。ViSTR-Bench 的提出旨在填补这一空白,通过专注于定性推理而非定量预测,揭示模型在连续视觉线索处理上的根本缺陷。
该基准不仅评估模型对运动、空间和物理动态的理解,还通过系统性错误分析指出,当前模型缺乏将时间序列转化为因果推理的能力。研究表明,仅靠文本思维链无法弥补视觉感知的不足,而引入显式视觉证据则能显著提升性能。
英文题目:ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
论文出处:arXiv 每日论文精选 · arXiv:2607.20868
原始论文:PDF / 论文页面
对应视频标题:MLLMs 看不懂动态视频?ViSTR-Bench 揭示空间时间推理的真实短板|推荐指数:★★★★★
这篇论文解决什么问题?
现有视频基准多关注低级感知任务,如物体计数或动作分类,忽略了高层的空间时间推理。这些任务往往可以通过静态帧或简单的时间聚合来解决,无法真正测试模型对动态场景演变的理解。
此外,许多基准侧重于定量预测,如估计速度或距离,这混淆了数值准确性与真正的推理能力。在自动驾驶和机器人应用中,模型更需要定性判断,如‘车辆是否会碰撞’或‘物体是否稳定’,而非精确数值。
当前 MLLMs 在静态空间任务上表现良好,但这种能力并未迁移到动态场景。模型难以处理连续的时间线索,导致在涉及运动状态、相对位置和物理交互的任务中频繁出错。
因此,需要一个专门针对动态场景定性推理的基准,以诊断模型的具体弱点并指导未来研究。ViSTR-Bench 应运而生,旨在提供这样一个全面的评估框架。
核心创新
方法概览
当前研究存在一个关键区分:静态空间能力并不等同于动态空间时间推理。现有空间 MLLMs 在静态或室内环境中表现良好,但面对动态场景演变时却束手无策。ViSTR-Bench 填补了这一空白,专注于定性推理,而非数值准确性,从而揭示模型在连续视觉线索处理上的真实短板。
- ViSTR-Bench 包含 1,340 个视频问答对,涵盖四个维度:运动感知、空间关系、结果预测和物理动力学。每个问题均为二元选择,要求模型整合时间证据进行定性推理。
- 数据收集来自公共数据集和网络视频,经过严格预处理,包括事件定位、视觉提示和结果截断,确保每个样本包含充足的时间线索。
- 问答对生成采用二进制选择模板,并由人工质量控制,确保答案的客观性和无歧义性。这一过程避免了主观判断,提高了评估的可靠性。
- 评估框架不仅包括整体准确率,还细分到 15 个子任务,以便进行细致的错误分析。这种细粒度评估有助于识别模型在不同推理类型上的具体弱点。
- 研究还探讨了两种改进策略:输入中心增强(使用 VGGT-Ω 进行 3D 重建)和工具增强推理(使用 WAFT 提取光流)。这些方法旨在为模型提供更显式的视觉证据。
- 此外,论文分析了不同输入格式(如文本、最后一帧、乱序帧、有序帧、原始视频)对性能的影响,以评估模型对时间顺序的依赖程度。
- 思维链(CoT)提示策略也被广泛测试,包括零样本、自一致性、计划与解决以及手动 CoT。这些实验旨在探索文本推理在视觉 grounding 中的作用。
- 最后,研究对 600 个错误预测进行了分类,识别出主要错误类型,如运动状态错误、空间关系错误等,为后续改进提供方向。
逐图理解论文
直观失败案例

图 1 展示了 ViSTR-Bench 的动机示例和基准结果。左侧示例显示人类能轻松回答的问题,但 Claude 却出错,突显动态推理的难度。右侧雷达图显示当前 MLLMs 与人类性能的显著差距,强调基准的重要性。
研究差距

图 3 展示了 ViSTR-Bench 的统计信息,包括四个任务维度和 15 个子任务。这有助于理解基准的结构和覆盖范围,为后续分析提供背景。
核心贡献

图 5 展示了不同模型组在 15 个子任务上的雷达比较。专有模型、开源模型和专门空间模型的表现差异清晰可见,人类性能作为参考,突显当前模型的不足。
最强结论

图 7 展示了模型改进的初步探索。左侧显示使用 VGGT-Ω 进行 3D 重建后的辅助视图,右侧显示使用 WAFT 提取的光流图。这些显式视觉证据显著提升了模型在 Ego Motion 和 Interaction Direction 任务上的准确率。
实验如何设计?
- 评估对象包括专有模型(如 GPT-5.4、Gemini、Claude)、开源模型(如 LLaVA、Qwen、InternVL)以及专门的空间 MLLMs(如 GeoThinker)。
- 实验在 ViSTR-Bench 的 1,340 个视频问答对上进行,涵盖 15 个子任务,确保评估的全面性和代表性。
- 输入格式包括文本、最后一帧、乱序帧、有序帧和原始视频,以测试模型对不同时间线索的利用能力。
- 思维链提示策略包括零样本、自一致性、计划与解决和手动 CoT,以评估文本推理对视觉 grounding 的贡献。
- 改进策略包括使用 VGGT-Ω 进行 3D 重建和 WAFT 提取光流,以提供显式视觉证据。
- 错误分析基于 600 个错误预测,分类为运动状态、空间关系、结果预测和物理动力学错误。
关键结果与论文证据
- 人类准确率为 91.0%,而最佳 MLLM(GPT-5.4-thinking)仅为 62.0%,差距达 29.0 个百分点(第 6-7 页)。这表明当前模型在动态推理上远未成熟。
- 最佳开源模型(Qwen3.5-27B-thinking)准确率为 55.0%,最佳专门空间模型(GeoThinker-Qwen2.5VL-7B)为 52.8%,显示静态空间训练无法有效迁移到动态场景(第 7 页)。
- 手动 CoT 相比直接提示仅提升 1.6%(至 55.2%),表明纯文本推理对视觉 grounding 帮助有限(第 8 页)。
- 原始视频输入相比纯文本提升 6.6%,但有序帧仅略优于乱序帧,说明模型难以有效利用时间顺序(第 10 页)。
- 最常见错误类型为运动状态错误(27.5%),其次是空间关系错误(第 10 页)。这反映了模型在理解连续运动变化上的困难。
- 使用 VGGT-Ω 进行 3D 重建后,Ego Motion 任务准确率从 63.4% 提升至 80.2%(第 11 页)。这证明显式 3D 证据能显著改善空间理解。
- 使用 WAFT 提取光流后,Interaction Direction 任务准确率从 78.6% 提升至 83.9%(第 11 页)。这表明光流信息有助于理解物体交互。
- 模型在运动感知上表现较好,但在结果预测和物理动力学上表现较差,显示能力不平衡(第 7 页)。
阅读时需要注意
- 任务和数据覆盖范围有限,仅包含 15 个子任务,未涵盖所有形式的空间时间推理。
- 当前 MLLMs 在运动感知上表现较好,但在结果预测和物理动力学上表现较差,能力不平衡。
- 文本思维链提示仅提供适度改进,表明纯文本推理在视觉 grounding 上存在局限。
- 专门的空间 MLLMs 在动态推理任务上未显示明显优势,静态空间训练无法有效迁移。
- 内置思维模式并非对所有模型都有益,如 Claude-Opus-4.6 性能略有下降。
关联工作
- 现有视频基准多关注低级感知或静态场景,缺乏对高层空间时间推理的评估。ViSTR-Bench 填补了这一空白。
- 现有空间 MLLMs 主要关注静态或室内环境,缺乏对动态场景演变的建模能力。ViSTR-Bench 揭示了这一局限。
- OmniSpatial 启用了手动 CoT 提示策略,但 ViSTR-Bench 进一步证明了其局限性,并提出了更有效的视觉增强方法。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
1
ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang
Project Page Leaderboard Evaluation Code ViSTR-Bench
Abstract—Multimodal Large Language Models (MLLMs) have Think [12] also achieved gold-medal-level performance at the achieved remarkable success across diverse expert-level tasks, International Collegiate Programming Contest (ICPC) World but they still struggle with fundamental abilities that humans Finals, ranking second among 139 university teams. However, naturally develop through continuous observation of the real despite these expert-level capabilities, which typically require world, such as spatial perception and dynamic reasoning. Recent studies have recognized this gap and introduced dedicated bench- long-term specialized training for humans to acquire, MLLMs marks to evaluate the spatial-temporal capabilities of MLLMs. still struggle with fundamental abilities that humans naturally However, existing benchmarks mostly focus on static scenes or develop through continuous observation and interaction with require exact quantitative predictions, leaving intuitive reasoning the environment, including spatial perception, temporal aware- from temporal cues largely underexplored. In this paper, we ness, and dynamic reasoning, as illustrated in Figure 1a. These introduce the Visual Spatial-Temporal Reasoning Benchmark (ViSTR-Bench), a novel evaluation suite designed to systemat- spatial-temporal reasoning capabilities are indispensable for ically assess whether MLLMs can perform qualitative reasoning real-world applications such as autonomous driving [13]–[15],2026 from continuous visual cues in dynamic scenes. Guided by robotics [16], [17], and embodied AI [18], [19]. the principles of temporal emphasis, reasoning orientation, and While recent efforts have recognized this gap and intro-Jul qualitative evaluation, ViSTR-Bench establishes a comprehensive duced benchmarks to evaluate the visual spatial intelligence four-dimensional evaluations covering Motion Perception, Spatial Relations, Outcome Prediction, and Physical Dynamics. The of MLLMs, several critical limitations remain in current task23 benchmark comprises 15 distinct subtasks and 1,340 high-quality designs. First, existing evaluations [20]–[25] predominantly video question-answer pairs spanning diverse tabletop, indoor, focus on static spatial attributes, such as object scale and scene and outdoor scenarios. Extensive evaluations of a broad spec- geometry, while largely neglecting the modeling of continuous trum of state-of-the-art proprietary, open-source, and specialized temporal information. Second, although some benchmarks spatial MLLMs reveal that, despite their strong general video understanding capabilities, current models still face substantial incorporate dynamic scenes [26]–[33], their tasks are often bottlenecks in complex spatial-temporal reasoning and remain restricted to low-level perception, such as object counting or[cs.CV] far below human performance. trajectory tracking, falling short of high-level reasoning about Index Terms—Multimodal Large Language Models, Spatial- dynamic spatial relations and future outcomes. Third, many Temporal Reasoning, Video Question Answering tasks [27], [29], [30], [32] rely on quantitative evaluation, which may conflate numerical prediction accuracy with gen- uine spatial-temporal reasoning ability. I. INTRODUCTION To address these limitations, we introduce the Visual N recent years, the Multimodal Large Language Mod- Spatial-Temporal Reasoning Benchmark (ViSTR-Bench), de- els (MLLMs) have demonstrated remarkable proficiency I signed to systematically evaluate whether MLLMs can reason across diverse domains, ranging from complex analytical tasks from continuous visual cues in dynamic scenes. Guided by such as mathematical reasoning and programming [2]–[6] to three core principles, namely temporal emphasis, reasoning high-quality visual content generation [7]–[9]. For example, orientation, and qualitative evaluation, ViSTR-Bench is struc- GPT-5 Pro [10] achieved 88.4% accuracy on GPQA [11], tured around four task dimensions: (1) Motion Perception a PhD-level scientific reasoning benchmark on which hu- evaluates whether models can identify and compare object man experts attain only 65.0% accuracy. Gemini 2.5 Deep Han Li is with the School of Artificial Intelligence, Beihang University, ronmental distractors; (2) Spatial Relations requires modelsarXiv:2607.20868v1 Han Li is with the School of Artificial Intelligence, Beihang University, Beijing 100191, China, and also with the Zhongguancun Academy, Beijing to reason about evolving geometric relationships and spatial 100094, China. E-mail: lihan0620@buaa.edu.cn. constraints, such as observer-object relations under camera Si Liu, Longfei Xu, and Jiahui Fu are with the School of Artificial Intelligence, Beihang University, Beijing 100191, China. E-mails: {liusi, motion and collision-free passage feasibility; (3) Outcome xulongfei, jiahuifu}@buaa.edu.cn. Prediction assesses the ability to infer current motion states Zehao Huang and Naiyan Wang are in Beijing, China. E-mails: from historical cues and anticipate future outcomes before {zehaohuang18, winsty}@gmail.com. Dongxin Lyu and Yuliang Xiu are with the School of Engineering, they are directly observed; (4) Physical Dynamics focuses Westlake University, Hangzhou 310030, China. E-mails: {lyudongxin, xiuyu- on intrinsic physical properties, dependencies, and stability liang}@westlake.edu.cn. conditions that are ambiguous in static images but become Daxin Tian is with the School of Transportation Science and Engineering, Beihang University, Beijing 100191, China, and also with the Zhongguancun evident through dynamic interactions. Academy, Beijing 100094, China. E-mail: dtian@buaa.edu.cn. Specifically, ViSTR-Bench consists of 15 diverse subtasks
第 2 页
2
人类差距:36.0% : 这是一段驾驶视频。请根据车辆随时间的运动情况,判断哪辆车移动得更快:绿色框中的车辆还是蓝色框中的车辆。回答 Green 或 Blue。 : 蓝色框跟踪一辆较大的 SUV。绿色框跟踪其右侧的一辆较小轿车。在早期帧中……随着帧的推进……在后期帧中……因此,答案是 Green。 X
: 这是一段车辆和交通锥的视频。请预测车辆能否在不触碰任何锥体的情况下通过锥体限制区域。回答 Yes 或 No。 : 我可以跟踪 SUV 相对于两个交通锥的运动。在早期帧中……随着视频的进行……在最后一帧中……因此,答案是 Yes。 X (a) (b)
图 1. 动机示例和基准测试结果。(a) ViSTR-Bench 中的两个代表性示例,其中下划线选项表示正确答案。虽然这些问题对人类来说在视觉上很简单,但 Claude [1] 仍然产生错误答案,突显了从动态场景中的连续视觉线索进行推理的难度。(b) ViSTR-Bench 上的定量评估结果,显示当前的 MLLMs 在空间-时间推理性能方面仍远未达到人类水平。
以及 1,340 个视频问答对,涵盖桌面、室内和室外场景。数据收集自多个来源,包括公开数据集(例如 Ego4D [34]、ScanNet [35]、ScanNet++ [36]、ARKitScenes [37]、Waymo Open Dataset [38] 和 Motion-X [39])、网络视频(例如 YouTube)以及自行采集的录制视频。我们在一系列先进的 MLLMs 上进行了广泛的评估,包括专有通用 MLLMs(例如 GPT [40]、Gemini [41]、Claude [1]、Seed [42] 和 MiMo [43])、开源通用 MLLMs(例如 LLaVA [44]、Qwen [45]、InternVL [46] 和 GLM [47])以及专用空间 MLLMs(例如 VG-LLM [48]、Spatial-MLLM [49]、Spatial-SSRL [50] 和 GeoThinker [51])。如图 1b 所示,实验结果表明,尽管当前 MLLMs 在通用视频问答方面取得了令人印象深刻的进展,但在需要细微运动感知、复杂关系推理和时间线索建模的任务中,它们仍存在显著的瓶颈,与人类表现相比仍有相当大的差距。
我们的主要贡献总结如下:
• 我们引入了视觉空间-时间推理基准(ViSTR-Bench),以系统评估 MLLMs 是否能够从动态场景中的连续视觉线索进行定性空间-时间推理。
• 我们建立了一个涵盖运动感知、空间关系、结果预测和物理动力学的四维评估框架,并构建了一个包含 15 个多样化子任务和 1,340 个高质量视频问答对的基准,涵盖桌面、室内和室外场景。
• 我们在专有、开源和专用空间 MLLMs 上进行了广泛的评估,揭示了当前模型尽管在通用视频问答和静态空间推理方面取得了进展,但在动态物理场景的推理方面仍远远落后于人类表现。
• 我们提供了对基于文本的思维链(Chain-of-Thought, CoT)提示策略、视觉输入格式以及模型失败模式的系统性诊断分析,并通过初步研究表明,明确提供与任务相关的空间和运动证据可以显著提高所选推理任务的性能。
II. 相关工作
A. MLLMs 的视频基准
继 MLLMs 在静态图像任务中取得成功 [52]–[55] 之后,涌现出大量基准来评估其视频理解能力 [56]–[67]。然而,大多数基准仅将视频视为 2D 图像的时序序列,使得 3D 动态场景中的推理在很大程度上未被探索。为了解决这一问题,最近的研究评估了 MLLMs 的空间智能 [20]–[25],尽管它们主要关注物体大小和相对定位等静态属性。随后的时空基准 [26]–[33] 引入了动态评估,例如轨迹跟踪和速度估计。尽管取得了这些进展,现有基准主要评估低级感知而非高级推理,且其对定量预测的依赖往往将数值精度与真正的空间-时间推理能力混为一谈。
B. 具有空间智能的 MLLMs
虽然 MLLMs 表现出卓越的视觉理解能力 [1], [40], [41], [44], [46], [68]–[72],但将其物理基础建立在 3D 世界中仍然具有挑战性。这一差距激发了关于空间 MLLMs 的大量研究工作 [22], [48]–[51], [73]–[82]。Spatial-MLLM [49] 利用了一个空间
第 3 页
3
车辆运动 相对速度 旋转方向
问:这是一段驾驶视频。请判断 问:这是一段驾驶视频。请判断 问:这是一段人物旋转的视频。从 绿色框中的车辆在视频期间是否 哪辆车移动得更快:绿色框中的 俯视视角,判断 有细微运动。回答 车辆还是蓝色框中的车辆。 旋转是顺时针还是逆时针。 是或否。 回答绿色或蓝色。 回答顺时针或逆时针。
自我运动 通行可行性 交互方向
问:这是一段由室内移动 问:这是一段车辆与交通锥的视频。 问:这是一段人与杆互动的视频。 摄像机拍摄的视频。请判断 请预测车辆能否在不 请判断 钢琴相对于摄像机的最终位置。回答右前或左前。 碰到任何锥体的情况下通过锥体限制区域。回答是或否。 人相对于杆的运动方向。回答向上或向下。
篮球投篮 足球射门 高尔夫击球
问:这是一段足球任意球的视频。 问:这是一段高尔夫击球的视频。请 问:这是一段篮球投篮的视频。请 请根据球的轨迹预测球是否会进入 根据观察到的轨迹预测高尔夫球是否会进入 预测篮球是否会进入篮筐。 球门。回答是 球洞。回答 是或否。 或否。 是或否。
台球击球 游泳比赛 跌倒方向
问:这是一段打台球的视频。请 问:这是一段游泳比赛的视频。请 问:这是一段人物跌倒的视频。请 预测目标球是否会进入袋中, 确定第4泳道和第6泳道的游泳者中 判断 基于其当前轨迹。回答 谁先到达终点线。 人物的跌倒方向。回答 是或否。 回答4或6。 左或右。
叠叠乐 挑棍 绳结
问:这是一段叠叠乐游戏的视频。请 问:这是一段挑棍游戏的视频。请 问:这是一段绳结操作的视频。 预测当手试图拉出的积木被移除后, 请判断被指示的棍子 请判断绳结是否为滑结 塔是否会保持稳定。回答是或否。 在不碰到任何其他棍子的情况下能否被拿起。回答是或否。 (可以通过拉动一端解开)还是死结。回答滑结或死结。
图 2. ViSTR-Bench 中的代表性任务示例。下划线选项表示正确答案。每个任务都表述为一个定性二元选择题,要求模型聚合时间证据并对动态视觉场景进行推理。
使用几何先验初始化的编码器以捕获 3D 结构信息。Spatial-SSRL [50] 提出了一种新颖的自监督强化学习范式,旨在增强 LVLM 的空间理解能力。然而,这些方法在很大程度上局限于静态或室内环境,缺乏显式建模动态场景演化的能力。为了克服这一限制,最近的工作已将空间 MLLM 扩展到动态真实世界设置的 4D 推理 [83], [84]。例如,LLaVA-4D [83] 将 3D 空间坐标和时间线索整合到一个统一的空间-时间提示中,从而促进全面的动态场景理解。
III. VISTR-BENCH
在本节中,我们首先在 III-A 节中定义 ViSTR-Bench 的任务分类和推理目标,然后在 III-B 节中描述基准构建流程。
第 4 页
4
A. 任务定义
ViSTR-Bench 评估 MLLMs 是否能够从动态场景的连续视觉线索中进行推理。每个任务都要求模型聚合时间证据,并对运动状态、空间关系、未来结果或潜在物理属性做出定性判断。我们将 ViSTR-Bench 组织为四个互补的维度,即运动感知(Motion Perception)、空间关系(Spatial Relations)、结果预测(Outcome Prediction)和物理动力学(Physical Dynamics),共包含 15 个子任务。代表性任务示例如图 2 所示,基准统计数据总结于图 3。
运动感知。该维度评估 MLLMs 是否能够从连续的视觉观察中感知并比较物体的运动。核心挑战在于区分真正的物体运动与由相机移动、视角变化或环境干扰引起的表观视觉变化。车辆移动(Vehicle Movement)要求模型判断目标车辆随时间推移是否实际在移动。相对速度(Relative Velocity)要求模型从自我运动(Ego Motion)视角比较两辆车的速度。旋转方向(Rotation Direction)考察模型能否从不断变化的观察视角识别人物的旋转方向。这些任务测试基本的时序感知能力,仅凭单张静态帧无法可靠地解决这些问题。
空间关系。该维度侧重于对动态场景中不断演变的空间关系和几何约束进行推理。与静态空间理解不同,这些任务要求模型考虑相机运动、物体位置、场景布局以及随时间变化的空间间隙。自我运动(Ego Motion)要求模型在相机移动时推断观察相机与周围物体之间的空间关系。通道可行性(Passage Feasibility)要求模型判断车辆能否在不与障碍物碰撞的情况下通过受限通道。交互方向(Interaction Direction)考察模型能否根据两者之间不断演变的空间关系,推断人物相对于交互对象的运动方向。这些任务强调以观察者为中心的空间推理和约束感知的场景理解。
结果预测。该维度评估 MLLMs 是否能在直接观察到最终结果之前,根据历史运动线索推断未来结果。篮球投篮(Basketball Shot)、足球射门(Soccer Shot)、高尔夫球击球(Golf Shot)和台球击球(Billiards Shot)要求模型根据观察到的轨迹预测移动物体是否会到达目标。游泳比赛(Swimming Race)要求模型根据部分观察结果确定哪位游泳者会率先到达终点线。坠落方向(Fall Direction)考察模型能否在坠落发生前观察到的运动线索中,预判人物将倒下的方向。这些任务要求模型估计运动趋势、外推轨迹,并根据时间证据推理结果层面的后果。
B. 基准构建 物理动力学。该维度考察 MLLMs 是否能够根据动态交互揭示的潜在物理属性、依赖关系和稳定性条件进行推理。这些属性在静态图像中往往模棱两可,但随着物理过程的展开可以推断出来。积木稳定性(Jenga Stability)要求模型预测移除积木后塔楼是否保持稳定。竹签依赖(Mikado Dependency)要求模型推断移除目标竹签是否会因接触或支撑依赖关系而扰动其他竹签。绳结类型(Knot Type)要求模型从其形成或操作过程中识别绳结结构。这些任务超越了可见的运动,要求从时序动力学中推断隐藏的物理状态。
我们通过一个系统的多阶段流程构建 ViSTR-Bench,包括数据收集、视频预处理、问答(QA)对生成以及人工质量控制,如图 4 所示。该流程旨在确保
Motion Perception (25.4%) qualitative judgments about motion states, spatial relations, future outcomes, or latent physical properties. We organize ViSTR Spatial Relations (18.1%) ViSTR-Bench into four complementary dimensions, namely Bench Outcome Prediction (39.4%) Motion Perception, Spatial Relations, Outcome Prediction, Physical Dynamics (17.1%) and Physical Dynamics, which comprise 15 subtasks in total. Representative task examples are shown in Figure 2, and the benchmark statistics are summarized in Figure 3. Motion Perception. This dimension evaluates whether MLLMs can perceive and compare object motion from contin- uous visual observations. The core challenge is to distinguish Fig. 3. Benchmark statistics. ViSTR-Bench consists of four task dimensions and 15 subtasks. true object motion from apparent visual changes caused by camera movement, viewpoint variation, or environmental dis- tractors. Vehicle Movement asks models to determine whether TABLE I a target vehicle is actually moving over time. Relative Velocity TASK-LEVEL DATA SOURCE STATISTICS OF VISTR-BENCH. FOR EACH requires models to compare the speeds of two vehicles from SUBTASK, WE REPORT THE TOTAL NUMBER OF QA PAIRS AND THE NUMBER OF SAMPLES COLLECTED FROM PUBLIC DATASETS, CURATED an egocentric viewpoint. Rotation Direction examines whether WEB VIDEOS, AND SELF-COLLECTED RECORDINGS. models can identify a person’s direction of rotation from Task Total Public Web Collected varying viewing perspectives. These tasks test fundamental Motion Perception temporal perception abilities that cannot be reliably solved Vehicle Movement 112 112 0 0 from a single static frame. Relative Velocity 84 84 0 0 Spatial Relations. This dimension focuses on reasoning Rotation Direction 145 41 104 0 about evolving spatial relationships and geometric constraints Spatial Relations in dynamic scenes. Unlike static spatial understanding, these Ego Motion 131 131 0 0 tasks require models to account for camera motion, ob- Passage Feasibility 55 0 0 55 ject positions, scene layout, and spatial clearance over time. Interaction Direction 56 56 0 0 Ego Motion asks models to infer the spatial relationship Outcome Prediction between the observing camera and surrounding objects as Basketball Shot 124 124 0 0 Soccer Shot 158 0 158 0the camera moves. Passage Feasibility requires models to Golf Shot 53 0 53 0 determine whether a vehicle can pass through a constrained Billiards Shot 75 28 47 0 passage without colliding with obstacles. Interaction Direction Swimming Race 72 0 72 0 examines whether models can infer a person’s movement Fall Direction 46 8 38 0 direction relative to an interacted object from the evolving Physical Dynamics spatial relationship between them. These tasks emphasize Jenga Stability 117 0 0 117 observer-centric spatial reasoning and constraint-aware scene Mikado Dependency 83 0 0 83 understanding. Knot Type 29 0 23 6 Outcome Prediction. This dimension evaluates whether Total 1340 584 495 261 MLLMs can infer future outcomes from historical motion cues before the final outcomes are directly observed. Basketball Shot, Soccer Shot, Golf Shot, and Billiards Shot require models over time. Jenga Stability requires models to predict whether a to predict whether a moving object will reach a target based tower remains stable after block removal. Mikado Dependency on its observed trajectory. Swimming Race asks models to asks models to infer whether removing a target stick will determine which swimmer will reach the finish line first disturb other sticks due to contact or support dependencies. from partial observations. Fall Direction examines whether Knot Type requires models to identify the knot structure from models can anticipate the direction in which a person will its formation or manipulation process. These tasks go beyond fall from motion cues observed before the fall occurs. These visible motion and require inferring hidden physical states tasks require models to estimate motion trends, extrapolate from temporal dynamics. trajectories, and reason about outcome-level consequences from temporal evidence.
第 5 页
5
数据收集 视频预处理 问答对生成 人工质量控制
提示模板 检查清单
这是一个视频……目标物体是 可见性 充分性 {TARGET}……请确定…… 回答 {OPTION_A} 或 {OPTION_B}。 客观性 非平凡性
元信息 TARGET: 钢琴 满足。 不满足。 OPTION_A: 右前方 OPTION_B: 左前方 GT: 左前方 保留 丢弃
图 4. 基准构建流程。我们通过系统的多阶段流程构建 ViSTR-Bench,包括数据收集、视频预处理、问答对生成和人工质量控制。该流程确保每个样本包含足够的时序证据,支持高级推理,并具有明确的定性答案。
每个样本都需要时序证据,支持高级推理,并具有明确的定性答案。 供人类标注者做出自信的定性判断。总体而言,这些预处理步骤 数据收集。为了涵盖桌面、室内和室外环境中多样化的时空推理场景,我们从既定的公共数据集中收集视频,精选的网络视频以及自行采集的录像。具体而言,对于自动驾驶场景,我们从 Waymo Open Dataset [38] 中采样视频。对于室内空间推理,我们使用来自 ScanNet [35]、ScanNet++ [36] 和 ARKitScenes [37] 的第一人称视角视频。对于以人为中心的推理任务,我们选择来自 Motion-X [39] 的视频,该数据集提供了从不同视角捕捉的多样化人类动作。对于与体育相关的结果预测,我们从 Ego4D [34] 中提取相关片段,并进一步补充相应体育赛事的网络视频。对于难以从现有数据集中构建的专门任务,如通道可行性(Passage Feasibility)和桌面物理动力学(Physical Dynamics)任务,我们在受控的真实环境中进行特定任务的录制。表 I 总结了 ViSTR-Bench 的任务级数据来源统计。更多细节见附录 A。
视频预处理。原始视频 inherently 包含多个独立事件、无关的时序上下文以及可能将推理任务简化为简单识别的明确结果。为了系统地消除这些混淆因素并防止模型通过捷径学习,我们通过三阶段预处理流程处理所有收集的视频:(1) 事件定位。为了防止多事件纠缠并隔离特定的推理实例,我们将原始视频定位到离散的、事件级别的片段,并剥离无关的时序上下文。(2) 视觉提示。对于以物体为中心的任务,仅靠文本描述可能会引入指代歧义,尤其是在包含多个相似物体的杂乱场景中。为了明确地定位目标物体,我们在相应的视频帧上叠加视觉标记(例如边界框)。例如,在车辆移动和相对速度任务中,我们利用数据集标注来突出显示特定的车辆。(3) 结果截断。对于终端结果直接揭示答案的任务,我们在结果变得视觉上明确之前截断视频。我们不使用固定的截断比例,而是为每个片段手动确定一个实例特定的决策点,确保保留的片段包含足够的时序证据供人类标注者做出自信的定性判断。总体而言,这些预处理步骤标准化了视觉输入,并减轻了来自无关上下文、指代歧义和答案泄露帧的混淆因素。
问答对生成。我们将所有实例表述为使用特定任务模板的二选一问题。详细的提示模板见附录 B。虽然大多数子任务本质上遵循二选一格式,但那些答案空间更广泛的子任务,例如涉及包括左前方、右前方、左后方和右后方等方向的第一人称运动(Ego Motion)任务,都被转换以适配此框架。具体而言,我们将真实答案与从剩余有效选项中随机抽取的一个合理干扰项配对。为了减轻模型评估过程中的位置偏差,每道题的两个候选选项的顺序都会进行系统性的随机化。
人工质量控制。为了确保 ViSTR-Bench 的可靠性,专家标注者根据四个严格标准手动筛选所有候选问答对。具体而言,我们首先验证目标物体的可见性,确保它们可以根据文本描述或视觉提示被识别。然后,我们检查每个片段的时序充分性,确保其包含推理所需的充足视觉证据。此外,我们确保数据集的客观性,要求所有真实答案都是确定的,并与观察到的视觉事件完全一致。最后,我们通过丢弃那些可以从单个静态帧或常识语言先验中 trivially 回答的样本,强制执行严格的非平凡性标准。通过这一严格的审查流程,ViSTR-Bench 为连续的时空推理建立了可靠的评估基础。
发布与排行榜协议。发布时,我们将公开 ViSTR-Bench 的 50%(670 个问答对),并保留剩余的 50%(670 个问答对)作为私有保留集用于受控评估。我们将基于保留集维护一个排行榜,并定期更新新发布模型的结果。
IV. 在 ViSTR-Bench 上的评估
在本节中,我们在 ViSTR-Bench 上评估现有的 MLLMs。所有基准结果均使用完整的 1,340 个问答对集计算得出。我们首先描述评估设置
第 6 页
6
表 II ViSTR-Bench 上的主要结果。我们报告了分布在四个推理维度的 15 个子任务上的准确率 (%)。后缀 -thinking 表示模型是在启用其内置思维模式的情况下进行评估的。Avg. 表示所有问答对的总体平均准确率, Rank 表示在每个模型类别中的排名。每个模型组中的最佳和次佳结果分别用浅绿色和浅黄色高亮显示。
运动感知 空间关系 结果预测 物理动力学 方法 排名 平均 车辆 相对 旋转 自 行人 内部 基础 社交 高尔夫 双 游泳 掉落 积木 微观 绳结 运动 速度 方向 运 特征 方向 击球 击球 击球 击球 赛跑 方向 状态 依赖 类型
基线 随机水平 (随机) – 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 50.0 随机水平 (频率) – 57.9 64.3 59.5 53.1 53.4 65.5 83.9 57.3 52.5 54.7 53.3 50.0 58.7 65.0 54.2 58.6
专有通用 MLLMs GPT-5.4 5 56.1 66.1 67.9 57.9 63.4 67.3 78.6 42.7 53.2 45.3 52.0 51.4 52.2 46.2 45.8 69.0 GPT-5.4-thinking 1 62.0 57.1 75.0 76.6 75.6 58.2 87.5 46.8 51.3 54.7 58.7 50.0 56.5 67.5 47.0 72.4 Gemini-3-Flash-Preview 14 50.7 35.7 44.0 50.3 55.7 63.6 71.4 44.4 54.4 49.1 53.3 59.7 41.3 44.4 50.6 62.1 Gemini-3.1-Flash-Lite-Preview 11 52.6 45.5 50.0 51.7 62.6 63.6 66.1 53.2 46.8 49.1 36.0 59.7 43.5 60.7 44.6 65.5 Gemini-3.1-Pro-Preview 9 53.6 45.5 52.4 50.3 72.5 65.5 73.2 56.5 50.0 43.4 54.7 50.0 39.1 42.7 47.0 75.9 Claude-Sonnet-4.6 13 51.0 67.9 40.5 46.9 64.9 52.7 55.4 54.8 55.1 50.9 48.0 50.0 34.8 34.2 38.6 62.1 Claude-Sonnet-4.6-thinking 10 53.4 67.0 40.5 46.9 66.4 52.7 51.8 51.6 62.0 58.5 52.0 51.4 28.3 48.7 44.6 62.1 Claude-Opus-4.6 6 55.4 65.2 45.2 46.9 64.1 70.9 57.1 49.2 63.3 50.9 40.0 50.0 43.5 65.8 44.6 72.4 Claude-Opus-4.6-thinking 7 54.7 65.2 40.5 46.9 71.8 67.3 62.5 44.4 56.3 52.8 46.7 50.0 37.0 65.0 48.2 55.2 Seed-2.0-Lite 8 54.4 64.3 60.7 41.4 51.1 63.6 66.1 52.4 55.7 49.1 49.3 48.6 43.5 65.0 55.4 48.3 Seed-2.0-Lite-thinking 3 58.8 68.8 67.9 52.4 66.4 65.5 69.6 49.2 61.4 58.5 48.0 51.4 43.5 65.0 51.8 51.7 Seed-2.0-Pro 4 56.8 57.1 67.9 52.4 58.0 70.9 82.1 52.4 51.3 47.2 58.7 55.6 43.5 63.2 48.2 48.3 Seed-2.0-Pro-thinking 2 60.1 63.4 81.0 57.2 67.9 69.1 82.1 55.6 53.2 49.1 54.7 66.7 50.0 57.3 45.8 51.7 MiMo-V2.5 12 52.4 59.8 40.5 49.7 64.9 50.9 73.2 42.7 55.7 37.7 56.0 52.8 45.7 51.3 42.2 62.1 MiMo-V2.5-thinking 9 53.6 51.8 38.1 51.7 58.0 63.6 80.4 50.8 53.8 35.8 50.7 51.4 52.2 60.7 53.0 55.2
开源通用 MLLMs LLaVA-OneVision-1.5-4B 12 47.6 58.0 33.3 44.1 48.1 65.5 76.8 43.5 47.5 49.1 46.7 50.0 47.8 35.0 45.8 41.4 LLaVA-OneVision-1.5-8B 10 49.7 63.4 45.2 53.1 49.6 67.3 67.9 39.5 52.5 37.7 56.0 50.0 41.3 35.0 45.8 41.4 Qwen3.5-27B-thinking 1 55.0 60.7 50.0 51.0 62.6 65.5 76.8 59.7 55.1 49.1 49.3 58.3 39.1 47.9 44.6 51.7 Qwen3.5-35B-A3B-thinking 11 49.0 46.4 45.2 46.9 58.0 63.6 67.9 48.4 50.6 35.8 52.0 40.3 39.1 41.0 48.2 55.2 Qwen3.5-122B-A10B-thinking 3 53.4 53.6 50.0 50.3 61.8 67.3 82.1 48.4 50.0 39.6 56.0 43.1 39.1 55.6 48.2 72.4 Qwen3.5-397B-A17B-thinking 2 54.4 57.1 57.1 51.7 65.6 63.6 80.4 59.7 51.3 43.4 48.0 45.8 34.8 52.1 38.6 69.0 InternVL3.5-8B 7 50.9 59.8 57.1 51.0 62.6 67.3 66.1 44.4 47.5 43.4 53.3 47.2 34.8 35.0 45.8 51.7 InternVL3.5-14B 6 51.3 48.2 58.3 51.7 54.2 65.5 66.1 41.9 46.8 45.3 52.0 58.3 58.7 40.2 57.8 41.4 InternVL3.5-38B 4 52.3 43.8 38.1 44.8 59.5 65.5 75.0 44.4 52.5 43.4 57.3 50.0 47.8 65.0 50.6 65.5 InternVL3.5-30B-A3B 8 50.1 50.9 56.0 49.0 54.2 67.3 78.6 43.5 48.7 32.1 37.3 51.4 60.9 39.3 56.6 37.9 InternVL3.5-241B-A28B 3 53.4 65.2 46.4 42.8 66.4 69.1 76.8 45.2 46.8 49.1 53.3 47.2 41.3 55.6 49.4 62.1 Intern-S1-thinking 5 51.7 48.2 57.1 53.1 60.3 58.2 71.4 48.4 47.5 35.8 56.0 48.6 45.7 47.9 45.8 58.6 Intern-S1-Pro-thinking 10 49.7 53.6 40.5 48.3 63.4 56.4 73.2 41.9 47.5 58.5 45.3 41.7 37.0 48.7 42.2 55.2 GLM-4.6V-thinking 9 49.9 58.0 41.7 46.9 61.8 52.7 78.6 42.7 47.5 39.6 46.7 52.8 47.8 35.9 49.4 65.5
专用空间 MLLMs SpaceR-SFT-7B 2 51.6 47.3 58.3 46.2 61.1 65.5 76.8 42.7 55.7 54.7 52.0 47.2 43.5 35.0 54.2 51.7 VG-LLM-4B 7 48.2 50.0 48.8 50.3 42.0 65.5 83.9 42.7 47.5 60.4 52.0 45.8 41.3 35.0 54.2 3.4 VG-LLM-8B 9 47.6 36.6 47.6 53.1 35.1 63.6 82.1 46.0 48.1 52.8 54.7 50.0 37.0 35.0 45.8 65.5 Spatial-MLLM-135K-4B 10 47.3 42.0 50.0 46.9 57.3 34.5 75.0 41.9 43.7 50.9 46.7 51.4 47.8 35.0 47.0 65.5 Spatial-MLLM-820K-4B 3 51.3 64.3 59.5 46.9 47.3 58.2 76.8 42.7 47.5 54.7 46.7 51.4 58.7 35.0 53.0 69.0 SpatialLadder-3B 8 47.8 42.9 63.1 47.6 42.0 61.8 48.2 45.2 51.9 47.2 49.3 51.4 43.5 35.0 54.2 41.4 Spatial-SSRL-7B 5 50.3 46.4 52.4 39.3 58.8 65.5 78.6 43.5 54.4 43.4 49.3 48.6 52.2 35.0 54.2 65.5 VST-7B-RL 6 49.4 64.3 51.2 42.8 44.3 65.5 48.2 42.7 49.4 58.5 42.7 50.0 56.5 40.2 56.6 48.3 GeoThinker-Qwen2.5VL-7B 1 52.8 64.3 41.7 46.2 42.7 65.5 80.4 41.1 47.5 56.6 46.7 50.0 63.0 65.0 54.2 69.0 GeoThinker-Qwen3VL-8B 4 50.5 64.3 59.5 46.2 39.7 65.5 67.9 42.7 47.5 54.7 46.7 50.0 67.4 35.0 49.4 72.4
人类评估 人类 – 91.0 90.6 97.0 100.0 99.6 85.5 100.0 81.5 82.9 87.7 77.3 84.7 100.0 94.4 98.8 77.6
第 IV-A 节并展示第 IV-B 节中的主要结果。然后我们 和时空推理 能力。第二,我们评估 研究基于文本的 CoT 提示的影响在第 IV-C 节中 开源通用 MLLMs,包括 LLaVA- 并分析不同视觉输入格式的影响在第 OneVision-1.5 [44]、Qwen3.5 [45]、InternVL3.5 [46]、Intern- 第 IV-D 节中。我们进一步在第 IV-E 节中呈现错误分析,并在 S1 [85], [86] 和 GLM-4.6V [47]。对于开源模型 第 IV-F 节中展示模型改进策略的初步探索。定性可视化见附录 C。 支持思维模式的模型,我们默认启用思维模式。第三,我们包括专门的 空间 MLLMs 这些模型是专门设计用于增强空间智能的, A. 评估设置 包括 SpaceR [22]、VG-LLM [48]、Spatial-MLLM [49]、 评估模型。我们在 ViSTR-Bench 上评估了广泛现有的 SpatialLadder [76]、Spatial-SSRL [50]、VST [79] 和 Geo- MLLMs,分为三类。 Thinker [51]。由于 ViSTR-Bench 专注于视觉空间- 首先,我们考虑专有通用 MLLMs,包 时间推理来自视频,我们只包括那些 括 GPT-5.4 [40]、Gemini-3/3.1 [41]、Claude-4.6 [1]、 仅使用视觉输入和文本提示操作的模型,而不 Seed-2.0 [42] 和 MiMo-V2.5 [43] 系列。对于具有 需要额外的真实 3D 信息,如深度 可控思维模式的模型,我们报告标准和思维变体的结果,以检查启用 图、相机姿态或点云。 内置思维是否能提高他们的多步规划 输入协议。对于原生支持视频 能力。 输入,如 Gemini-3/3.1 [41]、Seed-2.0 [42]、MiMo-
第 7 页
7
图 5. 模型组间的雷达图对比。我们展示了专有通用多模态大语言模型(MLLMs)、开源通用多模态大语言模型以及专用空间多模态大语言模型在 ViSTR-Bench 的 15 个子任务中的代表性模型。人类表现作为参考展示,突显了当前多模态大语言模型与人类水平空间-时间推理能力之间的巨大差距。
V2.5 [43]、Qwen3.5 [45] 和 GLM-4.6V [47],我们直接提供原始视频片段。最大视频分辨率限制为 1920×1280,最大 Base64 编码视频大小设置为 10 MB。对于仅支持图像输入模型,如 GPT-5.4 [40]、Claude-4.6 [1]、Intern-S1 [85], [86] 和 InternVL3.5 [46],我们从每个视频中均匀采样 16 帧。该协议实现了基于视频和基于图像的多模态大语言模型的统一评估,同时保留了任务所需的时间线索。
评估指标。ViSTR-Bench 中的所有任务均表述为定性二元选择题。因此,我们使用准确率(%)作为主要评估指标。具体而言,我们报告每项任务的准确率以分析模型在不同推理能力上的表现,并以所有问答对的平均准确率作为主要汇总指标。
基线与人类评估。为了提供参考性能水平,我们包含了两个随机水平基线。随机水平(Chance Level (Random))对应于在每个问题的候选答案中随机选择一个选项。在我们的二元选择题设置下,这将在所有任务中产生 50% 的预期准确率。频率水平(Chance Level (Frequency))始终选择每个任务中出现频率最高的答案。该基线捕捉了潜在的数据集偏差,例如不平衡的答案分布。此外,我们进行了人类评估以估计人类在 ViSTR-Bench 上的表现水平。人类结果作为近似上限参考,表明了当前多模态大语言模型与人类视觉空间-时间推理之间的性能差距。
B. 主要结果
表 II 和图 5 报告了 ViSTR-Bench 上的综合评估结果。我们将主要观察结果总结如下。
当前多模态大语言模型距离人类水平的空间-时间推理仍有很大差距。现有多模态大语言模型表现出有限的性能,在 ViSTR-Bench 上的表现远低于人类水平。
专有通用多模态大语言模型整体表现最佳。在所有评估的模型组中,专有通用多模态大语言模型取得了最好的整体结果。GPT-5.4-thinking 和 Seed-2.0-Pro-thinking 分别排名第一和第二名,准确率分别为 62.0% 和 60.1%,其次是 Seed-2.0-Lite-thinking 的 58.8% 和 Seed-2.0-Pro 的 56.8%。相比之下,开源通用多模态大语言模型的表现普遍较差,大多数模型的准确率在 48.0% 到 55.0% 之间。表现最好的开源模型 Qwen3.5-27B-thinking 达到 55.0%,但仍落后于 GPT-5.4-thinking 7.0 个百分点。这些结果表明,专有模型在连续空间-时间推理方面目前具有明显优势,尽管所有模型组仍有巨大的改进空间。
空间多模态大语言模型在动态推理方面的泛化能力有限。虽然专用空间多模态大语言模型旨在增强空间智能,但它们在 ViSTR-Bench 上并未显示出明显的优势。该组中表现最好的模型 GeoThinker-Qwen2.5VL-7B 仅取得 52.8% 的整体准确率,接近随机水平,且低于许多通用多模态大语言模型。此外,我们观察到几个专用空间多模态大语言模型在某些任务上表现出偏向单一选项的预测模式。因此,它们的性能往往与频率水平(Chance Level (Frequency))或其互补水平相当。
第 8 页
值。这表明从静态或几何中心训练数据集中学习到的空间能力并不能直接迁移到动态时空推理中。ViSTR-Bench 要求模型聚合时间证据、跟踪状态变化,并对未来结果或物理相互作用进行推理,而这些能力是当前空间多模态大语言模型(Spatial MLLMs)捕捉较弱的方面。
思考模式有帮助,但并不可靠。对于支持内置思考模式的模型,启用思考通常会提高整体性能。例如,GPT-5.4 从 56.1% 提升至 62.0%,Seed-2.0-Pro 从 56.8% 提升至 60.1%。然而,这种提升并非普遍存在。Claude-Opus-4.6 在启用思考后略有下降,从 55.4% 降至 54.7%,而 MiMo-V2.5 的收益也很微小。这表明显式推理机制有助于时空推理,但当前的思考模式在不同模型中并不总是有益的。
不同推理维度的性能差异显著。模型在运动感知(Motion Perception)和空间关系(Spatial Relations)方面通常表现更好,其中几个顶级模型在单个子任务上的准确率超过 65%。相比之下,结果预测(Outcome Prediction)和物理动力学(Physical Dynamics)仍然更具挑战性,许多结果接近随机水平。这些任务需要预测未来结果或推理潜在的物理依赖关系,而不仅仅是识别可见的运动或空间关系。这种能力不平衡表明,当前的多模态大语言模型更擅长描述观察到的动态,而不擅长进行基于时间的预测和直观的物理推理。
C. 基于文本的思维链提示的影响
我们进一步研究显式的基于文本的思维链(Chain-of-Thought, CoT)提示是否能增强 ViSTR-Bench 上的时空推理。以 Gemini-3.1-Pro-Preview 作为代表性的基于视频的多模态大语言模型,我们将四种基于文本的 CoT 提示策略与直接提示(Direct Prompting)进行比较,即零样本思维链(Zero-shot CoT)[87]、自洽性(Self-Consistency)[88]、规划与求解(Plan-and-Solve)[89],以及受 OmniSpatial [20] 启发的手动思维链(Manual CoT)。具体而言,零样本思维链附加了一个通用的逐步推理指令,而没有针对特定任务的设计。自洽性通过在五次独立试验中运行零样本思维链提示来采样多个推理路径,并通过多数投票聚合最终预测。规划与求解指示模型首先制定推理计划,然后执行该计划以解决问题。手动思维链将每个任务分解为人工制作的、针对特定任务的步骤,这些步骤是根据其底层时空推理需求量身定制的。手动思维链的详细提示模板见附录 B。
如表 III 所示,基于文本的思维链提示在 ViSTR-Bench 上仅带来有限的改进。与直接提示相比,零样本思维链将整体准确率从 53.6% 略微提升至 54.5%,这表明仅仅诱发通用的逐步推理可以提供一些益处,但对于复杂的基于视频的时空推理来说仍然不足。自洽性和规划与求解分别将整体准确率相对于直接提示提高了 1.0% 和 1.3%。这表明聚合多个推理路径或施加更结构化的推理过程可以在一定程度上帮助模型,但收益
第 9 页
9
: 你是体育视频分析和基于轨迹的运动预测专家。我将为你提供一段台球视频… : 你是体育视频分析和基于轨迹的运动预测专家。我将为你提供一段高尔夫击球视频…
: <thinking> 1. 目标识别:球员正在瞄准白球击打黑8号球。目标袋口似乎是球桌左侧的侧袋(从击球后的摄像机视角来看)。2. 运动方向分析:球员击打母球,母球随后击中8号球。8号球沿直线轨迹运动,直接朝向预期的侧袋。速度适中,适合干净利落地进球。3. 结果预测:8号球的轨迹与侧袋中心完美对齐。路径上没有障碍物,且速度适宜。基于其在视频结束前一直运动到袋口边缘的情况,可以明显看出球会进袋。 </thinking> 〈answer〉是 〈/answer〉 (a) 目标识别错误
: 你是驾驶视频分析和细微运动检测专家。我将为你提供一段驾驶视频… : 你是体育视频分析和物理轨迹预测专家。我将为你提供一段篮球投篮视频。你的任务是预测篮球是否会进入篮筐… : <thinking> 1. 目标识别:绿色方框中的车辆是一辆深色汽车,在右侧车道行驶,距离自车较近。蓝色方框中的车辆是一辆浅色SUV,在左侧车道行驶,位于绿色汽车前方较远处。2. 运动分析:通过观察从头到尾的视频,我们可以看到两辆车的相对距离。起初,绿色汽车和蓝色SUV之间的距离相对较小。随着视频的进行,蓝色SUV明显拉开了与绿色汽车的距离,增加了它们之间的间隙。3. 速度比较:由于两车之间的距离在增加,且蓝色车辆随着时间的推移在绿色车辆前方移动得更远,很明显蓝色方框中的车辆速度高于绿色方框中的车辆。 </thinking> 〈answer〉蓝色 〈/answer〉 (c) 运动状态错误
: 你是驾驶场景分析和车辆-障碍物间隙推理专家。我将为你提供一段显示车辆在交通锥附近行驶的视频。你的任务是预测车辆能否在不碰到任何锥体的情况下完成当前的驾驶操作… : 你是物理推理和绳结行为分析专家。我将为你提供一段绳结操作视频。你的任务是确定该绳结是活结还是固定结… : <thinking> 1. 结构观察:视频中,一根绳子穿过金属栏杆。然后,此人通过将绳子一端形成一个环(bight,即折叠的环),并将另一端穿过由另一端形成的环来打结。 resulting 绳结有一个明显的突出环和一个悬挂的自由尾端。这表明是滑动结构。2. 拉动行为分析:在视频末尾,此人抓住连接到突出环的绳子自由尾端。当他们拉动这个单独的尾端时,环被拉回绳结结构中。一旦环完全拉过,整个绳结失去其结合摩擦力并瞬间散开。3. 绳结类型判定:由于拉动绳子的特定一端(滑动环的尾部)会导致绳结完全释放并散开,这完全符合活结的定义。 </thinking> 〈answer〉活结 〈/answer〉 : <thinking> 1. 锥体布局分析:地面上放置了两个交通锥,一个在左侧,一个在右侧,形成了一条清晰定义的狭窄通道供车辆通过。2. 车辆运动分析:一辆灰色SUV正直线向前行驶,接近由两个锥体形成的通道。车辆与锥体间隙的中心对齐良好,并以缓慢、稳定的速度移动,没有任何显著的转向偏差。3. 间隙预测:当车辆进入锥体之间的空间时,它保持居中。车辆侧面与左侧和右侧锥体之间均有可见的间隙。车辆的直线轨迹和居中位置表明它将成功通过狭窄通道,而不会碰到任何一个锥体。 </thinking> 〈answer〉是 〈/answer〉 (e) 空间关系错误 (f) 物理交互错误
图 6. 每种主要错误类型的代表性示例。
保持适度。手动思维链(Manual CoT)实现了最佳的总体逐任务性能,比直接提示(Direct Prompting)提高了 1.6%,达到 55.2%。通过将每个任务分解为特定于任务的推理步骤,手动思维链为将文本推理锚定到相关视觉证据提供了更强的指导。然而,提升幅度仍然适中,且高度依赖于任务。
此外,即使是最优的思维链结果也接近随机水平基线,这表明仅靠基于文本的推理提示无法完全弥补当前多模态大语言模型(MLLMs)在准确视觉感知和时间锚定方面的局限性。
第 10 页
10
D. 视觉输入格式的影响
我们进一步研究了不同的视觉输入格式如何影响模型在 ViSTR-Bench 上的性能。以 Gemini-3.1-Pro-Preview 作为被评估模型,我们比较了五种输入设置:纯文本输入、仅最后一帧、时间顺序被打乱的乱序帧、从视频中均匀采样的有序帧,以及原始视频输入。如表 IV 所示,所有视觉输入格式的表现均一致优于纯文本设置,表明视觉证据提供了超越语言先验的有用线索。多帧输入带来了略微更大的提升,其中乱序帧和有序帧相比仅使用最后一帧的设置分别提升了 0.2% 和 0.3%,这表明模型可以从观察多个视觉状态中受益。然而,有序帧在整体准确率上仅略优于乱序帧,这表明模型并不能可靠地利用帧之间的连续时间顺序。这暗示当前的 MLLMs 可能从多帧中捕捉到了粗略的时间相关线索,但在推理连续视觉动态方面仍面临困难。
为了进一步验证这一观察结果,我们在“篮球投篮”(Basketball Shot)这一代表性结果预测任务上进行了小型诊断研究。具体而言,我们选取了 20 个样本,并重新编辑每个视频以保留完整的投篮过程,包括最终的投篮结果。然后,我们向人类和 Gemini-3.1-Pro-Preview 提供每个重新编辑视频的前 50%、75% 和 100% 内容,其中 100% 的设置包含最终投篮结果,因此不再需要预测。人类的准确率从 80% 单调增加到 90%,然后达到 100%,表明额外的时间证据具有信息量。相比之下,Gemini-3.1-Pro-Preview 分别获得了 50%、65% 和 60% 的准确率,这表明即使有更多视频内容可用,模型仍然无法可靠地利用揭示最终结果的时间线索。
原始视频输入取得了最佳性能,比纯文本设置提高了 6.6%。这些结果表明,视频输入提供了最完整的视觉证据,而从连续视觉线索中进行有效推理对于当前的 MLLMs 来说仍然具有挑战性。
E. 错误分析
为了更好地理解当前 MLLMs 在 ViSTR-Bench 上表现有限的原因,我们手动检查了在手动思维链(Manual CoT)设置下 Gemini-3.1-Pro-Preview 做出的 600 次错误预测。对于每种情况,我们根据任务定义、真实答案以及模型遵循手动 CoT 提示生成的推理步骤,分配一个主要错误类型。我们按照一般的推理过程组织这些失败案例:定位目标、跟踪其时间演变、估计运动或空间状态,最后得出结果层面或物理层面的结论。这导致了六种与任务无关的错误类型,代表性示例如图 6 所示。
表 V 主要错误类型的分布。我们分析了 Gemini-3.1-Pro-Preview [41] 在手动 CoT 设置下做出的 600 次错误预测。每次错误预测都被分配一个主要错误类型。
| 主要错误类型 | 错误数量 | 比例 | | :— | :— | :— | | 运动状态错误 (Motion State Error) | 165 | 27.5% | | 结果推理错误 (Outcome Reasoning Error) | 147 | 24.5% | | 目标跟踪错误 (Target Tracking Error) | 110 | 18.3% | | 物理交互错误 (Physical Interaction Error) | 95 | 15.8% | | 空间关系错误 (Spatial Relation Error) | 76 | 12.7% | | 目标识别错误 (Target Identification Error) | 7 | 1.2% | | 总计 | 600 | 100.0% |
目标识别错误(Target Identification Error)发生在模型在初始定位阶段失败,并识别出问题指定的错误目标时。典型情况包括混淆台球中的目标球、在游泳比赛中搞错泳道编号,或定位错误的积木块或木棒。
目标跟踪错误(Target Tracking Error)发生在目标已被识别之后,但模型无法在帧之间一致地跟踪它。例如,模型可能会丢失对移动球的跟踪,将其位置与附近的物体混淆,或者无法在连续观察中将同一目标关联起来。
运动状态错误(Motion State Error)指在估计目标基本运动属性时的失败。在这些情况下,模型观察到了相关物体,但误判了其是否正在移动、哪个物体更快,或者某人旋转的方向。
空间关系错误(Spatial Relation Error)捕捉到了关于目标、观察者和参考对象之间几何关系推理中的错误。代表性案例包括在自我运动(Ego Motion)中反转以观察者为中心的方向、误判车辆是否有足够的间隙通过受限区域,或者混淆人相对于交互对象的运动方向。
结果推理错误(Outcome Reasoning Error)发生在模型捕捉到了某些当前的运动或中间状态,但未能将其外推至正确的最终结果时。典型例子包括错误预测投篮是否会成功、哪位游泳者会先到达终点,或者某人最终倒下的方向。
物理交互错误(Physical Interaction Error)表示从动态证据中推断潜在物理属性、依赖关系或稳定性条件时的失败。例如,模型可能会误判一根木棒是否被另一根木棒阻挡,积木块是否承重,或者特定的绳结是否可以通过拉动一端解开。
表 V 报告了 resulting 分布。运动状态错误是最常见的类别,表明当前的 MLLMs 在确定提示对象是否移动以及比较或分类运动相关属性(如相对速度和旋转方向)方面仍然面临困难。结果推理错误是第二大类别,表明模型通常未能将观察到的运动或中间状态外推至正确的最终结果。目标跟踪错误排名第三,反映了在维持时间上一致的证据方面的失败,特别是在以球为中心的结果预测任务中。物理交互错误主要在积木稳定性(Jenga Stability)、木棒依赖关系(Mikado Dependency)和绳结类型(Knot Type)中观察到,显示出推断潜在支撑关系、物体依赖关系和稳定性条件的能力有限。空间关系错误主要出现在自我运动(Ego Motion)、通道可行性(Passage Feasibility)和交互方向(Interaction Direction)中。
第 11 页
11
(a) (b)
图 7. 模型改进的初步探索。我们考察了两种互补策略,以使与任务相关的视觉证据更加明确。 (a) 针对“自我运动”(Ego Motion)任务的输入中心增强,我们使用 VGGT-Ω[90] 重建场景并渲染辅助新视角,以提供明确的 3D 空间证据。(b) 针对“交互方向”(Interaction Direction)任务的工具增强推理,我们使用 WAFT [91] 提取光流线索,并遵循 Perception Program [92] 将其转换为紧凑的、符合语言习惯的摘要。第一行显示了来自原始视频的分帧样本,而第二行显示了 (a) 中的渲染新视角和 (b) 中的估计光流图。这些试点研究将 GPT-5.4 [40] 在“自我运动”任务上的准确率从 63.4% 提高到 80.2%,在“交互方向”任务上的准确率从 78.6% 提高到 83.9%。
错误,其中模型反转了以观察者为中心的方向,误判了空间间隙,或混淆了相对运动方向。相比之下,“目标识别错误”仅占 7 例,主要出现在台球场景中。总体而言,这些结果表明,当前 MLLMs 在 ViSTR-Bench 上的主要瓶颈并非简单地无法识别目标物体,而是无法跟踪动态证据、估计运动和空间状态、外推结果以及推理潜在的物理交互。
F. 模型改进的初步探索
我们使用 WAFT [91] 生成光流图,并遵循 Perception Program [92] 将工具输出转换为紧凑的、结构化的、符合语言习惯的摘要,以便 MLLMs 直接解析和推理。该流程将准确率从 78.6% 提高到 83.9%,表明明确的运动证据可以帮助模型更好地捕捉交互模式并推断相对运动方向。与其提供一个完整的解决方案,这些试点研究证明了使与任务相关的空间和运动证据更加明确,是提高当前 MLLMs 时空推理能力的一个有前景的方向。
错误分析显示,当前的 MLLMs 在从动态场景中的连续视觉线索进行推理方面仍然面临困难。基于这些观察,我们讨论了提高模型性能的几种互补方向。首先,数据中心方向是构建更大规模的训练数据,专门针对动态时空推理。尽管当前的 MLLMs 是在海量的图像-文本和视频-文本语料库上训练的,但现有数据集 [25], [72] 主要关注静态视觉识别或通用视频理解,并为细粒度的动态推理提供的监督有限。其次,输入中心方向是通过在原始相机轨迹之外提供更明确的空间证据来丰富视觉输入。例如,可以从重建的场景中渲染辅助新视角并添加到原始视频中,提供从捕获视角无法直接观察到的互补几何和布局线索。第三,工具增强方向是构建智能体系统,将复杂的视频推理问题分解为中间子问题,并使用外部工具提取与任务相关的视觉证据。例如,检测器和跟踪器可以定位目标物体,光流可以估计运动模式,3D 重建可以恢复场景几何。这种范式是有前景的,因为它将低级视觉感知卸载到专用工具上,使 MLLMs 能够更专注于高级时空推理。
图 7 说明了我们在相应视觉证据特别相关的两个任务上对其中两个方向的初步探索,其中 GPT-5.4 作为基线模型。对于输入中心方向,我们通过用明确的空间证据丰富原始视觉输入来研究“自我运动”任务。具体而言,我们使用 VGGT-Ω[90] 从原始视频中重建场景,并渲染 10 个辅助新视角,以提供超越采样帧的互补布局和视角线索。这种增强将准确率从 63.4% 提高到 80.2%,表明几何增强的输入可以使当前 MLLMs 更容易获取与任务相关的空间线索。对于工具增强方向,我们通过使用外部工具提取明确的运动证据来研究“交互方向”任务。
V. 结论与讨论
A. 结论
在本文中,我们介绍了 ViSTR-Bench,这是一个视觉时空推理基准,旨在评估 MLLMs 是否能够从动态场景中的连续视觉线索进行推理。与主要关注静态空间属性、低级时间感知或定量预测的先前基准不同,ViSTR-Bench 强调时间证据、面向推理的任务设计和定性评估。它涵盖了四个互补维度,包含 15 个子任务,以及跨桌面、室内和室外场景的 1,340 对高质量视频问答对。通过对专有、开源和专用空间 MLLMs 的综合评估,我们发现当前模型的表现仍远低于人类水平。我们希望 ViSTR-Bench 能作为
第 12 页
12
作为面向未来物理 grounded 多模态智能、具身智能和动态世界建模研究的诊断测试平台。
B. 局限性与未来工作
尽管 ViSTR-Bench 为视觉时空推理提供了诊断测试平台,但它也存在若干局限性,从而激发了未来的研究方向。
任务与数据覆盖范围。ViSTR-Bench 涵盖了桌面、室内和室外场景中的 15 个子任务,但并未旨在穷尽物理世界中所有形式的时空推理。当前的基准测试主要关注目标明确且决策为二元的较短片段。相比之下,许多现实世界的具身任务需要长视距规划、多智能体交互以及对持续变化目标的适应。未来的工作可以将 ViSTR-Bench 扩展到更广泛的场景类别、更长的时间上下文以及更具交互性的场景,从而在更接近机器人、自动驾驶和具身智能应用的环境中进行评估。
评估格式。ViSTR-Bench 中的所有任务均被表述为定性的二元选择题。这种设计减少了标注歧义,减轻了微小数值错误的影响,并使得不同 MLLMs 之间的比较更加可控。然而,二元准确率仅衡量最终决策,无法充分捕捉分级的时空理解能力或中间推理步骤的正确性。未来的基准测试可能会将定性决策与更丰富的答案格式相结合,例如开放式解释或对物体状态、空间关系和物理依赖关系的结构化标注。
模型改进。我们的实验和误差分析表明,当前的 MLLMs 主要在目标跟踪、结果外推、空间关系估计和潜在物理交互推理方面存在困难。第 IV-F 节中的初步探索表明,更丰富的空间证据可以提供有用的线索,但这仅仅是迈向改进动态场景推理的初步步骤。有前景的方向包括:为动态时空推理构建更大的训练语料库;集成外部感知工具,如物体跟踪器、光流估计器和 3D 重建模块;以及开发能够显式维护物体状态和物理关系随时间变化的世界建模机制。我们希望 ViSTR-Bench 不仅能作为评估基准,还能作为诊断资源,用于识别动态视觉推理中发展不足的组件,从而支持这些方向的研究。
参考文献
[1] Anthropic, “Anthropic Model System Cards,” https://www.anthropic.com/system-cards, 2026. [2] P. Lu, H. Bansal, T. Xia, J. Liu, C. Li, H. Hajishirzi, H. Cheng, K.-W. Chang, M. Galley, and J. Gao, “MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts,” in International Conference on Learning Representations, vol. 2024, 2024, pp. 23 439–23 554. [3] K. Wang, J. Pan, W. Shi, Z. Lu, H. Ren, A. Zhou, M. Zhan, and H. Li, “Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset,” Advances in Neural Information Processing Systems, vol. 37, pp. 95 095–95 169, 2024. [4] R. Zhang, D. Jiang, Y. Zhang, H. Lin, Z. Guo, P. Qiu, A. Zhou, P. Lu, K.-W. Chang, Y. Qiao et al., “MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?” in European Conference on Computer Vision, 2024, pp. 169–186. [5] K. Li, Y. Tian, Q. Hu, Z. Luo, Z. Huang, and J. Ma, “MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems,” in Findings of the Association for Computational Linguistics: EMNLP 2024, 2024, pp. 736–783. [6] C. Si, Y. Zhang, R. Li, Z. Yang, R. Liu, and D. Yang, “Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering,” in Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), 2025, pp. 3956–3974. [7] X. Wang, X. Zhang, Z. Luo, Q. Sun, Y. Cui, J. Wang, F. Zhang, Y. Wang, Z. Li, Q. Yu et al., “Emu3: Next-Token Prediction is All You Need,” arXiv preprint arXiv:2409.18869, 2024. [8] S. Wu, H. Fei, L. Qu, W. Ji, and T.-S. Chua, “NExT-GPT: Any-to-Any Multimodal LLM,” in Forty-first International Conference on Machine Learning, 2024. [9] K. Zheng, X. He, and X. E. Wang, “MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens,” arXiv preprint arXiv:2310.02239, 2023. [10] OpenAI, “Introducing GPT-5,” https://openai.com/index/introducing-gpt-5, 2025. [11] D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael, and S. R. Bowman, “GPQA: A Graduate-Level Google-Proof Q&A Benchmark,” arXiv preprint arXiv:2311.12022, 2023. [12] Google DeepMind, “Gemini Achieves Gold-Medal Level at the International Collegiate Programming Contest World Finals,” https://deepmind.google/blog/gemini-achieves-gold-medal-level-at-the-international-collegiate-programming-contest-world-finals, 2025. [13] H. Shao, Y. Hu, L. Wang, G. Song, S. L. Waslander, Y. Liu, and H. Li, “LMDrive: Closed-Loop End-to-End Driving with Large Language Models,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 15 120–15 130. [14] C. Sima, K. Renz, K. Chitta, L. Chen, H. Zhang, C. Xie, J. Beißwenger, P. Luo, A. Geiger, and H. Li, “DriveLM: Driving with Graph Visual Question Answering,” in European Conference on Computer Vision, 2024, pp. 256–274. [15] Z. Xu, Y. Zhang, E. Xie, Z. Zhao, Y. Guo, K.-Y. K. Wong, Z. Li, and H. Zhao, “DriveGPT4: Interpretable End-to-End Autonomous Driving Via Large Language Model,” IEEE Robotics and Automation Letters, vol. 9, no. 10, pp. 8186–8193, 2024. [16] M. J. Kim, K. Pertsch, S. Karamcheti, T. Xiao, A. Balakrishna, S. Nair, R. Rafailov, E. Foster, G. Lam, P. Sanketi et al., “OpenVLA: An Open-Source Vision-Language-Action Model,” arXiv preprint arXiv:2406.09246, 2024. [17] B. Zitkovich, T. Yu, S. Xu, P. Xu, T. Xiao, F. Xia, J. Wu, P. Wohlhart, S. Welker, A. Wahid et al., “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control,” in Conference on Robot Learning, 2023, pp. 2165–2183. [18] M. Ahn, A. Brohan, N. Brown, Y. Chebotar, O. Cortes, B. David, C. Finn, C. Fu, K. Gopalakrishnan, K. Hausman et al., “Do As I Can, Not As I Say: Grounding Language in Robotic Affordances,” arXiv preprint arXiv:2204.01691, 2022. [19] D. Driess, F. Xia, M. S. Sajjadi, C. Lynch, A. Chowdhery, B. Ichter, A. Wahid, J. Tompson, Q. Vuong, T. Yu et al., “PaLM-E: An Embodied Multimodal Language Model,” arXiv preprint arXiv:2303.03378, 2023. [20] M. Jia, Z. Qi, S. Zhang, W. Zhang, X. Yu, J. He, H. Wang, and L. Yi, “OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models,” arXiv preprint arXiv:2506.03135, 2025. [21] J. Lin, R. Xu, S. Zhu, S. Yang, P. Cao, Y. Ran, M. Hu, C. Zhu, Y. Xie, Y. Long et al., “MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence,” arXiv preprint arXiv:2512.10863, 2025. [22] K. Ouyang, Y. Liu, H. Wu, Y. Liu, H. Zhou, J. Zhou, F. Meng, and X. Sun, “SpaceR: Reinforcing MLLMs in Video Spatial Reasoning,” arXiv preprint arXiv:2504.01805, 2025. [23] J. Yang, S. Yang, A. W. Gupta, R. Han, L. Fei-Fei, and S. Xie, “Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025, pp. 10 632–10 643. [24] S. Yang, J. Yang, P. Huang, E. L. Brown II, Z. Yang, Y. Yu, S. Tong, Z. Zheng, Y. Xu, M. Wang et al., “Cambrian-S: Towards Spatial Supersensing in Video,” in The Fourteenth International Conference on Learning Representations, 2025.
第 13 页
13
[25] J. Zhang, Y. Chen, Y. Zhou, Y. Xu, Z. Huang, J. Mei, J. Chen, Y.-J. Yuan, X. Cai, G. Huang 等,“从平面到空间:教导视觉-语言模型在 3D 中感知和推理”,arXiv 预印本 arXiv:2503.22976,2025。 [26] Y. Huang, K. Wen, R. Gao, D. Liu, Y. Lou, J. Wu, J. Xu, J. Zhang, Z. Yang, Y. Lin 等,“在动力学中思考:多模态大语言模型如何感知、跟踪和推理物理 4D 世界中的动力学”,arXiv 预印本 arXiv:2603.12746,2026。 [27] Y. Li, Y. Zhang, T. Lin, X. Liu, W. Cai, Z. Liu, 和 B. Zhao,“STI-Bench:MLLMs 是否已准备好进行精确的时空世界理解?”在 IEEE/CVF 国际计算机视觉会议论文集,2025,第 5622–5632 页。 [28] J. Lin, C. Zhu, R. Xu, X. Mao, X. Liu, T. Wang, 和 J. Pang,“OST-Bench:评估 MLLMs 在在线时空场景理解中的能力”,arXiv 预印本 arXiv:2507.07984,2025。 [29] J. Shi, J. Wang, Z. You, B. He, 和 Z. Wu,“VideoLoom:用于联合时空理解的视频大语言模型”,arXiv 预印本 arXiv:2601.07290,2026。 [30] X. Yin, C. Li, J. Chang, C.-M. Pun, 和 X. Cun,“MLLM-4D:迈向基于视觉的时空智能”,arXiv 预印本 arXiv:2603.00515,2026。 [31] Z. Zhang, Z. Wang, G. Zhang, W. Dai, Y. Xia, Z. Yan, M. Hong, 和 Z. Zhao,“DSI-Bench:动态空间智能基准”,arXiv 预印本 arXiv:2510.18873,2025。 [32] S. Zhou, Y. Chen, Y. Ge, W. Huang, J. Lin, Y. Shan, 和 X. Qi,“在 4D 中推理:视觉语言模型的动态空间理解”,arXiv 预印本 arXiv:2512.20557,2025。 [33] S. Zhou, A. Vilesov, X. He, Z. Wan, S. Zhang, A. Nagachandra, D. Chang, D. Chen, X. E. Wang, 和 A. Kadambi,“VLM4D:迈向视觉语言模型的时空意识”,在 IEEE/CVF 国际计算机视觉会议论文集,2025,第 8600–8612 页。 [34] K. Grauman, A. Westbury, E. Byrne, Z. Chavis, A. Furnari, R. Girdhar, J. Hamburger, H. Jiang, M. Liu, X. Liu 等,“Ego4D:3000 小时第一人称视频中的世界之旅”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2022,第 18 995–19 012 页。 [35] A. Dai, A. X. Chang, M. Savva, M. Halber, T. Funkhouser, 和 M. Nießner,“ScanNet:室内场景的丰富标注 3D 重建”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2017,第 5828–5839 页。 [36] C. Yeshwanth, Y.-C. Liu, M. Nießner, 和 A. Dai,“ScanNet++:高保真室内场景数据集”,在 IEEE/CVF 国际计算机视觉会议论文集,2023,第 12–22 页。 [37] G. Baruch, Z. Chen, A. Dehghan, T. Dimry, Y. Feigin, P. Fu, T. Gebauer, B. Joffe, D. Kurz, A. Schwartz 等,“ARKitScenes:用于使用移动 RGB-D 数据进行 3D 室内场景理解的多样化真实世界数据集”,arXiv 预印本 arXiv:2111.08897,2021。 [38] P. Sun, H. Kretzschmar, X. Dotiwalla, A. Chouard, V. Patnaik, P. Tsui, J. Guo, Y. Zhou, Y. Chai, B. Caine 等,“自动驾驶感知中的可扩展性:Waymo 开放数据集”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2020,第 2446–2454 页。 [39] J. Lin, A. Zeng, S. Lu, Y. Cai, R. Zhang, H. Wang, 和 L. Zhang,“Motion-X:大规模 3D 表现力全身人体运动数据集”,神经信息处理系统进展,第 36 卷,第 25 268–25 280 页,2023。 [40] A. Singh, A. Fry, A. Perelman, A. Tart, A. Ganesh, A. El-Kishky, A. McLaughlin, A. Low, A. Ostrow, A. Ananthram 等,“OpenAI GPT-5 系统卡片”,arXiv 预印本 arXiv:2601.03267,2025。 [41] Google DeepMind,“Google DeepMind 模型卡片”,https://deepmind.google/models/model-cards,2026。 [42] ByteDance Seed Team,“Seed2.0 模型卡片:迈向现实世界复杂性的智能前沿”,https://seed.bytedance.com/en/seed2,2026。 [43] Xiaomi MiMo Team,“Xiaomi MiMo-V2.5:代理能力和多模态的飞跃”,https://mimo.xiaomi.com/mimo-v2-5,2026。 [44] X. An, Y. Xie, K. Yang, W. Zhang, X. Zhao, Z. Cheng, Y. Wang, S. Xu, C. Chen, D. Zhu 等,“LLaVA-OneVision-1.5:用于民主化多模态训练的全开放框架”,arXiv 预印本 arXiv:2509.23661,2025。 [45] Qwen Team,“Qwen3.5:迈向原生多模态智能体”,https://qwen.ai/blog?id=qwen3.5,2026。 [46] W. Wang, Z. Gao, L. Gu, H. Pu, L. Cui, X. Wei, Z. Liu, L. Jing, S. Ye, J. Shao 等,“InternVL3.5:在多用途、推理和效率方面推进开源多模态模型”,arXiv 预印本 arXiv:2508.18265,2025。 [47] Z.ai,“GLM-4.6V:具有原生多模态工具使用的开源多模态模型”,https://docs.z.ai/guides/vlm/glm-4.6v,2025。 [48] D. Zheng, Y. Li, L. Wang 等,“从视频中学习以构建 3D 世界:通过 3D 视觉几何先验增强 MLLMs”,神经信息处理系统进展,第 38 卷,第 20 560–20 586 页,2026。 [49] D. Wu, F. Liu, Y.-H. Hung, 和 Y. Duan,“Spatial-MLLM:提升基于视觉的空间智能中的 MLLM 能力”,arXiv 预印本 arXiv:2505.23747,2025。 [50] Y. Liu, B. Zhang, Y. Zang, Y. Cao, L. Xing, X. Dong, H. Duan, D. Lin, 和 J. Wang,“Spatial-SSRL:通过自监督强化学习增强空间理解”,arXiv 预印本 arXiv:2510.27606,2025。 [51] H. Li, Q. Cao, T. Tang, K. Xiang, Z. Guo, J. Han, H. Xu, 和 X. Liang,“与几何一起思考:主动几何集成用于空间推理”,arXiv 预印本 arXiv:2602.06037,2026。 [52] B. Li, Y. Ge, Y. Ge, G. Wang, R. Wang, R. Zhang, 和 Y. Shan,“SEED-Bench:基准测试多模态大语言模型”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2024,第 13 299–13 308 页。 [53] Y. Liu, H. Duan, Y. Zhang, B. Li, S. Zhang, W. Zhao, Y. Yuan, J. Wang, C. He, Z. Liu 等,“MMBench:你的多模态模型是全栈玩家吗?”在欧洲计算机视觉会议,2024,第 216–233 页。 [54] W. Yu, Z. Yang, L. Li, J. Wang, K. Lin, Z. Liu, X. Wang, 和 L. Wang,“MM-Vet:评估大型多模态模型的集成能力”,在第 41 届国际机器学习会议论文集,2024,第 57 730–57 754 页。 [55] X. Yue, Y. Ni, K. Zhang, T. Zheng, R. Liu, G. Zhang, S. Stevens, D. Jiang, W. Ren, Y. Sun 等,“MMMU:面向专家级 AGI 的大规模多学科多模态理解和推理基准”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2024,第 9556–9567 页。 [56] X. Fang, K. Mao, H. Duan, X. Zhao, Y. Li, D. Lin, 和 K. Chen,“MMBench-Video:用于整体视频理解的长格式多镜头基准”,神经信息处理系统进展,第 37 卷,第 89 098–89 124 页,2024。 [57] C. Fu, Y. Dai, Y. Luo, L. Li, S. Ren, R. Zhang, Z. Wang, C. Zhou, Y. Shen, M. Zhang 等,“Video-MME:首个多模态 LLMs 视频分析综合评估基准”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2025,第 24 108–24 118 页。 [58] K. Li, Y. Wang, Y. He, Y. Li, Y. Wang, Y. Liu, Z. Wang, J. Xu, G. Chen, P. Luo 等,“MVBench:全面的多模态视频理解基准”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2024,第 22 195–22 206 页。 [59] S. Li, L. Li, Y. Liu, S. Ren, Y. Liu, R. Gao, X. Sun, 和 L. Hou,“VI-TATECS:用于视频-语言模型时间概念理解的诊断数据集”,在欧洲计算机视觉会议,2024,第 331–348 页。 [60] X. Linghu, J. Huang, X. Niu, X. Ma, B. Jia, 和 S. Huang,“3D 场景中的多模态情境推理”,神经信息处理系统进展,第 37 卷,第 140 903–140 936 页,2024。 [61] Y. Liu, S. Li, Y. Liu, Y. Wang, S. Ren, L. Li, S. Chen, X. Sun, 和 L. Hou,“TempCompass:视频 LLMs 真的理解视频吗?”在计算语言学协会 ACL 2024 发现论文,2024,第 8731–8772 页。 [62] A. Majumdar, A. Ajay, X. Zhang, P. Putta, S. Yenamandra, M. Henaff, S. Silwal, P. Mcvay, O. Maksymets, S. Arnaud 等,“OpenEQA:基础模型时代的具身问答”,在 IEEE/CVF 计算机视觉与模式识别会议论文集,2024,第 16 488–16 498 页。 [63] K. Mangalam, R. Akshulakov, 和 J. Malik,“EgoSchema:用于超长视频语言理解的诊断基准”,神经信息处理系统进展,第 36 卷,第 46 212–46 244 页,2023。 [64] M. Ning, B. Zhu, Y. Xie, B. Lin, J. Cui, L. Yuan, D. Chen, 和 L. Yuan,“Video-Bench:用于评估基于视频的大型语言模型的综合基准和工具包”,计算视觉媒体,2025。 [65] Z. Shangguan, C. Li, Y. Ding, Y. Zheng, Y. Zhao, T. Fitzgerald, 和 A. Cohan,“TOMATO:评估多模态基础模型中的视觉时间推理能力”,在第十三届学习表征国际会议,2024。 [66] J. Wang, Y. Ming, Z. Shi, V. Vineet, X. Wang, Y. Li, 和 N. Joshi,“一张图片值一千字吗?深入探讨空间推理”
第 14 页
14
“视觉语言模型”,《神经信息处理系统进展》,第 37 卷,第 75 392–75 421 页,2024 年。 计算语言学协会第 61 届年会 (第 1 卷:长论文),2023 年,第 2609–2634 页。 [67] H. Ye, H. Zhang, E. Daxberger, L. Chen, Z. Lin, Y. Li, B. Zhang, [90] J. Wang, M. Chen, S. Zhang, N. Karaev, J. Sch¨onberger, P. Labatut, H. You, D. Xu, Z. Gan 等,“MM-Ego:构建用于视频问答的以自我为中心的 P. Bojanowski, D. Novotny, A. Vedaldi, 和 C. Rupprecht,“VGGT-Ω,” 多模态大语言模型”,《第十三届国际学习表征会议》,2024 年。 arXiv 预印本 arXiv:2605.15195,2026 年。 [68] Y. Chen, F. Xue, D. Li, Q. Hu, L. Zhu, X. Li, Y. Fang, H. Tang, S. Yang, [91] Y. Wang 和 J. Deng,“WAFT:用于光流提取的单独扭曲场变换”, Z. Liu 等,“LongVILA:扩展长上下文视觉语言模型以处理长视频”,arXiv 预印本 arXiv:2408.10188,2024 年。 arXiv 预印本 arXiv:2506.21526,2025 年。 [69] B. Li, Y. Zhang, D. Guo, R. Zhang, F. Li, H. Zhang, K. Zhang, P. Zhang, [92] M. K. Janjua, H. Silva, D. Niu, 和 B. Rashidi,“不要展示像素, Y. Li, Z. Liu 等,“LLaVA-OneVision:简单的视觉任务迁移”,arXiv 预印本 arXiv:2408.03326,2024 年。 展示线索:通过感知程序解锁语言模型中的视觉工具推理”,《IEEE/CVF 计算机视觉与模式识别会议论文集》, [70] J. Lin, H. Yin, W. Ping, P. Molchanov, M. Shoeybi, 和 S. Han,“VILA:视觉语言模型的预训练”,《IEEE/CVF 计算机视觉与模式识别会议论文集》, 2026 年,第 5165–5174 页。 2024 年,第 26 689–26 699 页。 [93] G. Pavlakos, V. Choutas, N. Ghorbani, T. Bolkart, A. A. Osman, [71] P. Zhang, K. Zhang, B. Li, G. Zeng, J. Yang, Y. Zhang, Z. Wang, H. Tan, D. Tzionas, 和 M. J. Black,“单张图像中的表现力身体捕捉:3D 手、 C. Li, 和 Z. Liu,“从语言到视觉的长上下文迁移”,arXiv 预印本 arXiv:2406.16852,2024 年。 脸和身体”,《IEEE/CVF 计算机视觉与模式识别会议论文集》,2019 年,第 [72] Y. Zhang, J. Wu, W. Li, B. Li, Z. Ma, Z. Liu, 和 C. Li,“LLaVA- 10 975–10 985 页。 Video:使用合成数据进行视频指令微调”,arXiv 预印本 arXiv:2410.02713,2024 年。 [73] B. Chen, Z. Xu, S. Kirmani, B. Ichter, D. Sadigh, L. Guibas, 和 F. Xia,“SpatialVLM:赋予视觉语言模型空间推理能力”,《IEEE/CVF 计算机视觉与模式识别会议论文集》,2024 年,第 14 455–14 465 页。 [74] Z. Fan, J. Zhang, R. Li, J. Zhang, R. Chen, H. Hu, K. Wang, H. Qu, S. Zhou, D. Wang 等,“VLM-3R:通过指令对齐的 3D 重建增强视觉语言模型”,arXiv 预印本 arXiv:2505.20279,2025 年。 [75] X. Huang, J. Wu, Q. Xie, 和 K. Han,“3DRS:MLLMs 需要 3D 感知表示监督以进行场景理解”,arXiv 预印本 arXiv:2506.01946,2025 年。 [76] H. Li, D. Li, Z. Wang, Y. Yan, H. Wu, W. Zhang, Y. Shen, W. Lu, J. Xiao, 和 Y. Zhuang,“SpatialLadder:视觉语言模型中空间推理的渐进式训练”,arXiv 预印本 arXiv:2510.08531, 2025 年。 [77] Y. Liu, D. Chi, S. Wu, Z. Zhang, Y. Hu, L. Zhang, Y. Zhang, S. Wu, T. Cao, G. Huang 等,“SpatialCoT:通过坐标对齐和思维链推进具身任务规划中的空间推理”,arXiv 预印本 arXiv:2501.10074,2025 年。 [78] Z. Qi, W. Zhang, Y. Ding, R. Dong, X. Yu, J. Li, L. Xu, B. Li, X. He, G. Fan 等,“SoFar:语言引导的方向桥接空间推理与物体操作”,arXiv 预印本 arXiv:2502.13143, 2025 年。 [79] R. Yang, Z. Zhu, Y. Li, J. Huang, S. Yan, S. Zhou, Z. Liu, X. Li, S. Li, W. Wang 等,“视觉空间微调”,arXiv 预印本 arXiv:2511.05491,2025 年。 [80] S. Zhang, Q. Shen, S. Wang, T. Pan, 和 X. Wang,“使几何对空间推理至关重要”,arXiv 预印本 arXiv:2603.26639,2026 年。 [81] Z. Zhang, Y. Wu, L. Jia, Y. Wang, Z. Zhang, Y. Li, B. Ran, F. Zhang, Z. Sun, Z. Yin 等,“Think3D:通过空间思考进行空间推理”,arXiv 预印本 arXiv:2601.13029,2026 年。 [82] C. Zhu, T. Wang, W. Zhang, J. Pang, 和 X. Liu,“LLaVA-3D:一种简单而有效的路径,赋予 LMMs 3D 感知能力”,arXiv 预印本 arXiv:2409.18125,2024 年。 [83] H. Zhou 和 G. H. Lee,“LLaVA-4D:将时空提示嵌入 LMMs 以进行 4D 场景理解”,《第十四届国际学习表征会议》,2025 年。 [84] ——,“Uni4D-LLM:用于 4D 理解和生成的统一时空感知 VLM”,arXiv 预印本 arXiv:2509.23828,2025 年。 [85] L. Bai, Z. Cai, M. Cao, W. Cao, C. Chen 等,“Intern-S1:科学多模态基础模型”,arXiv 预印本 arXiv:2508.15763,2025 年。 [86] Y. Zou, D. Zhu, L. Zhu, T. Zhu, Y. Zhou 等,“Intern-S1-Pro:万亿规模科学多模态基础模型”,arXiv 预印本 arXiv:2603.25040,2026 年。 [87] T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, 和 Y. Iwasawa,“大语言模型是零样本推理器”,《神经信息处理系统进展》,第 35 卷,第 22 199–22 213 页,2022 年。 [88] X. Wang, J. Wei, D. Schuurmans, Q. Le, E. Chi, S. Narang, A. Chowd- hery, 和 D. Zhou,“自洽性改进语言模型中的思维链推理”,arXiv 预印本 arXiv:2203.11171, 2022 年。 [89] L. Wang, W. Xu, Y. Lan, Z. Hu, Y. Lan, R. K.-W. Lee, 和 E.- P. Lim,“计划与解决提示:通过大语言模型改进零样本思维链推理”,《计算语言学协会
第 15 页
15
APPENDIX A Motion-X [39] 支持文本驱动的整体运动生成和 3D 全身人体网格重建等任务。 DETAILED DATA SOURCES 在 ViSTR-Bench 中,我们将 Motion-X [39] 用作以人为中心的时空推理任务的数据源,包括旋转方向、交互方向和跌倒方向。 In this section, we provide a detailed description of each Waymo Open Dataset [38] 是一个大规模自动驾驶数据集,包含 1,150 个驾驶片段。 data source and its corresponding usage in ViSTR-Bench. 每个片段长约 20 秒,并提供带有丰富标注的多视角同步视频,涵盖车辆、行人和骑行者等交通参与者。该数据集广泛用于自动驾驶感知任务,如 3D 目标检测、目标跟踪和运动预测。在 ViSTR-Bench 中,我们使用 Waymo Open Dataset [38] 中的视频进行与驾驶相关的运动感知任务,包括车辆运动和相对速度。我们还利用可用的车辆标注来定位目标车辆,并在相应的视频帧上叠加视觉提示。 Waymo Open Dataset [38] is a large-scale autonomous ScanNet [35] 是一个富含标注的 RGB-D 数据集,包含真实的室内场景,由超过 1,500 个室内扫描和超过 250 万个 RGB-D 视图组成。该数据集涵盖了多样化的室内环境,如卧室、办公室和客厅。ScanNet 广泛用于 3D 重建、语义分割和实例分割。在 ViSTR-Bench 中,我们将 ScanNet [35] 作为 Ego Motion 任务的数据源之一。给定一段室内第一人称视频和一个目标物体,模型需要推断观察相机与目标物体之间的最终空间关系。 driving dataset comprising 1,150 driving segments. Each segment lasts approximately 20 seconds and provides syn- APPENDIX B chronized multi-view videos with rich annotations for traf- DETAILED PROMPT TEMPLATES fic agents, including vehicles, pedestrians, and cyclists. The A. Direct Prompting dataset is widely used for autonomous driving perception Table VI presents the Direct Prompting templates used tasks such as 3D object detection, object tracking, and motion in ViSTR-Bench. Each prompt specifies the visual context, forecasting. In ViSTR-Bench, we use videos from the Waymo the reasoning target, and the required answer format for Open Dataset [38] for driving-related motion perception tasks, the corresponding subtask. Placeholders such as {TARGET}, including Vehicle Movement and Relative Velocity. We also {PERSPECTIVE}, {OPTION_A}, and {OPTION_B} are re- leverage the available vehicle annotations to localize target placed with instance-specific metadata during QA pair gen- vehicles and overlay visual prompts on the corresponding eration. Most subtasks adopt fixed binary answer spaces, video frames. including Yes/No for judgment tasks, Green/Blue for com- ScanNet [35] is a richly annotated RGB-D dataset of real- paring prompted vehicles, Slip/Fixed for knot classification, world indoor scenes, comprising more than 1,500 indoor scans and Clockwise/Counterclockwise for rotation direction. For and over 2.5 million RGB-D views. The dataset covers diverse the remaining subtasks, binary choices are constructed from indoor environments, such as bedrooms, offices, and living task-specific label spaces. Ego Motion uses relative-position rooms. ScanNet is widely used for 3D reconstruction, semantic labels such as Front-left, Front-right, Back-left, and Back- segmentation, and instance segmentation. In ViSTR-Bench, we right, Swimming Race uses lane numbers, while Interaction use ScanNet [35] as one of the data sources for the Ego Motion Direction and Fall Direction use directionality labels. task. Given an indoor egocentric video and a target object, the model is required to infer the final spatial relationship between the observing camera and the target object. B. Manual CoT ScanNet++ [36] is an extension of ScanNet [35], offer- Inspired by OmniSpatial [20], Manual CoT explicitly de- ing more detailed geometry, denser visual observations, and composes each task into visually grounded intermediate rea- more complete scene coverage. It contains 460 indoor scenes, soning steps. This design differs from existing methods such covering more than 1,000 object categories and over 21,000 as Zero-shot CoT [87], Self-Consistency [88], and Plan-and- object instances. In ViSTR-Bench, we use ScanNet++ [36] as Solve [89], which rely on generic reasoning instructions or an additional data source for the Ego Motion task. repeated sampling with the same prompt. Specifically, we ARKitScenes [37] is a large-scale indoor RGB-D dataset manually design a task-specific reasoning procedure for each captured using mobile devices equipped with LiDAR sensors. subtask in ViSTR-Bench, guiding the model to first identify It contains 5,047 captures from 1,661 unique indoor scenes. the relevant visual target, then track task-specific spatial- ARKitScenes [37] is commonly used for 3D reconstruction, temporal evidence across the video, and finally produce the depth estimation, and indoor object detection. In ViSTR- prediction using the prescribed answer format. The complete Bench, we use ARKitScenes [37] as another data source for Manual CoT prompt templates are shown in Figures 8-22. the Ego Motion task. Ego4D [34] is a large-scale egocentric video dataset that APPENDIX C records unscripted daily human activities from a first-person QUALITATIVE VISUALIZATIONS perspective. It contains more than 3,700 hours of video col- We provide qualitative visualizations for all 15 tasks in lected by 926 participants across 74 locations in nine countries. ViSTR-Bench. For each task, we select one representa- The dataset covers diverse activities in homes, workplaces, tive example and visualize the model outputs from GPT- outdoor environments, and recreational scenes. Ego4D [34] 5.4-thinking [40], Gemini-3.1-Pro-Preview [41], and Claude- is widely used for egocentric video understanding, activity Opus-4.6-thinking [1]. The results are shown in Figures 23-37. recognition, and human-object interaction analysis. In ViSTR- Bench, we use Ego4D [34] as a public data source for outcome prediction tasks, including Basketball Shot and a subset of Billiards Shot examples. Motion-X [39] is a large-scale 3D expressive whole-body human motion dataset comprising 81.1K motion sequences and 15.6 million precise 3D whole-body pose annotations represented using SMPL-X [93]. The dataset is constructed from large-scale online videos and eight existing motion datasets and provides expressive whole-body annotations cov- ering body movements, hand gestures, and facial expressions.
第 16 页
16
表 VI ViSTR-Bench 中使用的直接提示模板。在问答对生成过程中,诸如 {TARGET}、{PERSPECTIVE}、{OPTION_A} 和 {OPTION_B} 之类的占位符会被替换为特定实例的元数据。
任务 提示模板
运动感知 车辆运动 这是一段驾驶视频。请判断绿色方框中的车辆在视频期间是否显示出细微的运动。回答是或否。 相对速度 这是一段驾驶视频。请根据它们随时间的运动情况,判断哪辆车移动得更快:绿色方框中的车辆还是蓝色方框中的车辆。回答绿色或蓝色。 旋转方向 这是一段人物视频。从 {PERSPECTIVE} 视角,请判断运动是顺时针还是逆时针。回答顺时针或逆时针。
空间关系 自我运动(Ego Motion) 这是一段在室内场景中由移动相机拍摄的视频。目标物体是 {TARGET}。请确定目标物体相对于相机的最终位置。它是 {OPTION_A} 还是 {OPTION_B}?回答 {OPTION_A} 或 {OPTION_B}。 通行可行性 这是一段车辆及其驾驶路径附近放置的交通锥的视频。请预测车辆能否在不触碰任何锥体的情况下通过锥体限制区域。回答是或否。 交互方向 这是一段人物与 {TARGET} 互动的视频。请确定人物相对于 {TARGET} 的运动方向。回答 {OPTION_A} 或 {OPTION_B}。
结果预测(Outcome Prediction) 篮球投篮 这是一段篮球投篮的视频。请预测篮球是否会进入篮筐。回答是或否。 足球射门 这是一段足球任意球的视频。请根据球的轨迹预测球是否会进入球门,忽略守门员和任何防守干扰。回答是或否。 高尔夫击球 这是一段高尔夫击球的视频。请根据观察到的轨迹预测高尔夫球是否会进入洞中。回答是或否。 台球击球 这是一段台球的视频。请根据当前轨迹预测目标球是否会进入袋口。回答是或否。 游泳比赛 这是一段游泳比赛的视频。画面顶部的游泳运动员位于 1 号泳道,泳道编号从上到下递增。请确定在 {OPTION_A} 号泳道和 {OPTION_B} 号泳道之间,哪位游泳运动员会先到达终点。回答 {OPTION_A} 或 {OPTION_B}。 跌倒方向 这是一段人物跌倒的视频。请确定人物的跌倒方向。回答 {OPTION_A} 或 {OPTION_B}。
物理动力学(Physical Dynamics) 叠叠乐稳定性 这是一段叠叠乐游戏的视频。请预测在取出手试图抽出的积木块后,塔是否会保持稳定。回答是或否。 挑棍依赖性 这是一段挑棍游戏的视频。请预测指示棒所指的棍子能否在不触碰任何其他棍子的情况下被捡起。回答是或否。 绳结类型 这是一段绳结操作的视频。请判断绳结是活结(可以通过拉一端解开)还是死结(无法解开,拉紧时保持紧固)。回答活结或死结。
第 17 页
17
车辆移动
您是驾驶视频分析和细微运动检测方面的专家。我将为您提供一段驾驶视频。您的任务是确定绿色方框中的车辆在视频期间是否显示出细微的移动。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标车辆识别:识别绿色方框中的车辆,并观察其相对于附近车道标线、周围车辆或其他静态背景参考物的位置。 2. 运动比较:比较目标车辆在连续帧之间的位置,并分析其在一段时间内是否存在轻微但一致的位移。 3. 运动判定:根据观察到的帧间变化,确定绿色方框中的车辆在视频期间是否显示出细微的移动。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 8. 车辆移动任务的思维链 (CoT) 提示模板。
相对速度
您是驾驶视频分析和运动比较方面的专家。我将为您提供一段驾驶视频。您的任务是确定哪个车辆移动得更快:绿色方框中的车辆还是蓝色方框中的车辆。请基于它们在一段时间内的运动情况做出判断,而不仅仅是基于单帧中的位置。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标识别:识别绿色方框中的车辆和蓝色方框中的车辆。 2. 运动分析:观察并比较它们在连续帧之间的运动,重点关注每辆车在一段时间内移动了多少。 3. 速度比较:根据它们的位移和运动一致性,确定哪辆车移动得更快。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [绿色 或 蓝色] 〈/answer〉
图 9. 相对速度任务的思维链 (CoT) 提示模板。
第 18 页
18
旋转方向
你是基于视频的空间-时间推理专家。我将向你提供一段人物执行旋转动作的视频。从 {PERSPECTIVE} 视角出发,你的任务是判断观察到的运动是顺时针还是逆时针。两个候选答案为:顺时针(Clockwise)和逆时针(Counterclockwise)。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标运动识别:识别人物,并定位视频中需要判断的主要旋转动作。 2. 基于视角的运动追踪:从 {PERSPECTIVE} 视角出发,追踪人物的身体或相关运动部位在帧间的朝向变化。 3. 旋转方向判定:根据朝向的时间变化,从指定视角判断运动是顺时针还是逆时针。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [顺时针 或 逆时针] 〈/answer〉
图 10. 旋转方向的手动思维链(CoT)提示模板。
自我运动(Ego Motion)
你是基于视频的空间推理专家。我将向你提供一段在室内场景中由移动相机拍摄的视频。目标物体是 {TARGET}。你的任务是确定目标物体相对于相机的最终位置。两个候选答案为:{OPTION_A} 和 {OPTION_B}。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标物体识别:识别 {TARGET} 并观察其在场景中的位置。 2. 相对运动分析:在整个视频过程中,追踪目标物体相对于移动相机的位置变化。 3. 最终位置判定:根据相对运动,确定最终位置是 {OPTION_A} 还是 {OPTION_B}。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [{OPTION_A} 或 {OPTION_B}] 〈/answer〉
图 11. 自我运动(Ego Motion)的手动思维链(CoT)提示模板。
第 19 页
19
通道可行性
你是驾驶场景分析和车辆-障碍物间隙推理方面的专家。我将提供一段显示车辆在交通锥附近移动的视频。你的任务是预测车辆能否在不触碰任何锥体的情况下完成当前的驾驶操作。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 锥体布局分析:观察交通锥相对于车辆行驶路径的位置,包括它们是否形成狭窄通道或仅放置在车辆的一侧。 2. 车辆运动分析:分析车辆相对于附近锥体的当前位置、方向、移动方向和转向趋势。 3. 间隙预测:基于锥体布局和车辆运动,预测车辆能否在不触碰任何锥体的情况下完成操作。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 Yes 或 No 〈/answer〉
图 12. 通道可行性的人工思维链(CoT)提示模板。
交互方向
你是人-物交互分析方面的专家。我将提供一段人与 {TARGET} 交互的视频。你的任务是确定人相对于 {TARGET} 的运动方向。两个候选答案为:{OPTION_A} 和 {OPTION_B}。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标交互识别:识别人和 {TARGET},并观察它们在视频中的初始空间关系。 2. 相对运动分析:跟踪人相对于 {TARGET} 的位置或运动在帧间如何变化,必要时忽略由相机运动引起的位移。 3. 运动方向确定:基于随时间的相对位移,确定人相对于 {TARGET} 的运动方向是 {OPTION_A} 还是 {OPTION_B}。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [{OPTION_A} 或 {OPTION_B}] 〈/answer〉
图 13. 交互方向的人工思维链(CoT)提示模板。
第 20 页
20
篮球投篮
您是体育视频分析和物理轨迹预测方面的专家。我将为您提供一段篮球投篮的视频。您的任务是预测篮球是否会进入篮筐。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 出手分析:观察篮球的初始出手动作,包括其方向、角度和表观力度。 2. 轨迹追踪:追踪篮球在空中的运动,并分析其相对于篮筐和篮板的轨迹。 3. 结果预测:根据观察到的轨迹和对齐情况,预测篮球是否会进入篮筐。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 14. 篮球投篮的手动思维链(CoT)提示模板。
足球射门
您是体育视频分析和物理轨迹预测方面的专家。我将为您提供一段足球任意球的视频。您的任务是根据球的轨迹预测球是否会进入球门,忽略守门员和任何防守干扰。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 踢球分析:观察任意球踢出后球的初始方向、高度和表观力度。 2. 轨迹追踪:追踪球在空中的飞行路径,并分析其相对于球门框的弯曲度和对齐情况。 3. 结果预测:仅根据球的轨迹及其与球门的对齐情况,预测球是否会进入球门,忽略守门员和其他任何球员。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 15. 足球射门的手动思维链(CoT)提示模板。
第 21 页
21
高尔夫击球
您是体育视频分析和基于轨迹的运动预测专家。我将为您提供一段高尔夫击球的视频。您的任务是根据观察到的轨迹预测高尔夫球是否会进洞。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 初始运动分析:观察高尔夫球被击打后的初始方向、速度和运动模式。 2. 轨迹跟踪:跟踪球随时间的运动,包括任何滚动或弹跳行为,并分析其相对于球洞的路径。 3. 结果预测:根据观察到的轨迹及其与球洞的对齐情况,预测球是否会进洞。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 16. 高尔夫击球的手动思维链(CoT)提示模板。
台球击球
您是体育视频分析和基于轨迹的运动预测专家。我将为您提供一段台球的视频。您的任务是根据当前轨迹预测目标球是否会进袋。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标识别:识别目标球并观察其相对于袋口的当前位置。 2. 运动方向分析:根据目标球的近期运动分析其方向和速度。 3. 结果预测:根据球的轨迹及其与袋口的对齐情况,预测其是否会进袋。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出您的详细推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 17. 台球击球的手动思维链(CoT)提示模板。
第 22 页
22
游泳比赛
你是基于视频的运动分析和时序推理专家。我将为你提供一段游泳比赛的视频。画面顶部的游泳运动员位于第 1 泳道,泳道编号从上到下递增。 你的任务是确定在泳道 {OPTION_A} 和泳道 {OPTION_B} 的游泳运动员中,谁将率先到达终点。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 泳道识别:根据运动员在画面中的垂直位置,识别出位于泳道 {OPTION_A} 和泳道 {OPTION_B} 的游泳运动员。 2. 运动分析:观察并比较他们随时间变化的运动情况,重点关注他们的速度、划水动作的一致性以及向前的位移。 3. 顺序预测:根据他们的运动趋势,判断哪位游泳运动员将率先到达终点。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 {OPTION_A} 或 {OPTION_B} 〈/answer〉
图 18. 游泳比赛的手动思维链(CoT)提示模板。
跌倒方向
你是基于视频的人类运动分析专家。我将为你提供一段人物跌倒的视频。你的任务是确定该人物的运动方向或运动类别。两个候选答案为:{OPTION_A} 和 {OPTION_B}。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标人物识别:识别需要判断其运动的人物,并观察其初始身体姿态和位置。 2. 时序运动分析:追踪该人物的身体位置、姿态和位移随时间的变化,重点关注与两个候选答案相关的运动证据。 3. 运动方向判定:根据该人物的时序运动和最终状态,确定正确答案是 {OPTION_A} 还是 {OPTION_B}。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [{OPTION_A} 或 {OPTION_B}] 〈/answer〉
图 19. 跌倒方向的手动思维链(CoT)提示模板。
第 23 页
23
积木稳定性
你是物理推理和基于视频的结构稳定性分析专家。我将为你提供一段玩积木(Jenga)游戏的视频。你的任务是预测在抽出手试图取出的积木块后,塔楼是否能保持稳定。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标积木识别:识别手试图取出的积木块,并确定其在塔楼中的位置。 2. 结构支撑分析:分析该积木块如何支撑和平衡周围的积木块及上层结构。 3. 稳定性预测:基于塔楼结构和目标积木块的作用,预测移除该积木块后塔楼是否能保持稳定。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 20. 积木稳定性任务的思维链(CoT)提示模板。
木条依赖性
你是物理交互分析和基于视频的接触推理专家。我将为你提供一段玩挑棍(Mikado)游戏的视频。你的任务是预测由指示棒指向的木条能否在不触碰任何其他木条的情况下被拿起。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 目标木条识别:识别指示棒,并确定它所指的目标木条是哪一根。 2. 接触分析:观察目标木条是否与其他木条接触、支撑或缠绕。 3. 拿起可行性预测:基于接触关系和排列方式,预测目标木条能否在不触碰其他木条的情况下被拿起。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [是 或 否] 〈/answer〉
图 21. 木条依赖性任务的思维链(CoT)提示模板。
第 24 页
24
结类型
你是物理推理和结的行为分析专家。我将为你提供一段结操作的视频。你的任务是确定该结是活结(slip knot)还是死结(fixed knot)。活结是指通过拉拽绳子的一端即可解开或释放的结。死结是指无法通过拉拽一端解开,反而会变得更紧或保持固定的结。请仔细观察视频,严格遵循以下分析步骤,并以固定格式输出最终答案。
[分析步骤] 1. 结构观察:观察绳子的配置,包括环、交叉点以及结的形成方式。 2. 拉拽行为分析:分析拉拽绳子一端时发生的情况,特别是结是变松、释放还是变紧。 3. 结类型判定:根据观察到的行为,确定该结是否可以通过拉拽一端解开。
[输出格式要求] 请严格遵循以下 XML 标签格式进行回复。不要在标签外添加任何额外文本。
<thinking> 在此处根据上述三个步骤写出详细的推理过程。 </thinking> 〈answer〉 [活结或死结] 〈/answer〉
图 22. 结类型的手动思维链(CoT)提示模板。
:这是一段驾驶视频。请判断绿色方框中的车辆在视频期间是否显示出细微运动。回答“是”或“否”。
:绿色方框中的车辆正常向前行驶,其相对于相机和环境的运动在整个视频片段中清晰且连续。这代表稳定、明显的运动,而非细微运动。是。 X
:观察图像序列,我需要跟踪绿色方框高亮显示的车辆以确定其是否显示出细微运动。在第一帧中,绿色方框高亮显示了一辆车辆(看起来是一辆白色/银色汽车),它位于同一车道的前方,距离相对较远。随着帧的推进,绿色方框中的车辆看起来变大(更靠近相机),这表明自车(相机)正在接近它,或者被跟踪的车辆相对静止/比自车移动得慢。更仔细地观察进展:随着序列的推进,被跟踪的车辆(在绿色方框中)相对于帧的大小似乎在增加。车辆在帧中的位置略微向下移动并变大。车辆确实在向前移动,但速度比自车慢,这解释了为什么它在各帧中看起来逐渐变近并变大。是。绿色方框中的车辆在视频序列中显示出细微运动。虽然自车(相机)显然正在接近它(被跟踪的汽车在每一帧中都变大),但被跟踪的车辆本身也在向前移动,这由其相对于固定元素(如道路标记“ONLY”、“BUS”)和建筑物的位置变化得到证实。该车辆似乎以与自车相同的方向行驶,但速度较慢,导致两者之间的距离缩短。 X
:确定车辆运动。我需要回答方框中的车辆是否在视频中显示出细微运动。我正在推断帧之间的相对运动。左中心车道前方有一辆银色 SUV,随着我分析帧,看起来方框和汽车都变大,并相对于车道略微向左移动。由于自车也在向前移动,目标车辆似乎也在细微移动。它向左移动、变大,并朝向路口前进。所以,我的回答是“是”。是。 X
图 23. 车辆运动的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 25 页
25
:这是一段驾驶视频。请根据车辆在一段时间内的运动情况,判断哪辆车的速度更快:绿色框中的车辆还是蓝色框中的车辆。回答 Green 或 Blue。
:分析车辆速度。我目前专注于分析初始帧以建立基线。我的首要任务是识别左侧车道中由蓝色边界框标记的深色 SUV,然后评估其相对于场景中其他物体的位置,从而开始确定其速度。Green。 X
:让我分析两辆车在帧序列中的运动。蓝色框跟踪一辆浅色的小型货车/SUV,绿色框跟踪其后方/旁边的深色轿车。观察帧序列,我需要追踪每辆车相对于相机(相机也在向前移动)的位置变化。在早期帧中,两辆车都离相机相对较近。随着帧的推进,两辆车似乎都在远离相机(变小),这意味着相机车辆没有追上它们。让我更仔细地看:蓝色框(小型货车)似乎正在穿过路口并继续沿着道路行驶。它在帧中的视在尺寸逐渐减小,表明它正在远离相机。绿色框(深色轿车)也在向前移动,其尺寸同样在减小。现在我在检查两辆车之间的关系。在早期帧中,它们都很大且很近,但随着序列的推进,它们都在后退。绿色框中的车辆似乎相对于蓝色框中的车辆正在取得进展,但我需要更仔细地查看相机的自身运动是否影响了这种感知。观察它们的相对位置,绿色车辆起始时位于蓝色车辆的右后方,随着帧的推进,它似乎正在保持或可能缩小这一差距。实际上,我意识到我需要关注关键比较:哪辆车相对于相机移动得更快。两辆车在画面中都在缩小,但绿色轿车似乎相对于小型货车保持着大致相同的位置,甚至略微落后,这表明蓝色框中的小型货车可能以相似或略快的速度移动。两辆车都在通过显示绿灯的路口。绿色框中的车辆位于稍前方的相邻车道,随着帧的推进,它似乎比蓝色车辆更快地拉开距离,表明它以更高的速度通过路口。观察每个框在序列中缩小的速度,尺寸变化的速率指示了它们的相对速度,绿色车辆更快的缩小表明它比蓝色车辆更快地远离相机。Green。 观察帧序列,我可以追踪两辆车的相对运动。绿色框中的车辆(相邻车道中的深色轿车)比蓝色框中的车辆(浅色小型货车)移动得更快。 X
:确定相对速度。我需要弄清楚绿色汽车还是蓝色面包车移动得更快。蓝色面包车在左侧车道,起始时看起来较大,而绿色汽车在右侧车道,似乎保持其距离。通过检查它们在序列中的运动,绿色汽车实际上增加了与蓝色面包车的间距。因此,我得出结论,绿色汽车是更快的车辆。确定相对速度。我需要弄清楚绿色汽车还是蓝色面包车移动得更快。蓝色面包车在左侧车道,起始时看起来较大,而绿色汽车在右侧车道,似乎保持其距离。通过检查它们在序列中的运动,绿色汽车实际上增加了与蓝色面包车的间距。因此,我得出结论,绿色汽车是更快的车辆。Green。 X
图 24. 相对速度的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 26 页
26
:这是一段人物旋转的视频。从俯视角度判断,旋转是顺时针还是逆时针。回答 顺时针或逆时针。
:目标运动识别:视频中的人物进行旋转舞蹈动作。旋转从第 00:04 帧开始,到第 00:08 帧结束。基于视角的运动跟踪:从俯视视角观察,起初人物面向摄像机。在第 00:05 帧,他们开始向右转,右臂伸展并向后挥动。到第 00:06 帧,他们的背部完全朝向摄像机。他们继续转动,带动左侧身体绕过来,并在第 00:08 帧重新面向摄像机。旋转方向判定:从上方跟踪其身体正面,朝向从面向摄像机,转向其身体右侧(从我们的视角看是屏幕左侧),然后背对摄像机,接着转向屏幕右侧,最后回到正面。从俯视角度观察到的这条圆形路径遵循 顺时针方向。顺时针。 X
:从俯视角度观察图像序列,我需要跟踪表演者在各帧中的朝向和运动方向。在早期帧中,表演者面向摄像机,双手叉腰。随着序列的推进,表演者开始转动,经历各种姿态:起初面向前方(朝向摄像机)。然后转向展示其右侧。然后背对/进一步转动。然后展示其左侧。然后回到面向前方。从俯视(鸟瞰)视角跟踪旋转方向:表演者似乎从面向前方 → 转向其左侧 → 展示背部 → 转向其右侧 → 回到面向前方。这种运动模式,从上方观看时,代表逆时针旋转。 逆时针。 ✓
:确定旋转方向。我需要根据视频帧从俯视角度确定人物的旋转方向。我正在观察序列以确定旋转是顺时针还是逆时针。起初面向摄像机,然后举起一只手臂。大约在第 10 帧,人物似乎单腿抬起保持平衡。通过检查帧,我看到朝向从正面变为略微右侧,再到背面,然后回到正面。由此可以推断出旋转方向。分析旋转方向。如果人物逆时针(CCW)旋转,其朝向将转向其左侧。经过四分之一转后,我需要确定他们是面向摄像机右侧还是摄像机左侧。使用坐标系,摄像机位于负 y 轴向正 y 方向看,人物起初面向摄像机(负 y 方向)。CCW 旋转将其朝向从负 y 变为正 x,这意味着他们现在面向屏幕右侧。因此,是的,从摄像机视角的 CCW 旋转会导致面向屏幕右侧。分析旋转序列。我正在考虑第 10-13 帧的旋转。我认为这可能涉及连续运动,第 11 和 12 帧的动作更为明显。我需要仔细检查细节。对于第 14 帧,我认为侧脸不应面向左侧,第 15 帧显示双手叉腰的近乎正面视图,而第 16 帧是略微向右倾斜。我意识到主要动作涉及旋转,包括手臂运动和身体扭动,最终以旋转舞步结束。我需要决定整体的旋转方向。分析舞蹈动作。到第 12 帧,如果舞者继续逆时针(CCW)旋转,其面部应指向屏幕左侧然后回到正面。观察第 12 帧,舞者似乎面向摄像机左侧,表明可能是 CCW 旋转。逆时针。 ✓
图 25. 旋转方向的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude- Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 27 页
27
:这是一段在室内场景中由移动相机拍摄的视频。目标物体是椅子。请确定目标物体相对于相机的最终位置。是左前方还是右前方?回答“左前方”或“右前方”。
:定位目标物体。我已成功在初始帧中识别出椅子,注意到它位于桌子左侧的位置。这标志着跟踪其运动的起点。确定椅子的位置。我已确认椅子最初位于左侧。随着相机向右平移,椅子移出视野,现在位于当前相机视角的左后方。确认最终位置。我已分析相机向右的完整平移过程。基于椅子的初始位置和相机显著的向右移动,我推断其相对于相机最终视角的最终位置为左前方。椅子的最终位置是左前方。 X
:椅子在第一张图像的左侧可见。随着相机在房间内平移(向右移动并最终转身),椅子最终会位于相机后方。让我追踪相机的运动。图像 1:椅子在桌子区域左侧可见。图像 2-16:相机从桌子区域移开,展示床、床尾,然后是衣柜区域和窗户。到最后一帧(图像 16)时,相机正对着窗户/衣柜区域。带有椅子的桌子位于房间的另一侧。根据房间布局,椅子将位于相机最终位置的后方和左侧。左前方。在第一张图像中,椅子在桌子区域左侧清晰可见。随着相机顺时针环绕房间平移,展示床、门、床头柜,最后是衣柜/窗户区域,椅子仍然位于相对于相机最终朝向窗户/衣柜墙壁的方位的左前方部分。 X
:推断椅子位置。我在思考椅子相对于相机的最终位置。椅子最初在桌子左侧可见。随着相机向右向床移动,椅子很可能最终位于最终相机位置(我估计在窗户或衣柜附近)的后方和左侧,从而移出视野。我需要分析视频序列以确定如果相机方向改变,椅子是否可能位于前方。绘制房间布局。我在考虑椅子相对于相机的位置。左前方或右前方的选项似乎表明椅子应位于房间的前部。但如果相机向左转,它可能仍然可见吗?查看最后几帧显示衣柜和窗户,梳妆台在左侧。初始相机位置靠近入口,面向桌子和床,椅子在桌子左侧。看起来椅子仍然在桌子附近,靠近远墙。确定相机和椅子位置。我想象最终相机位置靠近窗户,看向衣柜和窗户,这比初始视角更靠右。看起来相机沿着床的右侧向前移动,然后转身面向窗户。鉴于这种运动,当面向窗户时,椅子可能位于相机的左侧且稍靠前。因此,得出结论椅子位于左前方是合理的。左前方。 X
图 26. 自我运动(Ego Motion)的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 28 页
28
:这是一段车辆及其驾驶路径附近放置的交通锥的视频。请预测车辆能否在不触碰任何锥体的情况下通过锥体限制区域。回答“是”或“否”。
:评估锥体障碍物。我目前专注于视觉输入,分析银色 SUV 相对于锥体放置位置的轨迹。明亮的车灯带来了挑战,因此我正在努力减轻眩光,以便更清晰地看清前方的即时路径。预测车辆净空。我正在细化对 SUV 在锥体之间路径的评估。虽然居中轨迹很有希望,但强烈的车灯眩光使得精确的宽度比较变得困难。我正在仔细检查最后几帧,以确定间隙是否确实足够。确定碰撞可能性。我现在专注于车身宽度与锥体间隙的对比。虽然看起来是居中的,但车灯眩光掩盖了精确的边缘数据。基于我对 SUV 宽度的估计以及锥体排列的狭窄程度,我倾向于认为会发生碰撞。估计车辆通过性。我一直在仔细审视车辆相对于锥体的路径。尽管看起来是居中的,但明亮的车灯眩光掩盖了精确的边缘。我目前的估计,将 SUV 的可见宽度与狭窄的间隙进行比较,使我相信至少与一个锥体发生碰撞是可能的。评估路径适配性。我目前的重点是车身宽度相对于锥体间隙的情况。虽然看起来是居中的,但车灯眩光使得精确的边缘评估变得具有挑战性。我的估计表明车辆比可用空间更宽,因此我预测会发生碰撞。根据视频,车辆正驶向两个交通锥之间的狭窄间隙。两个锥体之间的距离似乎比车辆的宽度更窄。随着车辆在最后几帧中越来越近,看起来不可避免地无法在不接触的情况下通过间隙。因此,车辆极有可能触碰至少一个锥体。否。 ✓
:让我分析图像序列以确定车辆是否在不触碰任何锥体的情况下通过锥体限制区域。按时间顺序查看图像:1. 车辆(一辆银色/灰色电动 SUV)开着车灯从远处驶来。驾驶车道上放置了两个橙色/红色交通锥。2-5. 车辆继续接近锥体,越来越近。6-8. 车辆现在非常接近锥体。一名行人正在左侧行走。车辆似乎正在减速或停止。9-10. 车辆似乎停在锥体附近或移动非常缓慢。11-16. 随着序列继续,车辆穿过由位于车道中央的锥体形成的狭窄通道。在最后几帧中,车辆成功通过了锥体区域,锥体保持直立且未受干扰,处于原始位置。是。车辆成功通过锥体限制区域而未触碰任何锥体。图像序列显示银色电动 SUV 从远处接近两个交通锥,随着距离拉近而减速,然后小心地在它们之间/旁边导航。在后面的帧中,当车辆经过时,锥体保持直立处于原始位置,证实未发生接触。 X
:评估车辆定位。我注意到车辆似乎向右倾斜。左侧非常靠近右侧的锥体,这似乎形成了一个约 20-30 厘米的狭窄间隙。同时,左侧的间隙看起来更大。似乎很可能有一条路径可以通过这里。我觉得我对如何继续有很好的视觉感觉。是。 X
图 27. 通行可行性定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 29 页
29
:这是一段人与杆子互动的视频。请判断该人相对于杆子的运动方向。 答案:向上或向下。
:观察身体运动。我专注于主体在杆子上的位置变化。我目前的分析表明,在观察到的片段中,她一直呈一致的向下轨迹。向下。 X
:图像序列显示一个人在看似户外健身区(可能是圣莫尼卡或威尼斯海滩)攀爬杆子。在整个帧序列中,我们可以观察到:1. 在早期帧中,人的脚靠近画面底部,用手和脚抓住杆子。2. 随着帧序列的推进,人的身体相对于地面逐渐升高。3. 在后期帧中,只有小腿和脚出现在画面中,因为人已经爬得更高。攀爬动作展示了攀爬杆子时典型的手递手和脚抓握技巧,人明显在向上攀爬。向上。 ✓
:确定运动方向。我需要评估视频中的人是在向上还是向下移动。有 16 个采样帧显示了他们在攀爬杆上的位置。这个人穿着绿色衬衫和黑色裤子,开始时上半身靠近画面顶部。当我按时间顺序回顾这些帧时,他的躯干似乎逐渐移出画面,这表明可能正在向上移动。我将仔细检查序列,并根据背景检查其位置。分析垂直运动。为了评估垂直运动,我正在比较人在杆子上的脚和手相对于杆子和背景的位置。在早期帧中,我看到他的下脚靠近杆子底部,而在后期帧中,他的脚升得更高,这表明他可能正在向上攀爬。我需要仔细分析每一帧:在第 1 帧中,人抱着杆子;在随后的帧中,每个细微的变化都暗示着向上移动。我将谨慎进行。确定运动方向。在第 7 帧中,人的右腿向下伸展,脚靠近地面,可能准备向上推。这可能表明他正在下降,所以我需要更仔细地观察。起初,他的臀部位于一堵低矮混凝土墙上方,随着我看到随后的帧,只能看到下半身和腿,这表明他很可能在上升,因为随着时间的推移,他的身体更多部分移出了摄像机的视野。很明显:答案是向上。向上。 ✓
图 28. 互动方向的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 30 页
30
:这是一段篮球投篮的视频。请预测篮球是否会进入篮筐。回答“是”或“否”。
:分析球员动作:我目前专注于视频的前几秒,特别观察白衣球员接球并开始突破上篮的情况,注意到防守压力很大。确定投篮结果:我的分析确认投篮未中。观察比赛过程,该球员失去平衡且受到严密防守,导致投篮未中,球打在篮板上并远离篮筐。否。 X
:让我分析图像序列以确定篮球是否进入篮筐。按时间顺序查看图像:1. 黄昏时分,室外篮球场上有三名球员。2. 四名球员,其中一人似乎在运球。3. 球员向篮筐移动。4. 球员在运动中,一人持球。5. 持球球员似乎在做动作。6. 球员准备投篮或传球。7. 球员在篮筐附近站位。8. 球员似乎正在突破上篮。9. 球员在篮筐附近,似乎正在尝试上篮。10. 球员在篮筐处尝试投篮。11. 篮筐区域附近有三名球员。12. 一名球员起跳尝试上篮,在随后的帧中,球似乎碰到了篮筐。13. 随后球员从篮筐处随意走开,而不是争抢篮板,这表明投篮命中。是。观察帧序列,我可以看到一名球员在后面的帧中突破上篮。在最后几帧中,球员似乎从篮筐处随意走开,而不是争抢篮板,这表明投篮成功。 ✓
:分析篮球序列:我需要根据按时间顺序采样的帧来确定篮球投篮是否会命中。看起来序列显示的是篮筐附近的投篮而不是远投。在最后几帧中,球靠近篮板和篮筐。在第11帧中,球员跳起上篮,球靠近他的左手。在第12-14帧中,不清楚球是否碰到了篮筐。我正在从该图像序列中预测结果。看起来很可能会进。最终确定投篮预测:哦等等,我刚刚意识到右上角可见的球实际上是月亮,而不是篮球!篮球只在后面的帧中靠近篮筐。在第15帧中,球员仍然抬头看着篮筐附近,但还没有明显的篮板迹象。如果投篮命中,他们可能会放松。看起来球很可能碰到了篮筐并且仍然很近,所以我在想,是的,这很可能是一个轻松的上篮。是。 ✓
图 29. 篮球投篮的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 31 页
31
用户:这是一段足球任意球的视频。请根据球的轨迹预测球是否会进入球门,忽略守门员和任何防守干扰。回答是或否。
模型:分析轨迹与物理特性。我目前正在拆解任意球的初始阶段。我的关注点在于球离开球员脚部时的发射角度、速度和旋转,以便更好地预测其路径。现有总结:分析轨迹与物理特性。我目前正在拆解任意球的初始阶段。我的关注点在于球离开球员脚部时的发射角度、速度和旋转,以便更好地预测其路径。确定是否进球。我的分析确认球的轨迹偏离球门。尽管越过了人墙,它将从右侧门柱外侧飞过,完全错过球门。我的预测是明确的“否”。确认最终路径。我的评估表明球的轨迹持续向右偏转。它最终将错过球门,从右侧门柱外侧飞过,确认为“否”的结果。否。 ✓
用户:观察图像序列,我可以看到一名球员正在练习任意球。让我追踪球的轨迹:1. 球起始于球员前方的地面上。2. 球员助跑并击球。3. 在后续帧中,我看到球在空中飞向球门。4. 在最后几帧中,球似乎飞越/偏离了球门,在第14帧中,我看到球似乎飞向左侧且位置较高,似乎错过了球门(飞越横梁或偏出)。更仔细地观察最后几帧,球似乎正朝左上角飞去。在倒数第二帧和最后一帧中,球似乎已经飞越横梁/偏出球门。更仔细地检查第12帧,球在球门附近的空中可见,它明显高高飞起并向左,飞越了横梁。所以答案是否定的,球没有进。否。基于后续帧中可见的轨迹,球似乎高高向左弯曲,飞越横梁而不是落入球门。球的飞行路径显示它上升且没有足够快地下降以保持在横梁下方。 ✓
用户:决定球门轨迹。我需要确定这是否是一个进球。我的观察表明,从相机视角来看,其轨迹正朝向球门的左上角上升。在第12帧中,球在人墙上方并进入球门区域。在随后的帧中,它似乎靠近横梁,可能就在左侧门柱内侧。球似乎旋入左上角,因此我将得出结论,这是一个进球。是!是。 X
图 30. 足球射门定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
用户:这是一段高尔夫击球的视频。请根据观察到的轨迹预测高尔夫球是否会进洞。回答是或否。
模型:预测球轨迹。我目前专注于分析球从长草区击出后的路径。我的过程包括追踪其在果岭上的落点,观察其滚动,并确定它最终是否会进洞。根据视频,高尔夫球滚过球门并未进洞。因此,答案是否定的。 X
用户:观察图像序列,我可以看到一名高尔夫球手从球道击出攻果岭球。球在空中飞行并落在果岭上,向旗杆/球洞滚动。在最后几帧中,球似乎滚到球洞附近,但停在球洞旁而不是进洞。否。 X
用户:推断轨迹方向。我需要基于图像序列给出是或否的答案。球从右侧接近,向左滚动朝向球洞。在最后一帧中,它似乎位于球洞右侧且略低的位置,可能相距约一英尺。我需要根据其观察到的轨迹预测它是否会进洞。看起来球很可能停在球洞附近但实际不会进洞。所以,答案是否定的。否。 X
图 31. 高尔夫射门定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 32 页
32
:这是一段台球视频。请预测目标球是否会进袋。回答是或否。
:观察球轨迹。我目前专注于分析击球的初始设置。我的思路集中在母球与目标球之间的精确对齐上,这是预测结果的关键第一步。分析球的运动。我的注意力已转移到击球的动态阶段。我正在追踪母球撞击后的路径,并观察其与目标球的相互作用,注意初始角度和施加的力。根据球被击中后的轨迹,它似乎会直直地进入中袋。是。 X
:查看图像序列,我可以看到一场正在进行的台球比赛。穿白色衣服的球员正在瞄准击球。让我追踪进展:球员似乎在瞄准黑8号球,母球(白色)位于其后方。在整个序列中,球员保持击球姿势,仔细瞄准。在后面的帧中,球员似乎已经击球并站起来观察结果。查看各帧中的球位置,母球和8号球(黑色)位于球台中心偏左的位置。球员似乎正瞄准将8号球打入其中一个袋口。在最后几帧中,球员直立站着观看球台,8号球仍然可见在台面上,表明这杆球没有进袋。实际上,我意识到这些帧中的大多数显示的是设置和瞄准阶段,包括练习挥杆,而不是实际击球的结果。球员在最后两帧中更直立的姿势表明击球已经完成,但8号球仍然看起来在台面上,所以我的答案是否。否。基于图像序列,穿白色衣服的球员正在瞄准黑8号球。在整个帧序列中,我们可以看到球员的击球设置和练习挥杆。在最后几帧中,球员站起来观察结果,黑球看起来仍然可见在台面上,表明目标球没有进袋。 ✓
:确定球轨迹:我需要确定目标球(看起来是一个绿色的条纹球)是否会基于其轨迹进入底部中间的袋口。序列表明母球击中了位于上部中间的绿色条纹球,然后它向下移动向袋口。在最后几帧中,它正好位于底部中间袋口的边缘,所以我得出结论答案是是。是。 X
图 32. 台球击球定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 33 页
33
问题:这是一段游泳比赛的视频。画面顶部的泳道是第1道,泳道编号从上到下递增。请判断第4道和第6道的游泳者中,谁会先到达终点线。回答4或6。
回答:观察游泳比赛。我目前专注于区分接近终点的第4道和第6道的游泳者。我的分析始于注意比赛的进展并识别第1道的游泳者。比较第4道和第6道。我现在正全神贯注地比较接近池壁的第4道和第6道游泳者的进度。我最初的重点是建立比赛背景并注意到第1道的游泳者,但我当前的重点是确定这两位特定竞争者中的获胜者。确定第4道获胜者。我已经完成了分析,并确认第4道的游泳者比第6道的游泳者先到达终点。我的观察集中在他们接近并触碰终点池壁时的位置。4。 X
回答:观察图像序列,我需要追踪第4道和第6道的游泳者在接近终点线(后续画面左侧的墙壁)时的位置。观察后续画面(当他们接近墙壁时),我可以看到游泳者正靠近左侧墙壁。让我比较第4道和第6道:在后续画面中,第4道的游泳者似乎略微领先或与第6道的游泳者大致持平。观察最后几个画面,第4道似乎比第6道稍微先到达墙壁。实际上,让我再仔细看看。在最后几个画面中,游泳者正接近左侧的墙壁。第4道和第6道非常接近,但在大多数后续画面中,第4道似乎略微领先。观察游泳者接近终点池壁(左侧)的帧序列,我可以追踪第4道和第6道的相对位置。在后续画面中,第4道的游泳者始终比第6道的游泳者更接近终点墙壁。4。 X
回答:评估游泳泳道。我需要确定第4道或第6道的游泳者中,谁先到达左侧的终点。他们正从右向左移动,朝向终点墙壁。当我观察画面时,时间推移,很明显泳道编号在左侧,那里有官员驻守。看起来第4道始终领先于第6道,并且在结束时更接近左侧墙壁。因此,答案是第4道。评估游泳泳道。我需要确定第4道或第6道的游泳者中,谁先到达左侧的终点。他们正从右向左移动,朝向终点墙壁。当我观察画面时,时间推移,很明显泳道编号在左侧,那里有官员驻守。看起来第4道始终领先于第6道,并且在结束时更接近左侧墙壁。因此,答案是第4道。4。 X
图33. 游泳比赛的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 34 页
34
:这是一段有人坠落的视频。请判断该人的坠落方向。回答“左”或“右”。
:确定坠落方向。我正在分析视频,特别是个体如何失去对横杆的抓握。我的重点在于腿部摆动产生的动量,以及这如何直接导致向后坠落。确认坠落轨迹。我修正了我的评估;尽管有初步观察,但仔细查看显示,由于旋转动量,坠落轨迹在画面中主要向左,而非直接向后下降。左。 X
:观察图像序列,我可以追踪人物的运动:1. 起初,人物悬挂在树枝上(第1-4帧)。2. 他们摆动并积累动量(第5-8帧)。3. 他们从树枝上释放并在空中飞行(第9-12帧)。4. 他们在向画面左侧移动时落地/坠落(第13-16帧)。人物向左坠落。左。 X
:确定坠落方向。我需要决定人物是向左还是向右坠落。看起来他们悬挂在树枝或单杠上,我必须检查16帧的序列以分析运动。起初,人物悬挂在画面右侧,然后向左摆动。到最后,他们似乎正在向长凳下降,但仍向左移动。我认为我会将坠落方向分类为可能向左,但我想确保仔细检查所有内容。分析运动帧。在第一帧中,一个人悬挂在靠近树干(位于右侧)的树枝上。人物的身体看起来在树干的左侧,手臂举过头顶。在第二帧中,他们开始稍微向左摆动,腿部也朝那个方向移动。到第5-8帧,他们的身体进一步向左移动,抬起膝盖并摆动。在第9-10帧中,他们的身体水平伸直,脚朝向左侧,头朝向树干。检查摆动轨迹。人物可能以脚领先向左摆动,而身体在后面拖曳,表明其质心向左移动。在第11帧中,看起来一只手可能正在释放,身体仍然向左并略微向下移动。到第12帧,双手都离开了,身体处于空中,位置在中心右侧并向摄像机移动。第13-16帧显示人物在地面或长凳区域附近下降,可能准备以坐姿着陆,一只手在他们身后,相对于背景仍然向左移动。分析坠落方向。我想确保我正确理解问题。它要求我确定视频中人物的坠落方向,具体是相对于观察者向左还是向右坠落。通常,数据集根据水平运动对坠落方向进行分类。在这种情况下,由于人物摆动然后坠落,且树在他们的右侧,看起来他们正在向左坠落。左。 X
图 34. 坠落方向的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 35 页
35
用户:这是一个叠叠乐游戏的视频。请预测在试图抽出的积木被移除后,塔是否会保持稳定。回答“是”或“否”。
模型:分析叠叠乐的稳定性。我目前正在解析视觉数据,特别关注一只手指示塔基座上蓝色积木的动作。我的分析正在深入,以理解底层中这块目标积木的结构影响,该层看起来由三块积木组成。细化层结构。我的注意力已转移到细化底层的细节上。我已确定蓝色积木为目标,现在正在确认其精确位置以及支撑它的粉色积木。最初认为底层有三块积木的印象是不正确的;它实际上是两块积木的配置,这在移除蓝色积木时对稳定性分析产生了重大影响。评估积木相互作用。我现在专注于手与中央蓝色积木之间的相互作用。我目前的想法是手指指示该积木为移除目标。这促使我分析手是在推还是在指。修正底层配置。我正在重新审视初始层评估。我之前的关于两层底层的想法是不完整的;我现在看到右侧有一块粉色积木和中央一块蓝色积木。关键在于,左侧积木似乎缺失,且上一层的方向不同。评估结构不平衡。我现在正在考虑底层左侧识别出的空隙的影响。我的分析表明,移除手指示的中央蓝色积木将使塔失稳。右侧剩余的粉色积木无法充分支撑偏移的重心。根据视觉证据,塔的底层目前仅由两块积木组成:中间的蓝色积木和右侧的粉色积木。左侧的积木已经缺失。如果手移除中间的蓝色积木,塔的全部重量将仅由最右侧的单块粉色积木支撑。由于塔的重心大致位于中间(即当前蓝色积木所在的位置),移除这个中央支撑将导致塔完全失去平衡并立即向左倒塌。因此,塔将无法保持稳定。否。 X
用户:查看图像序列,我可以看到一个由粉色/红色和蓝色积木组成的叠叠乐塔。一只手从左侧靠近,似乎正伸向塔中下部的一块积木。手似乎正在指向或试图从塔底部附近抽出一块积木。在整个所有帧中,塔看起来相对稳定,并没有明显倾斜或显示倒塌迹象。查看被瞄准的积木,它似乎是下部的一块积木。塔在全部 16 帧中保持直立,这表明要么积木尚未完全移除,要么塔保持稳定。由于塔在整个所有帧中看起来稳定且未显示任何倾倒迹象,我将预测塔将保持稳定。是。移除积木后塔将保持稳定。手似乎正瞄准塔基附近的一块积木,但塔在整个图像序列中保持其结构完整性。塔没有显示明显的倾斜或不稳定,重量分布看起来足够平衡,即使在移除积木后也能支撑结构。 ✓
用户:评估积木稳定性。我正在观察位于同一层粉色积木之间的底部中央的蓝色积木。如果从左侧推动,整个装置可能会向右移动并倾倒。这块蓝色积木似乎是底部三块积木行中的中间一块。如果我移除它,两块外侧积木可能会使塔保持稳定,但我仍需评估重心和整体支撑。结构相当不规则,但大致居中。检查积木稳定性。看起来手指位于第二行粉色积木下方,而蓝色积木夹在另一块粉色板下方。他们选择了一块与前面齐平的积木,使其易于推动,但如果塔不稳定,它可能会迅速倒塌。尽管如此,推动时没有明显的倾斜。如果在叠叠乐设置中移除底部中央支撑,两块外侧积木可能会保持稳定。我将检查顶部中心相对于底座的位置,以查看其是否保持平衡。确认积木位置。我想再次确认目标积木实际上并非位于中心左侧。我的手指正触摸一块可见蓝色积木的左端,它似乎是底部行的中心积木,稍微突出一点。所以,答案看起来是“是”。我只需要用“是”或“否”简单地表达出来。是。 ✓
图 35. 叠叠乐稳定性的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 36 页
36
用户:这是一个Mikado(挑棍)游戏的视频。请预测被指示棒指向的那根棍子是否可以被拿起,而不碰到任何其他棍子。回答是或否。
模型:分析棍子配置。我目前专注于理解Mikado棍子的初始复杂排列。我的过程涉及仔细检查游戏的最初时刻,以绘制出所有棍子相对于彼此的位置图。确定棍子的可移动性。我已经转向检查相互作用。我的分析显示,目标棍子目前位于另一根水平放置的棍子下方。这一关键细节强烈表明,如果不扰动其他棍子,就无法将其移除。确认棍子相互作用。我最新的分析证实,目标棍子位于至少一根其他棍子之下。这一关键观察使我得出结论,任何试图操纵它的尝试都不可避免地会导致扰动其他组件。检测支撑棍。我已经彻底检查了视觉数据并确定了目标棍子。我的分析揭示它明确地位于至少一根其他棍子之下,根据游戏规则,使其孤立是不可能的。根据视频,被手压下的棍子显然位于至少一根其他棍子之下。因此,如果你试图拿起或移动它,它将不可避免地触碰并移动位于其上方的棍子。否。 X
用户:查看图像序列,我可以看到有人在玩Mikado(挑棍)。图像显示一只手伸向棍子堆,似乎试图拿起一根特定的棍子。查看后面的帧,我可以看到那只手伸向棍子堆的底部中心区域,那里有多根棍子相互重叠和交叉。该区域的棍子似乎与上方和下方的其他棍子纠缠在一起。鉴于该区域棍子的密度以及它们相互重叠的方式,在不扰动其他棍子的情况下拿起指定的棍子将非常困难。否。手/指示手势所指示的棍子似乎位于棍子堆中密集重叠的区域,其中多根棍子相互交叉和重叠。鉴于该区域可见的交叉点和接触点数量,在不扰动相邻棍子的情况下移除指定的棍子将非常困难。 X
用户:评估棍子移动。我需要确定指定的棍子是否可以在不触碰其他棍子的情况下被拿起。看来我应该分析显示一只手拿着指示棒靠近中心的帧,以识别目标。我猜它可能指向簇中的另一根棍子。关键问题是手能否在不干扰的情况下成功拿起它。我可能需要根据视频片段评估动作以评估结果。识别目标棍子。我注意到指示棒的尖端似乎靠近中心,在手左侧。在第4帧中,有一根细棍从拳头中伸出,可能指向中心右侧的另一根棍子。手垂直拿着一根棍子,这让我认为它是在指示一个特定目标。我需要澄清,问题在于被指示的棍子,而不是指针本身。我需要找到指针的尖端,以决定引用哪根棍子。确定目标棍子。我需要查看相对于指针尖端最中心的位置来确定目标棍子。当我检查第10到16帧时,我看到指针移向一根特定的棍子。指针垂直拿着,略带角度。它似乎悬停在一根短斜棍附近,该短斜棍穿过一根长棍下方。潜在的目标看起来像是一根带有红色和蓝色段的短棍。这很困难,因为很难看到清晰的移除,更多的是评估可见性和接触点。确定棍子接触。我正在分析目标棍子是否与附近的棍子接触,通常,接触会导致它们位置的明显变化。我没有在这里看到这种情况发生。有一根向右倾斜的小棍穿过目标棍子下方。在第4帧中,它看起来略有对角线,但在后面的帧中看起来没有变化。这表明提取可能没有接触。因此,答案可能是是。我只需要将其确定为是或否。是。 ✓
图 36. Mikado 依赖性的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。
第 37 页
37
:这是一个绳结操作的视频。请判断该绳结是活结(通过拉动一端即可解开)还是死结(无法解开,且在被拉动时保持紧固)。回答“Slip”或“Fixed”。
:识别绳结类型。我目前正在分析绳结形成的初始阶段。我的重点是通过观察绳子在杆子周围的操纵方式,来区分它是活结还是死结。确认活结机制。通过详细观察,我已确认所呈现的打结动作清楚地展示了活结的定义特征。具体而言,如 00:16 和 00:23-00:25 标记所示,能够通过拉动工作端完全解开绳结,这证实了这一识别结果。Slip。 X
:观察图像序列,我看到有人在金属栏杆/管道上打结。让我分析一下进展过程:1. 这个人开始将白色绳子/线缠绕在深色金属管上。2. 他们通过几个打结步骤操纵绳子。3. 在最后几张图像中,绳结似乎已完成,有两个末端从绳结中伸出。观察最后几帧,绳结看起来有一个紧凑的中心,两端从中伸出。根据其打结方式,中间帧中可见的环和缠绕,以及最终结果显示出一个看似牢固的、围绕管道收紧的绳结,这看起来可能是一个双套结(clove hitch)或类似的死结。更仔细地检查打结序列,特别是环的形成方式以及绳子在中间帧中穿过的路径,这形成了一个在拉动时会收紧而不是滑动的绳结。最终结构显示两端伸出,表明这是一种固定在栏杆上的、非滑动的连接,可能是双套结或收紧结(constrictor knot),旨在牢固固定。Fixed。图像序列显示该人在金属栏杆上打结,涉及多次缠绕和穿插。最终结果显示出一个紧凑、牢固的绳结,两端向外伸出,表明在施加张力时会紧紧抓住杆子。这种打结技术涉及相互穿过的环并在栏杆处收紧,是死结(如收紧结或类似的绑扎结)的特征,当从任一端拉动时会保持牢固,而不是在一端被拉动时松开的活结。 ✓
:分析绳结结构。我需要确定拉动绳结的一端是否会将其解开。序列显示绳结附近有一段短尾和一段长工作端,这似乎形成了一个环并缠绕在固定端上。在最后几帧中,当拉动长的自由端时,绳结仍然保持在栏杆上。我需要根据自由端是环(bight)还是实际末端来将绳结分类为活结或死结。看起来它是死结,因为尾端被穿过了,且拉动会使其收紧。Fixed。 ✓
图 37. 绳结类型的定性可视化。我们比较了 GPT-5.4-thinking [40]、Gemini-3.1-Pro-Preview [41] 和 Claude-Opus-4.6-thinking [1] 的输出。灰色文本表示内置的思维内容。