视觉语言模型在科学图表上会“自信地编造”吗?——SCIFIGBENCH的行为评估

A-R-I框架与SCIFIGBENCH的贡献

论文提出SCIFIGBENCH基准与A-R-I行为框架,联合评估VLM在科学图表理解中的感知、推理与不确定性下的行为可靠性,揭示高感知能力模型(如GPT-5.2)仍可能成为“自信的编造者”。

DreamX-Phi 1.0:让视频世界模型真正理解机械臂的刚体动作

研究缺口

DreamX-Phi 1.0 是一个基于 Wan2.2-TI2V-5B 的动作条件视频世界模型,通过 PRoPE 几何注意力、深度监督和对象一致性约束,在给定单帧观测和双手动作轨迹时预测未来视频,并在 WorldArena 2.0 上取得 Track 1 第一、Track 2 并列第二。

因果世界模型:当世界模型不再只是预测器

论文贡献

本文提出因果世界模型(CWM)的形式化定义,将观测、关系变量、动作、转移与效用耦合为结构化决策模型,并以组件级可识别性框架阐明各组件可从数据中恢复的等价类及接口兼容条件。