VideoArgus:为每个视频输入定制评分细则,统一评估生成与编辑

失败案例与直觉

提出VideoArgus框架与VideoArgus-Bench基准,通过为每个输入实例生成可复用的、输出盲态的样本特定评分细则,并结合VLM问答与专用视觉工具,实现对五种视频生成与编辑任务的统一、证据驱动的细粒度评估。

LAWM-3D:从人类视频中学习3D感知的潜在动作,构建可泛化的机器人世界模型

几何对齐与多视角训练

提出LAWM-3D框架,通过多视角联合训练、非单射RGB-D重建和几何特征对齐,从无标签人类视频中学习视角不变的3D感知潜在动作,显著提升世界模型的生成质量、物理一致性和泛化能力。

多模态大模型的空间幻觉:如何不训练就揪出推理链中的错误证据?

方法贡献

提出一种无训练、模块化的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA)来定位并纠正多模态大模型推理链中与视觉输入不一致的中间空间证据,从而提升最终答案准确性。