深度学习
从体育到安全:多模态大模型为何“看见”危险却“看不懂”因果?
提出SPRINT基准,通过2888个真实体育视频评估MLLMs的主动物理危险预警能力,揭示模型在危险感知与因果理解之间存在巨大差距,且高度依赖提示词。
WorldClaw:用智能体从一句话生成可探索的3D开放世界
WorldClaw是一个从开放文本提示生成可探索、可编辑3D世界的智能体框架,通过全局到局部的流程先构建语义地形基础,再生成并放置区域对象。
VideoArgus:为每个视频输入定制评分细则,统一评估生成与编辑
提出VideoArgus框架与VideoArgus-Bench基准,通过为每个输入实例生成可复用的、输出盲态的样本特定评分细则,并结合VLM问答与专用视觉工具,实现对五种视频生成与编辑任务的统一、证据驱动的细粒度评估。
TruthLens:让LVLM自己说出幻觉——一个特殊token如何暴露模型的不诚实
TruthLens微调LVLM的LM head,通过一个特殊token的对数概率来暴露每个目标token的真实性信号,无需辅助模型即可实现SOTA的幻觉检测。
一段落胜千条标题:重新思考视觉-语言检索的文本监督
通过冻结视觉编码器并仅微调文本编码器,系统性地研究了文本粒度(从短标题到多句段落)对对比式视觉-语言检索的影响,发现段落监督是提升长文本检索性能的最关键因素。
LAWM-3D:从人类视频中学习3D感知的潜在动作,构建可泛化的机器人世界模型
提出LAWM-3D框架,通过多视角联合训练、非单射RGB-D重建和几何特征对齐,从无标签人类视频中学习视角不变的3D感知潜在动作,显著提升世界模型的生成质量、物理一致性和泛化能力。
多模态大模型的空间幻觉:如何不训练就揪出推理链中的错误证据?
提出一种无训练、模块化的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA)来定位并纠正多模态大模型推理链中与视觉输入不一致的中间空间证据,从而提升最终答案准确性。