E-VQA:通过时空证据掩码实现可解释视频问答

数据:自动化流水线

本文提出E-VQA任务,解决现有Video LLMs缺乏可验证视觉Grounding的问题。通过构建ST-Evidence基准和160k规模指令数据集,模型需输出时间片段与密集分割掩码作为证据。实验显示,Ours-7B在ST-Evidence-Gen上t-mean提升27.2,但单纯增加参数量效果有限,数据质量与架构设计更为关键。