SurgNarrator:用生成式检索打破手术视频理解的速度与推理僵局

论文代表图:figure-01-p002-01

生成式检索在通用视频领域已经展现出桥接推理与速度的潜力,但直接搬到手术场景行不通。原因在于,手术领域有自己独特的术语体系、细粒度的动作分类和严格的语义层级——通用的词汇表和检索策略根本无法适配。SurgNarrator的核心洞见是:将手术视频理解重新定义为在结构化临床概念空间上的查询条件化检索。它不生成自由文本,而是从一个精心构建的、按手术类型分层组织的手术中心词汇表中检索答案。

RUTA:把视觉令牌分配变成一个率-效用优化问题

固定预算的困境

问题的根源在于,现有方法把令牌缩减当成一个预处理步骤,没有和查询需求关联起来。RUTA 的核心洞见是:这本质上是一个率-效用优化问题——在保证回答质量的前提下,最小化传递给大语言模型的令牌数量。这个视角把令牌分配从手工规则提升到了有理论支撑的优化框架。

当文字说谎:SIGNPOST-Bench 如何揭示多模态模型的视觉-文本冲突困境

反事实五元组与 MCRS 评分

此前的文本-视觉冲突研究,要么用离散的分类正确率做判断,要么只比较文字有无的二元情况。SIGNPOST-Bench 的关键突破在于,它把冲突仲裁放到了一个连续的输出空间里——地理坐标。这让研究者第一次可以测量模型预测被对抗文字“牵引”了多远、偏向了哪个方向,而不仅仅是答对还是答错。

PhysMind:把视频变成可执行世界,让VLM真正理解物理

核心差距与PhysMind的思路

这暴露了一个根本差距:VLM擅长语义理解,但缺乏对物理状态转移的精确建模。PhysMind的解决思路很直接——与其让模型凭空推理,不如先帮它从视频里重建一个完整的、可执行的物理世界。这个世界包含了物体的三维网格、运动轨迹和动力学参数,可以被反复运行、检查甚至编辑。等具体问题来了,再在这个世界里“执行”问题,根据执行结果给出答案。

更好、更强、更快、更广:面向多模态大语言模型分割的结构化全掩码预测

论文贡献与解决方案

提出结构化全掩码预测范式,将自回归对话与非自回归掩码生成解耦,通过单次前向传播同时预测所有掩码令牌,在保持对话能力的同时实现高效、高性能的通用分割。