CDSeg:用可渲染高斯载体,把二维分割标签搬进三维世界

方法贡献与验证

现有方法要么需要大量三维标注来训练分割网络,要么用复杂的全局优化来求解标签,但都忽略了一个关键事实:高斯泼溅的渲染器本身就能告诉我们每个像素对应哪个三维原语。CDSeg 的核心洞察就是把这个渲染器变成像素与原语之间的关联引擎,让高斯原语充当标签的载体。

CoordRefer:解耦坐标帧选择与定位,消除多视角3D视觉定位中的坐标相对框歧义

研究空白与核心思路

提出坐标感知框架CoordRefer,将坐标帧选择与坐标条件定位解耦,以解决现有方法中因联合预测导致的坐标相对框歧义问题,在多个基准上大幅提升性能。

DynaPix:视觉语言模型为何认不出精确的未来?

论文代表图:figure-01-p002-01

这就是 DynaPix 基准揭示的核心发现:时间锚定差距。现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 用物理模拟器生成场景,因此每个未来帧都有精确的真值。它将预测任务分为三类:由碰撞等物理事件锚定的、由经过的固定时间锚定的、以及由短时间窗口锚定的。结果发现,所有模型在事件锚定上表现尚可,在时间锚定上却集体失败。