关系流形上的流映射蒸馏:让知识迁移从静态对齐走向动态轨迹
提出FoRM框架,将关系知识蒸馏建模为关系流形上的连续流映射问题,通过流映射算子、安全半群一致性和端点锚定损失实现轨迹级监督,在多个复原任务上稳定超越静态蒸馏方法。
提出FoRM框架,将关系知识蒸馏建模为关系流形上的连续流映射问题,通过流映射算子、安全半群一致性和端点锚定损失实现轨迹级监督,在多个复原任务上稳定超越静态蒸馏方法。
现有方法要么需要大量三维标注来训练分割网络,要么用复杂的全局优化来求解标签,但都忽略了一个关键事实:高斯泼溅的渲染器本身就能告诉我们每个像素对应哪个三维原语。CDSeg 的核心洞察就是把这个渲染器变成像素与原语之间的关联引擎,让高斯原语充当标签的载体。
提出坐标感知框架CoordRefer,将坐标帧选择与坐标条件定位解耦,以解决现有方法中因联合预测导致的坐标相对框歧义问题,在多个基准上大幅提升性能。
提出首个百万级工业机械制图到可执行参数化CAD程序生成的基准OmniMech,系统评估了当前LMM在精确几何重建、尺寸标注理解和工程约束推理方面的严重不足。
ChronoVision 通过重建最终视觉状态的潜在表征并引导注意力到关键动态区域,来解决多模态大模型在复杂时间推理任务中的文本瓶颈问题。
提出EffectLearner框架,结合VLM语义推理与DiT视频修复,并构建包含复杂物理效应的EffectWorld数据集,实现视频中目标物体及其诱发效应的完整、时空一致移除。
提出HERA框架与RRPM适配器,通过结构化记忆库和分离的Memory/Workspace Registers将历史证据路由至冻结的V-JEPA 2预测器,提升物理违规检测的准确性。
这就是 DynaPix 基准揭示的核心发现:时间锚定差距。现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 用物理模拟器生成场景,因此每个未来帧都有精确的真值。它将预测任务分为三类:由碰撞等物理事件锚定的、由经过的固定时间锚定的、以及由短时间窗口锚定的。结果发现,所有模型在事件锚定上表现尚可,在时间锚定上却集体失败。