世界模型会运动,却不懂动力学?iKCE诊断长视界失效
长视界世界模型可能只会做平滑的运动学外推,并未理解摩擦等动力学变化。论文提出iKCE和扰动扫描进行测试时诊断。本期分析摩擦无感、关节噪声阳性对照和消融结果,也说明低iKCE不能直接等同于动力学正确。
长视界世界模型可能只会做平滑的运动学外推,并未理解摩擦等动力学变化。论文提出iKCE和扰动扫描进行测试时诊断。本期分析摩擦无感、关节噪声阳性对照和消融结果,也说明低iKCE不能直接等同于动力学正确。
小型多模态模型加入触觉时容易发生灾难性遗忘。Splash冻结视觉关键子空间,只更新休眠子空间与触觉前端。本期查看VTL与视觉基准、稀疏率消融和实时延迟,并讨论静态子空间和跨传感器泛化。
MrFlow采用低分辨率生成、像素空间超分和高分辨率微调的分阶段采样,在无需训练的情况下加速Flow Matching。本期核对Qwen-Image与FLUX结果、组合蒸馏收益,以及VAE、超分开销和低频偏差风险。
LingBot-Vision把边界从下游输出变成预训练信号,通过边界强制掩码和在线目标生成提升密集空间感知。本期查看深度、分割、视频对象分割和深度补全证据,同时讨论几何能力与全局语义分类之间的权衡。
PixWorld直接在像素空间优化多视图渲染,把3D场景重建和生成放入统一DiT框架。本期解释Pixel-space Flow Matching与Geometry Perception Loss,核对重建、生成和WorldScore结果,并讨论NFE、分辨率和户外泛化限制。
AlayaWorld面向长视界可玩视频世界,组合相机控制、3D空间缓存、压缩历史和少步蒸馏。本期重点看回路闭合、实时提示切换和跨风格结果,并区分视觉一致性、物理交互性与项目页定性展示。
RynnWorld-Teleop让人手姿态驱动动作条件世界模型,生成带动作标签的机器人第一视角训练视频。本期解释深度感知骨架、流式自回归蒸馏和真实机器人策略实验,同时关注合成动力学误差与Sim2Real边界。
面向内容创作的视频模型未必适合机器人。LingBot-Video从稀疏MoE、具身数据画像和多维奖励三方面重新设计视频预训练。本期核对长序列效率、物理合理性证据,并讨论路由开销、训练数据和奖励模型的复现边界。
传统视觉任务需要不同结构和预测头。SenseNova-Vision尝试把检测、OCR、分割、深度、法线和多视图几何统一成文本、图像或混合生成。本期重点看统一接口、语料构建、各任务实验,以及评估协议与复杂场景失败案例。
UniKPT提出了一种全新的类别统一3D SOT框架,核心是用稀疏的、结构感知的关键点匹配替代密集点云交互。通过自适应关键点提取、渐进式对应对齐和置信度感知定位,实现高效且鲁棒的跟踪。