CG-World:用工业CG的隐藏状态教会世界模型理解物理演化
世界模型研究正从视频生成转向世界理解与预测,但现有数据集大多只提供终端观测,缺乏动作、物理状态与因果干预信号。CG-World从工业CG生产管线中恢复出约85万条镜头级世界状态片段,将显式的物理中间状态、多模态观测与同根反事实分支系统对齐。实验表明,基于CG-World的后训练能显著提升视频生成质量、动作预测精度与VLA仿真迁移成功率。数据集继承工业CG生产偏差,生产衍生状态不能直接视为真实世界物理真值。
世界模型研究正从视频生成转向世界理解与预测,但现有数据集大多只提供终端观测,缺乏动作、物理状态与因果干预信号。CG-World从工业CG生产管线中恢复出约85万条镜头级世界状态片段,将显式的物理中间状态、多模态观测与同根反事实分支系统对齐。实验表明,基于CG-World的后训练能显著提升视频生成质量、动作预测精度与VLA仿真迁移成功率。数据集继承工业CG生产偏差,生产衍生状态不能直接视为真实世界物理真值。
多模态大模型在推理时越来越喜欢画草图、做标注,但它们真的依赖这些自生成的视觉信息吗?See2Think这篇论文没有只看最终答案,而是设计了一套诊断框架,把视觉推理拆成三个环节:动作是否相关、渲染是否保真、后续推理是否采纳。通过在1200个样本上对四个主流模型进行标准与损坏渲染的对照实验,研究发现一个反直觉的结论——模型经常提出相关动作,但渲染质量普遍不高,而且即使渲染正确,收益也远小于损坏反馈带来的伤害。这说明当前模型的中间视觉推理更像一种行为惯性,而非真正的视觉依赖。视频将带你理解这一诊断逻辑及其对多模态系统设计的启示。
视频世界模型通过想象动作后果来规划机器人行为,但现有方法用关节状态或演员掩码作为条件化信号,这些信号与特定具身深度绑定,难以从人类演示迁移到机器人。ContactFlow 提出一种具身无关的动作表示——将手或夹爪与物体间的 3D 接触点轨迹投影到图像空间,形成稀疏的 7 通道控制视频。基于 Wan 视频扩散模型训练后,该方法在 DROID 数据集上取得最优视频预测质量,并在 7 个未见数据集上展现出强泛化能力。真实世界实验中,世界模型在 10 个桌面抓取放置场景中正确预测了 8 个场景的执行结果。但该方法依赖标定良好的外中心相机和可靠深度估计,推理速度也远未达到实时。
现有的游戏世界模型虽然能生成逼真的游戏画面,却常常违反游戏规则——比如零血状态下还能攻击,或者技能槽没满就放出超杀。StatePlay 通过显式预测血量、技能槽等内部状态,让生成的画面真正符合游戏机制。在街霸3数据集上,StatePlay 的机制保真度相比最强基线提升了近20个百分点。但该方法目前仅在格斗游戏上验证,且依赖模拟器提取的精确状态标注,泛化到其他游戏类型仍需更多工作。
现有流式音视频生成方法依赖不断增长的KV缓存,推理成本随生成长度线性增加,难以支持长视频。Ripple提出跨模态循环记忆机制,用固定长度滑动窗口替代KV缓存,实现恒定成本推理。记忆模块包含模态特定的记忆构建与跨模态交互,通过三阶段训练范式将双向教师模型转化为流式生成器,并在第三阶段首次引入在线扩散强化学习优化音视频质量与同步性。实验表明,Ripple在30秒长视频生成中实现约15倍加速,且音视频质量与身份一致性超越教师模型。用户偏好率显著优于OmniForcing和Hallo-Live。局限在于长视频中运动多样性受限,因首块缓存引入时间锚定效应。
SLAM实时但脆弱,一次跟踪失败就可能导致重建崩溃;SfM离线但把视频当成无序图片,完全浪费了时序信息。VidMap提出非因果重建范式:先像SLAM一样提取时序轨迹和回环,再像SfM一样做全局优化,但关键创新在于它记住了每条观测的“来源”——是顺序跟踪还是回环匹配。这让系统能用不同策略对待不同观测,有效压制视觉对称导致的错误回环。同时,VidMap把单目深度先验注入全局定位,解决了纯旋转等退化运动下的尺度漂移。在LaMAR、CroCoDL等四个数据集上,VidMap全面超越现有方法,尤其在灾难环境的机器人序列上优势巨大。但系统为离线设计,不适用于实时应用,且深度先验在短序列上可能引入噪声。
自回归视频扩散模型在长时域自滚动生成中,误差累积会导致颜色漂移、运动停滞和视觉崩溃。现有attention sink方法可以缓解但无法根除这一问题。FreqForcing从频域角度揭示了问题的本质——低频能量漂移,并提出频谱自锚定(SSA)技术,通过双分支注意力与频域融合显式校正频谱能量。在VBench-Long基准上,FreqForcing在60秒和120秒生成中均取得最优的动态程度和整体一致性,且仅增加约16.5%的推理延迟。需要注意的是,SSA的超参数需手动调节以平衡一致性与多样性,且方法目前仅在Wan2.1-T2V-1.3B和Self-Forcing上验证。
当前主流 VLA 模型将大语言模型置于核心,视觉信息先转成文本 token 再预测动作,这条 V→L→A 间接通路带来了巨大的计算和内存开销。TurboVLA 提出直接 V+L→A 范式,用轻量双向交叉注意力融合视觉与语言特征,完全绕过 LLM。在 LIBERO 基准上以 0.2B 参数达到 97.7% 成功率,推理延迟仅 31.2 ms,显存占用不到 1 GB。真实世界实验中四项任务均优于 π0.5。但该方法专为执行级指令设计,缺乏高层任务规划所需的复杂语义推理能力。
现有的具身评测要么抽象掉物理运动,要么将决策与电机控制纠缠在一起,无法单独评估 VLM 的动作推理能力。HumanCLAW 提出了一套解耦框架:VLM 只负责决策,技能条件运动生成器负责执行,半物理仿真器负责反馈。在包含 1218 个长程寻找-导航-交互任务的基准测试中,最强的 VLM 也只能完成 16.8% 的完整交互任务。错误分析表明,失败主要源于 VLM 无法感知自身身体状态——它不知道何时已到达目标、何时被卡住、何时会坐到空气里。这项研究为具身智能的评估提供了新视角,但也受限于仅使用自我中心视觉输入、交互任务单一等局限。 论文介绍、全文中文翻译与相关资料: https://www.pc
传统3DGS难以处理镜面反射,且现有反射重建方法通常依赖密集的360度覆盖。PanoLess通过表面对齐的2D Gaussian Splatting提取精确法线,结合延迟着色查询神经立方体贴图,从单侧反射图像中恢复环境贴图。引入可见性掩码区分观测与推断区域。在Shiny Partial基准上显著优于MaterialRefGS等基线。注意:该方法对相机位姿敏感,且仅适用于高镜面反射表面。