快速导读:提出一种基于3D接触点轨迹的具身无关动作表示Contact Flow,用于条件化视频世界模型,实现从人类演示到不同机器人具身的零样本操作规划与验证。
机器人操作规划的一个核心挑战是:如何让模型在未见过的机器人上预测动作后果?ContactFlow 给出的答案是——不看谁在动,只看在哪里接触。该工作提出一种基于 3D 接触点轨迹的具身无关动作表示,将手或夹爪与目标物体间的接触点及其位移投影到图像空间,形成稀疏的 7 通道控制视频,用于条件化视频世界模型。
在 Wan 视频扩散模型上,ContactFlow 支持 ControlNet 和 VACE 两种控制注入机制,并在混合人类演示与机器人数据上训练。推理时,从规划轨迹和场景重建中合成 Contact Flow,生成预测视频并由 VLM 验证后执行。实验表明,该方法在 DROID 数据集上取得最优视频预测质量,在 7 个未见数据集上展现强泛化能力,并在真实世界 10 个桌面场景中正确预测了 8 个场景的执行结果。
英文题目:ContactFlow: A video action conditioning that transfers across embodiments
论文出处:arXiv 每日论文精选 · arXiv:2607.26579
原始论文:PDF / 论文页面
对应视频标题:ContactFlow:用接触点轨迹打通人类演示与机器人操作之间的具身鸿沟|推荐指数:★★★★★
这篇论文解决什么问题?
世界模型通过“想象”动作后果来实现机器人规划,但视频生成模型常忽略物理接触约束。现有动作条件化方法大致分为两类:一是使用关节状态或末端执行器姿态,这类信号与特定具身绑定,无法跨平台迁移;二是使用演员掩码轨迹,虽然部分解耦了具身形态,但仍偏向演员的形状而非交互的本质——接触。
以 UniPi 和 Cosmos 为代表的工作分别使用文本引导和末端执行器状态作为条件化信号,前者缺乏精确的几何控制,后者具身特定。Mask2iv 使用手-物掩码轨迹,虽能编码交互区域,但掩码本身携带了手的形状信息,在人类手与机器人夹爪之间迁移时仍存在域差距。
这些方法的共同盲点是:物理交互的核心是接触,而非执行接触的肢体形状。一个人类手指的接触点与一个平行夹爪的接触点,在几何和物理意义上是可对齐的——这正是 ContactFlow 的出发点。
此外,现有方法在数据利用上也存在瓶颈。人类操作视频丰富但缺乏机器人关节标注,机器人数据有精确状态但规模有限。ContactFlow 通过从两类数据中统一提取接触点轨迹,实现了数据层面的规模化利用。
核心创新
- 提出Contact Flow:一种紧凑、具身无关的动作表示,基于3D接触点轨迹,在图像空间编码交互界面。
- 实现用Contact Flow条件化视频世界模型,支持ControlNet和VACE两种控制注入架构及多种模型规模。
- 构建可扩展的数据处理管线,从异构人类演示和机器人数据集中提取Contact Flow,并用于零样本推理。
方法概览
提出Contact Flow:将手或夹爪与目标物体间的3D接触点及其位移投影到图像空间,形成稀疏7通道控制视频。利用该信号条件化基于Wan的视频扩散模型(支持ControlNet和VACE两种注入机制),在混合人类和机器人数据上训练。推理时,从规划轨迹和场景重建中合成Contact Flow,生成预测视频并由VLM验证后执行。
- Contact Flow 定义:对于手或夹爪上的每个接触点,记录其在 3D 空间中的位置和位移,然后投影到图像空间,形成 7 通道的稀疏控制视频。7 个通道包括:接触点位置(x, y)、位移向量(dx, dy)、接触置信度、以及一个时间衰减掩码,用于编码接触的时序信息。
- 符号孪生场景重建:从单视图 RGBD 图像出发,利用 SAM3 分割物体和手/夹爪,结合深度信息重建度量一致的 3D 场景模型。该模型称为“符号孪生”,是后续接触点提取和轨迹规划的基础。
- 数据处理管线:从异构数据集中自动提取 Contact Flow。对于机器人数据,利用已知的末端执行器姿态和物体分割计算接触点;对于人类演示数据,利用手部姿态估计和物体分割推断接触区域。管线支持 DROID、RLBench、AgiBot、TACO 等多个数据集。
- 视频世界模型训练:基于 Wan 视频扩散模型,支持两种控制注入机制——ControlNet 通过额外的空间控制分支注入 Contact Flow 信号,VACE 则在扩散 Transformer 的注意力层中注入条件。模型在混合人类和机器人数据上训练,学习具身无关的视频预测能力。
- 推理管线:给定初始 RGBD 观测,构建符号孪生场景;策略(如 π0.5)在符号孪生中规划末端执行器轨迹;从轨迹中合成 Contact Flow;世界模型生成预测视频;VLM 验证预测结果是否符合任务目标;验证通过后执行动作。
- 跨具身泛化机制:Contact Flow 只编码接触点的几何信息,不编码手或夹爪的形状。因此,从人类手部接触点学到的交互模式可以直接迁移到机器人夹爪上,只要接触点的空间位置和位移模式相似。
逐图理解论文
方法实现与验证

Table 1 展示了在 DROID 数据集上的视频预测质量对比。Contact Flow 结合 ControlNet 在 Wan 2.2 14B 模型上取得所有指标的最优结果,DreamSim 低至 0.035。注意观察 CF 方法在 PSNR 和 SSIM 上相对于 Kinema4D 的显著提升,这反映了接触点表示在保持场景结构方面的优势。
Figure 1: Closed-loop deployment with Contact Flow

Figure 1 展示了 Contact Flow 的闭环部署流程。左侧从单视图 RGBD 构建符号孪生场景,π0.5 策略在其中规划轨迹;右侧对比真实执行(上)与世界模型预测(下),注意观察预测视频中物体运动与真实执行的一致性,以及接触点轨迹如何准确编码了夹爪与物体的交互。
Table 2: Cross-dataset evaluation

Table 2 展示了跨数据集泛化评估结果。关键观察点:在人类手部数据上训练的模型(human)在机器人数据集(如 TACO、TASTE-Rob)上仍取得优异指标,DreamSim 分别低至 0.021 和 0.016,这直接验证了 Contact Flow 的具身无关特性。
实验如何设计?
- DROID 数据集评估:在 25 个留出片段上评估视频预测质量,使用 DreamSim、PSNR、SSIM 三个指标,预测和真值均使用 RoboSeg 掩码去除可见机器人。
- 跨数据集泛化评估:在 RLBench、AgiBot、GenieSim、TACO、TASTE-Rob、OakInk、EgoDex 等 7 个未见数据集上测试,每个数据集 25 个留出片段,同样掩码去除可见手/机器人后计算指标。
- 真实世界实验:在 Franka Panda 机器人上部署 10 个未见桌面抓取放置场景,测试完整的“提议-想象-验证-执行”闭环管线。
- 基线对比:包括 Kinema4D(使用 4D 点图编码完整机器人几何)、CTRL-World(低维动作嵌入)、TesserAct(仅语言条件化)。
- 模型规模消融:测试 Wan 2.2 14B 和更小规模模型,以及 ControlNet 和 VACE 两种注入机制的性能差异。
关键结果与论文证据
- DROID 数据集上,Contact Flow + ControlNet(Wan 2.2 14B)取得最佳结果:DreamSim 0.035,PSNR 24.20,SSIM 0.896,显著优于 Kinema4D 等基线(Table 1,第 7 页)。
- 跨数据集泛化表现突出:14B(human)模型在 TACO 上 DreamSim 0.021,PSNR 28.28,SSIM 0.869;在 TASTE-Rob 上 DreamSim 0.016,PSNR 30.66,SSIM 0.899(Table 2,第 8 页)。
- Contact Flow 在人类手部数据上训练的模型,可以直接泛化到机器人夹爪场景,验证了具身无关表示的有效性(Table 2 中 human 模型在机器人数据集上的表现,第 8 页)。
- 真实世界实验中,世界模型在 8/10 个场景中正确预测了真实机器人执行结果,而直接部署 π0.5 策略的成功率为 0,强调了验证步骤的必要性(第 8 页)。
- ControlNet 注入机制在大多数场景下优于 VACE,尤其在保持物体形状和接触区域精度方面(Table 1,第 7 页)。
- 模型规模对性能有显著影响:14B 模型在所有指标上均优于更小规模的模型(Table 1,第 7 页)。
- Contact Flow 的稀疏性(仅编码接触点而非完整手部区域)是其跨具身泛化的关键:它迫使模型关注交互界面而非演员形态。
- 推理管线中,VLM 验证步骤有效过滤了世界模型的错误预测,将执行成功率从 0 提升到 8/10(第 8 页)。
阅读时需要注意
- 世界模型对交互结果的物理真实性仍可加强,尤其在接触密集型任务中,预测视频可能出现物理不一致。
- 推理速度远未达到实时,限制了在动态环境中的部署。
- 接触质量依赖上游标定、度量深度和 SAM3 分割精度,假设存在标定良好的外中心相机和可靠深度估计。
- 真实世界实验中,π0.5 策略单独运行成功率为 0,但论文未提供详细的失败分析。
- Table 2 中 EgoDex† 数据集标注了 † 符号,但未在提供页面中解释其含义。
关联工作
- Kinema4D 使用 4D 点图编码完整机器人几何作为条件化信号,是零样本迁移的主要对比方法,但其信号维度高且与机器人几何强绑定。
- UniPi 使用文本引导视频生成作为通用策略,缺乏精确的几何轨迹控制。
- Cosmos 使用机器人末端执行器状态作为条件化信号,具身特定,无法跨平台迁移。
- Mask2iv 使用手-物掩码轨迹条件化视频生成,虽部分解耦具身形态,但掩码仍偏向演员形状。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
ContactFlow:一种跨具身迁移的视频动作条件化方法
Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum
波恩大学,Lamarr研究所
摘要:世界模型为机器人规划提供了一条有前景的途径,它使智能体能够在执行前想象并验证动作的后果。然而,当前基于视频的世界模型往往难以捕捉支配操作行为的物理约束,尤其是接触约束。此外,它们的动作条件化通常局限于特定具身,例如平行夹爪。我们提出Contact Flow,这是一种具身无关的动作表示,通过编码执行器与目标物体之间3D接触点的轨迹来描述操作行为。通过摒弃执行器特定的外观和运动学信息,Contact Flow为人类演示和机器人执行提供了共享的条件化信号。因此,我们能够在人类和机器人物体交互视频上,以Contact Flow为条件,训练一个大规模视频生成模型,从而得到一个能够预测物理上合理的操作结果的世界模型。我们将该模型集成到一个提议-想象-验证-执行的管线中,在该管线中,生成的推演结果在执行前由视觉-语言模型进行评估。在DROID数据集和真实世界桌面操作任务上的实验表明,Contact Flow能够实现人类演示与不同机器人具身之间的迁移。
关键词:世界建模,动作编码,交互学习
1 引言
教导机器人与物理世界交互,仍然是具身智能的核心挑战之一。一个有前景的方向是为机器人配备世界模型,即一种学习环境动态的模拟器,可用于在付诸执行前规划和验证动作。此类学习型模拟器已被用于一系列机器人应用:通过在意象中推演候选动作序列并选择能达成目标的序列,用于规划和控制[1, 2];通过从生成的视觉动态中预训练或蒸馏操作策略,用于策略学习[3, 4];通过合成新颖的演示和经验来提升泛化能力,用于数据增强[5, 6, 7];以及作为动作条件化模拟器,在真实世界执行前对行为进行评分或验证,用于评估和验证[8, 9]。视频生成领域的最新进展使这一切变得越来越可行:大规模生成模型[10, 11]现在能够以多种信号为条件,合成时间连贯、照片般逼真的未来帧[12]。然而,物理保真度仍然难以实现[13, 14]。视觉上合理的视频未必遵循接触和操作的力学规律,而一个会幻觉出物理上不可能结果的世界模型,对机器人控制而言用途有限。
我们认为,缺失的关键要素之一是一种合适的交互表示,即一种条件化信号,它编码的不是场景的外观,而是智能体计划如何与之进行物理交互。现有方法可分为两类,每一类都存在根本性的局限。基于关节的表示[10, 15]虽然表达力强,但本质上是具身特定的:针对特定运动链定义的信号无法迁移到形态不同的机器人上。执行器掩码或轮廓表示[16, 17]在一定程度上避免了这个问题,但引入了另一种偏差:由于它们编码了执行器的完整轮廓,会不经意地将重点放在执行器的形状上——
第 2 页
接触流:一种用于具身无关操作的统一动作表示
摘要
当前用于机器人操作的动作表示——无论是语言、关键点还是图像目标——都紧密耦合于执行动作的特定具身形态(手或末端执行器),而非其与目标物体的交互。这两种表示都没有分离出物理上真正重要的东西:智能体与世界之间的接触。
这一观察引出了一个简单但意义深远的见解:物理操作由接触主导。无论执行者的形态如何,物体的运动仅由施加于其上的力的位置和方式决定。这可以被捕捉为一个紧凑的、局部的几何信号,且与产生它的具身形态无关。我们将这一直觉形式化为接触流:手或机器人抓取与目标物体之间随时间变化的3D接触点轨迹,并投影到图像空间中。接触流在设计上是最小化的,它丢弃了关于执行者除交互轨迹之外的一切信息,并且由于它完全根据以物体为中心的接触几何来定义,因此可以自然地跨具身形态迁移。
我们使用接触流来条件化一个大规模视频生成模型(Wan [11]),并在异构的人类手物交互(HOI)视频[18]和遥操作机器人演示的混合数据集上进行训练。由此产生的世界模型生成操作推演,并充当轨迹验证器:候选动作序列被渲染为合成视频,并由视觉语言模型(VLM)进行评估,只有在仿真中被判定成功的轨迹才会被传递给机器人执行。至关重要的是,由于接触流抽象掉了执行者,在推理时,完全相同的信号可以直接从机器人在目标物体上规划的抓取中产生:我们读取夹爪与物体之间的3D接触点,并将其投影到相机中,这与我们在训练期间从人手中提取它们的方式完全一致。这使得在训练期间未见过的环境和物体上实现零样本部署成为可能。
我们在DROID [19]的保留测试集、一组训练期间未见过的操作基准测试,以及使用固定臂机械手在桌面操作任务中的真实世界实验(由外中心相机观察,环境在训练期间未见)上验证了此流程。我们的结果表明,一个通过单一具身无关信号从人类和机器人演示中学习交互的模型,能够操作其在训练期间从未遇到过的物体,且环境也是训练期间未见过的,我们将这种能力直接归因于接触流的具身无关特性。我们的贡献如下:
• 接触流,一种人类和机器人共享的新型动作编码:一种紧凑的、具身无关的表示,基于执行者与目标物体之间3D接触点轨迹在图像空间中的投影。 • 一种用接触流条件化视频世界模型的方法,我们使用ControlNet [20]和VACE [12]控制注入机制,并在多个骨干网络规模上进行了实例化。 • 一个可扩展的数据处理流程,用于从异构的人类演示和机器人操作数据集中提取高质量的接触流,并用于推理时的零样本规划。
2 相关工作
面向机器人技术的视频世界模型 近期研究探索了将生成式视频模型作为世界模型,用于机器人规划、策略学习、数据增强和评估。UniPi [1] 使用预测视频作为视觉计划,从中可以推断出动作。GR-1 [3] 表明,大规模视频生成预训练可以改善语言条件化的操作策略。RoboDreamer [5] 学习组合式视频世界模型用于机器人想象,Dreamitate [7] 将生成的人类演示视频迁移到真实世界的视觉运动策略,而DreamGen [6] 则生成神经轨迹以改善机器人学习中的泛化能力。近期工作[8, 4, 9]进一步将视频模型视为动作条件化的模拟器,甚至策略表示。一系列系统将轨迹或显式搜索作为操作推演的控制接口,例如深度编码的轨迹到视频生成[21]和搜索引导的生成式世界模型[22]。我们提出了一种与具身形态无关的动作表示,用于模拟不同智能体的操作轨迹,而不是将世界模型绑定到特定的机器人或手上。
第 3 页
可控视频生成为视频世界模型提供了被引导至任务相关未来的机制。现有方法的主要区别在于条件信号的形式。[2, 6, 23] 依赖高层语义控制,使用语言指定目标或中间计划。另一类工作以动作或运动信号为条件:[8, 10] 使用机器人末端执行器状态,[15] 使用全身人体姿态序列。最后,空间控制方法通过图像对齐的线索引导生成,包括手部掩码 [24]、手-物掩码轨迹 [16]、手部关键点 [18]、深度图 [25]、光流 [26, 27] 以及运动轨迹提示 [28]。这些工作表明,控制信号对于交互视频生成至关重要。然而,大多数现有信号要么是高层语义的,要么是具身特定的,要么与执行者的可见形态绑定。相比之下,我们的工作以执行者与物体之间的接触几何为条件,提供了一种局部且具身无关的交互表示。
手-物交互 大量工作研究手-物交互及其所中介的接触。多个数据集和方法捕捉抓取时接触物体的位置:ContactDB [29] 中的热接触图、ContactPose [30] 中成对的手部姿态与物体接触标注、ContactOpt [31] 中接触驱动的抓取重建,以及 H2O [32] 中的双手操作理解。在机器人学中,接触几何支撑着抓取合成 [33] 和接触丰富的操作规划 [34]。这些工作将接触作为分析或控制目标进行检测、预测或规划。我们将估计的接触几何重新用作生成式条件信号。
跨具身适应是视频世界模型面临的一个关键挑战。关于机器人到机器人的迁移,Kinema4D [35] 将机器人运动表示为编码时空机器人占位的 4D 点图,而 BridgeV2W [36] 使用渲染的具身掩码来引导跨视角、场景和机器人平台的视频生成。这些方法降低了对原始机器人动作的依赖,但仍聚焦于执行具身的几何形态。其他工作使用以物体为中心或基于流的接口,包括作为跨域操作接口的流 [37]、任意点轨迹建模 [38]、3D 物体流 [39] 以及以物体为中心的 3D 运动场 [40]。这些工作与我们以物体为中心的动机一致,但预测的是整个物体或表面的运动,而 Contact Flow 则隔离了产生该运动的主动接触界面。
3 方法
接下来,我们描述接触流以及如何利用它来条件化视频世界模型。然后,我们说明如何从现有的机器人和人类演示数据集中提取接触流以训练模型。最后,我们解释如何在推理时构建接触流输入。
3.1 接触流编码
接触流描述了智能体与场景中物体发生接触的表面界面,以及该接触界面随时间在场景中移动的方式。它捕捉接触发生的位置以及该接触区域如何移动,但不包含随后发生的物体运动。例如,当某人转动门把手时,接触流捕捉手指按压并旋转把手表面的运动,但不包括锁舌释放后门随后摆开的动作。因此,它完美地捕捉了主动动力学,同时排除了被动动力学。这是可取的,因为它将学习信号聚焦于交互本身。它避免了在像素中已包含最终结果的信号上进行训练,并且不与特定的机器人控制接口绑定。相同的接触运动应产生相同的表示,无论它是由人手还是机器人夹爪产生的。形式上,在每个时间步 t,我们将接触流表示为一组接触点
Nt (1) Ct = c(i)t i=1, c(i)t = x, y, z, ∆x, ∆y, ∆z, w ∈R7, 其中 (x, y, z) 是物体表面上接触点在相机坐标系中的 3D 位置,(∆x, ∆y, ∆z) 是它到下一帧的位移(局部接触运动,即“流”),w ∈[0, 1] 是置信度权重。每个点通过相机内参 K 投影到图像平面,即 u(i)t = π K, (x, y, z) ,其七个属性被写入像素 u(i)t 以形成
3
第 4 页
一个稀疏的7通道控制帧,将这些帧沿时间堆叠即得到时空接触流视频C1:T,用于条件化生成器,可渲染为ControlNet [20]分支的控制视频,或编码为VACE [12]的视频条件。
置信度w结合了某点确实处于接触状态的估计置信度与两个几何一致性线索。基础项是具身相关的:对于机器人数据,它源自夹爪与物体表面之间的空间接近程度;对于人手数据,则是HaMeR手部姿态与HACO接触置信度的组合(第3.3节)。随后,我们利用局部时空邻域对w进行调制:时间对齐会提升那些位移方向与邻域点一致的点权重,而邻域密度则会降低孤立点的权重。低置信度点对条件信号和训练损失的贡献都较小,这使得该表示对第3.3节提取管线产生的逐帧含噪接触估计具有鲁棒性。
3.2 CF世界模型
我们基于近期DiT视频生成器[11],采用潜空间视频扩散Transformer来实例化接触流世界模型。给定输入视频x0:T = {x0, x1, . . . , xT },我们将帧编码为潜序列z0:T = E(x0:T ),其中E表示冻结的视频VAE编码器。模型以首帧观测x0和接触流信号C1:T为条件,后者指定了预测时间范围内的预期交互,从而学习一个条件生成模型
pθ(z1:T | z0, C1:T ). (2)
训练在潜空间中使用流匹配目标进行。我们将干净的目标潜序列记为z1:T ∼q(z1:T | x1:T ),并采样相同形状的噪声ϵ ∼N(0, I),首帧潜变量z0保持干净作为条件,不添加噪声。对于采样的时间τ ∼U(0, 1),我们构造插值uτ = (1 −τ) ϵ + τ z1:T ,并训练DiT去噪网络vθ以预测目标速度
h i LFM = Ez1:T ,ϵ,τ ∥vθ(uτ, τ, z0, C1:T ) −(z1:T −ϵ)∥22 . (3)
在推理时,模型从潜空间中的噪声出发,在z0和C1:T的条件下积分学习到的速度场,生成未来潜变量ˆz1:T ,再解码为预测帧ˆx1:T = D(ˆz1:T )。其目标是将未来预测条件化于执行者与物体交互的位置和方式,而非执行者的外观、手部形状、机器人形态或具身相关的动作空间。
基于扩散的生成模型中的控制注入由ControlNet [20]推广,它引入了一个可训练的冻结U-Net编码器模块副本,通过零初始化的卷积层连接。深度图、姿态骨架或边缘图等条件信号通过该并行分支馈入,其输出被加回主网络,从而在不修改预训练骨干的情况下实现细粒度的结构控制。最近,VACE [12]引入了视频条件单元(VCU),将控制信号、参考帧和二进制时空掩码编码为统一的token表示,并通过分布在各网络层的轻量级上下文适配器模块注入冻结的扩散Transformer,实现了对空间结构和时间动态的同时组合控制。
本工作中,我们使用两种条件机制测试接触流表示,以验证其有效性不依赖于特定的控制架构。在基于ControlNet的变体中,接触流被渲染为时空控制视频,由可训练的控制分支处理,将接触感知特征注入冻结的视频生成骨干。在基于VACE的变体中,相同的接触流信号被编码为额外的视频条件,通过VCU和上下文适配器注入。两种变体使用相同的底层表示:随时间投影到图像平面的稀疏、以物体为中心的接触点轨迹。
第 5 页
3.3 数据处理
我们的训练数据来源于人类操作视频和遥操作机器人片段。人类数据提供了接触丰富交互的规模和多样性,而机器人数据则提供了度量准确、具身特定的信号。两种数据流均经过处理,以恢复相同的下游目标:物体掩码、手/夹爪姿态、稠密点图以及接触区域。对于一段由RGB帧\(x_t\)组成的视频序列\(\{x_t\}_{T}^{t=0}\),我们首先获取对应的点图\(P_t\)。根据可用的传感模态,我们通过立体像对恢复这些点图,使用FoundationStereo [41]估计度量深度,并利用标定的内参将其反投影;或者直接从RGB帧中恢复,可选地借助MapAnything [42]以带噪声的深度测量作为引导。
3.3.1 来自人类演示的接触流
手部网格。 如果数据集中尚未提供,我们首先使用HaMeR [43]估计每一帧中的手部姿态。我们通过其分配的置信度来识别被遮挡的手部关键点。对于可见的关键点,我们从HaMeR的2D输出推断其3D坐标,并在点图中查找对应的3D点,因为我们发现HaMeR的直接3D估计与点图估计的一致性不足。然后,我们基于估计的手部姿态和形状参数将MANO模型 [44] 放入场景中,并通过最小二乘回归将其拟合到可见关键点的3D坐标上。 物体掩码。 我们通过向SAM3 [45] 提示目标物体的名称,来分割每一帧中被操作的物体。该名称的获取方式取决于数据集提供的线索:当任务的语言描述可用时,我们使用spaCy [46] 提取候选物体名词;当不可用时,我们则向视觉-语言模型(Gemini [47])查询第一帧\(I_0\),以命名被操作的物体。如果数据集已附带物体掩码或网格,我们直接使用它们并跳过检测。生成的逐帧掩码索引到点图\(P_t\)中,以恢复物体的点云,并提供接触估计期间使用的物体支撑区域。 接触估计。 我们使用HACO [48] 来估计手部网格的哪些部分与物体发生接触。该模型仅在右手上训练,因此对于左手,我们向其输入左右翻转后的观测。我们发现,它在预测哪些手指等部位发生接触方面是可靠的,但在预测手部是否发生接触方面并不可靠,即使手部距离任何物体数米远,它也可能预测出随机接触。因此,我们用一个二值估计来过滤其输出,判断手部是否与物体接触。为此,我们测量是否有任何手部点距离物体小于\(\delta_{\text{contact dist}}\),以及图像中(膨胀后的)手部掩码与物体掩码之间是否存在非空的2D重叠。当两个条件都满足时,估计该帧存在接触。我们进一步对此逐帧估计应用时序平滑滤波。 数据集细节。 通过上述步骤,我们处理了TasteRob [18]、TACO [49] 和OakInk [50]。对于TasteRob,我们将其提供的物体掩码和深度插值到全帧率,并通过最近邻方法修复深度图中的空洞。对于TACO和OakInk,我们将每个相机视角作为独立样本处理,并使用其提供的手部和物体网格。我们仍会进行额外的质量检查,将任务标注传递给GroundingDINO [51],验证预测的边界框是否覆盖了重投影的物体网格。我们跳过检查失败的样本。
3.3.2 来自机器人数据的接触流
对于机器人数据,我们通常假设存在一个标定的、静态的、外中心(即注视机械臂,但不随机械臂移动)的相机,以及每个时间戳可用的URDF和相应的状态向量。因此,我们可以采用更具几何性的方法进行接触估计。 分割。 给定视频中任务的文本描述,我们通过spaCy [46] 枚举候选物体名词,并使用WildDet3D [52] 估计每个物体的3D边界框(当有真实深度时使用)。从这些候选中,我们通过检查机器人的工具中心点进入了哪个候选物体的3D边界框,来识别机器人实际交互的物体。然后,我们取点图\(P_0\),并用该3D边界框裁剪,以获取物体的点云。此外,我们向SAM3 [45] 提示选定的物体名词和\(I_0\),以在外中心相机图像中获得2D物体掩码。尽管理论上,机器人在
第 6 页
尽管相机视角理论上总能通过机器人-相机标定、机器人状态和URDF渲染推导得出,但我们发现实际中这一链条上的微小误差很容易导致几个像素的偏移。因此,我们使用RoboEngine数据集[53]以及1000张人工标注图像,在机器人上对SAM3模型进行微调。
接触估计。对于接触,我们区分位于相机与物体之间的机器人手指,以及从相机视角看位于物体后方的手指。通过URDF和物体点云,我们可以获知每个手指的这一区别。在本段后续内容中,我们假设使用一个具有前指和后指的平行夹爪,但该方法适用于任意数量的手指。对于前指,我们推导物体掩码与机器人掩码之间的重叠区域,并将P0过滤至该重叠区域。所得点即为物体上与机器人手指接触的点。由于后指不可直接可见,且物体背面的几何形状通常不完整,我们需采用不同方法:我们将URDF渲染到图像中,必要时调整其重投影以匹配检测到的机器人掩码。然后取后指的渲染结果,再次检查其与物体掩码的重叠区域。接触点随后从该重叠区域内后指的渲染深度中提取。最后,我们将两组点合并,得到给定帧的接触点。对于夹爪闭合后的帧,我们假设机器人手腕与最后接触点之间存在刚性变换,直至夹爪再次打开。跨帧的点对应关系(“流”)通过基于霍夫变换的滤波器在3帧窗口上进行平滑处理,我们通过实验发现这是最佳操作点。我们丢弃渲染的机器人和夹爪与检测到的机器人掩码不一致的帧,并额外使用RobotInter[54]进行过滤——该交互预测模型单独作为接触信号不够可靠,但能让我们剔除预测交互与我们的估计严重不符的样本。
3.3.3 推理时的Contact Flow
在推理时,我们仅需一条末端执行器轨迹以及恢复的真实世界场景模型,仅凭夹爪几何形状即可合成预期的接触流,因此条件信号与生成该轨迹的任何策略无关。为填充场景,我们需要目标物体的度量精确3D模型和位姿,以及相机坐标系下的点图:我们假设至少能访问一个外部立体相机,并对其应用FoundationStereo[41]。与训练时一样,任务被传递给一个VLM(Gemini[47]),该模型将其简化为原子指令,并为目标物体提议一个边界框,迭代优化该框并可选择回退至GroundingDINO[51],然后选定的物体名词提示SAM3[45]生成物体掩码。我们通过在初始帧上运行SAM 3D-Objects[55](以点图为条件)来恢复物体的3D几何形状,由于这通常会留下数厘米的位姿误差,我们应用分阶段优化:首先进行带符号消歧的闭式PCA对齐,随后针对观测到的物体点云进行修剪ICP(补偿完全生成的高斯泼溅与单视图可见表面之间的半壳偏差),接着通过gsplat[56]可微光栅化执行可微渲染与比较步骤,通过最小化软掩码IoU、掩码深度MSE和逐像素RGB余弦相似度的复合损失,优化高斯泼溅的全局刚体位姿和均匀尺度,最后进行逐高斯不透明度修剪和颜色优化步骤以锐化轮廓和外观。每个阶段仅在通过所有三个严格的渲染空间门控——掩码IoU、深度内点比例和RGB余弦相似度(≥0.95)——时才被接受,确保最终的高斯泼溅在校准相机下忠实地再现观测到的几何形状和外观。最后,给定恢复的场景,我们通过夹爪URDF将末端执行器轨迹应用于相机坐标系点图,生成与机器人数据提取中完全一致的预期接触流,并将此接触流输入视频世界模型,该模型预测真实场景在提议轨迹下的演变。
4 实验
我们研究两个问题:(Q1)Contact Flow是否是一种有效的条件信号,能够生成准确、连贯的机器人操作预测?(Q2)世界模型对真实世界结果的预测是否足够好,以至于可以作为未见场景中提议轨迹的零样本验证器?
第 7 页
表1:DROID评估。所有指标均在25个保留的DROID片段上计算,预测和真值中均通过RoboSeg遮罩了可见机器人。箭头表示各指标的偏好方向。
方法 动作编码 骨干网络 DreamSim↓ FID↓ FVD↓ PSNR↑ SSIM↑ LPIPS↓
CF + VACE 7ch Wan 2.1 14B 0.039 75.17 0.12 23.37 0.884 0.160 CF + CTRL-Net 7ch Wan 2.2 5B 0.036 40.41 0.03 23.28 0.904 0.165 CF + CTRL-Net 7ch Wan 2.2 14B 0.035 74.05 0.13 24.20 0.896 0.161
Kinema4D 机器人点云图 Wan 2.1 14B 4DNeX 0.043 67.06 0.08 20.17 0.830 0.220 CTRL-World 动作嵌入 SVD 1.5B 0.059 72.90 0.07 22.44 0.800 0.090 TesserAct 语言条件 CogVideo-X 5B 0.106 164.54 0.34 13.96 0.615 0.396
图1:基于Contact Flow的闭环部署。左侧,单视图RGBD实例化一个符号孪生模拟器,其中π0.5策略提出一条末端执行器轨迹。右侧,我们的世界模型以初始帧和该轨迹的Contact Flow为条件,想象推演过程,上方为真实推演,下方为模拟推演。
4.1 实验设置
训练数据。我们在DROID [19]、Taste-ROB [18]、TACO [49]、OakInk [50]和LIBERO [57]上进行训练。我们按第3节所述处理这些人类与机器人混合数据集。
机器人平台。真实机器人实验在Franka Panda固定臂机械臂上进行,配备单个外心RGBD相机。部署时,我们一次性恢复场景,并在单次离线过程中实例化符号孪生(第4节)。从外心立体对中,我们使用FoundationStereo [41]估计度量深度,提示SAM3 [45]获取物体遮罩,并拟合一个直接置于基座坐标系中的度量物体网格,通过第3.3节的可微分过程优化其刚体姿态和均匀缩放,直至与观测度量一致。孪生就位后,π0.5 [58]视觉-语言-动作策略在孪生内部推演出一条候选末端执行器轨迹。我们将其转换为预期的接触流,用接触流视频世界模型渲染预测推演,并由VLM(Gemini [47])判断任务是否完成。仅当判断通过时,轨迹才在真实机器人上开环执行。
基线方法与指标。TesserAct [23]以语言为条件,仅接受任务描述,没有针对特定轨迹的几何控制。CTRL-World [59]以低维动作嵌入为条件,这些嵌入是具身特定的,与训练机器人的动作空间绑定,因此无法零样本迁移。Kinema4D [35]以完整机器人的4D点云图为条件,编码整个执行体几何而非仅接触轨迹。与我们相同,它支持零样本迁移,是我们的主要竞争对手。为独立于骨干网络和控制机制测试鲁棒性,我们评估了三种配置:Wan2.1-14B + VACE、Wan2.2-5B + ControlNet和Wan2.2-14B + ControlNet。由于Contact Flow仅以物体侧接口为条件,从不以执行体为条件,我们在执行体遮罩区域计算对齐指标(PSNR、SSIM、LPIPS、DreamSim [60]),从预测和真值中移除执行体(机械臂或人手),训练损失也应用相同遮罩。遮罩来自RoboSeg(机器人)和SAM2(人类)。FID和FVD是全帧分布指标。所有结果使用每个数据集25个保留片段,每个片段为49帧窗口,8 FPS,832 × 480分辨率。DreamSim是我们的主要指标。对于Q2,我们的主要衡量标准是预测准确率,即VLM对想象推演的预测是否与π0.5提出的每条轨迹的真实机器人执行结果匹配。仅当机器人完成任务且无不良后果(例如撞倒或掉落物体),即目标物体被成功抓取并放置在指定区域,该轨迹才算成功。
7
第 8 页
(a) 机器人操作 (b) 人手操作
基准模型 DreamSim↓PSNR↑SSIM↑LPIPS↓FID↓FVD↓ 基准模型 DreamSim↓PSNR↑SSIM↑LPIPS↓FID↓FVD↓
Kinema4D 0.051 26.11 0.872 0.176 81.79 0.12 Kinema4D 0.070 23.18 0.803 0.243 88.29 0.29 5B 0.044 25.30 0.821 0.160 124.96 0.15 5B 0.027 27.44 0.852 0.174 44.47 0.20 RLBench OOD 14B (混合) 0.040 25.44 0.826 0.164 106.66 0.14 TACO 14B (混合) 0.024 27.22 0.857 0.168 39.50 0.20 14B (DROID) 0.043 27.53 0.844 0.142 127.58 0.18 14B (DROID) 0.067 24.22 0.819 0.205 75.14 0.31 14B (人类) 0.061 25.23 0.817 0.175 126.16 0.18 14B (人类) 0.021 28.28 0.869 0.158 36.46 0.18
Kinema4D 0.075 20.79 0.839 0.226 101.69 0.37 Kinema4D 0.107 20.68 0.783 0.221 175.95 0.52 5B 0.066 21.10 0.770 0.261 107.51 0.44 5B 0.016 30.30 0.882 0.134 36.90 0.17 AgiBot OOD 14B (混合) 0.054 20.29 0.772 0.264 91.83 0.35 TASTE-Rob 14B (混合) 0.019 29.11 0.888 0.134 36.34 0.21 14B (DROID) 0.082 19.97 0.801 0.233 107.92 0.44 14B (DROID) 0.062 22.75 0.815 0.185 87.79 0.49 14B (人类) 0.084 18.70 0.689 0.346 108.03 0.39 14B (人类) 0.016 30.66 0.899 0.124 32.62 0.20
Kinema4D 0.085 21.21 0.858 0.253 92.99 0.49 Kinema4D 0.074 22.08 0.797 0.266 105.66 0.35 5B 0.050 24.73 0.876 0.202 100.03 0.48 5B 0.040 25.96 0.839 0.217 75.35 0.35 GenieSim OOD 14B (混合) 0.063 22.45 0.856 0.222 101.10 0.44 OakInk 14B (混合) 0.032 26.09 0.852 0.207 58.10 0.33 14B (DROID) 0.132 20.61 0.809 0.278 131.51 0.50 14B (DROID) 0.060 23.05 0.807 0.261 94.87 0.41 14B (人类) 0.075 22.31 0.823 0.271 108.15 0.45 14B (人类) 0.029 26.77 0.854 0.199 57.10 0.33
Kinema4D 0.125 22.68 0.823 0.358 127.76 0.31 5B 0.127 22.11 0.818 0.372 128.33 0.36 EgoDex† OOD 14B (混合) 0.138 20.79 0.804 0.436 116.33 0.40 14B (DROID) 0.218 19.79 0.770 0.410 167.14 0.43 14B (人类) 0.123 22.04 0.818 0.382 109.11 0.35
表2: 跨数据集评估。所有指标均在每个数据集25个保留片段上计算,预测和真值中可见的手/机器人都已被遮罩。
结果 (Q1) 我们首先评估Contact Flow作为视频预测条件信号的效果。在保留的DROID场景上,每个模型接收初始帧以及从真值末端执行器轨迹导出的Contact Flow,并必须生成完整的未来视频,我们将其与真实记录进行评分(表1)。这衡量了从训练分布中抽取的保留场景上的预测质量;我们在下方的跨数据集评估中探究了对完全未见过的具身形态、场景和渲染风格的泛化能力。我们以原生帧率的三分之一(步长为3)采样这些DROID帧,因此单个49帧的推演预测的时间跨度大约为实际交互的三倍,约为十秒量级。随后,我们将此评估从DROID扩展到人类和机器人训练数据的保留划分,以及四个训练期间完全未见的数据集(表2),涵盖新的具身形态、场景和渲染风格,从而探究相同的接触流接口是否能在无需任何逐数据集适配的情况下跨域迁移。(Q2) 我们在Franka Panda机器人上部署了完整管线,涵盖10个未见过的桌面抓取-放置场景。使用Wan 2.2 14B骨干网络,世界模型在8/10个案例中正确预测了真实机器人的结果。这一验证步骤是部署成功的关键。直接将π0.5模型部署到真实世界中无法实现任何一次成功运行,尽管它是一个最先进的VLA。最小化孪生模型能让策略提出动作,但它过于粗糙,无法认证该动作。
我们在Franka Panda机器人上部署了完整管线,涵盖10个未见过的桌面抓取-放置场景。使用Wan 2.2 14B骨干网络,世界模型在8/10个案例中正确预测了真实机器人的结果。这一验证步骤是部署成功的关键。直接将π0.5模型部署到真实世界中无法实现任何一次成功运行,尽管它是一个最先进的VLA。最小化孪生模型能让策略提出动作,但它过于粗糙,无法认证该动作。
5 局限性与结论
我们提出了Contact Flow,一种具身无关的动作表示,将操作编码为执行器与物体之间3D接触点的轨迹。以此信号为条件,一个在混合人类与机器人数据上训练的单一世界模型能够预测合理的结果,并作为零样本验证器,跨训练时未见过的具身形态、场景和物体进行迁移。 该世界模型对交互结果的捕捉比底层物理更忠实,这足以用于验证,但对于接触密集型任务,可以使其更具物理基础。推理成本仍远未达到实时能力。此外,接触质量依赖于上游标定、度量深度和SAM3掩码,因此该方法假设存在一个已标定的外心相机,并能提供可靠的深度信息。
第 9 页
致谢
若论文被接收,最终版将(且理应)包含致谢部分。所有致谢置于文末,包括对提供宝贵意见的审稿人、贡献想法的同事,以及提供资金支持的资助机构和赞助商的感谢。
参考文献
[1] Y. Du, S. Yang, B. Dai, H. Dai, O. Nachum, J. Tenenbaum, D. Schuurmans, and P. Abbeel. Learning universal policies via text-guided video generation. In *Advances in Neural Information Processing Systems*, volume 36, 2023.
[2] Y. Du, S. Yang, P. Florence, F. Xia, A. Wahid, P. Sermanet, T. Yu, P. Abbeel, J. B. Tenenbaum, L. Kaelbling, et al. Video language planning. In *International Conference on Learning Representations*, volume 2024, pages 31138–31155, 2024.
[3] H. Wu, Y. Jing, C. Cheang, G. Chen, J. Xu, X. Li, M. Liu, H. Li, and T. Kong. Unleashing large-scale video generative pre-training for visual robot manipulation. In *International Conference on Learning Representations*, 2024. URL https://openreview.net/forum?id=NxoFmGgWC9.
[4] J. Liang, P. Tokmakov, R. Liu, S. Sudhakar, P. Shah, R. Ambrus, and C. Vondrick. Video generators are robot policies. *arXiv preprint arXiv:2508.00795*, 2025. doi:10.48550/arXiv.2508.00795.
[5] S. Zhou, Y. Du, J. Chen, Y. Li, D.-Y. Yeung, and C. Gan. RoboDreamer: Learning compositional world models for robot imagination. In *Proceedings of the 41st International Conference on Machine Learning*, volume 235 of *Proceedings of Machine Learning Research*, pages 61885–61896. PMLR, 2024. URL https://proceedings.mlr.press/v235/zhou24f.html.
[6] J. Jang, S. Ye, Z. Lin, J. Xiang, J. Bjorck, Y. Fang, F. Hu, S. Huang, K. Kundalia, Y.-C. Lin, L. Magne, A. Mandlekar, A. Narayan, Y. L. Tan, G. Wang, J. Wang, Q. Wang, Y. Xu, X. Zeng, K. Zheng, R. Zheng, M.-Y. Liu, L. Zettlemoyer, D. Fox, J. Kautz, S. Reed, Y. Zhu, and L. Fan. Dreamgen: Unlocking generalization in robot learning through video world models. In *Proceedings of The 9th Conference on Robot Learning*, volume 305 of *Proceedings of Machine Learning Research*, pages 5170–5194. PMLR, 2025. URL https://proceedings.mlr.press/v305/jang25a.html.
[7] J. Liang, R. Liu, E. Ozguroglu, S. Sudhakar, A. Dave, P. Tokmakov, S. Song, and C. Vondrick. Dreamitate: Real-world visuomotor policy learning via video generation. In *Proceedings of The 8th Conference on Robot Learning*, volume 270 of *Proceedings of Machine Learning Research*, pages 3943–3960. PMLR, 2025. URL https://proceedings.mlr.press/v270/liang25b.html.
[8] F. Zhu, H. Wu, S. Guo, Y. Liu, C. Cheang, and T. Kong. IRASim: A fine-grained world model for robot manipulation. In *Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)*, pages 9834–9844, October 2025.
[9] Y. Wang, R. Syed, F. Wu, M. Zhang, A. Onol, J. Barreiros, H. Nayyeri, T. Dear, H. Zhang, and Y. Li. Interactive world simulator for robot policy training and evaluation. In *Robotics: Science and Systems*, 2026. URL https://www.yixuanwang.me/interactive_world_sim/.
[10] N. Agarwal, A. Ali, M. Bala, Y. Balaji, E. Barker, T. Cai, P. Chattopadhyay, Y. Chen, Y. Cui, Y. Ding, et al. Cosmos world foundation model platform for physical ai. *arXiv preprint arXiv:2501.03575*, 2025.
9
第 10 页
[11] A. Wang, B. Ai, B. Wen, C. Mao, C.-W. Xie, D. Chen, F. Yu, H. Zhao, J. Yang, J. Zeng, 等. Wan: 开放且先进的大规模视频生成模型. arXiv 预印本 arXiv:2503.20314, 2025.
[12] Z. Jiang, Z. Han, C. Mao, J. Zhang, Y. Pan, 和 Y. Liu. Vace: 一体化视频创作与编辑. 收录于 IEEE/CVF 国际计算机视觉会议论文集, 页码 17191–17202, 2025.
[13] H. Bansal, Z. Lin, T. Xie, Z. Zong, M. Yarom, Y. Bitton, C. Jiang, Y. Sun, K.-W. Chang, 和 A. Grover. Videophy: 评估视频生成的物理常识. 收录于国际学习表征会议, 卷 2025, 页码 102075–102121, 2025.
[14] S. Motamed, L. Culp, K. Swersky, P. Jaini, 和 R. Geirhos. 生成式视频模型理解物理原理吗?收录于 IEEE/CVF 冬季计算机视觉应用会议论文集, 页码 948–958, 2026.
[15] E. Pallotta, S. M. Azar, L. Doorenbos, S. Ozsoy, U. Iqbal, 和 J. Gall. Egocontrol: 通过3D全身姿态实现可控的第一人称视频生成. 收录于 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 页码 4269–4279, 2026年6月.
[16] G. Li, B. Zhao, J. Yang, 和 L. Sevilla-Lara. Mask2iv: 通过掩码轨迹实现以交互为中心的视频生成. 收录于 AAAI 人工智能会议论文集, 卷 40, 页码 6091–6099, 2026.
[17] H. Yan, H. Yu, Z. Zhong, W. Yuan, X. Gong, Z. Luo, C. Heyu, J. Li, W. Song, S. Zhou, 等. 基于结构与接触感知表征的开放世界手物交互视频生成. arXiv 预印本 arXiv:2512.01677, 2025.
[18] H. Zhao, X. Liu, M. Xu, Y. Hao, W. Chen, 和 X. Han. Taste-rob: 推进面向任务的手物交互视频生成以实现可泛化的机器人操作. 收录于计算机视觉与模式识别会议论文集, 页码 27683–27693, 2025.
[19] A. Khazatsky, K. Pertsch, S. Nair, A. Balakrishna, S. Dasari, S. Karamcheti, S. Nasiriany, M. K. Srirama, L. Y. Chen, K. Ellis, 等. Droid: 大规模野外机器人操作数据集. 收录于机器人学: 科学与系统, 2024.
[20] L. Zhang, A. Rao, 和 M. Agrawala. 为文本到图像扩散模型添加条件控制. 收录于 IEEE/CVF 国际计算机视觉会议论文集, 页码 3836–3847, 2023.
[21] Y. Bai, L. Yang, G. Eskandar, F. Shen, M. Altillawi, Z. Liu, 和 G. Kutyniok. DRAW2ACT: 将深度编码轨迹转化为机器人演示视频. arXiv 预印本 arXiv:2512.14217, 2025.
[22] W. Lin, J. Zhang, K. Cai, 和 K. Wang. Storm: 用于机器人操作的搜索引导生成式世界模型. arXiv 预印本 arXiv:2512.18477, 2025.
[23] H. Zhen, Q. Sun, H. Zhang, J. Li, S. Zhou, Y. Du, 和 C. Gan. Tesseract: 学习4D具身世界模型. arXiv 预印本 arXiv:2504.20995, 2025.
[24] R. Akkerman, H. Feng, M. J. Black, D. Tzionas, 和 V. F. Abrevaya. Interdyn: 基于视频扩散模型的可控交互动力学. 收录于 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 12467–12479, 2025.
[25] Y. Wang, C. Wen, H. Guo, S. Peng, M. Qin, H. Bao, X. Zhou, 和 R. Hu. 通过视觉动作提示实现精确的动作到视频生成. 收录于 IEEE/CVF 国际计算机视觉会议论文集, 页码 12713–12724, 2025.
10
第 11 页
[26] W. Jin, Q. Dai, C. Luo, S.-H. Baek, and S. Cho. Flovd: Optical flow meets video diffusion model for enhanced camera-controlled video synthesis. In *Proceedings of the Computer Vision and Pattern Recognition Conference*, pages 2040–2049, 2025.
[27] M. Koroglu, H. Caselles-Dupré, G. Jeanneret, and M. Cord. Onlyflow: Optical flow based motion conditioning for video diffusion models. In *Proceedings of the Computer Vision and Pattern Recognition Conference*, pages 6226–6236, 2025.
[28] D. Geng, C. Herrmann, J. Hur, F. Cole, S. Zhang, T. Pfaff, T. Lopez-Guevara, Y. Aytar, M. Rubinstein, C. Sun, O. Wang, A. Owens, and D. Sun. Motion prompting: Controlling video generation with motion trajectories. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, 2025.
[29] S. Brahmbhatt, C. Ham, C. C. Kemp, and J. Hays. Contactdb: Analyzing and predicting grasp contact via thermal imaging. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, pages 8709–8719, 2019.
[30] S. Brahmbhatt, C. Tang, C. D. Twigg, C. C. Kemp, and J. Hays. Contactpose: A dataset of grasps with object contact and hand pose. In *Computer Vision – ECCV 2020*, pages 361–378. Springer, 2020.
[31] P. Grady, C. Tang, C. D. Twigg, M. Vo, S. Brahmbhatt, and C. C. Kemp. Contactopt: Optimizing contact to improve grasps. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, pages 1471–1481, 2021.
[32] T. Kwon, B. Tekin, J. Stühmer, F. Bogo, and M. Pollefeys. H2O: Two hands manipulating objects for first person interaction recognition. In *Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)*, pages 10138–10148, 2021.
[33] M. Sundermeyer, A. Mousavian, R. Triebel, and D. Fox. Contact-graspnet: Efficient 6-DoF grasp generation in cluttered scenes. In *IEEE International Conference on Robotics and Automation (ICRA)*, pages 13438–13444, 2021.
[34] T. Pang, H. J. T. Suh, L. Yang, and R. Tedrake. Global planning for contact-rich manipulation via local smoothing of quasi-dynamic contact models. *IEEE Transactions on Robotics*, 39(6):4691–4711, 2023.
[35] M. Xu, T. Zhang, T. Liu, Z. Chen, X. Han, and Z. Liu. Kinema4d: Kinematic 4d world modeling for spatiotemporal embodied simulation. *arXiv preprint arXiv:2603.16669*, 2026.
[36] Y. Chen, P. Li, J. Yang, K. He, X. Wu, Y. Xu, K. Wang, J. Liu, N. Liu, Y. Huang, et al. Bridgev2w: Bridging video generation models to embodied world models via embodiment masks. *arXiv preprint arXiv:2602.03793*, 2026.
[37] M. Xu, Z. Xu, Y. Xu, C. Chi, G. Wetzstein, M. Veloso, and S. Song. Flow as the cross-domain manipulation interface. In *8th Annual Conference on Robot Learning (CoRL)*, 2024.
[38] C. Wen, X. Lin, J. So, K. Chen, Q. Dou, Y. Gao, and P. Abbeel. Any-point trajectory modeling for policy learning. In *Robotics: Science and Systems (RSS)*, 2024.
[39] H. Zhi, P. Chen, S. Zhou, Y. Dong, Q. Wu, L. Han, and M. Tan. 3DFlowAction: Learning cross-embodiment manipulation from 3d flow world model. *arXiv preprint arXiv:2506.06199*, 2025.
[40] Z.-H. Yin, S. Yang, and P. Abbeel. Object-centric 3d motion field for robot learning from human videos. *Advances in Neural Information Processing Systems*, 38:55923–55943, 2026.
[41] B. Wen, M. Trepte, J. Aribido, J. Kautz, O. Gallo, and S. Birchfield. FoundationStereo: Zero-shot stereo matching. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, pages 5249–5260, 2025.
11
第 12 页
[42] N. Keetha, N. M¨uller, J. Sch¨onberger, L. Porzi, Y. Zhang, T. Fischer, A. Knapitsch, D. Zauss, E. Weber, J. Luiten, M. Lopez-Antequera, S. Rota Bul`o, C. Richardt, D. Ramanan, S. Scherer, 和 P. Kontschieder. MapAnything: 通用前馈度量三维重建. 载于 International Conference on 3D Vision (3DV), 2026.
[43] G. Pavlakos, D. Shan, I. Radosavovic, A. Kanazawa, D. Fouhey, 和 J. Malik. 使用Transformer进行手部三维重建. 载于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 页码 9826–9836, 2024.
[44] J. Romero, D. Tzionas, 和 M. J. Black. Embodied hands: 联合建模与捕捉手部和身体. ACM Transactions on Graphics (Proc. SIGGRAPH Asia), 36(6):245:1–245:17, 2017.
[45] N. Carion, L. Gustafson, Y.-T. Hu, S. Debnath, R. Hu, D. Suris, 等. SAM 3: 基于概念分割一切, 2025.
[46] M. Honnibal, I. Montani, S. Van Landeghem, 和 A. Boyd. spaCy: Python中的工业级自然语言处理, 2020.
[47] G. Team, R. Anil, S. Borgeaud, J.-B. Alayrac, J. Yu, R. Soricut, J. Schalkwyk, A. M. Dai, A. Hauth, K. Millican, 等. Gemini: 一组高性能多模态模型. arXiv 预印本 arXiv:2312.11805, 2023.
[48] D. S. Jung 和 K. M. Lee. 从不平衡数据中学习密集手部接触估计. Advances in Neural Information Processing Systems, 2025.
[49] Y. Liu, H. Yang, X. Si, L. Liu, Z. Li, Y. Zhang, Y. Liu, 和 L. Yi. TACO: 面向可泛化双手工具-动作-物体理解的基准测试. 载于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 页码 21740–21751, 2024.
[50] X. Zhan, L. Yang, Y. Zhao, K. Mao, H. Xu, Z. Lin, K. Li, 和 C. Lu. OAKINK2: 一个面向复杂任务完成的双手手-物操作数据集. 载于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 页码 445–456, 2024.
[51] S. Liu, Z. Zeng, T. Ren, F. Li, H. Zhang, J. Yang, Q. Jiang, C. Li, J. Yang, H. Su, J. Zhu, 和 L. Zhang. Grounding DINO: 将DINO与基于定位的预训练结合用于开放集物体检测. 载于 Computer Vision – ECCV 2024, 页码 38–55. Springer, 2024.
[52] W. Huang, J. Zhang, S. Li, T. Jia, J. Duan, Y. Cheng, J. Cho, M. Wallingford, R. Soraki, C. D. Kim, S. Liu, D. Clay, T. Anderson, W. Han, A. Farhadi, B. Hariharan, Z. Ren, 和 R. Krishna. WildDet3D: 大规模可提示的三维检测, 2026.
[53] C. Yuan, S. Joshi, S. Zhu, H. Su, H. Zhao, 和 Y. Gao. RoboEngine: 即插即用的机器人数据增强,结合语义机器人分割与背景生成. 载于 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 页码 7622–7629, 2025.
[54] H. Li, Z. Wang, Z.-h. Ding, S. Yang, Y. Chen, Y. Tian, X. Hu, T. Wang, D. Lin, F. Zhao, 等. Robointer: 面向机器人操作的整体中间表示套件. 载于 The Fourteenth International Conference on Learning Representations, 2026.
[55] X. Chen, F.-J. Chu, P. Gleize, K. J. Liang, A. Sax, H. Tang, W. Wang, M. Guo, T. Hardin, X. Li, 等. Sam 3d: 将图像中的任意物体三维化. arXiv 预印本 arXiv:2511.16624, 2025.
[56] V. Ye, R. Li, J. Kerr, M. Turkulainen, B. Yi, Z. Pan, O. Seiskari, J. Ye, J. Hu, M. Tancik, 和 A. Kanazawa. gsplat: 一个用于高斯泼溅的开源库. Journal of Machine Learning Research, 2024.
12
第 13 页
[57] B. Liu, Y. Zhu, C. Gao, Y. Feng, Q. Liu, Y. Zhu, and P. Stone. LIBERO: Benchmarking knowledge transfer for lifelong robot learning. In Advances in Neural Information Processing Systems, volume 36, pages 44776–44791, 2023.
[58] Physical Intelligence, K. Black, N. Brown, J. Darpinian, K. Dhabalia, D. Driess, A. Esmail, M. Equi, C. Finn, K. Hausman, B. Ichter, S. Levine, K. Pertsch, Q. Vuong, H. Walke, et al. π0.5: a vision-language-action model with open-world generalization. arXiv preprint arXiv:2504.16054, 2025.
[59] Y. Guo, L. X. Shi, J. Chen, and C. Finn. Ctrl-world: A controllable generative world model for robot manipulation. arXiv preprint arXiv:2510.10125, 2025.
[60] S. Fu, N. Tamir, S. Sundaram, L. Chai, R. Zhang, T. Dekel, and P. Isola. Dreamsim: Learning new dimensions of human visual similarity using synthetic data. arXiv preprint arXiv:2306.09344, 2023.