ACE-Data-0:在真实家中同步捕捉视觉、运动与触觉,填补具身数据鸿沟

论文代表图:figure-02-p010-01

具身智能面临数据瓶颈:现有数据集要么缺少运动真值,要么脱离真实家居环境,且大多只覆盖秒级原子动作。ACE-Data-0通过环境捕捉引擎ACE,在真实公寓中同步采集第一人称视频、全身运动、物体轨迹、音频和触觉信号,构建了包含17M帧、75000个交互片段的长程数据集。论文建立三级分层基准,从触觉推断、人体运动估计到手物交互估计,系统评估了感知-行动循环。基准测试显示,现有模型在真实家居遮挡和长程任务下仍有显著提升空间。注意:数据集目前仅覆盖2个环境和50名参与者,场景多样性有限;触觉手套和动捕服可能对自然行为产生轻微干扰。

HumanCLAW:VLM 为何能看却不会动?具身自我感知才是真正的瓶颈

评测的缺口

现有的具身评测要么抽象掉物理运动,要么将决策与电机控制纠缠在一起,无法单独评估 VLM 的动作推理能力。HumanCLAW 提出了一套解耦框架:VLM 只负责决策,技能条件运动生成器负责执行,半物理仿真器负责反馈。在包含 1218 个长程寻找-导航-交互任务的基准测试中,最强的 VLM 也只能完成 16.8% 的完整交互任务。错误分析表明,失败主要源于 VLM 无法感知自身身体状态——它不知道何时已到达目标、何时被卡住、何时会坐到空气里。这项研究为具身智能的评估提供了新视角,但也受限于仅使用自我中心视觉输入、交互任务单一等局限。 论文介绍、全文中文翻译与相关资料: https://www.pc

具身操作的数据金字塔:如何平衡数据规模与机器人对齐?

论文代表图:figure-07-p024-01

具身智能缺乏像多模态大模型那样统一的互联网级数据源。本文提出“具身数据金字塔”分类法,从可扩展性与机器人对齐度两个维度系统梳理了真实机器人、UMI、第一人称、仿真及通用数据五大来源,并分析其在具身基础模型中的应用与挑战。视频通过具体案例和数据对比,揭示了不同数据源的优势与局限,为具身智能体的数据整合提供了系统化指导。

UniPhysGen:让3D资产具备物理属性,一键生成仿真就绪模型

核心:UniPhysGen模型架构

本文提出UniPhysGen,解决3D资产缺乏物理语义的问题。通过感知引导分解、几何感知关节接地和仿真验证,将异构网格转化为仿真就绪资产。在UniPhys-Bench上关节类型准确率达89.96%,优于现有基线。需注意极端旋转下轴推理仍有挑战,且仿真验证目前以定性为主。

REAL框架:去Oracle化的开放世界移动操作具身智能体

方法:REAL框架核心设计

本文提出REAL框架,旨在解决现有具身智能依赖特权Oracle感知API、难以处理模糊指令及仿真现实差距的问题。通过移除全局物体列表等特权信息,构建无Oracle感知的闭环视觉环境,并集成LLM驱动的模拟用户进行交互式消歧。采用SFT对齐Qwen3-VL-8B工具接口,随后使用GSPO进行在线强化学习以优化自适应推理。实验显示,该框架在REAL-Bench基准SUL任务成功率达56.9%,超越所有Zero-shot VLM基线;在Ark LIFT2真实机器人部署中端到端成功率达78.3%。需注意SFT阶段存在行为克隆过拟合风险,且底层VLA策略的执行稳定性直接影响整体表现。

CD-LAM:因果去偏潜在动作模型,解决具身世界模型动作跟随性差与数据效率低问题

方法概述:CD-LAM三阶段框架

本文提出CD-LAM框架,针对潜在动作模型(LAM)中动作无关视觉因素泄露导致的动作跟随性差问题,引入基于因果的去偏目标进行微调。实验显示,该方法在2B和14B模型上显著降低FDCE(前景位移切弗距离误差),并在AgiBot真实机器人数据集上实现12倍以上的适应效率提升。需注意,高PSNR不保证良好的动作跟随性,FDCE是更可靠的评估指标。

EmbodiedGen V2:具身智能仿真环境自动化生成与Sim-to-Real验证

核心方法概述

本文介绍EmbodiedGen V2,一个面向具身智能的仿真就绪3D世界引擎。针对现有3D生成模型缺乏物理属性和交互语义的问题,该系统通过代理式生成、Affordance自动标注和Vibe Coding编辑,实现从自然语言到可执行物理环境的自动化构建。实验显示,在生成环境中进行在线RL训练,仿真成功率从9.7%提升至79.8%,Sim-to-Real任务成功率从21.7%提升至75.0%。需注意,完全在线生成耗时较长,且部分资产需手动调整。