ACE-Data-0:在真实家中同步捕捉视觉、运动与触觉,填补具身数据鸿沟

论文代表图:figure-02-p010-01

具身智能面临数据瓶颈:现有数据集要么缺少运动真值,要么脱离真实家居环境,且大多只覆盖秒级原子动作。ACE-Data-0通过环境捕捉引擎ACE,在真实公寓中同步采集第一人称视频、全身运动、物体轨迹、音频和触觉信号,构建了包含17M帧、75000个交互片段的长程数据集。论文建立三级分层基准,从触觉推断、人体运动估计到手物交互估计,系统评估了感知-行动循环。基准测试显示,现有模型在真实家居遮挡和长程任务下仍有显著提升空间。注意:数据集目前仅覆盖2个环境和50名参与者,场景多样性有限;触觉手套和动捕服可能对自然行为产生轻微干扰。

CG-World:用工业CG的隐藏状态教会世界模型理解物理演化

论文代表图:figure-03-p005-01

世界模型研究正从视频生成转向世界理解与预测,但现有数据集大多只提供终端观测,缺乏动作、物理状态与因果干预信号。CG-World从工业CG生产管线中恢复出约85万条镜头级世界状态片段,将显式的物理中间状态、多模态观测与同根反事实分支系统对齐。实验表明,基于CG-World的后训练能显著提升视频生成质量、动作预测精度与VLA仿真迁移成功率。数据集继承工业CG生产偏差,生产衍生状态不能直接视为真实世界物理真值。

RealDefocus:为何真实数据能解锁高容量模型的散焦去模糊潜力?

关键证据

单图像散焦去模糊(SIDD)长期受限于合成数据和固定光圈的小规模数据集。本文介绍 RealDefocus 基准,通过 23,000 对真实高分辨率图像对,证明训练数据的真实性与规模是提升模型泛化能力的关键。实验显示,在 RealDefocus 上训练的模型在 RealDOF 测试集上表现显著优于传统 DPDDS 训练模型。注意:高容量模型计算成本较高,且真实 Ground Truth 可能存在残留模糊。

TransBiolab:当 SAM 和 FoundationPose 遇见透明移液管

论文代表图:figure-01-p001-01

本文介绍 TransBiolab 数据集,解决实验室中透明生物医学物体感知难的问题。通过多视图 RGB-D 数据和真机操作实验,揭示 SAM 3 和 FoundationPose 在透明、对称物体上的性能瓶颈。注意:真机成功率受控制策略影响,不仅限于感知误差。