快速导读:现有数据集缺乏对透明生物医学物体的覆盖。ClearPose 和 KeyPose 主要关注家用物体,无法模拟实验室的复杂场景。基础模型在透明、对称和杂乱物体上的泛化能力不足。
自主实验室机器人需要精确感知透明生物医学物体,如培养皿、离心管和移液管。然而,现有数据集主要关注不透明或家用物体,缺乏针对实验室复杂场景的高质量数据。TransBiolab 填补了这一空白,提供了一个包含 15 种杂乱透明物体的真实世界 RGB-D 数据集。
该数据集通过校准的多视图序列和基于 CAD 模型的精确标注,支持分割、深度估计和 6D 位姿估计的基准测试。实验表明,当前基础模型在透明、对称和杂乱场景中存在显著性能下降,揭示了实验室自动化感知的关键挑战。
英文题目:TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects
论文出处:arXiv 每日论文精选 · arXiv:2607.21071
原始论文:PDF / 论文页面
对应视频标题:TransBiolab:当 SAM 和 FoundationPose 遇见透明移液管|推荐指数:★★★★
这篇论文解决什么问题?
实验室自动化依赖于对透明物体的精确感知。透明物体的反射、折射和遮挡特性使得传统视觉算法难以处理。此外,实验室场景通常包含多个物体和复杂背景,进一步增加了感知难度。
现有数据集如 ClearPose 和 KeyPose 主要关注家用或化学透明物体,缺乏对生物医学物体的覆盖。FoundationPose 和 SAM 3 等基础模型在透明物体上的表现不佳,尤其是在对称物体和陡峭视角下。
TransBiolab 通过模拟真实实验室场景,包括不同光照、背景和物体排列,提供了更具挑战性的测试环境。数据集包含 161,315 帧 RGB-D 图像,覆盖 98 个场景,其中 10 个为保留场景,用于评估模型的泛化能力。
核心创新
方法概览
现有数据集缺乏对透明生物医学物体的覆盖。ClearPose 和 KeyPose 主要关注家用物体,无法模拟实验室的复杂场景。基础模型在透明、对称和杂乱物体上的泛化能力不足。
- 数据采集使用机器人安装的 Intel RealSense D435i 相机,确保多视图序列的校准和一致性。
- 场景设计基于实验室标准操作流程,包括 11 种排列模式,涵盖不同级别的杂乱和遮挡。
- 标注通过 ProgressLabeller 进行多视图对齐,提供精确的 6D 位姿、掩码和深度信息。
- 数据集包含 15 种生物医学物体,如培养皿、离心管、移液管和生物反应器,覆盖多种几何形状和透明度。
- 基准测试包括分割、深度估计和 6D 位姿估计,使用 SAM 3、Depth Anything 3 和 FoundationPose 等模型。
- 真机操作实验使用平行夹爪和灵巧手,评估感知结果在实际抓取任务中的有效性。
逐图理解论文
研究缺口

现有数据集缺乏对透明生物医学物体的覆盖。ClearPose 和 KeyPose 主要关注家用物体,无法模拟实验室的复杂场景。基础模型在透明、对称和杂乱物体上的泛化能力不足。
核心贡献

TransBiolab 提供 161,315 帧校准多视图 RGB-D 数据,覆盖 15 种生物医学物体。通过 ProgressLabeller 进行精确标注,支持分割、深度和 6D 位姿估计的基准测试。真机操作实验验证感知结果的实际有效性。
最强结论

表 7 展示了 6D 位姿估计在不同数据集和保留实验室场景上的结果。FoundationPose 在保留场景上的性能下降,揭示了泛化能力的局限。
意义与局限

图 10 展示了机器人操作平台,包括平行夹爪和灵巧手。真机操作实验验证了感知结果在实际抓取任务中的有效性。
实验如何设计?
- 分割基准测试使用 SAM 3 和 TransLab,评估掩码级分割性能。
- 深度估计和补全使用 Depth Anything 3 和 ClearGrasp,评估绝对相对误差。
- 6D 位姿估计使用 FoundationPose 和 MegaPose-6D,评估 ADD-S AUC 指标。
- 真机操作实验在真实实验室环境中进行,使用平行夹爪和 LinkerHand 灵巧手。
关键结果与论文证据
- SAM 3 在 TransBiolab-all 上的 mIoU 为 0.685,显著低于在不透明物体上的表现(第 5 页)。
- FoundationPose 在 TransBiolab-all 上的 ADD-S AUC 为 80.80,但在保留场景 TBiolab-HO 上降至 75.35(第 7 页)。
- Depth Anything 3 在 TransBiolab-all 上的 AbsRel 为 0.371,透明区域误差较高(第 7 页)。
- 真机抓取成功率在平行夹爪下为 65.3%,在灵巧手下为 56.67%(第 8 页)。
- 对称物体(如离心管)和陡峭视角下的位姿估计误差显著增加。
- 杂乱场景中的遮挡和反射导致分割和深度估计性能下降。
阅读时需要注意
- 当前基础模型在透明生物医学物体上的性能显著低于不透明物体。
- 位姿估计在对称物体和陡峭视角下存在较大误差。
- 深度估计在透明区域误差较高。
- 真机操作成功率受抓取合成和控制复杂性影响,不仅限于感知误差。
关联工作
- ClearPose 和 KeyPose 是现有的透明物体数据集,但主要关注家用或化学物体。
- FoundationPose 和 SAM 3 是当前的基础模型,但在透明物体上的表现有限。
- TransBiolab 通过真实世界数据和真机操作验证,提供了更全面的评估。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
TransBiolab:一个面向杂乱透明生物医学物体的真实世界多视角数据集
马珂 王一飞 华中科技大学人工智能与自动化学院 中国武汉 make@hust.edu.cn
王猛 夏天∗ 同济大学设计创意学院 上海智能自主系统研究院 中国上海 mengwangtj@tongji.edu.cn
华中科技大学软件学院 中国武汉 tianxia@hust.edu.cn
2026
[cs.CV] ;),67'$*53#1')/')3.#-,'-6,#:)10
摘要 +)$,($*)*&'%(#"!)($,
图 1:所提出的 TransBiolab 数据集概览,具有多目标和多视角特性。红色矩形框标注的帧表示更高程度的杂乱和遮挡。
多目标杂乱、遮挡以及校准的多视角能力
自主生物医学实验室日益依赖视觉感知来识别、定位和操作透明塑料制品,然而针对该场景的高质量真实世界数据集仍然有限。领域相关数据的稀缺在杂乱的多人/多物体场景中尤为突出,即使对于当代视觉基础模型而言,相互遮挡和视角依赖的外观变化仍然是严峻挑战。现有的透明物体数据集在分割、深度和位姿估计方面取得了进展,但通常未评估组合设置下的性能,而这正是真实实验室操作场景的特征。为弥补这一空白,我们提出了 TransBiolab,这是一个包含杂乱透明生物医学物体的真实世界 RGB-D 数据集,以校准的多视角序列形式捕获。TransBiolab 包含来自 98 个场景的 161,315 帧图像,涵盖 15 种实验室物体类型,共计 103 万个实例标注,包括 6 自由度位姿估计、完整及可见掩码、深度图以及逐帧相机标定。该数据集沿三个反映操作难度的轴进行组织:物体类别、帧中物体总数以及相机视角。我们进一步
∗通讯作者。
第 2 页
MM ’26, 2026年11月10–14日, 巴西里约热内卢 Ma 等人
定义面向分割、深度估计与补全以及 6D 位姿估计的数据集中心基准,并报告由发布的注释和标定支持的系统级机器人操作评估。通过聚焦重复出现的透明物体、杂乱场景以及多视角实验室采集,TransBiolab 为自主实验室操作中的分割、深度估计、6D 位姿估计和多视角推理提供了资源。项目主页。
CCS 概念 • 计算方法学 → 机器人视觉;重建;3D 成像。
我们引入 TransBiolab,这是一个包含 15 种生物医学实验室物体的真实世界 RGB-D 数据集,以标定多视角序列形式呈现,如图 1 所示。总体而言,它提供了 161,315 帧图像和 103 万个实例注释,包括 6D 位姿、掩码、深度和逐帧相机标定。该数据集涵盖 88 个受控采集场景,包含 11 种排列模式、4 种背景、2 种光照设置,以及 10 个保留的真实世界实验室场景,这些场景包含新的布局、更多的干扰物以及不同的环境条件。由于每个场景均作为有序多视角序列采集,该数据集支持基于帧的评估以及用于解决透明物体遮挡问题的多视角或基于视频的方法。
1 引言
自主生物医学实验室正从固定工作单元自动化向感知驱动的操作转变,在此过程中,机器人必须在液体处理、样品制备和细胞培养工作流程中识别、定位并转移实验室器皿 [1, 7, 12, 21–26, 30–35, 37, 45]。许多被操作的物体是透明或半透明的塑料耗材,如微孔板、培养皿、离心管、培养瓶、移液器、试剂瓶和生物反应器。它们的外观纹理微弱,具有强烈的视角依赖性,并经常因反射、折射和透射而与背景纠缠在一起 [6, 29, 42]。
2 相关工作
2.1 真实世界 3D 数据集
真实世界 3D 数据集塑造了物体位姿估计和机器人感知。LINEMOD 和 LM-O 为无纹理物体和遮挡建立了早期评估设置 [13, 15]。T-LESS、ITODD、RU-APC 和 IC-BIN 将基准测试扩展至具有对称性、低纹理和杂乱的工业、仓库和多实例场景 [8, 9, 14, 28]。YCB、YCB-Video、GraspNet、HOPE 和 ROBI 扩大了物体尺度、场景真实性、多视角推理、抓取注释和反射材料的研究范围 [2, 11, 36, 39, 43]。这些数据集仍然是重要的参考,但大多数侧重于不透明的家用物体或工业零件,而非透明生物医学耗材。实验室塑料耗材的外观和操作背景在 3D 基准中仍代表性不足。
同时,感知模型变得更加通用。FoundationPose 针对从物体模型进行统一的新物体 6D 位姿估计和跟踪 [38];MegaPose 将物体中心的位姿预测扩展至广泛的物体集合 [16];SAM 2 和 SAM 3 将可提示的分割扩展至图像、视频和概念级提示 [4, 27];以及最近的几何模型如 Depth Anything V2 和 Depth Anything 3 扩展了通用深度和任意视角的场景理解 [17, 23, 44]。透明物体仍然是这些模型的实际边界案例,因为标准基准中对透明塑料耗材的光学和几何模糊性表示不足 [6, 20]。
现有数据集仅部分覆盖此设置。经典的真实世界 3D 数据集如 LINEMOD、YCB、YCB-Video、T-LESS、ITODD、RU-APC、HOPE 和 ROBI 是物体位姿研究的核心,但它们主要强调不透明的家用物体或工业零件 [2, 9, 13, 14, 28, 36, 39, 43]。透明物体数据集如 KeyPose、TODD、StereOBJ-1M、ClearPose、TransCG 和 Trans10K-v2 已大幅扩展了透明物体的评估范围,但它们通常侧重于家用、化学或通用抓取物体,而非生物医学塑料耗材 [6, 10, 18, 19, 41, 42]。此外,真实的实验室操作场景不仅具有透明性;它们还以与实验室程序相关的方式结合重复实例、杂乱布局和标定多视角采集。
我们的核心观点是,杂乱透明物体的感知应沿反映操作难度的轴线进行评估:(i) 物体类别,(ii) 帧中可见物体的总数,以及 (iii) 相机视角分布。这些因素直接指导数据收集和注释。
2.2 透明物体数据集
透明物体数据集将感知基准的范围扩展到了不透明刚性物体之外。KeyPose 引入了桌面透明物体的多视角注释和立体位姿估计 [19]。StereOBJ-1M 将立体采集扩展至混合桌面物体和物体位姿监督 [18]。ClearPose 提供了以透明物体分割和位姿分析为中心的大规模基准,涵盖家用和化学物体 [6]。TransCG 专注于杂乱日常场景中的真实世界透明物体深度补全和抓取 [10],而 Trans10K-v2 强调野外分割 [41]。这些数据集对透明物体感知至关重要,但许多主要展示家用或化学玻璃器皿,而非塑料生物医学耗材,且未以
第 3 页
TransBiolab:一个面向杂乱透明生物医学物体的真实世界多视角数据集 MM ’26,2026年11月10–14日,巴西里约热内卢
图 3:从俯视和侧视角度校准的机器人搭载相机轨迹。
图 2:TransBiolab 中包含的 15 个物体的渲染视图,涵盖微孔板、培养皿、离心管、移液器、试管架、培养瓶、试剂瓶以及生物反应器。
在真实实验室场景中,对重复透明实例、杂乱环境以及校准多视角采集的结合进行评估。
图 4:用于构建具有递增杂乱度、重复实例和跨类别交互的控制场景的 11 种排列模式。
2.3 透明物体感知的基础模型及跨类别交互
最近的基础模型拓宽了分割、几何和位姿估计任务中的感知能力,但透明物体对这三类任务而言仍然难以处理。可提示的分割模型如 SAM 2 和 SAM 3 旨在泛化到开放词汇物体和视频设置 [4, 27]。通用几何模型如 Depth Anything V2 和 Depth Anything 3 扩展了单目和任意视角的场景理解 [17, 44]。FoundationPose 和 MegaPose 通过基于物体模型的推理和渲染比较优化,将 6D 位姿估计扩展到了新物体 [16, 38]。我们的动机并非提出另一种模型,而是提供数据以测试通用模型在透明实验室物体上的表现,涵盖分割、深度导向推理和 6D 位姿估计,并揭示这一边界案例中的差距。
3 TransBiolab 数据集
3.1 物体与采集设置
TransBiolab 包含 15 个实验室物体,分为五个功能组,并明确包含不透明辅助工具,这些组经常出现在生物医学操作工作流中:微孔板(6、12、24 和 96 孔)、细胞培养皿(35 mm、60 mm 和 90 mm)、液体处理物体(15 ml 和 50 ml 离心管、移液器和试管架)、细胞培养瓶(25 ml、75 ml 和 125 ml)以及 1 L 生物反应器。图 2 展示了物体集合。七个物体完全透明,六个物体由透明主体与不透明盖子或底座组合而成,两个为不透明辅助工具。这种组成反映了实验室工作流中透明容器与支持工具的结合。
数据使用安装在 7 自由度 Franka Emika Panda 机器人上的 Intel RealSense D435i RGB-D 相机以 1280×720 分辨率和 30 FPS 采集。机器人搭载的设置提高了可重复性,并允许相机遍历场景上方的连续多视角路径,如图 3 所示。每个序列持续约 50 秒,通常包含 1,300–1,800 帧;这种变化遵循围绕名义 30 FPS 速率的采集时间。平均序列长度约为 1,646 帧,完整轨迹以校准视频形式发布。
3.2 场景设计与数据采集
图 4 中的 11 种排列模式并非随机组合。它们旨在反映重复的实验室程序,如样品制备、液体处理、混合、取样、液体转移、工作站之间的运输以及需要跨多个容器转移材料的细胞扩增或收获步骤。因此,这些模式根据实验室功能 affordances 和类似标准操作程序 (SOP) 的任务结构编码物体组合。一些模式强调来自同一类别的重复实例,如多个试管或培养皿,因为在实践中相同的容器经常一起出现。其他模式混合了几种物体,因为真实的实验室场景通常结合透明和不透明物体。在模式之间,场景难度从包含 4–5 个物体的中等杂乱增加到包含 9–12 个物体且相互遮挡更严重的密集场景。控制场景还通过四种桌面背景和两种光照设置进一步变化,如图 5 所示。四种背景为白色桌布、灰色桌布、裸露的木质桌面和覆盖杂志的桌面。两种光照设置为约 190 lx 的顶光和约 75 lx 的侧光。这些因素在不改变底层场景组成的情况下改变对比度、反射和遮挡线索,有助于隔离视觉敏感性。
除了受控的桌面采集外,我们还使用手持 RGB-D 采集收集了 10 个未见的真实世界实验室场景。
第 4 页
MM ’26, 2026年11月10–14日, 巴西里约热内卢 Ma 等人
Gray_tablecloth Magazine White_tablecloth Wood_table 数据集,并表明 TransBiolab 结合了生物医学实验室 侧光 重点与真实世界的 RGB-D 采集、重复出现的透明实例、显式干扰物以及校准的多视图序列。图 6 展示了场景-物体分布及初始的训练/测试划分,强调 15 种物体类型在场景中反复出现,而非集中在少数孤立拍摄中。图 1 说明了从单个校准序列中均匀采样的十个视角的预期呈现。图 7 总结了视角覆盖情况,图 8 总结了平移和旋转空间中 6D 标注的分布,展示了物体身份、相机运动和姿态标签在数据集中的分布情况。
图 5:四种桌面背景和两种光照设置下的受控变化。
这些场景包含新的场景布局、更多的干扰物以及背景和光照的环境变化,如图 1 所示。在受控场景和保留场景的总和中,TransBiolab 包含 98 个场景、161,315 帧 RGB-D 图像以及约 103 万个物体实例标注。每个场景设置包含三个以上的物体;161,059 帧(99.84%)包含三个以上的帧内物体,而 256 帧(0.16%)恰好包含三个物体,此时相机运动短暂地将其他物体移出视野。我们保留这些帧以保持序列连续性,并提供初始的场景不相交划分,将受控场景与保留的实验室场景分开。
4 基准任务
我们针对分割、深度估计与补全以及 6 自由度位姿估计进行基准测试。数据集内的诊断使用场景不相交划分和每条轨迹采样的十个视角;完整校准序列仍可用于视频和多视图方法。我们还报告了在十个保留的实验室场景上的结果,这些场景具有新的布局、干扰物、背景和光照,记为 TBiolab-HO。
3.3 标注流程
仅凭单帧深度难以可靠地标注透明物体,因此我们采用以序列为中心的多视图标注流程。首先,在 Rhino 中以毫米精度测量每个物体并重建为 3D 网格,我们以 OBJ 格式发布所有 15 种物体模型。接下来,将图像序列和物体模型导入基于 Blender 的 Progress-Labeller 工作区 [5]。使用 ORB-SLAM3 [3] 估计相机轨迹,并使用 KinectFusion 风格的重建将深度流融合为场景级点云。标注员通过在多视图工作区中联合检查 RGB 重投影、深度生成的点云以及跨视图的平面一致性来对齐物体网格。此流程为每帧生成物体身份、6D 位姿、完整掩码、可见掩码和对齐深度,以及相机内参和每帧外参。一个约 2,000 张图像的序列的序列级标注耗时约 40 分钟。我们还提供用于 BOP 风格评估 [15] 的格式转换工具,以便现有位姿估计工具链能以有限的努力进行适配。我们进一步审核了发布的 CAD 模型、位姿、掩码、内参和轨迹之间的相互一致性。投影的 CAD 轮廓和可见掩码的平均 IoU 为 0.949(中位数 0.971)。同视角重投影的中位数对称轮廓误差为 0.62 像素,跨视角变换后为 0.91 像素;两种情况下的第 95 百分位误差均低于一个像素。
这种几何一致性审核不构成独立的计量学验证。
3.4 数据集可视化
我们从四个互补的视角可视化和分析 TransBiolab:跨数据集比较、场景-物体组成、校准的多视图结构以及发布的标注分布。表 1 比较了代表性的透明物体…
4.1 透明物体分割
除了下面提到的实例匹配 SAM 3 协议外,我们还使用数据集定义的物体掩码比较 SAM 3 [4] 和 TransLab [40]。我们报告 IoU、精确率、召回率和 F1 值;所有四个指标均为越高越好。
表 2 显示 TransLab 在 Trans10K 上表现强劲,但在 TransBiolab 和 TBiolab-HO 上下降。SAM 3 在 TransBiolab 上的得分也低于 ClearPose,表明生物医学实验室环境仍未饱和。
实例匹配协议。对于每帧,我们使用针对一个物体类别的文本提示查询 SAM 3,并通过 IoU 贪婪地将预测掩码与真实实例匹配。未匹配的真实实例获得 IoU 0。我们报告 mIoU、匹配率和匹配实例的 mF1。在评估子集上,SAM 3 的整体 mIoU 为 0.685,匹配率为 84.8%,匹配实例的 mF1 为 0.881。
物体类别。表 3 显示盘子和碗通常最容易,Grex 1L 生物反应器、90 毫米培养皿、60 毫米培养皿和 24 孔板给出了最强的 mIoU 值。试管和较大的烧瓶更难,特别是 15 毫升和 50 毫升离心管,其细圆柱形状和弱边界降低了召回率和重叠率。按几何家族分组的结果给出了相同的排名:盘状物体表现最好,瓶状物体保持中等,管状物体最难。
场景杂乱。我们根据可见物体的总数和类别数对帧进行分组。性能在稀疏设置中最强,在更密集的混合物中较弱,但下降并非严格单调,表明杂乱、几何形状和外观之间存在交互作用。
视角。表 5 显示了与位姿估计不同的模式。从 VP1 到 VP8,mIoU 保持相对稳定,主要退化仅出现在最陡峭的视角。在 VP9 和 VP10,
第 5 页
TransBiolab:一个面向杂乱透明生物医学物体的真实世界多视角数据集 MM ’26,2026年11月10–14日,巴西里约热内卢
表 1:与代表性透明物体数据集的比较。N/A 表示原始论文中未明确报告的信息。
| Dataset | Primary domain | Sensor / modality | Objects | Scenes | Images | Grounds | Lighting | Multi-instance | Multi-view | Dis-tractors | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | KeyPose [19] | Desktop transparent objects | Stereo RGB + RGB-D | 15 | 600 seq. | 48K | 10 | No | Yes | Yes | No | | StereOBJ-1M [18] | Mixed tabletop objects | Stereo RGB | 18 | 183 | 396,509 | 11 env. | Varied | Yes | | | | ClearPose [6] | Household + chemical | RGB-D | 63 | 51 | 354,481 | 7 sets | Varied | Yes | | | | TransCG [10] | Daily-life transparent objects | RGB-D | 51 | 130 | 57,715 | 4 | 1 | Yes | | | | Trans10K-v2 [41] | Household / wild segmentation | RGB | 11 | N/A | 10,428 | Wild | Wild | Yes | No | Yes | | TransBiolab | Biomedical laboratory | RGB-D | 15 | 98 | 161,315 | 4 | 2 | Yes | | |
标注数量 min:0, max: 5715 训练集 测试集 id 物体名称 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 场景
35mm 培养皿
Grex 1L 生物反应器
175ml 烧瓶
96_well 板
6_well 板
12_well 板
24_well 板
试管架
90mm 培养皿
25ml 烧瓶
75ml 烧瓶
60mm 培养皿
移液器
50ml 离心瓶
15ml 离心瓶
max: 5715
图 6:场景-物体分布矩阵及初始的场景不重叠训练/测试划分。
视角覆盖率 %
80
70 71.05 70.44 70.36 70.22 69.54 69.41 68.74 68.13 67.68 67.51 65.01 64.23 63.37 60.54 60 55.21
50
40
30
20
10
0 物体 Grex_1L_bioreactor 试管架 175ml_flask 15ml_离心管 6_well 50ml_离心管 60mm_dish 90mm_dish 24_well 96_well_plate 75ml_flask 移液器 12_well 25ml_flask 35mm_dish
图 7:经校准的多视角序列中各物体的视角覆盖率。
表 2:三个数据集及保留场景上的掩码级分割性能(越高越好)。
| Dataset / split | Method | IoU ↑ | Precision ↑ | Recall ↑ | F1 ↑ | | :— | :— | :— | :— | :— | :— | | TransBiolab-all | SAM 3 [4] | 0.662 | 0.881 | 0.703 | 0.764 | | TransBiolab-all | TransLab [40] | 0.363 | 0.586 | 0.653 | 0.496 | | ClearPose-all [6] | SAM 3 [4] | 0.699 | 0.885 | 0.744 | 0.789 | | ClearPose-all [6] | TransLab [40] | 0.491 | 0.569 | 0.853 | 0.632 | | Trans10K [40] | SAM 3 [4] | 0.704 | 0.821 | 0.827 | 0.824 | | Trans10K [40] | TransLab [40] | 0.812 | 0.874 | 0.916 | 0.881 | | TBiolab-HO | SAM 3 [4] | 0.477 | 0.656 | 0.648 | 0.632 | | TBiolab-HO | TransLab [40] | 0.344 | 0.475 | 0.665 | 0.491 |
匹配率下降幅度大于匹配实例的 mF1,表明漏检主导了匹配掩码的质量。
4.2 透明物体深度估计与补全
我们评估了 Depth Anything 3 (DA3) [17] 用于度量深度预测,以及 ClearGrasp [29] 用于数据集定义物体区域内的透明物体深度补全。DA3 使用度量深度
第 6 页
MM ’26, 2026年11月10–14日, 巴西里约热内卢 Ma 等人
图 8: 发布的 6D 标注在平移和旋转轴上的分布。
表 3: SAM 3 [4] 物体类别结果。 表 5: SAM 3 [4] 视角结果。
名称 匹配率 mIoU mF1 视角 仰角 方位角 mIoU 匹配 mF1
移液管 89.9% 0.718 0.884 VP1 -22.2 -68.1 0.681 88.0% 0.856 试管架 90.0% 0.640 0.828 VP2 -24.6 -99.0 0.681 91.1% 0.837 60 mm 培养皿 95.5% 0.818 0.922 VP3 -27.3 -74.6 0.684 89.6% 0.847 6 孔板 85.0% 0.766 0.946 VP4 -32.6 -86.1 0.685 86.3% 0.874 12 孔板 87.8% 0.797 0.951 VP5 -40.9 -85.0 0.687 85.5% 0.880 24 孔板 87.8% 0.802 0.953 VP6 -51.1 -86.2 0.693 82.4% 0.905 35 mm 培养皿 83.3% 0.720 0.900 VP7 -51.9 -103.1 0.682 84.0% 0.886 90 mm 培养皿 97.1% 0.845 0.925 VP8 -53.4 -75.2 0.692 82.4% 0.905 15 ml 离心管 71.7% 0.484 0.795 VP9 -58.9 -83.4 0.609 71.2% 0.919 50 ml 离心管 75.6% 0.495 0.780 VP10 -62.0 -75.6 0.583 68.0% 0.915 25 ml 烧瓶 91.3% 0.735 0.883 75 ml 烧瓶 77.1% 0.574 0.829 125 ml 烧瓶 78.6% 0.587 0.799 96 孔板 81.4% 0.721 0.932 Grex 1L 生物反应器 100.0% 0.914 0.954 4.3 6D 物体位姿估计 FoundationPose 被用作 6D 位姿估计的通用基线。 总体而言 84.8% 0.685 0.881 对于每个目标实例,我们加载 RGB-D 帧、可见掩码、相机内参和 CAD 模型,然后使用 15 次细化迭代运行标准的注册-细化流程。存储的数据集位姿被转换为基线使用的相机内物体约定。我们报告 ADD、ADD-S 以及高达 0.1 m 的 AUC [13, 39]。在完整数据集上,FoundationPose 达到了 80.8 的 ADD-S AUC、53.9 的 ADD AUC 和 23.2 mm 的平均 ADD-S。 表 4: SAM 3 [4] 几何家族结果。 形状 代表性物体 mIoU 匹配率 板状 6/12/24/96 孔板和 35/60/90 mm 培养皿 0.789 89.2% 瓶状 25/75/125 ml 烧瓶、试管架、Grex 1L 生物反应器 0.700 86.3% 管状 15/50 ml 离心管和移液管 0.536 76.1% 为了进行额外的比较,FoundationPose 使用 RGB-D、真实掩码和 CAD 模型,而 MegaPose-6D [16] 使用 RGB、真实边界框和 CAD 模型,且没有深度信息。表 7 显示,FoundationPose 在 TransBiolab-all 上的 ADD-S AUC 从 ClearPose-all 上的 91.05 下降到 80.80,在 TBiolab-HO 上下降到 75.35,且没有进行测试时的尺度或平移对齐。所有报告的指标均为越低越好。 两种方法在 TransBiolab-all 上的物体区域深度误差均高于 ClearPose-all,这表明 TransBiolab 对深度估计和补全仍然具有挑战性。ClearGrasp 的保留误差较低。 物体类别。我们首先按物体类别对结果进行分组。表 8 列出了所有 15 个物体,而表 9 按几何
第 7 页
TransBiolab:杂乱透明生物医学物体的真实世界多视角数据集 MM ’26,2026年11月10–14日,巴西里约热内卢
表 6:跨数据集及保留场景的对象区域深度评估。值越低越好。
数据集 划分 方法 AbsRel ↓ RMSE (m) ↓ MAE (m) ↓ 原始缺失 ↓
TransBiolab 全部 DA3 [17] 0.371 0.224 0.220 0.349 TransBiolab 全部 ClearGrasp [29] 0.393 0.473 0.349 0.313 ClearPose [6] 全部 DA3 [17] 0.161 0.221 0.141 0.390 ClearPose [6] 全部 ClearGrasp [29] 0.327 0.404 0.276 0.299 TransBiolab 保留 DA3 [17] 0.302 0.180 0.174 0.189 TransBiolab 保留 ClearGrasp [29] 0.179 0.132 0.086 0.178
表 7:跨数据集及保留实验室场景的 6自由度位姿估计。
数据集/划分 方法 输入 ADD-S AUC ↑ ADD AUC ↑ ADD-S 均值 ↓ 成功率 ↑
TransBiolab-all FoundationPose [38] RGB-D, GT mask, CAD 80.80 53.90 23.20 mm 67.86% ClearPose-all [6] FoundationPose [38] RGB-D, GT mask, CAD 91.05 49.26 9.77 mm 89.53% TransBiolab-all MegaPose-6D [16] RGB, GT box, CAD 31.76 31.49 67.76 mm 34.14% ClearPose-all [6] MegaPose-6D [16] RGB, GT box, CAD 39.84 12.40 64.29 mm 25.00% TBiolab-HO FoundationPose [38] RGB-D, GT mask, CAD 75.35 47.06 34.53 mm 62.31% TBiolab-HO MegaPose-6D [16] RGB, GT box, CAD 55.50 25.17 96.46 mm 26.59%
表 8:按对象类别划分的 FoundationPose [38]。 表 10:按视角划分的 FoundationPose [38] 结果。
名称 ADD-S AUC ADD AUC ADD-S (mm) 视角 仰角 方位角 ADD-S AUC ADD AUC ADD-S
移液管 93.0 88.2 10.8 VP1 -22.2 -68.1 72.2 47.2 38.7 试管架 94.1 46.2 9.9 VP2 -24.6 -99.0 72.2 43.2 48.4 60 mm 培养皿 90.1 56.9 9.9 VP3 -27.3 -74.6 74.0 41.6 28.1 6 孔板 91.7 49.2 8.6 VP4 -32.6 -86.1 73.9 48.7 30.1 12 孔板 91.9 44.2 8.1 VP5 -40.9 -85.0 79.9 54.1 21.3 24 孔板 93.4 52.8 6.6 VP6 -51.1 -86.2 88.0 60.3 12.2 35 mm 培养皿 83.8 66.7 17.0 VP7 -51.9 -103.1 84.7 56.3 16.1 90 mm 培养皿 90.6 37.6 11.0 VP8 -53.4 -75.2 87.1 60.3 13.3 15 ml 离心管 75.4 64.4 24.8 VP9 -58.9 -83.4 87.6 64.8 12.5 50 ml 离心管 81.0 58.7 19.7 VP10 -62.0 -75.6 87.8 61.5 12.5 25 ml 烧瓶 77.7 57.8 38.1 75 ml 烧瓶 54.2 35.0 53.2 125 ml 烧瓶 41.0 28.1 75.1 96 孔板 91.6 53.5 8.6 Grex 1L 生物反应器 72.9 45.4 31.9
总计 80.8 53.9 23.2
表 9:按几何家族划分的 FoundationPose [38]。
形状 代表性对象 ADD-S AUC ADD-S (mm) 图 9:按场景复杂度划分的位姿结果。
板状 6/12/24/96 孔板 92.2 7.9 场景杂乱度。接下来,我们根据每帧中可见对象的总数和不同类别的数量对结果进行分组。图 9 显示该趋势并非严格单调:一些中等杂乱度的区间表现优于稀疏区间,因为几何形状和对称性仍然主导着难度。这表明杂乱度与部分可见性及对象形状相互作用,而非作为单一标量因子起作用。 架/细长 移液管、试管架 93.6 10.4 皿状 35/60/90 mm 培养皿 90.4 10.4 管状 15/50 ml 离心管 78.2 22.2 瓶状 25/75 ml 烧瓶 65.9 45.6 大/不规则 125 ml 烧瓶,Grex 1L 生物反应器 56.9 53.5 家族。板、架和皿通常较容易,而管、烧瓶和大而不规则的容器则较难。ADD-S/ADD 差距也具有信息量:试管架、培养皿和微孔板保持较高的 ADD-S AUC 但 ADD AUC 较低,表明在对称性下旋转身份的不确定性。相比之下,移液管的差距较小,因为其非对称几何形状提供了更强的方向线索。这些模式表明,TransBiolab 揭示了与透明度、几何形状和对称性相关的难度,而不仅仅是杂乱度。
视角。表 10 显示了明显的视角效应。浅视角最难:VP1 从 ADD-S AUC 72.2 和平均 ADD-S 38.7 mm 开始,而 VP10 达到 ADD-S AUC 87.8 和平均 ADD-S 12.5 mm。中等到陡峭的视角更稳定,因为它们揭示了更大的顶面和更清晰的轮廓,表明视角规划和多视角融合仍然具有前景。
第 8 页
MM ’26, 2026年11月10–14日, 巴西里约热内卢 Ma 等人
物体和模型集以及基准测试协议。在 IEEE 国际机器人会议 (ICAR)。510–517。 [3] Carlos Campos, Richard Elvira, Juan J. Gómez Rodríguez, José M. M. Montiel, 和 Juan D. Tardós。2021。ORB-SLAM3:用于视觉、视觉惯性及多地图 SLAM 的精确开源库。IEEE 机器人学汇刊 37, 6 (2021), 1874–1890。 [4] Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, 等。2025。SAM 3: 基于概念分割万物。arXiv 预印本 arXiv:2511.16719 (2025)。 [5] Xiaotong Chen, Huijie Zhang, Zeren Yu, Stanley Lewis, 和 Odest Chadwicke Jenkins。2022。ProgressLabeller:用于训练以物体为中心的 3D 感知的视觉数据流标注。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS)。13066–13073。 [6] Xiaotong Chen, Huijie Zhang, Zeren Yu, Anthony Opipari, 和 Odest Chad- wicke Jenkins。2022。ClearPose:大规模透明物体数据集与基准。在欧洲计算机视觉会议 (ECCV)。381–398。 图 10:机器人操作平台。[7] Maria-Nefeli Doulgkeroglou, Andrea Di Nubila, Bianca Niessing, Verena Kearns, Robert H. Schmitt, Ingo Martin, Bram de Wildt, Bjorn Spee, 等。2020。自 动化、监测和细胞产品制造的标准化。《生物工程和生物技术前沿》8 (2020), 811。 4.4 系统级真实机器人评估 [8] Anastasios Doumanoglou, Rigas Kouskouridas, Tae-Kyun Kim, Sotiris Malassi- TransBiolab 还旨在支持端到端操作 otis, 和 Nikos Komodakis。2016。从人群中恢复 6D 物体位姿并预测 在真实机器人平台上进行实验。如图 10 所示,该最佳视角。在 IEEE 计算机视觉与模式识别会议 (CVPR)。3583–3592。 系统首先从分割中获取物体掩码,然后估计 [9] Bertram Drost, Markus Ulrich, Christian Nitschke, 等。2017。引入 目标 6D 位姿(使用 FoundationPose),将此位 MVTec ITODD——一个用于工业中 3D 物体识别的数据集。在 IEEE 国 姿通过手眼标定变换到机器人基座,最后规划 际计算机视觉研讨会 (ICCVW)。 抓取和放置动作(通过 ROS/MoveIt)。相同的 6D [10] Hongjie Fang, Hao-Shu Fang, Sheng Xu, 和 Cewu Lu。2022。TransCG:一个大型 位姿输出也可用于初始化灵巧手抓取合成。 规模真实世界数据集,用于透明物体深度补全及抓取 我们在杂乱桌面场景中使用两种末端执行器执 基线。IEEE 机器人与自动化快报 7, 3 (2022), 7383–7390。 行真实机器人抓取试验。使用 Franka 平行夹爪 [11] Hao-Shu Fang, Chenxi Wang, Minghao Gou, 和 Cewu Lu。2020。GraspNet- 时,系统在 150 次试验中成功 98 次,成功率为 1Billion:一个用于通用物体抓取的大规模基准。在 IEEE/CVF 计 65.3%。将末端执行器替换为 LinkerHand 10-DoF 灵 算机视觉与模式 recognition 会议 (CVPR)。11444–11453。 巧手时,150 次试验中有 85 次成功抓取,成功 [12] Keiji Fushimi, Yusuke Nakai, Akiko Nishi, Ryo Suzuki, Masahiro Ikegami, Risa 率为 56.67%。这是系统级操作评估,而非 6D 位 Nimura, Taichi Tomono, Ryota Hidese, Hisashi Yasueda, Yusuke Tagawa, 等。 姿准确性的代理指标。与平行夹爪抓取相比, 2025。开发支持生物技术研究的自主实验室系统。《科学报告》15 (2025), 6648。 LinkerHand 还需要选择抓取类型、高维关节映射 [13] Stefan Hinterstoisser, Vincent Lepetit, Slobodan Ilic, Stefan Holzer, Gary Bradski, 以及富含接触的闭合;因此其较低的成功率可能 Kurt Konolige, 和 Nassir Navab。2012。基于模型的训练、检测和 反映了抓取合成与控制复杂性以及感知误差。 在严重杂乱场景中无纹理 3D 物体的位姿估计。在亚洲 5 结论 [14] Tomas Hodan, Pavel Haluza, Stepan Obdrzalek, Jiri Matas, Manolis Lourakis, 和 Xenophon Zabulis。2017。T-LESS:一个用于 6D 位姿估计的 RGB-D 数据集 我们提出了 TransBiolab,这是一个包含杂乱 无纹理物体。IEEE 计算机视觉应用冬季会议 透明生物医学物体的真实世界多视角数据集。 (WACV) (2017), 880–888。 TransBiolab 包含来自 98 个场景的 161,315 帧 [15] Tomas Hodan, Frank Michel, Eric Brachmann, Wadim Kehl, Anders Glent Buch, 和 1.03M 实例标注,涵盖 15 种实验室物体类 Dirk Kraft, Anastasios Doumanoglou, 等。2018。BOP:6D 物体 型,包括 6D 位姿、完整和可见掩码、全深度 位姿估计基准。欧洲计算机视觉会议 (ECCV)。Stan 19–35.Birchfield, 和每帧相机标定。在分割、深度估计与补全, Yannpose 估计。Labbé, LucasInManuelli,EuropeanArsalanConferenceMousavian,on ComputerVisionTyree, 以及 6D 位姿估计方面,扩展结果表明,当前 StephenBirchfield, 方法在不同领域、物体几何形状、对称性、杂乱 Jonathan Tremblay, Justin Carpentier, Mathieu Aubry, Dieter Fox, 和 Josef Sivic。 和视角方面仍存在显著差距。机器人实验提供 2022。MegaPose:通过渲染与比较进行新物体 6D 位姿估计。 了系统级操作评估,而非位姿准确性的代理指标, 在机器人学习会议 (CoRL)。 因为测量的成功率也反映了抓取合成与控制。 [17] Haotong Lin, Sili Chen, Junhao Liew, Donny Y. Chen, Zhenyu Li, Guang Shi, 因此,我们将 TransBiolab 视为研究未解决边 Jiashi Feng, 和 Bingyi Kang。2025。Depth Anything 3:从任意视角恢复视觉 界案例的数据集,而非已解决的基准。发表后, 空间。arXiv 预印本 arXiv:2511.10647 (2025)。 我们将发布完整的 RGB-D 序列、15 个 OBJ CAD [18] Xingyu Liu, Shun Iwase, 和 Kris M. Kitani。2021。StereOBJ-1M:用于 6D 物体 模型、6D 位姿、掩码、深度、标定文件和评估 位姿估计的大规模立体图像数据集。在 IEEE/CVF 国际 脚本。该数据集不包含人脸、个人身份或患者 计算机视觉研讨会 (ICCVW)。1294–1303。 数据。 [19] Xingyu Liu, Rico Jonschkowski, Anelia Angelova, 和 Kurt Konolige。2020。Key- Pose:透明物体的多视角 3D 标注和关键点估计。在 参考文献 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。11602– [1] Milad Abolhasani 和 Eugenia Kumacheva。2023。自动驾驶实验室在化学和 11610。 材料科学中的兴起。《自然合成》2 (2023), 483–492。 [20] Alan Lukezic, Ziga Trojer, Jiri Matas, 等。2024。一个用于透明物体跟踪的新 [2] 数据集和抗干扰架构。《国际计算机视觉杂志》132 (2024), 2729–2742。 [21] Ke Ma 和 Jing Cao。2019。设计模式作为连接人类与社会机器人的自适应交互 设计的实用工具。在国际智能人机系统整合会议。Springer, 613–617。 [22] Ke Ma, Yizhou Fang, Jean-Baptiste Weibel, Shuai Tan, Xinggang Wang, Yang Xiao, Yi Fang, 和 Tian Xia。2026。Phys-liquid:一个用于估计透明可变形液体 3D 几何形状和体积的物理感知数据集。在 AAAI 人工智能会议论文集, 第 40 卷。7782–7790。 [23] Ke Ma, Cong Fu, Jianing Wang, Yifei Wang, Wenyuan Li, Xinggang Wang, Meng Wang, 和 Tian Xia。2026。WPIS:从野外网络图像到物理感知 3D 场景图,用于物理推理。在 ACM Web 会议论文集 2026。1410–1421。
[2] Berk Calli, Arjun Singh, Aaron Walsman, Siddhartha Srinivasa, Pieter Abbeel, [24] Alice Melocchi, Brigitte Schmittlein, Alexis L. Jones, Yasmine Ainane, Ali Rizvi, 以及 Aaron M. Dollar。2015。操作研究中的基准测试:YCB Darius Chan, Elaine Dickey 等人。2024。机器人集群的开发
第 9 页
TransBiolab:杂乱透明生物医学物体的真实世界多视角数据集 MM ’26,2026年11月10–14日,巴西里约热内卢
自动化且可扩展的细胞治疗制造。Cytotherapy 26, 9 (2024), Vision. Springer, 398–416. 1095–1104. [35] Gary Tom, Stefan P. Schmid, Sterling G. Baird, Zhi Wang, Livia Choi, Naveen [25] Polyxeni Moutsatsou, Julia Ochs, Robert H. Schmitt, Christopher J. Hewitt, and Kumar, and Alan Aspuru-Guzik. 2024. Self-driving laboratories for chemistry Mariana P. Hanga. 2019. Automation in cell and gene therapy manufacturing: and materials science. Chemical Reviews 124, 16 (2024), 9633–9732. from past to future. Biotechnology Letters 41, 11–12 (2019), 1245–1253. [36] Stephen Tyree, Jonathan Tremblay, Tommy To, Jia Cheng, Terry Mosier, Jeffrey [26] Julia Ochs, Mahyar Golkaram, Silja Joussen, Alexander Wittemeier, Max Frank, Smith, Stan Birchfield, and Gregory D. Hager. 2022. 6-DoF pose estimation of Christina Möllmann, et al. 2021. Fully automated cultivation of adipose-derived household objects for robotic manipulation: an accessible dataset and bench- stem cells in the StemCellDiscovery—a robotic laboratory for small-scale, high- mark. In Conference on Robot Learning (CoRL). throughput cell production including deep learning-based confluence estima- [37] Amanda A. Volk and Milad Abolhasani. 2024. Performance metrics to unleash tion. Stem Cell Reviews and Reports 17 (2021), 1651–1668. the power of self-driving labs in chemistry and materials science. Nature Com- [27] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, munications 15 (2024), 1378. Laura Gustafson, et al. 2024. SAM 2: Segment anything in images and videos. [38] Bowen Wen, Wei Yang, Jan Kautz, and Stan Birchfield. 2024. FoundationPose: arXiv preprint arXiv:2408.00714 (2024). Unified 6D pose estimation and tracking of novel objects. In IEEE/CVF Conference [28] Colin Rennie, Rohan Shome, Kostas Bekris, and Alberto F. De Souza. 2016. A on Computer Vision and Pattern Recognition (CVPR). 17868–17879. dataset for improved RGBD-based object detection and pose estimation for ware- [39] Yu Xiang, Tanner Schmidt, Venkatraman Narayanan, and Dieter Fox. 2018. house pick-and-place. In IEEE International Conference on Robotics and Automa- PoseCNN: A convolutional neural network for 6D object pose estimation in clut- tion Workshops (ICRAW). tered scenes. In Robotics: Science and Systems (RSS). [29] Nikhil Sajjan, Matthew Moore, Mikey Pan, Gaurav Nagaraja, Jia Lee, Andy Zeng, [40] Enze Xie, Wenjia Wang, Wenhai Wang, Mingyu Ding, Chunhua Shen, and Ping Shuran Song, and Thomas Funkhouser. 2020. ClearGrasp: 3D shape estimation Luo. 2020. Segmenting Transparent Objects in the Wild. In European Conference of transparent objects for manipulation. In IEEE International Conference on Ro- on Computer Vision (ECCV). 696–711. botics and Automation (ICRA). 3634–3642. [41] Enze Xie, Wenjia Wang, Wenhai Wang, Peize Sun, Hang Xu, Ding Liang, and [30] Jintian Shi and Ke Ma. 2017. Digital touchpoints in campus slow traffic service Ping Luo. 2021. Segmenting transparent object in the wild with transformer. In system. In International Conference on Applied Human Factors and Ergonomics. International Joint Conference on Artificial Intelligence (IJCAI). 1003–1009. Springer, 349–361. [42] Haoping Xu, Yi Ru Wang, Sagi Eppel, Alan Aspuru-Guzik, Florian Shkurti, and [31] Shuai Tan, Bill Gong, Bin Ji, and Ye Pan. 2025. FixTalk: Taming identity leakage Animesh Garg. 2022. Seeing glass: Joint point-cloud and depth completion for for high-quality talking head generation in extreme cases. In Proceedings of the transparent objects. In Conference on Robot Learning (CoRL) (Proceedings of Ma- IEEE/CVF International Conference on Computer Vision. 24–36. chine Learning Research, Vol. 164). 827–838. [32] Shuai Tan, Biao Gong, Ke Ma, Yutong Feng, Qiyuan Zhang, Yan Wang, Yujun [43] Jun Yang, Yizhou Gao, Dong Li, and Steven L. Waslander. 2021. ROBI: A multi- Shen, and Hengshuang Zhao. 2026. CoDance: An Unbind-Rebind Paradigm for view dataset for reflective objects in robotic bin-picking. In IEEE/RSJ Interna- Robust Multi-Subject Animation. arXiv preprint arXiv:2601.11096 (2026). tional Conference on Intelligent Robots and Systems (IROS). [33] Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, [44] Lihe Yang, Bingyi Kang, Zilong Huang, Xin Xu, Jiashi Feng, and Hengshuang Kecheng Zheng, Xing Zhu, Yujun Shen, et al. 2026. Synmotion: Semantic- visual Zhao. 2024. Depth Anything V2. arXiv preprint arXiv:2406.09414 (2024). adaptation for motion customized video generation. In Proceedings of the [45] Yuhang Zhang, Ryohei Ishikawa, Tsuyoshi Tanaka, Koichi Hashimoto, and Hi- IEEE/CVF Conference on Computer Vision and Pattern Recognition. 30477–30489. royuki Oikawa. 2023. Integrating a manual pipette into a collaborative robot [34] Shuai Tan, Bin Ji, Mengxiao Bi, and Ye Pan. 2024. EDTalk: Efficient disentangle- manipulator for flexible liquid dispensing. In IEEE/SICE International Symposium ment for emotional talking head synthesis. In European Conference on Computer on System Integration (SII). 1–6.