VLM-IE3D:仅用RGB视频实现细粒度3D空间理解

方法概览:VLM-IE3D框架

本文介绍VLM-IE3D框架,通过融合隐式几何令牌(IGTs)和显式几何令牌(EGTs),解决现有RGB-only VLMs缺乏细粒度3D理解的问题。实验显示在Scan2Cap、ScanRefer、3D Video Detection及VSI-Bench上均取得SOTA表现。注意:推理速度略有下降,且依赖3D几何编码器重建质量。

超越前沿:SCAGE利用几何异常引导3D自主探索与高保真重建

创新点二:自适应视点生成机制

传统3D自主探索方法(如FrontierNet)往往只关注最大化空间体积覆盖率,导致轨迹效率低下且最终重建质量不足,无法捕捉精细几何细节。本文提出SCAGE框架,核心在于∆-Net网络,它基于Point Transformer V3训练,通过预测点分布偏移量来学习室内结构先验。推理时,系统计算全局归一化异常分数,聚类高异常区域并生成自适应6-DoF观察视点。实验显示,该方法在HM3D数据集上平均体积覆盖率达89.7%,Chamfer Distance仅为0.91×10⁻³,优于基线近三倍。真实世界验证表明,网络能识别训练集外未见结构的异常,证明其具备底层几何理解能力而非简单记忆。

UniPhysGen:让3D资产具备物理属性,一键生成仿真就绪模型

核心:UniPhysGen模型架构

本文提出UniPhysGen,解决3D资产缺乏物理语义的问题。通过感知引导分解、几何感知关节接地和仿真验证,将异构网格转化为仿真就绪资产。在UniPhys-Bench上关节类型准确率达89.96%,优于现有基线。需注意极端旋转下轴推理仍有挑战,且仿真验证目前以定性为主。