VLM-IE3D:仅用RGB视频实现细粒度3D空间理解

方法概览:VLM-IE3D框架

本文介绍VLM-IE3D框架,通过融合隐式几何令牌(IGTs)和显式几何令牌(EGTs),解决现有RGB-only VLMs缺乏细粒度3D理解的问题。实验显示在Scan2Cap、ScanRefer、3D Video Detection及VSI-Bench上均取得SOTA表现。注意:推理速度略有下降,且依赖3D几何编码器重建质量。

SceneBind:跨视觉、音频和语言的语义与空间绑定

方法概述:全局嵌入与对象中心槽

SceneBind提出了一种结合全局语义嵌入和对象中心语义-空间槽的通用模态场景表示方法。通过显式建模3D空间属性,解决了现有模型缺乏显式空间结构的问题。实验显示,SceneBind在跨模态场景检索(V↔T R@1: 65.3)和对象级空间检索(Spatial mAP: 48.0)上显著优于ImageBind和M2D-SigLIP2*。该方法依赖真实世界空间对齐的多模态数据,且对象槽数量需根据任务调整。