SceneBind:跨视觉、音频和语言的语义与空间绑定
SceneBind提出了一种结合全局语义嵌入和对象中心语义-空间槽的通用模态场景表示方法。通过显式建模3D空间属性,解决了现有模型缺乏显式空间结构的问题。实验显示,SceneBind在跨模态场景检索(V↔T R@1: 65.3)和对象级空间检索(Spatial mAP: 48.0)上显著优于ImageBind和M2D-SigLIP2*。该方法依赖真实世界空间对齐的多模态数据,且对象槽数量需根据任务调整。
SceneBind提出了一种结合全局语义嵌入和对象中心语义-空间槽的通用模态场景表示方法。通过显式建模3D空间属性,解决了现有模型缺乏显式空间结构的问题。实验显示,SceneBind在跨模态场景检索(V↔T R@1: 65.3)和对象级空间检索(Spatial mAP: 48.0)上显著优于ImageBind和M2D-SigLIP2*。该方法依赖真实世界空间对齐的多模态数据,且对象槽数量需根据任务调整。