快速导读:提出坐标感知框架CoordRefer,将坐标帧选择与坐标条件定位解耦,以解决现有方法中因联合预测导致的坐标相对框歧义问题,在多个基准上大幅提升性能。
CoordRefer针对现有多视角图像3D视觉定位方法中的一个根本性问题:坐标帧选择与3D框回归被耦合优化时,同一物理框在不同坐标帧下具有不同的数值表示,导致模型面临多个等价但矛盾的优化目标,最终预测出无效的折中框。论文将这一现象形式化为“坐标相对框歧义”(coordinate-relative box ambiguity),并提出坐标感知框架CoordRefer,将任务解耦为坐标帧选择和坐标条件定位两个阶段。
该框架在ScanRefer、NR3D、SR3D和Multi3DRefer四个域内基准上,以Qwen3-VL-2B为基座,相比坐标无关基线实现了11–14%的Acc@0.25提升。在ARKitSceneRefer零样本跨域评估中也取得了最优泛化性能。消融实验系统验证了坐标感知公式、次优帧监督、时序重采样以及直接/间接IoU奖励各自的关键贡献。
英文题目:CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images
论文出处:arXiv 每日论文精选 · arXiv:2608.05569
原始论文:PDF / 论文页面
这篇论文解决什么问题?
多模态大语言模型(MLLMs)在3D视觉定位任务中展现出强大潜力,主流方法通常将识别参考帧和回归3D边界框作为一个耦合过程。然而,这种联合优化忽略了一个关键的几何事实:同一个物理3D框,在不同的坐标帧下具有完全不同的数值表示。当模型同时预测坐标帧和3D框时,多个等价的坐标-框组合都可能是正确的,但它们指向不同的优化方向。
这种坐标相对框歧义导致模型在训练时接收到矛盾的监督信号,最终收敛到一个折中但无效的解——预测的坐标帧与3D框在几何上不一致,变换到统一空间后无法准确定位目标物体。论文通过Figure 2清晰地展示了这一现象:无坐标条件时,多个等价目标导致折中解;而显式坐标条件则提供了唯一的优化目标。
此前的方法如SPAR和VG-LLM虽然也涉及坐标帧预测,但均未意识到这一歧义问题的存在。SPAR预测坐标帧和2.5D框再提升至3D,VG-LLM直接从图像序列预测坐标帧和3D框,两者本质上都是坐标无关(coordinate-agnostic)的框架,无法避免歧义监督。
核心创新
- 识别并定义了现有图像基3D视觉定位中的坐标相对框歧义问题。
- 提出坐标感知框架,将坐标帧选择与坐标条件定位解耦,为每个样本提供唯一的优化目标。
- 设计渐进式训练策略:SFT阶段使用伪标签和次优帧监督建立基础能力;RL阶段使用直接和间接3D IoU奖励对齐下游定位质量。
- 引入间接IoU奖励机制,通过冻结的定位模型评估所选坐标帧的下游效用,替代启发式伪标签奖励。
方法概览
提出CoordRefer框架,将任务解耦为两步:1) 坐标帧选择(Coordinate Frame Selection):从多视角图像中选择一个参考帧定义坐标系;2) 坐标条件定位(Coordinate-Conditioned Grounding):在选定坐标系下预测3D边界框。训练分为两个阶段:坐标感知监督微调(Coordinate-Aware SFT)建立显式坐标-框对应关系;坐标感知强化学习(Coordinate-Aware RL)使用GRPO,以直接3D IoU奖励优化定位,以间接3D IoU奖励优化帧选择。
- 坐标感知解耦框架:CoordRefer将3D视觉定位分解为两个顺序步骤。第一步是坐标帧选择(Coordinate Frame Selection),从多视角图像序列中选出一个参考帧来定义坐标系;第二步是坐标条件定位(Coordinate-Conditioned Grounding),在选定坐标系的条件下预测3D边界框。这种解耦确保每个样本只有唯一的优化目标。
- 坐标感知监督微调(Coordinate-Aware SFT):SFT阶段使用伪坐标帧标签和真实3D框进行联合训练。伪标签通过启发式规则生成——排除目标不可见的帧后,基于投影面积和几何完整性筛选最优帧。同时引入次优帧监督(suboptimal-frame supervision),使用非最优但有效的坐标帧作为额外监督,提高模型对不完美帧选择的鲁棒性。
- 时序重采样(Temporal Resampling):在选定参考帧后,将其与相邻时序帧一起构成定位模块的输入。这一设计丰富了视觉证据,使定位模型能够利用多帧信息进行更准确的3D框预测。
- 坐标感知强化学习(Coordinate-Aware RL):RL阶段使用GRPO算法进一步优化。框预测使用直接3D IoU奖励,帧选择使用间接IoU奖励——通过冻结的定位模型评估所选坐标帧的下游定位IoU,作为帧选择的奖励信号。这种间接奖励机制替代了3D-RFT中的启发式伪标签帧奖励,使帧选择直接对齐下游定位质量。
- 共享策略设计:坐标帧选择和坐标条件定位共享同一个2B模型,而非使用两个独立模型。实验表明任务特定策略仅带来微弱且不一致的性能变化,却使模型存储和部署需求翻倍。
- 3D细化变体:在基础框架之上,CoordRefer还提供了一个3D细化变体,通过几何细化进一步提升定位精度,在ScanRefer上超越了使用显式3D输入的方法。
逐图理解论文
失败案例与直觉

直观展示了坐标相对框歧义的本质:(a)同一物理框在不同坐标帧下数值不同;(b)无坐标条件时多个等价目标导致折中无效解;(c)显式坐标条件提供唯一优化目标。
研究空白与核心思路

左图对比了坐标无关框架和坐标感知框架的核心差异:前者联合预测坐标帧和3D框导致歧义监督,后者解耦为两步提供唯一优化目标。右图展示了在多个基准上11–14%的性能提升。
方法贡献与验证

展示了CoordRefer的两阶段训练策略:SFT阶段使用伪标签和真实框建立坐标-框对应关系,RL阶段用直接IoU奖励优化框预测、间接IoU奖励优化帧选择。
核心结论

定性展示了坐标感知框架如何解决歧义:基线预测出不一致的坐标-框对,而CoordRefer在不同坐标帧下预测的框变换到统一空间后均对齐同一目标。
意义与局限

这项工作揭示了坐标感知设计是多视角3D定位的关键缺失环节,为后续研究指明了方向。但坐标帧选择仍是主要瓶颈——预测帧与最优帧之间还存在巨大差距,说明模型在判断哪个视角最适合定位方面仍有很大提升空间。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 域内评估在ScanRefer、NR3D、SR3D(单目标)和Multi3DRefer(多目标)四个基准上进行,使用Qwen3-VL-2B作为基座模型。
- 零样本跨域泛化评估在ARKitSceneRefer上进行,所有模型在ScanRefer上训练后直接评估,不做目标域微调。
- 消融研究系统验证SFT组件(坐标感知公式、次优帧监督、时序重采样)和RL组件(直接/间接IoU奖励)的贡献。
- 上限分析使用Oracle坐标帧(选择能产生最高定位IoU的帧)和框细化来探究性能瓶颈。
- 额外评估了框架对3D目标检测和3D描述任务的影响,验证解耦设计不损害其他能力。
- 分析了相机位姿估计精度对性能的影响,以及推理延迟的增加幅度。
关键结果与论文证据
- ScanRefer Acc@0.25:CoordRefer-2B达到51.1%,相比坐标无关基线39.7%提升11.4%(Table 1, p.5)。
- NR3D Acc@0.25:42.1% vs. 27.4%,提升14.7%,在所有基准中提升幅度最大(Table 1, p.5)。
- SR3D Acc@0.25:42.6% vs. 31.5%,提升11.1%(Table 1, p.5)。
- Multi3DRefer F1@0.25:45.4% vs. 34.4%,提升11.0%,验证了框架在多目标场景下的有效性(Table 1, p.5)。
- 3D细化变体在ScanRefer上达到Acc@0.25 60.0%,超越了使用显式3D输入的方法如Video-3D LLM(Table 2, p.5)。
- 零样本泛化:ARKitSceneRefer上Acc@0.25达到7.9%,优于所有对比方法(Table 3, p.6)。
- SFT消融:坐标感知公式+次优帧监督+时序重采样组合达到47.1% Acc@0.25,相比基线39.7%提升显著(Table 4, p.7)。
- RL消融:直接IoU奖励用于框预测、间接IoU奖励用于帧选择的组合达到最优51.1%,优于使用伪标签帧奖励的方案(Table 5, p.7)。
- 上限分析:Oracle帧选择可达到83.2% Acc@0.25,表明帧选择仍有巨大提升空间;框细化将Acc@0.5从23.6%提升至53.4%,表明几何精度是另一瓶颈(Table 12, p.12)。
- 相机位姿影响:使用估计位姿(π3)时Acc@0.25从51.1%降至49.3%,显示方法对位姿精度有一定依赖(Table 13, p.12)。
- 推理延迟:坐标感知框架推理时间为10.4秒,相比基线8.2秒增加约27%,属于适度开销(Table 10, p.11)。
阅读时需要注意
- 坐标帧选择仍不完美:预测帧与Oracle帧之间存在巨大性能差距(51.1% vs. 83.2% Acc@0.25),模型可能选择可见性不足或空间配置不佳的帧,这是当前框架的主要瓶颈。
- 坐标条件定位的几何精度不足:框细化带来的显著提升(Acc@0.5从23.6%到53.4%)表明,即使选对了坐标帧,精确的3D框估计仍有很大改进空间。
- 对相机位姿的依赖:方法需要相机位姿将预测框变换到统一坐标系,使用估计位姿会导致性能下降,在实际部署中可能受限。
- RL训练计算开销大:需要64块NPU进行训练,且推理延迟相比基线有适度增加。
关联工作
- SPAR(Zhang et al. 2025):基于视频输入预测坐标帧和2.5D框再提升至3D的早期工作,是CoordRefer的基线方法之一,但未意识到坐标相对框歧义问题。
- VG-LLM(Zheng et al. 2025):直接从图像序列预测坐标帧和3D框的坐标无关方法,是CoordRefer的主要对比对象。
- 3D-RFT(Linghu et al. 2026):引入可验证帧和3D IoU奖励的强化微调方法,CoordRefer在RL阶段与其伪标签帧奖励进行了消融对比,证明间接IoU奖励更优。
- Video-3D LLM(Zheng, Huang, and Wang 2025):使用显式3D输入(点云)的方法,CoordRefer的3D细化变体在ScanRefer上超越了其性能。