CoordRefer:解耦坐标帧选择与定位,消除多视角3D视觉定位中的坐标相对框歧义

快速导读:提出坐标感知框架CoordRefer,将坐标帧选择与坐标条件定位解耦,以解决现有方法中因联合预测导致的坐标相对框歧义问题,在多个基准上大幅提升性能。

CoordRefer针对现有多视角图像3D视觉定位方法中的一个根本性问题:坐标帧选择与3D框回归被耦合优化时,同一物理框在不同坐标帧下具有不同的数值表示,导致模型面临多个等价但矛盾的优化目标,最终预测出无效的折中框。论文将这一现象形式化为“坐标相对框歧义”(coordinate-relative box ambiguity),并提出坐标感知框架CoordRefer,将任务解耦为坐标帧选择和坐标条件定位两个阶段。

该框架在ScanRefer、NR3D、SR3D和Multi3DRefer四个域内基准上,以Qwen3-VL-2B为基座,相比坐标无关基线实现了11–14%的Acc@0.25提升。在ARKitSceneRefer零样本跨域评估中也取得了最优泛化性能。消融实验系统验证了坐标感知公式、次优帧监督、时序重采样以及直接/间接IoU奖励各自的关键贡献。

英文题目:CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images

论文出处:arXiv 每日论文精选 · arXiv:2608.05569

原始论文:PDF / 论文页面

这篇论文解决什么问题?

多模态大语言模型(MLLMs)在3D视觉定位任务中展现出强大潜力,主流方法通常将识别参考帧和回归3D边界框作为一个耦合过程。然而,这种联合优化忽略了一个关键的几何事实:同一个物理3D框,在不同的坐标帧下具有完全不同的数值表示。当模型同时预测坐标帧和3D框时,多个等价的坐标-框组合都可能是正确的,但它们指向不同的优化方向。

这种坐标相对框歧义导致模型在训练时接收到矛盾的监督信号,最终收敛到一个折中但无效的解——预测的坐标帧与3D框在几何上不一致,变换到统一空间后无法准确定位目标物体。论文通过Figure 2清晰地展示了这一现象:无坐标条件时,多个等价目标导致折中解;而显式坐标条件则提供了唯一的优化目标。

此前的方法如SPAR和VG-LLM虽然也涉及坐标帧预测,但均未意识到这一歧义问题的存在。SPAR预测坐标帧和2.5D框再提升至3D,VG-LLM直接从图像序列预测坐标帧和3D框,两者本质上都是坐标无关(coordinate-agnostic)的框架,无法避免歧义监督。

核心创新

  • 识别并定义了现有图像基3D视觉定位中的坐标相对框歧义问题。
  • 提出坐标感知框架,将坐标帧选择与坐标条件定位解耦,为每个样本提供唯一的优化目标。
  • 设计渐进式训练策略:SFT阶段使用伪标签和次优帧监督建立基础能力;RL阶段使用直接和间接3D IoU奖励对齐下游定位质量。
  • 引入间接IoU奖励机制,通过冻结的定位模型评估所选坐标帧的下游效用,替代启发式伪标签奖励。

方法概览

提出CoordRefer框架,将任务解耦为两步:1) 坐标帧选择(Coordinate Frame Selection):从多视角图像中选择一个参考帧定义坐标系;2) 坐标条件定位(Coordinate-Conditioned Grounding):在选定坐标系下预测3D边界框。训练分为两个阶段:坐标感知监督微调(Coordinate-Aware SFT)建立显式坐标-框对应关系;坐标感知强化学习(Coordinate-Aware RL)使用GRPO,以直接3D IoU奖励优化定位,以间接3D IoU奖励优化帧选择。

  • 坐标感知解耦框架:CoordRefer将3D视觉定位分解为两个顺序步骤。第一步是坐标帧选择(Coordinate Frame Selection),从多视角图像序列中选出一个参考帧来定义坐标系;第二步是坐标条件定位(Coordinate-Conditioned Grounding),在选定坐标系的条件下预测3D边界框。这种解耦确保每个样本只有唯一的优化目标。
  • 坐标感知监督微调(Coordinate-Aware SFT):SFT阶段使用伪坐标帧标签和真实3D框进行联合训练。伪标签通过启发式规则生成——排除目标不可见的帧后,基于投影面积和几何完整性筛选最优帧。同时引入次优帧监督(suboptimal-frame supervision),使用非最优但有效的坐标帧作为额外监督,提高模型对不完美帧选择的鲁棒性。
  • 时序重采样(Temporal Resampling):在选定参考帧后,将其与相邻时序帧一起构成定位模块的输入。这一设计丰富了视觉证据,使定位模型能够利用多帧信息进行更准确的3D框预测。
  • 坐标感知强化学习(Coordinate-Aware RL):RL阶段使用GRPO算法进一步优化。框预测使用直接3D IoU奖励,帧选择使用间接IoU奖励——通过冻结的定位模型评估所选坐标帧的下游定位IoU,作为帧选择的奖励信号。这种间接奖励机制替代了3D-RFT中的启发式伪标签帧奖励,使帧选择直接对齐下游定位质量。
  • 共享策略设计:坐标帧选择和坐标条件定位共享同一个2B模型,而非使用两个独立模型。实验表明任务特定策略仅带来微弱且不一致的性能变化,却使模型存储和部署需求翻倍。
  • 3D细化变体:在基础框架之上,CoordRefer还提供了一个3D细化变体,通过几何细化进一步提升定位精度,在ScanRefer上超越了使用显式3D输入的方法。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 2: Coordinate-relative box ambiguity and its resolu- tion through explicit coordinate conditioning. (a) The same physical 3D box has different representations under different coordinate frames. (b) Without coordinate conditioning, mul- tiple equivalent targets may lead to a compromise but invalid solution. (c) Conditioning box regression on the selected co- ordinate frame provides a unique optimization target.

直观展示了坐标相对框歧义的本质:(a)同一物理框在不同坐标帧下数值不同;(b)无坐标条件时多个等价目标导致折中无效解;(c)显式坐标条件提供唯一优化目标。

研究空白与核心思路

研究空白与核心思路
Figure 1: Left: Resolving box ambiguity for 3D visual grounding. Existing coordinate-agnostic frameworks jointly infer coordinate frames and 3D boxes, causing ambiguous supervision and producing invalid coordinate–box predictions. Our coordinate-aware framework decouples these two objectives by first selecting a coordinate frame and then grounding objects in the selected coordinate system, yielding a unique box representation and improved performance. Right: Performance gains on 3D visual grounding benchmarks. Our framework achieves improvements of 11–14% across multiple benchmarks over baseline.

左图对比了坐标无关框架和坐标感知框架的核心差异:前者联合预测坐标帧和3D框导致歧义监督,后者解耦为两步提供唯一优化目标。右图展示了在多个基准上11–14%的性能提升。

方法贡献与验证

方法贡献与验证
Figure 3: Coordinate-aware training strategy. In the SFT stage, the pretrained VLM is jointly trained on decoupled coordinate- frame selection and coordinate-conditioned grounding using pseudo frame labels and ground-truth boxes. In the RL stage, GRPO optimizes box prediction with a direct IoU reward and frame selection with an indirect IoU reward computed by a frozen grounding model. The grounding model is periodically updated with the latest policy weights.

展示了CoordRefer的两阶段训练策略:SFT阶段使用伪标签和真实框建立坐标-框对应关系,RL阶段用直接IoU奖励优化框预测、间接IoU奖励优化帧选择。

核心结论

核心结论
Figure 4: Qualitative evidence of resolving coordinate-relative box ambiguity. The coordinate-agnostic baseline predicts an inconsistent coordinate–box pair, producing a box misaligned with the target in 3D space. In contrast, our method predicts box representations under coordinates C, C1, and C2, which align with the same object after transformation to a common 3D space. Red, blue, and green denote coordinate-agnostic predictions, coordinate-aware predictions, and ground truth, respectively.

定性展示了坐标感知框架如何解决歧义:基线预测出不一致的坐标-框对,而CoordRefer在不同坐标帧下预测的框变换到统一空间后均对齐同一目标。

意义与局限

意义与局限
Figure 8: Qualitative comparison between our two-stage framework and oracle coordinate frame selection. Compared with CoordRefer, the oracle frame often provides more informative viewpoints and leads to more accurate localization, revealing significant room for improvement in coordinate frame selection.

这项工作揭示了坐标感知设计是多视角3D定位的关键缺失环节,为后续研究指明了方向。但坐标帧选择仍是主要瓶颈——预测帧与最优帧之间还存在巨大差距,说明模型在判断哪个视角最适合定位方面仍有很大提升空间。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 域内评估在ScanRefer、NR3D、SR3D(单目标)和Multi3DRefer(多目标)四个基准上进行,使用Qwen3-VL-2B作为基座模型。
  • 零样本跨域泛化评估在ARKitSceneRefer上进行,所有模型在ScanRefer上训练后直接评估,不做目标域微调。
  • 消融研究系统验证SFT组件(坐标感知公式、次优帧监督、时序重采样)和RL组件(直接/间接IoU奖励)的贡献。
  • 上限分析使用Oracle坐标帧(选择能产生最高定位IoU的帧)和框细化来探究性能瓶颈。
  • 额外评估了框架对3D目标检测和3D描述任务的影响,验证解耦设计不损害其他能力。
  • 分析了相机位姿估计精度对性能的影响,以及推理延迟的增加幅度。

关键结果与论文证据

  • ScanRefer Acc@0.25:CoordRefer-2B达到51.1%,相比坐标无关基线39.7%提升11.4%(Table 1, p.5)。
  • NR3D Acc@0.25:42.1% vs. 27.4%,提升14.7%,在所有基准中提升幅度最大(Table 1, p.5)。
  • SR3D Acc@0.25:42.6% vs. 31.5%,提升11.1%(Table 1, p.5)。
  • Multi3DRefer F1@0.25:45.4% vs. 34.4%,提升11.0%,验证了框架在多目标场景下的有效性(Table 1, p.5)。
  • 3D细化变体在ScanRefer上达到Acc@0.25 60.0%,超越了使用显式3D输入的方法如Video-3D LLM(Table 2, p.5)。
  • 零样本泛化:ARKitSceneRefer上Acc@0.25达到7.9%,优于所有对比方法(Table 3, p.6)。
  • SFT消融:坐标感知公式+次优帧监督+时序重采样组合达到47.1% Acc@0.25,相比基线39.7%提升显著(Table 4, p.7)。
  • RL消融:直接IoU奖励用于框预测、间接IoU奖励用于帧选择的组合达到最优51.1%,优于使用伪标签帧奖励的方案(Table 5, p.7)。
  • 上限分析:Oracle帧选择可达到83.2% Acc@0.25,表明帧选择仍有巨大提升空间;框细化将Acc@0.5从23.6%提升至53.4%,表明几何精度是另一瓶颈(Table 12, p.12)。
  • 相机位姿影响:使用估计位姿(π3)时Acc@0.25从51.1%降至49.3%,显示方法对位姿精度有一定依赖(Table 13, p.12)。
  • 推理延迟:坐标感知框架推理时间为10.4秒,相比基线8.2秒增加约27%,属于适度开销(Table 10, p.11)。

阅读时需要注意

  • 坐标帧选择仍不完美:预测帧与Oracle帧之间存在巨大性能差距(51.1% vs. 83.2% Acc@0.25),模型可能选择可见性不足或空间配置不佳的帧,这是当前框架的主要瓶颈。
  • 坐标条件定位的几何精度不足:框细化带来的显著提升(Acc@0.5从23.6%到53.4%)表明,即使选对了坐标帧,精确的3D框估计仍有很大改进空间。
  • 对相机位姿的依赖:方法需要相机位姿将预测框变换到统一坐标系,使用估计位姿会导致性能下降,在实际部署中可能受限。
  • RL训练计算开销大:需要64块NPU进行训练,且推理延迟相比基线有适度增加。

关联工作

  • SPAR(Zhang et al. 2025):基于视频输入预测坐标帧和2.5D框再提升至3D的早期工作,是CoordRefer的基线方法之一,但未意识到坐标相对框歧义问题。
  • VG-LLM(Zheng et al. 2025):直接从图像序列预测坐标帧和3D框的坐标无关方法,是CoordRefer的主要对比对象。
  • 3D-RFT(Linghu et al. 2026):引入可验证帧和3D IoU奖励的强化微调方法,CoordRefer在RL阶段与其伪标签帧奖励进行了消融对比,证明间接IoU奖励更优。
  • Video-3D LLM(Zheng, Huang, and Wang 2025):使用显式3D输入(点云)的方法,CoordRefer的3D细化变体在ScanRefer上超越了其性能。

发表评论