用于类别统一3D单目标跟踪的泛化结构感知关键点匹配

三分钟导读:UniKPT提出了一种全新的类别统一3D SOT框架,核心是用稀疏的、结构感知的关键点匹配替代密集点云交互。通过自适应关键点提取、渐进式对应对齐和置信度感知定位,实现高效且鲁棒的跟踪。

英文题目:Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking

论文出处:arXiv 每日论文精选 · CVPR 2026 Open Access

原始论文:PDF / 论文页面

对应视频标题:CVPR三分钟|用于类别统一3D单目标跟踪的泛化结构感知关键点匹配

这篇论文解决什么问题?

3D单目标跟踪是自动驾驶的基石,但现有方法多依赖类别特定范式,需为每类物体训练独立模型,扩展性极差。更致命的是,密集的点云交互在稀疏、遮挡场景下鲁棒性不足,难以应对尺度与结构的剧烈变化。

核心创新

  • 首先,自适应关键点提取器AKE根据物体尺度动态选择稀疏关键点,避免冗余计算。这种尺度感知机制确保在不同距离下都能捕获最具判别性的结构特征,为后续匹配提供高质量输入。
  • 其次,渐进式对应关系对齐器PCA通过多阶段自注意力和Deformable Attention逐步精炼模板与搜索区域的关键点对应。这种分层策略有效缓解了初始匹配的误差累积,提升了几何一致性。
  • 最后,置信度感知结构定位CASL利用邻域一致性抑制异常值,实现结构感知的边界框回归。该模块显著提升了在遮挡和噪声下的定位精度,确保跟踪结果的稳定性与可靠性。

方法概览

UniKPT提出了一种全新的类别统一3D SOT框架,核心是用稀疏的、结构感知的关键点匹配替代密集点云交互。通过自适应关键点提取、渐进式对应对齐和置信度感知定位,实现高效且鲁棒的跟踪。

逐图理解论文

背景与瓶颈

背景与瓶颈
Figure 1. Comparison of 3D single object tracking paradigms. (a) Category-specific trackers rely on dense point-to-point in- teractions, limiting generalization across categories. (b) Our UniKPT instead performs sparse keypoint-to-keypoint matching and structure-aware localization, enabling accurate and unified tracking without category-specific priors.

尽管MoCUT和TrackAny3D尝试了类别统一跟踪,但缺乏结构先验导致其在复杂几何下性能瓶颈明显。传统Siamese或运动中心范式依赖密集特征交互,计算冗余且易受噪声干扰,无法兼顾效率与泛化能力。

方法总览

方法总览
Figure 2. Overview of the proposed UniKPT framework. (a) Adaptive Keypoint Extractor (AKE) adaptively selects representative key- points from the template. (b) Progressive Correspondence Aligner (PCA) establishes and refines template–search correspondences. (c) Confidence-Aware Structural Localization (CASL) performs confidence-weighted structural reasoning for robust target localization. (d) Detailed structure of each refinement stage within PCA.

UniKPT提出了一种全新的类别统一3D SOT框架,核心是用稀疏的、结构感知的关键点匹配替代密集点云交互。通过自适应关键点提取、渐进式对应对齐和置信度感知定位,实现高效且鲁棒的跟踪。

NuScenes 实验结果

NuScenes 实验结果
Table 1. Comparisons with the state-of-the-art methods on NuScenes dataset. Success/Precision are used for evaluation. Numbers in brackets under each category denote the number of frames in the test set.

在NuScenes数据集上,UniKPT取得64.21% Success和77.29% Precision,超越类别统一基线TrackAny3D达9.64% Success,并领先类别特定SOTA方法4.37% Success,证明其强大的泛化能力。

KITTI 与计算效率

KITTI 与计算效率
Table 2. Comparisons with the state-of-the-art methods on KITTI dataset. Success/Precision are used for evaluation.

KITTI Car类别下,Success率达69.7%,Precision达81.4%。更重要的是,相比point-point baseline,UniKPT将FLOPs从1.11G降至0.55G,同时帧率从32 FPS提升到37 FPS,兼顾精度和实时性。

消融实验与启示

消融实验与启示
Table 3. Ablation study of key components on the NuScenes dataset. Mean success and precision are reported.

消融实验显示,关键点密度过高(如4x4x3)会导致性能饱和甚至下降,超过3阶段的精炼会引入冗余更新和噪声累积。这表明稀疏性与渐进策略需精确平衡,以优化几何覆盖与效率。

实验与关键结果

  • 在NuScenes数据集上,UniKPT取得64.21% Success和77.29% Precision,超越类别统一基线TrackAny3D达9.64% Success,并领先类别特定SOTA方法4.37% Success,证明其强大的泛化能力。
  • KITTI Car类别下,Success率达69.7%,Precision达81.4%。更重要的是,相比point-point baseline,UniKPT将FLOPs从1.11G降至0.55G,同时帧率从32 FPS提升到37 FPS,兼顾精度和实时性。
  • 消融实验显示,关键点密度过高(如4x4x3)会导致性能饱和甚至下降,超过3阶段的精炼会引入冗余更新和噪声累积。这表明稀疏性与渐进策略需精确平衡,以优化几何覆盖与效率。
  • 在NuScenes数据集上,UniKPT取得64.21% Success和77.29% Precision,超越类别统一基线TrackAny3D达9.64% Success,并领先类别特定SOTA方法4.37% Success,证明其强大的泛化能力。
  • KITTI Car类别下,Success率达69.7%,Precision达81.4%。更重要的是,相比point-point baseline,UniKPT将FLOPs从1.11G降至0.55G,同时帧率从32 FPS提升到37 FPS,兼顾精度和实时性。
  • 消融实验显示,关键点密度过高(如4x4x3)会导致性能饱和甚至下降,超过3阶段的精炼会引入冗余更新和噪声累积。这表明稀疏性与渐进策略需精确平衡,以优化几何覆盖与效率。

阅读时需要注意

  • 需注意的是,UniKPT依赖框级标注进行伪标签关键点监督,且KITTI数据集多样性有限,极端边缘案例的泛化性仍需验证。此外,行人等小目标在KITTI上仍具挑战,性能未全面超越所有类别特定模型。
  • The method relies on box-level annotations for supervision, requiring pseudo-labeling for keypoint coordinates.
  • Computational overhead increases with keypoint density, requiring a balance between geometric coverage and efficiency.
  • Results on KITTI show strong performance but the dataset is less diverse than NuScenes, potentially limiting generalization claims for extreme edge cases.

关联工作

  • 尽管MoCUT和TrackAny3D尝试了类别统一跟踪,但缺乏结构先验导致其在复杂几何下性能瓶颈明显。传统Siamese或运动中心范式依赖密集特征交互,计算冗余且易受噪声干扰,无法兼顾效率与泛化能力。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

本 CVPR 论文为开放获取版本,由计算机视觉基金会提供。 除该水印外,其内容与录用版本完全相同; 会议论文集的最终出版版本可在 IEEE Xplore 上获取。

面向类别统一 3D单目标跟踪的泛化结构感知关键点对应

Jie Xiao1 Yinchao Ma1 Yuyang Tang1 Dengqing Yang1 Jianpeng Yang1 Xu Zhou3 Qiao Li1 Wenfei Yang1 Tianzhu Zhang1,2* 1中国科学技术大学 2深空探测国家重点实验室,深空探测实验室 3深信服科技 {xj50805, imyc, yuyangtang, ydq, yjp}@mail.ustc.edu.cn zhouxu@sangfor.com.cn,byqiao09@163.com,{yangwf, tzzhang}@ustc.edu.cn

摘要 (a) 先前的类别特定范式 行人模型 模板 全局池化定位 卡车模型 全局池化 边界框 点云中的3D单目标跟踪(3D SOT)对于现实世界的3D感知至关重要,但由于数据稀疏性以及不同物体类别之间在尺度和结构上的巨大变化,它仍然具有挑战性。大多数现有方法依赖于类别特定范式,即为每个类别训练单独的模型,这严重限制了实际部署中的可扩展性和泛化能力。将这些方法扩展到能够跟踪不同物体类别的单一模型被证明是不够的,因为类别之间的显著差异使得在没有类别特定先验的情况下难以建立可靠的几何对应关系。为了克服这些局限性,我们提出了 Unified Structural KeyPoint Tracker (UniKPT),这是一种新颖的结构感知且具备泛化能力的框架,用于类别统一的3D点云跟踪。UniKPT 包含三个关键模块:(1) 自适应关键点提取器,生成尺度感知且具有语义意义的关键点;(2) 渐进式对应关系对齐器,建立鲁棒的跨帧几何关联;以及 (3) 置信度感知结构定位模块,抑制不可靠的匹配并利用细粒度的结构关系进行精确的3D定位。在 nuScenes 和 KITTI 基准上的大量实验表明,UniKPT 在类别统一的3D SOT 中取得了新的最先进性能。在具有挑战性的 nuScenes 数据集上,我们的统一模型进一步超越了类别特定的最先进跟踪器。 汽车模型 1 2 选择 最高 得分 用于 … 骑行者…模型 搜索区域 特征N 点 … …N 由于数据稀疏性以及不同物体类别之间在尺度和结构上的显著变化,3D SOT 仍然极具挑战性。 (b) 我们的类别统一范式 边界框 类别 模板 -统一 … 模型 搜索 区域 所有类别一个模型 自适应关键点稀疏对齐 结构感知定位 图1. 3D单目标跟踪范式的比较。 (a) 类别特定的跟踪器依赖于密集的点ToPoint交互,限制了跨类别的泛化能力。 (b) 我们的 UniKPT 则执行稀疏的关键点到关键点匹配和结构感知定位,实现了无需类别特定先验的准确且统一的跟踪。 旨在给定其在第一帧中的初始状态,在序列点云中持续且准确地定位物体。 尽管其重要性,3D SOT 仍然极具挑战性, 由于数据稀疏性以及不同物体类别之间在尺度和 结构上的显著变化。 大多数现有方法 [17, 23, 27, 40] 采用类别特定范式,即为每个物体类别训练单独的跟踪器。如图1 (a) 所示,典型的

4.37% 的成功率和 5.16% 的精确度。使用共享骨干网络处理模板和搜索区域,随后进行点对点密集特征交互,最终在搜索区域内定位目标。尽管这些方法得益于强大的类别特定先验并取得了令人印象深刻的性能,但它们在可扩展性和泛化性方面存在显著局限性。为每个类别训练和维护单独的模型会带来巨大的部署挑战,尤其是在多类别场景下。

1. 引言

3D单目标跟踪(SOT)在自动驾驶 [46] 和机器人感知 [1, 13] 中起着至关重要的作用。

*通讯作者。

28156

第 2 页

场景。这些局限性凸显了对一种类别统一的3D跟踪器的迫切需求,该跟踪器能够在单个模型中处理多样化的物体类别。然而,正如最近的研究[26]所揭示的,由于物体尺度和结构(例如行人、卡车)的巨大差异,简单地将特定类别的框架扩展到这种统一设置被证明是不够的。我们认为,这种不足主要源于现有流程中固有的某些局限性。首先,由于点云数据的稀疏性、噪声或频繁遮挡,模板区域和搜索区域之间往往缺乏准确的对应点对。这使得点对点密集特征交互机制[22, 39, 44, 47]难以学习稳定且可靠的几何对应关系,尤其是在没有特定类别先验的情况下。其次,当前的定位策略通常从单个点特征或通过池化操作获得的整体表示中预测目标边界框。前者[12, 23, 24]往往缺乏对周围上下文的感知,而后者[17, 27, 49]则压缩了空间拓扑结构。因此,这些方法在定位过程中忽略了目标内部结构关系的关键方面。结果,当前的特定类别范式难以捕捉准确且可泛化的跟踪性能所需的细粒度且鲁棒的空间关系。

基于上述分析,我们总结了开发鲁棒的类别统一3D跟踪器需要考虑的三个关键方面:(1) 如何提取适合多样化物体类别的尺度自适应特征?现有方法往往产生偏向特定物体尺寸或形状的特征。关键挑战在于提取在广泛尺度范围内保持判别力和一致性的特征,有效表示从细小详细的行人到大型稀疏结构的卡车等变化多样的物体。(2) 如何在没有特定类别先验的情况下建立鲁棒的几何对应关系?在缺乏点级监督且仅有框级对应关系可用的情况下,在稀疏、不完整和噪声点云下,可靠地建立模板区域和搜索区域之间的准确几何关系仍然具有挑战性。(3) 如何将结构感知能力嵌入目标定位?准确的3D定位需要理解目标内部配置以及点之间的空间关系。

综上所述,我们的贡献如下: • 我们提出了UniKPT,这是一种新颖的结构感知且可泛化的类别统一3D点云跟踪框架,能够在单个模型中有效处理多样化的物体类别。

物体的部分。挑战在于如何有效地利用这种细粒度的结构信息,以实现高精度的目标姿态估计。

为了实现上述目标,我们提出了统一结构关键点跟踪器(UniKPT),这是一种新颖的、感知结构的、类别统一的3D点云跟踪框架,如图1 (b)所示。UniKPT由三个协同工作的组件组成:(1) 自适应关键点提取器(Adaptive Keypoint Extractor, AKE)。该模块用于尺度自适应的特征提取;(2) 渐进式对应关系对齐器(Progressive Correspondence Aligner, PCA),用于建立鲁棒的几何对应关系;以及 (3) 置信度感知结构定位模块(Confidence-Aware Structural Localization, CASL),用于进行精确的、感知结构的目标姿态估计,并具备自适应的异常值处理能力。

• 我们设计了三个定制化的、相互依赖的组件:用于尺度自适应特征提取的自适应关键点提取器;用于建立鲁棒几何对应关系的渐进式对应关系对齐器;以及用于进行精确的、感知结构的目标姿态估计并具备自适应异常值处理能力的置信度感知结构定位模块。

• 为了验证我们的统一模型,我们进行了广泛的实验。

第 3 页

在 nuScenes [2] 和 KITTI [8] 数据集上进行了实验。我们提出的类别统一模型取得了优异的性能,在具有挑战性的 nuScenes 数据集上,其 Success / Precision 指标分别比现有的类别特定 SOTA 模型高出 4.37% / 5.16%。

2. 相关工作

3D 单目标跟踪(3D SOT)的目标是在给定初始状态的情况下,估计对象在点云序列中的位置和朝向。现有的 3D SOT 方法大致可分为两大类:基于孪生网络的方法和以运动为中心的方法。大多数现有的 3D 跟踪器 [9, 11, 30, 31, 38] 遵循孪生跟踪范式,将 3D 跟踪 formulated 为目标模板与搜索区域之间的帧间匹配问题。典型的流程包括用于特征提取的共享骨干网络,随后是模板与搜索区域之间的特征交互,以及目标定位。随着 Transformer 架构 [3–6, 19, 20, 28, 29, 33, 34, 36] 的出现,其在众多领域展现了显著的成功,许多近期工作 [7, 10, 12, 23, 25, 32, 43, 50] 已将注意力机制集成到孪生范式中,以实现针对目标更有效的点对点特征交互。上述基于孪生的方法主要关注瞬时的帧间匹配,很大程度上忽略了长期的时间依赖性。为了解决这一问题,一些方法通过利用历史外观或轨迹线索来整合时间上下文 [15, 17, 22, 40, 41, 44]。另一方面,其他 3D SOT 研究致力于解决数据的不完整性,探索补偿稀疏点云的策略 [42, 47]。除了上述基于孪生的跟踪方法外,另一条独特的研究路线专注于以运动为中心的跟踪。M2T [49] 首次提出了这一范式,直接预测目标在两个连续帧之间的运动。随后,BEV-Track [45]、VoxelTrack [21] 和 P2P [27] 进一步利用体素化表示来更有效地建模运动场。

尽管取得了进展,但这些方法都是类别特定的,导致冗余且泛化能力有限。MoCUT [26] 首次提出了一种具有自适应感受野模块的类别统一跟踪器,以缓解尺寸差异。最近,TrackAny3D [37] 利用预训练的 3D 模型实现类别统一的 3D 点云跟踪,展示了在不同对象类别上的改进泛化能力。然而,当前的跟踪框架主要依赖于密集的点对点特征交互。这种对缺乏强先验的密集、噪声局部相关性的依赖,严重限制了在不同类别上的泛化能力和鲁棒性,特别是在尺度变化、结构差异和遮挡情况下。在本文中,我们引入了 UniKPT,这是一种新颖的结构感知和以关键点为中心的框架,通过针对统一 3D 对象跟踪的鲁棒结构对应关系建模来解决这些局限性。

3. 方法

3.1. 任务定义

给定 LiDAR 点云序列中目标的初始 3D 边界框,3D 单目标跟踪(3D SOT)旨在在后续帧中连续定位同一目标。每个 3D 边界框由其中心 $(x, y, z)$、尺寸 $(w, h, l)$ 和航向角 $\theta$ 参数化,其中假设目标尺寸 $(w, h, l)$ 随时间保持恒定。因此,跟踪任务简化为估计连续帧之间的相对平移 $(\Delta x, \Delta y, \Delta z)$ 和旋转 $(\Delta \theta)$。在每个时间步 $t$,跟踪器以模板点云 $P_T$ 和搜索区域点云 $P_S$ 作为输入,并预测目标框 $B_t$:

$$ \hat{B}_t = \mathcal{F}_{track}(P_T, P_S, B_{t-1}; \Theta) \quad (1) $$

其中 $\mathcal{F}_{track}$ 表示由 $\Theta$ 参数化的可学习跟踪网络。

3.2. 整体跟踪框架

图 2 展示了我们 UniKPT 的整体框架,它由三个关键模块组成:自适应关键点提取器(Adaptive Keypoint Extractor, AKE)、渐进式对应关系对齐器(Progressive Correspondence Aligner, PCA)和置信度感知结构定位(Confidence-Aware Structural Localization, CASL)。给定来自两个连续帧的模板和搜索点云,分别记为 $P_{t-1} \in \mathbb{R}^{N_{t-1} \times 3}$ 和 $P_t \in \mathbb{R}^{N_t \times 3}$,其中 $N_{t-1}$ 和 $N_t$ 是点数,共享的基于体素的骨干网络 [51] 首先提取丰富的 3D 特征并将它们压缩为鸟瞰图(Bird’s-Eye-View, BEV)表示,记为 $F_{t-1}, F_t \in \mathbb{R}^{H \times W \times C}$,其中 $H$ 和 $W$ 是空间分辨率,$C$ 是特征通道维度。然后,自适应关键点提取器(AKE)从模板中自适应地选择一组稀疏但具有代表性的关键点,以尺度感知的方式捕获其内在结构。接下来,渐进式对应关系对齐器(PCA)通过逐步将这些模板关键点与搜索区域中的对应点对齐,建立鲁棒的几何对应关系。最后,置信度感知结构定位(CASL)利用这些对应关系,结合置信度感知机制,推断细粒度的结构关系并产生准确且鲁棒的 3D 目标定位。这三个核心模块之间的这种集成协作和顺序设计,使 UniKPT 能够通过利用通用结构特性,在不同对象类别上实现鲁棒的泛化。

3.3. 自适应关键点提取器

类别统一 3D 跟踪的一个关键挑战是如何提取能够适应对象尺度和形状显著变化同时保持

第 4 页

图 2. 所提出的 UniKPT 框架概览。(a) 自适应关键点提取器 (AKE) 从模板中自适应地选择具有代表性的关键点。(b) 渐进式对应关系对齐器 (PCA) 建立并细化模板与搜索区域之间的对应关系。(c) 置信度感知结构定位 (CASL) 执行置信度加权的结构推理,以实现鲁棒的目标定位。(d) PCA 中每个细化阶段的详细结构。

对噪声和遮挡具有鲁棒性。为了解决这一挑战,我们提出了自适应关键点提取器 (AKE),旨在以尺度感知的方式自适应地蒸馏出一组稀疏但具有代表性的关键点,以捕捉模板的内在几何结构,如图 2 (a) 所示。具体而言,我们初始化一组可学习的查询嵌入 $Q^0 \in \mathbb{R}^{N_q \times C}$,其中 $N_q = n_x n_y n_z$ 是通过沿每个轴将模板边界框 $B_{t-1}$ 均匀网格采样为 $n_x, n_y, n_z$ 个分区来确定的。所得的网格单元中心作为初始关键点坐标 $R_{t-1} \in \mathbb{R}^{N_q \times 3}$,确保覆盖不同尺度的对象并提供显式的空间先验。随后,我们通过堆叠 $L$ 个相同的层,使这些查询与模板特征进行交互,从而细化这些查询。每一层包含自注意力、交叉注意力和前馈网络。

接下来,MHCA 将查询与模板特征图 $F_{t-1}$ 对齐,以聚合自适应上下文。这使得查询能够通过整合全面的模板信息来充当关键点检测器:

$$ \hat{Q}^l = \bar{Q}^l + \text{MHCA}(\bar{Q}^l, F_{t-1}), \quad (4) $$

最后,全连接前馈网络细化聚合的特征:

$$ Q^l = \hat{Q}^l + \text{FFN}(\hat{Q}^l). \quad (5) $$

这进一步提高了特征表达能力和非线性,产生鲁棒且具有判别性的关键点特征。经过 $L$ 层后,我们在模板中获得语义丰富且结构自适应的关键点特征:

包含多头自注意力(MHSA)、多头交叉注意力(MHCA)以及带有残差连接的前馈网络(FFN),以实现稳定的训练。在第 $l$ 层,我们通过一个轻量级 MLP 对关键点坐标进行编码,并将其添加到查询特征中,以融入空间感知能力:

$$ \widetilde{Q}^{l}=Q^{l-1}+\text{MLP}(R_{t-1}). \tag{2} $$

这使得查询能够显式地感知其 3D 位置和结构上下文,从而促进尺度自适应和几何感知的特征学习。随后,MHSA 对查询之间的内部几何关系进行建模,使它们能够捕获相互的结构依赖性:

$$ \bar{Q}^{l} = \widetilde{Q}^{l} + \text{MHSA}(\widetilde{Q}^{l}), \tag{3} $$

$$ F_{t-1}^{\text{kpt}} = Q^{L} \in \mathbb{R}^{N_q \times C}, \tag{6} $$

形成一个紧凑的结构表示,支持后续模块中鲁棒的对应关系对齐和精确的目标定位。

3.4. 渐进式对应关系对齐器 (PCA)

由于点云的稀疏性、噪声和遮挡,尤其是在没有类别特定先验的情况下跟踪不同类别时,跨帧建立可靠的几何对应关系具有挑战性。为了解决这一问题,我们设计了渐进式对应关系对齐器(PCA),它如 图 2 (b) 所示,通过多个阶段逐步细化关键点到搜索区域的对应关系。

第 5 页

具体而言,我们使用模板初始化查询 $Q_t^0$,其中 $T_\theta \in \mathbb{R}^{3\times3}$ 是从关键点特征 $F_{t-1}^{\text{kpt}}$ 和偏航角 $\Delta\theta$ 导出的旋转矩阵,并将它们的初始坐标 $R_t^0$ 设置为这些模板关键点的 3D 坐标,即 $R_{t-1}$。然后,我们经过 $S$ 个迭代阶段逐步细化这些对应关系。如图 2 (d) 所示,对于第 $s$ 个阶段,我们首先通过使用多层感知机(MLP)编码当前关键点坐标 $R_t^{s-1}$ 并将其加到查询特征上来形成位置感知查询 $\tilde{Q}_t^s$:

$$ \tilde{Q}_t^s = Q_t^{s-1} + \text{MLP}_{\text{PE}}(R_t^{s-1}). \quad (7) $$

接下来,我们使用自注意力机制细化这些位置感知查询,以感知关键点之间的相互结构依赖关系:

$$ \bar{Q}_t^s = \text{MHSA}(\tilde{Q}_t^s). \quad (8) $$

随后,我们应用全局交叉注意力来聚合整个搜索区域的结构信息,其中细化后的位置感知查询作为查询,搜索区域特征作为键和值:

$$ \hat{Q}_t^s = \text{MHCA}(\bar{Q}_t^s, F_t). \quad (9) $$

这确保了全面的上下文聚合,并防止遗漏搜索区域中任何潜在的目标区域。

为了实现自适应局部特征聚合,我们随后采用可变形交叉注意力(Deformable Attention)[52]。这允许每个查询从其当前关键点坐标 $R_t^{s-1}$ 周围的搜索区域中选择性地采样稀疏局部特征,从而得到用于后续阶段的细化查询特征:

$$ Q_t^s = \hat{Q}_t^s + \text{DefAttn}(\hat{Q}_t^s, R_t^{s-1}, F_t). \quad (10) $$

最后,为了逐步更新关键点坐标,我们使用另一个 MLP 从这些细化后的查询特征中预测偏移量:

$$ R_t^s = R_t^{s-1} + \text{MLP}_{\text{offset}}(Q_t^s). \quad (11) $$

经过 $S$ 个阶段后,搜索关键点特征及其更新后的坐标为:

$$ \tilde{F}_t^{\text{kpt}} = \tilde{Q}_t^S \in \mathbb{R}^{N_q \times C}, \quad R_t^S \in \mathbb{R}^{N_q \times 3}. \quad (12) $$

它们共同编码了结构依赖关系和鲁棒的几何对应关系,为最终定位模块提供了可靠的线索。

回归关键点坐标具有挑战性,因为标准的 3D 跟踪数据集仅提供边界框标签。每个阶段 $s$ 预测的关键点坐标使用 $\ell_1$ 损失进行监督:

$$ \mathcal{L}_{\text{coord}} = \frac{1}{S} \sum_{s=1}^S \| R_t^s – R_t^{\text{gt}} \|_1. \quad (14) $$

3.5. 置信度感知结构定位 (CASL)

尽管渐进式对应关系对齐器(Progressive Correspondence Aligner, PCA)链接了模板和搜索关键点,但由于点云稀疏性和遮挡,仍可能出现缺失或异常值匹配。为了解决这个问题,我们引入了一个置信度感知结构定位(Confidence-Aware Structural Localization, CASL)模块,该模块降低不可靠对应关系的权重,并聚合可靠的对应关系以实现结构感知的目标定位,如图 2 (c) 所示。

通过相对几何关系进行置信度估计。 我们通过测量模板中的局部邻域关系在搜索区域中保留的程度来确定关键点对应关系的可靠性。对于模板,我们计算所有关键点之间的成对特征差异,以捕获它们的相对几何关系:

$$ \Delta F_{t-1}^{(i,j)} = F_{t-1}^{\text{kpt}(i)} – F_{t-1}^{\text{kpt}(j)}, \quad \Delta F_{t-1} \in \mathbb{R}^{N_q \times N_q \times C}. \quad (15) $$

这些关系通过一维卷积沿通道维度进行重塑和压缩,得到关系特征 $G_{t-1} \in \mathbb{R}^{N_q \times d}$。我们以相同的方式计算搜索区域的关系特征 $G_t$。模板和搜索关系特征被拼接并通过带有 Sigmoid 激活函数的 MLP:

$$ s = \sigma \left( \text{MLP}_{\text{confidence}} \left( [\mathbf{G}_{t-1}, \mathbf{G}_t] \right) \right). \quad (16) $$

其中 $s \in [0, 1]^{N_q}$,且每个 $s^{(i)}$ 表示第 $i$ 个对应关系的预测可靠性。

置信度加权的结构推理。 对于每个对应关系 $i$,我们将模板和搜索关键点特征拼接,并通过预测的置信度分数 $s^{(i)}$ 对其进行重新加权:

$$ \tilde{F}_{\text{pair}}^{(i)} = s^{(i)} \cdot [F_{t-1}^{\text{kpt}(i)}, \, F_t^{\text{kpt}(i)}]. \quad (17) $$

然后,置信度加权的关键点对 $\tilde{F}_{\text{pair}}$ 由轻量级 MLP-Mixer [35] 处理,该模型建模所有对应关系之间的交互并将它们聚合为紧凑的结构表示。随后,一个

级标注,其包含连续帧之间的相对平移 $\mathbf{t}_{gt} = [\Delta x, \Delta y, \Delta z]^\top$ 和旋转 $\Delta \theta$,而不包含直接的关键点级对应关系。为了生成监督信号,模板关键点坐标 $\mathbf{R}_{t-1}$ 使用真实相对位姿变换到搜索帧中:

$$ \hat{\mathbf{R}}_t^{gt} = \mathbf{T}_\theta \mathbf{R}_{t-1} \mathbf{t}_{gt}, \quad (13) $$

定位头回归目标边界框 $\hat{\mathbf{b}}_t = [\Delta x, \Delta y, \Delta z, \Delta \theta]^\top$。我们使用残差对数似然估计损失 [16] 训练该分支:

$$ \mathcal{L}_{loc} = \mathcal{F}(\hat{\mathbf{b}}_t, \mathbf{b}_t^{gt}), \quad (18) $$

其中 $\mathbf{b}_t^{gt}$ 是真实目标框,$\mathcal{F}$ 是基于对数似然的损失。

第 6 页

表 1. 在 NuScenes 数据集上与最先进方法的比较。使用 Success/Precision 进行评估。每个类别下方括号中的数字表示测试集中的帧数。

Car Pedestrian Truck Trailer Bus Mean 范式 跟踪器 来源 [64,159] [33,227] [13,587] [3,352] [2,953] [117,278]

SC3D CVPR’19 22.31/21.93 11.29/12.65 30.67/27.73 35.28/28.12 29.35/24.08 20.70/20.20 P2B CVPR’20 38.81/43.18 28.39/52.24 42.95/41.59 48.96/40.05 32.95/27.41 36.48/45.08 BAT ICCV’21 40.73/43.29 28.83/53.32 45.34/42.58 52.59/44.89 35.44/28.01 38.10/45.71 PTTR CVPR’22 51.89/58.61 29.90/45.09 45.30/44.74 45.87/38.36 43.14/37.74 44.50/52.07 M2Track CVPR’22 55.85/65.09 32.10/60.92 57.36/59.54 57.61/58.26 51.39/51.44 49.23/62.73 类别 GLT-T AAAI’23 48.52/54.29 31.74/56.49 52.74/51.43 57.60/52.01 44.55/40.69 44.42/54.33 特定 MBPTrack ICCV’23 62.47/70.41 45.32/74.03 62.18/63.31 65.14/61.33 55.41/51.76 57.48/69.88 HVTrack ECCV’24 55.9/62.9 41.3/67.6 55.6/55.2 52.0/40.2 36.3/41.6 51.1/62.2 SCVTrack AAAI’24 58.9/67.7 34.5/61.5 60.6/61.4 59.5/60.1 54.3/53.6 52.1/64.7 SeqTrack3D ICRA’24 62.55/71.46 39.94/68.57 60.97/63.04 68.37/61.76 54.33/53.52 55.92/68.94 StreamTrack AAAI’24 62.05/70.81 38.43/68.58 64.67/66.60 66.67/64.27 60.66/59.74 55.75/69.22 P2P IJCV’25 65.15/72.90 46.43/75.08 64.96/65.96 70.46/66.86 59.02/56.56 59.84/72.13

类别 MoCUT ICLR’24 57.32/66.01 33.47/63.12 61.75/64.38 60.90/61.84 57.39/56.07 51.19/64.63 统一 TrackAny3D ICCV’25 59.30/66.46 40.37/68.70 62.70/62.80 66.12/59.20 61.01/58.02 54.57/66.25 UniKPT Ours 71.63/79.89 45.03/74.62 72.92/75.17 74.62/72.99 67.52/66.97 64.21/77.29

通过置信度估计和结构推理,CASL 自适应地抑制不可靠的关键点对应关系,并充分利用潜在的几何结构,从而实现鲁棒且准确的目标定位。

3.6. 训练损失 整体训练目标由两个部分组成: (1) 关键点坐标监督,用于建立准确的几何对应关系;以及 (2) 边界框回归,用于最终的目标定位: \mathcal{L} = \lambda_1 \mathcal{L}_{coord} + \lambda_2 \mathcal{L}_{loc}, (19) 其中 $\lambda_1$ 和 $\lambda_2$ 是平衡权重。

4. 实验 4.1. 实验设置。 数据集。我们在两个流行的数据集 NuScenes [2] 和 KITTI [8] 上对我们的框架进行了广泛评估。NuScenes [2] 是一个具有挑战性的大规模数据集,包含 700 个训练场景和 150 个测试场景。相比之下,KITTI [8] 相对较小,仅包含 21 个训练序列和 29 个测试序列,使其多样性较低,但广泛用于评估 3D 跟踪方法。 评估指标和实现细节。我们采用来自单次评估 [14] 的 Success 和 Precision 作为指标。Success 是 IoU 曲线在 0 到 1 阈值范围内的曲线下面积(AUC),而 Precision 是中心距离曲线在 0 到 2 米阈值范围内的 AUC。网络在 NuScenes 上训练 30 个 epoch,在 KITTI 上使用 AdamW [18] 优化器训练 150 个 epoch(初始学习率 $1 \times 10^{-4}$,权重衰减 $1 \times 10^{-5}$)。实验在单张 RTX 3090 GPU 上进行。更多细节可在补充材料中找到。

4.2. 与最先进方法的比较 我们将 UniKPT 与代表性的 3D SOT 跟踪器进行比较,包括 SC3D [9]、P2B [31]、BAT [48]、PTTR [50]、V2B [11]、M2-Track [49]、STNet [12]、GLT-T [25]、CXTrack [43]、MBPTrack [44]、HVTrack [40]、SCV-Track [47]、SeqTrack3D [17]、StreamTrack [22]、P2P [27]、MoCUT [26] 和 TrackAny3D [37]。

NuScenes 上的结果。表 1 报告了在具有挑战性的 nuScenes 数据集上的结果,该数据集包含高度多样化的物体类别,具有大规模的变化和极其稀疏的 LiDAR 点云,使得类别统一跟踪特别具有挑战性。我们的统一跟踪器 UniKPT 取得了 64.21% 的 Success 和 77.29% 的 Precision,超越了之前的类别统一基线 TrackAny3D 9.64% / 11.04%。更重要的是,UniKPT 在所有类别上 consistently 建立了新的最先进结果,甚至优于使用显式先验训练的类别特定跟踪器。这些一致的改进主要源于自适应关键点提取和结构化对应关系推理,它们共同缓解了类别间尺度差异并捕获全局几何关系,从而实现对多样化物体形状的鲁棒且可泛化的跟踪。

KITTI 上的结果。表 2 报告了在 KITTI 数据集上的结果。UniKPT consistently 改进了之前的

第 7 页

表 2. 在 KITTI 数据集上与最先进方法的比较 表 3. 在 NuScenes 数据集上关键组件的消融研究。使用 Success/Precision 进行评估。

Car Pedestrian Van Cyclist 变体 Success Precision 方法 [6,424] [6,088] [1,248] [308] (1) w/o Lcoord 60.63 73.30 SC3D 41.3/57.9 18.2/37.8 40.4/47.0 41.5/70.4 (2) Single-Stage Lcoord 61.57 74.63 P2B 56.2/72.8 28.7/49.6 40.8/48.4 32.1/44.7 (3) w/o Deformable Attn 62.58 75.41 BAT 60.5/77.7 42.1/70.1 52.4/67.0 33.7/45.4 V2B 70.5/81.3 48.3/73.5 50.1/58.0 40.8/49.7 (4) w/o Confidence Estimation 63.34 76.31 PTTR 65.2/77.4 50.9/81.6 52.5/61.8 65.1/90.5 (5) MLP-Mixer→MLP 62.51 75.63 GLT-T 68.2/82.1 52.4/78.8 52.6/62.9 68.9/92.1 (6) MLP-Mixer→Self-Attn 63.02 76.21 STNet 72.1/84.0 49.9/77.2 58.0/70.6 73.5/93.7 (7) Ours 64.21 77.29 M2-Track 65.5/80.8 61.5/88.2 53.8/70.7 73.2/93.5 CXTrack 69.1/81.6 67.0/91.5 60.0/71.8 74.2/94.3 表 4. 关于细化阶段数量的消融研究。 HVTrack 68.2/79.2 64.6/90.6 54.8/63.8 72.4/93.7 SCVTrack 68.7/81.9 62.0/89.1 58.6/72.8 77.4/94.4 S 1 2 3 4 MBPTrack 73.4/84.8 68.6/93.9 61.3/72.7 76.7/94.3 Succ/Prec 62.0/74.1 63.4/76.5 64.2/77.3 63.8/76.7 StreamTrack 72.6/83.7 70.5/94.7 61.0/76.9 78.1/94.6 P2P 73.6/85.7 69.6/94.0 70.3/83.9 75.5/94.6 MoCUT 67.6/80.5 63.3/90.0 64.5/78.8 76.7/94.2 表 5. 关于关键点数量的消融研究。 UniKPT(Ours) 69.7/81.4 65.2/89.3 68.7/81.4 76.4/94.9 nx, ny, nz 2, 2, 2 3, 3, 2 3, 3, 3 4, 4, 3 Succ/Prec 62.1/75.0 63.0/76.1 64.2/77.3 64.0/76.9 我们统一的基线 MoCUT,在长尾 Van 类别上取得了显著增益,Success 提升 4.2%,Precision 提升 2.6%。尽管 KITTI 的数据规模较小且多样性有限,UniKPT 仍保持了与类别特定跟踪器相竞争的性能,证明了即使在数据稀缺条件下也具有强大的鲁棒性和稳定性。

4.3. 消融研究 我们在 NuScenes 数据集上进行消融研究。为了评估每个提出设计的贡献,我们研究了七个变体,如表 3 所示。 渐进式对应关系对齐器的影响。 表 3(变体 1–3)分析了渐进式对应关系对齐器的关键组件。移除坐标回归损失 Lcoord 导致性能显著下降至 60.63%/73.30%,表明显式的关键点定位监督对于稳定的对应关系学习至关重要。仅在最终阶段应用 Lcoord 将性能提升至 61.57%/74.63%,但仍低于我们的完整渐进式细化,证明了分阶段监督的好处。用标准密集交叉注意力替换稀疏可变形注意力将性能降低至 62.58%/75.41%,表明使用渐进式细化的关键点作为注意力先验能够实现更集中的特征交互,并产生更高质量的关键点。 置信度感知结构定位的影响。 表 3(变体 4–6)评估了我们置信度感知结构定位的设计。移除置信度预测分支将性能降低至 63.34%/76.31%,显示了置信度感知加权对于抑制不可靠对应关系的重要性。使用没有对应关系交互的简单 MLP 会使性能下降至 62.51%/75.63%,突出了通过交互进行结构感知的需求。将其替换为自注意力机制略微将性能提升至 63.02%/76.21%。我们完整的 MLP-Mixer(变体 7)取得了最佳结果,这可能是由于在对应关系和特征通道之间进行了联合交互。 阶段数量分析。 表 4 研究了细化阶段数量如何影响跟踪性能。随着阶段数量从 1 增加到 3,性能持续提高,证明了渐进式对应关系细化有效地增强了匹配质量和定位精度。然而,增加第四个阶段并没有进一步提高精度,因为过度的细化会在对应关系对齐中引入冗余更新和累积噪声。因此,我们默认选择 S = 3。 关键点数量分析。 表 5 研究了不同关键点数量对跟踪性能的影响。随着关键点数量的增加,性能持续提高,因为更密集的采样提供了更好的物体几何覆盖,并实现了更可靠的结构对应关系,特别是在部分观测或遮挡的情况下。然而,进一步将密度增加到 4 × 4 × 3 仅带来边际增益甚至轻微退化。这表明性能在超过一定关键点密度后会饱和。此外,更高的关键点

第 8 页

表 6. 点对点与我们关键点-关键点的比较。

方法 成功率/精度 FLOPs FPS 点对点 59.3/71.6 1.11G 32 我们 64.2/77.3 0.55G 37

表 7. 类别特定训练的结果。

方法 汽车 行人 卡车 拖车 公交车 P2P 65.15/72.90 46.43/75.08 64.96/65.96 70.46/66.86 59.02/56.56 我们 70.54/78.97 45.87/76.12 67.64/70.18 72.14/70.18 62.67/61.11

图 4. 多物体类别各细化阶段预测关键点的可视化。第一、第二和第三阶段的关键点分别以红色、绿色和蓝色显示。

图 3. 汽车和公交车示例上预测的关键点及其置信度得分的可视化。关键点以红色显示。仅显示汽车和公交车的部分关键点以清晰展示。预测的关键点很好地适应了不同的物体尺度,验证了我们自适应关键点提取的有效性。

关键点坐标和置信度得分。图 3 可视化了汽车和公交车的预测关键点及其置信度得分,其中仅显示了一部分以清晰展示。预测的关键点很好地适应了不同的物体尺度,验证了我们自适应关键点提取的有效性。此外,位于结构信息丰富区域(如物体边界和独特几何部分)的关键点获得了更高的置信度得分,表明模型学会了关注对准确对应估计至关重要的几何判别性线索。

基于关键点设计的分析。表 6 将我们的方法与基线点对点方法进行了比较。为了公平比较,基线采用了与我们自适应关键点提取器相同的层设计,但堆叠了六层以匹配参数大小,同时用密集模板点特征替换了学习到的关键点查询。我们的方法在显著降低 FLOPs 和加快推理速度的同时实现了更高的性能。这表明点对点匹配难以建立鲁棒的对应关系并产生高昂的计算成本,而我们的关键点设计有效地捕捉了结构化关系,提高了准确性和效率。

各细化阶段的关键点。图 4 可视化了不同类别代表性实例的各细化阶段预测关键点。可以观察到,早期阶段的关键点通常位于目标边界之外或坍缩成紧凑的簇。通过渐进式细化,它们逐渐扩散以准确覆盖整个物体。这证明了我们的渐进式对应关系对齐在跨阶段细化关键点质量方面的有效性。

类别特定训练的结果。表 7 显示,在类别特定训练下,UniKPT 在刚性、大规模物体(如汽车 (+5.39%/+6.07%) 和拖车 (+1.68%/+3.32%))上优于强大的 P2P 跟踪器,同时在高度遮挡的行人上保持竞争力。这些结果表明,所提出的结构化关键点匹配范式在类别特定训练下仍然非常有效,证实了 UniKPT 的性能源于其鲁棒的结构感知对应学习。

4.4. 可视化

5. 结论

我们提出了 UniKPT,这是一个结构感知且可泛化的框架,用于在单个模型中进行类别统一的 3D 点云跟踪。UniKPT 引入了三个互补模块:一个生成尺度一致、语义有意义的关键点的自适应关键点提取器,一个用于鲁棒几何对应的渐进式对应关系对齐器,以及一个用于精确可靠姿态估计的置信度感知结构定位模块。在 NuScenes 和 KITTI 上的广泛实验验证了其有效性。

第 9 页

致谢 本工作得到了国家自然科学基金(U25A20536)和中国科学院青年创新促进会的支持。

参考文献 [1] Widodo Budiharto, Edy Irwansyah, Jarot Sembodo Suroso, and Alexander Agung Santoso Gunawan. Design of object tracking for military robot using pid controller and computer vision. ICIC Express Letters, 14(3):289–294, 2020. 1 [2] Holger Caesar, Varun Bankiti, Alex H Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom. nuscenes: A multi-modal dataset for autonomous driving. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 11621–11631, 2020. 3, 6 [3] Zhixin Cheng, Jiacheng Deng, Xinjun Li, Li Liu, Xiaotian Yin, Baoqun Yin, and Tianzhu Zhang. B2-3d++: Uncertainty-aware hierarchical registration network with domain alignment. Authorea Preprints, 2025. 3 [4] Zhixin Cheng, Jiacheng Deng, Xinjun Li, Baoqun Yin, and Tianzhu Zhang. Bridge 2d-3d: Uncertainty-aware hierarchical registration network with domain alignment. In Proceedings of the AAAI Conference on Artificial Intelligence, pages 2491–2499, 2025. [5] Zhixin Cheng, Jiacheng Deng, Xinjun Li, Xiaotian Yin, Bohao Liao, Baoqun Yin, Wenfei Yang, and Tianzhu Zhang. Ca-i2p: Channel-adaptive registration network with global optimal selection. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 27739–27749, 2025. [6] Zhixin Cheng, Xiaotian Yin, Jiacheng Deng, Bohao Liao, Yujia Chen, Xu Zhou, Baoqun Yin, and Tianzhu Zhang. Adaptive agent selection and interaction network for image-to-point cloud registration. arXiv preprint arXiv:2511.05965, 2025. 3 [7] Yubo Cui, Zheng Fang, Jiayao Shan, Zuoxu Gu, and Sifan Zhou. 3d object tracking with transformer. arXiv preprint arXiv:2110.14921, 2021. 3 [8] Andreas Geiger, Philip Lenz, and Raquel Urtasun. Are we ready for autonomous driving? the kitti vision benchmark suite. In 2012 IEEE conference on computer vision and pattern recognition, pages 3354–3361. IEEE, 2012. 3, 6 [9] Silvio Giancola, Jesus Zarzar, and Bernard Ghanem. Leveraging shape completion for 3d siamese tracking. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 1359–1368, 2019. 3, 6 [12] Le Hui, Lingpeng Wang, Linghua Tang, Kaihao Lan, Jin Xie, and Jian Yang. 3d siamese transformer network for single object tracking on point clouds. In European Conference on Computer Vision, pages 293–310. Springer, 2022. 2, 3, 6 [13] Muxi Jiang, Rui Li, Qisheng Liu, Yingjing Shi, and Esteban Tlelo-Cuautle. High speed long-term visual object tracking algorithm for real robot systems. Neurocomputing, 434:268–284, 2021. 1 [14] Matej Kristan, Jiri Matas, Aleš Leonardis, Tomáš Vojíř, Roman Pflugfelder, Gustavo Fernandez, Georg Nebehay, Fatih Porikli, and Luka Čehovin. A novel performance evaluation methodology for single-target trackers. IEEE transactions on pattern analysis and machine intelligence, 38(11):2137–2155, 2016. 6 [15] Kaihao Lan, Haobo Jiang, and Jin Xie. Temporal-aware siamese tracker: Integrate temporal context for 3d object tracking. In Proceedings of the Asian Conference on Computer Vision, pages 399–414, 2022. 3 [16] Jiefeng Li, Siyuan Bian, Ailing Zeng, Can Wang, Bo Pang, Wentao Liu, and Cewu Lu. Human pose regression with residual log-likelihood estimation. In Proceedings of the IEEE/CVF international conference on computer vision, pages 11025–11034, 2021. 5 [17] Yu Lin, Zhiheng Li, Yubo Cui, and Zheng Fang. Seq-track3d: Exploring sequence information for robust 3d point cloud tracking. In 2024 IEEE International Conference on Robotics and Automation (ICRA), pages 6959–6965. IEEE, 2024. 1, 2, 3, 6 [18] Ilya Loshchilov and Frank Hutter. Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101, 2017. 6 [19] Jiahao Lu and Jiacheng Deng. Relation3d: enhancing relation modeling for point cloud instance segmentation. In 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 8889–8899. IEEE, 2025. 3 [20] Jiahao Lu, Jiacheng Deng, Chuxin Wang, Jianfeng He, and Tianzhu Zhang. Query refinement transformer for 3d instance segmentation. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 18516–18526, 2023. 3 [21] Yuxuan Lu, Jiahao Nie, Zhiwei He, Hongjie Gu, and Xudong Lv. Voxeltrack: Exploring voxel representation for 3d point cloud object tracking. arXiv preprint arXiv:2408.02263, 2024. 3 [22] Zhipeng Luo, Gongjie Zhang, Changqing Zhou, Zhonghua Wu, Qingyi Tao, Lewei Lu, and Shijian Lu. Modeling continuous motion for 3d point cloud object tracking. In Proceedings of the AAAI Conference on Artificial Intelligence, pages 4026–4034, 2024. 2, 3, 6 [23] Teli Ma, Mengmeng Wang, Jimin Xiao, Huifeng Wu, and

[10] Zhiyang Guo, Yunyao Mao, Wengang Zhou, Min Wang, and Yong Liu. Synchronize feature extracting and matching: A single branch framework for 3d object tracking. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 9953–9963, 2023. 1, 2, 3

[11] Le Hui, Lingpeng Wang, Mingmei Cheng, Jin Xie, and Jian Yang. 3d siamese voxel-to-bev tracker for sparse point clouds. Advances in Neural Information Processing Systems, 34:28714–28727, 2021. 3, 6

[24] Jiahao Nie, Zhiwei He, Yuxiang Yang, Zhengyi Bao, Mingyu Gao, and Jing Zhang. Osp2b: One-stage point-to-box network for 3d siamese tracking. arXiv preprint arXiv:2304.11584, 2023. 2

第 10 页

[25] Jiahao Nie, Zhiwei He, Yuxiang Yang, Mingyu Gao, and Jing Zhang. Glt-t: Global-local transformer voting for 3d single object tracking in point clouds. In Proceedings of the AAAI Conference on Artificial Intelligence, pages 1957–1965, 2023. 3, 6

[26] Jiahao Nie, Zhiwei He, Xudong Lv, Xueyi Zhou, Dong-Kyu Chae, and Fei Xie. Towards category unification of 3d single object tracking on point clouds. In International Conference on Learning Representations, 2024. 2, 3, 6

[27] Jiahao Nie, Fei Xie, Sifan Zhou, Xueyi Zhou, Dong-Kyu Chae, and Zhiwei He. P2p: Part-to-part motion cues guide a strong tracking framework for lidar point clouds. International Journal of Computer Vision, pages 1–17, 2025. 1, 2, 3, 6

[28] Yuwen Pan, Rui Sun, Yuan Wang, Tianzhu Zhang, and Yong-dong Zhang. Rethinking the implicit optimization paradigm with dual alignments for referring remote sensing image segmentation. In Proceedings of the 32nd ACM International Conference on Multimedia, pages 2031–2040, 2024. 3

[29] Yuwen Pan, Rui Sun, Wangkai Li, and Tianzhu Zhang. Exploring weather-aware aggregation and adaptation for semantic segmentation under adverse conditions. In Proceedings of the IEEE/CVF international conference on computer vision, pages 13952–13962, 2025. 3

[30] Charles R Qi, Or Litany, Kaiming He, and Leonidas J Guibas. Deep hough voting for 3d object detection in point clouds. In proceedings of the IEEE/CVF International Conference on Computer Vision, pages 9277–9286, 2019. 3

[31] Haozhe Qi, Chen Feng, Zhiguo Cao, Feng Zhao, and Yang Xiao. P2b: Point-to-box network for 3d object tracking in point clouds. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 6329–6338, 2020. 3, 6

[32] Jiayao Shan, Sifan Zhou, Zheng Fang, and Yubo Cui. Ptt: Point-track-transformer module for 3d single object tracking in point clouds. In 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pages 1310–1316. IEEE, 2021. 3

[33] Yuyang Tang, Yinchao Ma, Dengqing Yang, Jie Xiao, and Tianzhu Zhang. State space models for natural language tracking: Exploring context-adaptive language cues. IEEE Transactions on Circuits and Systems for Video Technology, 2025. 3

[34] Yuyang Tang, Yinchao Ma, and Tianzhu Zhang. Semantic-aware network for natural language tracking. IEEE Transactions on Circuits and Systems for Video Technology, 2025. 3

[37] Mengmeng Wang, Haonan Wang, Yulong Li, Xiangjie Kong, Jiaxin Du, Guojiang Shen, and Feng Xia. Trackany3d: Transferring pretrained 3d models for category-unified 3d point cloud tracking. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 28249–28259, 2025. 3, 6

[38] Zhoutao Wang, Qian Xie, Yu-Kun Lai, Jing Wu, Kun Long, and Jun Wang. Mlvsnet: Multi-level voting siamese network for 3d visual tracking. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 3101–3110, 2021. 3

[39] Qiangqiang Wu, Yan Xia, Jia Wan, and Antoni B Chan. Boosting 3d single object tracking with 2d matching distillation and 3d pre-training. In European Conference on Computer Vision, pages 270–288. Springer, 2024. 2

[40] Qiao Wu, Kun Sun, Pei An, Mathieu Salzmann, Yanning Zhang, and Jiaqi Yang. 3d single-object tracking in point clouds with high temporal variation. In European Conference on Computer Vision, pages 279–296. Springer, 2025. 1, 3, 6

[41] Jie Xiao, Yinchao Ma, Yuyang Tang, Chuxin Wang, and Tianzhu Zhang. State space models for long-term temporal context in 3d single object tracking. IEEE Transactions on Circuits and Systems for Video Technology, 2025. 3

[42] Jie Xiao, Yinchao Ma, Wenfei Yang, and Tianzhu Zhang. Learning adaptive conceptual prototypes for 3d single object tracking. IEEE Transactions on Circuits and Systems for Video Technology, 2025. 3

[43] Tian-Xing Xu, Yuan-Chen Guo, Yu-Kun Lai, and Song-Hai Zhang. Cxtrack: Improving 3d point cloud tracking with contextual information. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 1084–1093, 2023. 3, 6

[44] Tian-Xing Xu, Yuan-Chen Guo, Yu-Kun Lai, and Song-Hai Zhang. Mbptrack: Improving 3d point cloud tracking with memory networks and box priors. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 9911–9920, 2023. 2, 3, 6

[45] Yuxiang Yang, Yingqi Deng, Jinlong Fan, Jing Zhang, and Zheng-Jun Zha. Bevtrack: A simple and strong baseline for 3d single object tracking in bird’s-eye view. arXiv preprint arXiv:2309.02185, 2023. 3

[46] Tianwei Yin, Xingyi Zhou, and Philipp Krahenbuhl. Center-based 3d object detection and tracking. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 11784–11793, 2021. 1

[47] Jingwen Zhang, Zikun Zhou, Guangming Lu, Jiandong Tian,

[35] Ilya O Tolstikhin, Neil Houlsby, Alexander Kolesnikov, Lucas Beyer, Xiaohua Zhai, Thomas Unterthiner, Jessica Yung, Andreas Steiner, Daniel Keysers, Jakob Uszkoreit, et al. Mlp-mixer: An all-mlp architecture for vision. Advances in neural information processing systems, 34:24261–24272, 2021. 5 [36] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin. Attention is all you need. Advances in neural information processing systems, 30, 2017. 3 [48] Chaoda Zheng, Xu Yan, Jiantao Gao, Weibing Zhao, Wei Zhang, Zhen Li, and Shuguang Cui. Box-aware feature enhancement for single object tracking on point clouds. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 13199–13208, 2021. 6 [49] Chaoda Zheng, Xu Yan, Haiming Zhang, Baoyuan Wang, Shenghui Cheng, Shuguang Cui, and Zhen Li. Beyond

第 11 页

3D Siamese Tracking: A Motion-Centric Paradigm for 3D Single Object Tracking in Point Clouds. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 8111–8120, 2022. 2, 3, 6

[50] Changqing Zhou, Zhipeng Luo, Yueru Luo, Tianrui Liu, Liang Pan, Zhongang Cai, Haiyu Zhao, and Shijian Lu. Pttr: Relational 3D Point Cloud Object Tracking with Transformer. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 8531–8540, 2022. 3, 6

[51] Yin Zhou and Oncel Tuzel. Voxelnet: End-to-End Learning for Point Cloud Based 3D Object Detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 4490–4499, 2018. 3

[52] Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, and Jifeng Dai. Deformable DETR: Deformable Transformers for End-to-End Object Detection. arXiv preprint arXiv:2010.04159, 2020. 5

发表评论