快速导读:现有研究未能充分整合显式道路结构信息与隐式几何关系,缺乏多层次几何先验引导,限制了模型在复杂场景下的表现。
拓扑建图是自动驾驶路径规划的核心环节,但中心线实例在真实图像中往往缺乏显式视觉标记,导致检测困难。HGeo-TopoMap 提出利用分层几何先验增强拓扑建图,通过结合显式道路结构图与隐式几何一致性学习,显著提升映射精度与鲁棒性。
该方法在 OpenLane-V2 数据集上进行了全面评估,结果显示其在中心线检测和拓扑映射任务上均优于现有基线。特别是在视角缺失的复杂场景下,HGeo-TopoMap 展现了更强的适应能力,为自动驾驶系统提供了更可靠的地图构建方案。
英文题目:HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors
论文出处:arXiv 每日论文精选 · arXiv:2607.21281
原始论文:PDF / 论文页面
对应视频标题:拓扑建图新解:HGeo-TopoMap 如何用几何先验找回丢失的中心线|推荐指数:★★★★★
这篇论文解决什么问题?
现有拓扑建图方法多依赖隐式学习或距离先验,未能充分利用中心线的内在几何规律,如平行性和曲率。这导致在复杂环境中,模型难以准确识别和连接中心线实例,影响整体建图质量。
此外,传统方法往往忽略道路结构的显式线索,仅依靠图像特征进行推理,容易受到光照、遮挡等因素干扰。因此,如何有效整合显式道路结构信息与隐式几何关系,成为提升拓扑建图性能的关键挑战。
HGeo-TopoMap 针对这一问题,提出分层几何先验框架,旨在通过多层次几何信息引导模型学习,弥补单一特征表示的不足。
核心创新
方法概览
现有研究未能充分整合显式道路结构信息与隐式几何关系,缺乏多层次几何先验引导,限制了模型在复杂场景下的表现。
- 几何自适应学习(GAL)模块:通过逆透视映射(IPM)生成 BEV 道路结构图,提取语义和空间特征,并利用先验掩码注意力机制引导实例解码,聚焦于信息丰富的道路结构区域。
- 几何一致性学习(GCL)模块:采用分阶段中心点回归策略,结合几何对比学习,对齐具有相似几何朝向的实例特征,强化空间一致性。
- 中心点回归策略:不同于单点回归,该方法学习中心线的几何属性,提供更丰富的结构信息,有助于模型理解实例的空间分布。
- 分层先验融合:将显式道路结构图与隐式空间关系相结合,形成多层次几何先验,为模型提供更全面的上下文信息。
逐图理解论文
方法贡献

图 2 概述了 HGeo-TopoMap 架构。GAL 模块嵌入道路结构图先验,GCL 模块利用几何对比学习隐式几何关系。
核心结论

图 5 展示了在视角缺失条件下,HGeo-TopoMap 在 OLS 和 DETl 指标上的优越性能,证明其鲁棒性。
实验如何设计?
- 数据集:在 OpenLane-V2 数据集上进行中心线和车道段基准测试。
- 基线对比:与 TopoLogic 和 LaneSegNet 等方法进行比较。
- 消融实验:对 GAL、GCL 模块、损失权重及融合位置进行消融研究。
- 鲁棒性分析:评估在视角缺失条件下的性能表现。
- 扩展评估:在矢量化建图任务(StreamMapNet 基线)上进行扩展评估。
关键结果与论文证据
- 在 OpenLane-V2 中心线检测任务中,HGeo-TopoMap 的 OLS 达到 45.5%,较 TopoLogic 提升 2.0%(第 5 页)。
- DETl 指标达到 31.3%,较 TopoLogic 提升 1.6%(第 5 页)。
- 在车道段 mAP 上达到 34.0%,较 LaneSegNet 提升 5.7%(第 6 页)。
- 在矢量化建图任务中,mAP 达到 77.9%,较 StreamMapNet 提升 14.5%(第 7 页)。
- 在后左视角缺失条件下,DETl 提升 7.5%,展现较强鲁棒性(第 7 页)。
阅读时需要注意
- 依赖 IPM 假设平坦地面,可能导致远距离或 elevated 区域失真。
- 单帧道路结构图在复杂场景中可能存在信息不足。
- 当前视角缺失时性能仍有所下降,尽管优于基线。
关联工作
- TopoLogic:使用距离先验进行拓扑学习的基线方法。
- LaneSegNet:利用辅助车道检测进行拓扑建图的方法。
- TopoNet:早期使用 DETR 和 GNN 进行拓扑推理的方法。
- Chameleon:利用视觉语言模型进行地图构建的方法。
- StreamMapNet:矢量化建图评估的基线方法。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HGeo-TopoMap:利用分层几何先验增强拓扑建图
李思宇1,2,彭坤宇3,†,温迪3,侯北平1,李志勇2,杨凯伦2,†
摘要—拓扑地图是自动驾驶感知系统的关键输出,为路径规划提供必要的道路信息。它们识别中心线和交通标志等实例及其连通关系。由于真实环境中缺乏中心线的显式标记,中心线实例的检测仍然是一个重大挑战。为解决这一问题,我们提出了 HGeo-TopoMap,它利用显式先验地图和隐式空间关系来分层增强拓扑建图。首先,针对通过逆透视映射(Inverse Perspective Mapping, IPM)获得的道路结构图,设计了一个几何自适应学习(Geometric Adaptive Learning, GAL)模块。该模块对地图中的语义和空间特征进行离散编码,随后通过先验掩码注意力机制有选择地关注信息丰富的区域。然后,设计了一个几何一致性学习(Geometric Consistency Learning, GCL)模块,该模块利用中心线的几何属性和空间关系。基于几何感知解码器,它通过将具有相同几何方向的中心线实例特征对齐来强制空间一致性。所提方法在 OpenLane-V2 数据集的中心线、车道段和鲁棒性基准上进行了评估。除了显著提升拓扑建图精度外,所提方法还带来了增强的鲁棒性优势,在标准和挑战性条件下均持续优于基线方法。源代码和模型权重将在 https://github.com/lynn-yu/HGeo-TopoMap 公开。
索引术语—拓扑建图,几何先验,语义分割,自动驾驶
I. 引言
在线建图因其成本效益和对动态环境的适应性而在自动驾驶中备受关注。不同的地图表示服务于各种下游任务 [1], [2]。栅格地图以网格形式表征道路空间,通常用于避障。矢量地图使用点和线来描绘道路几何形状。拓扑地图不仅描述道路中心线的结构和连通性,还编码它们与交通标志的关系 [3],这与路径规划的需求 [4], [5] 高度一致。
为了更好地兼容下游驾驶任务,拓扑建图在鸟瞰图(Bird’s Eye View, BEV)中进行,这涉及检测多个类别的实例并推断它们之间的拓扑关系 [6], [7]。TopoNet [6] 采用 DETR 架构 [8] 检测交通标志和中心线实例,同时将图神经网络嵌入中心线检测中以学习拓扑关系。由于相连的中心线具有相同的起点和终点,TopoLogic [7] 引入了不同中心线实例起点和终点之间的距离作为先验,旨在增强拓扑关系学习。LaneSegNet [9] 发现了车道边界与中心线之间的强相关性,从而引入了辅助车道检测任务,提高了拓扑建图的精度。尽管取得了上述进展,现有方法未能解决中心线检测固有的一个关键问题。与道路边界和车道标记相比,中心线在图像中并不具有视觉显著性,如图 1 上所示。这种缺乏
图 1:HGeo-TopoMap 的动机。为解决地图实例缺乏显式标记的问题,所提方法引入分层几何先验来指导拓扑建图。
这项工作部分得到了国家自然科学基金(Grant No. 62473139)、湖南省科研与发展项目(Grant No. 2025QK3019)以及自主智能无人系统重点实验室(开放课题编号 ZZKF2025-2-10)的支持。
1 作者单位:中国,浙江科技大学自动化与电气工程学院。 2 作者单位:中国,湖南大学人工智能与机器人学院及国家工程研究中心机器人视觉感知与控制技术(邮箱:kailun.yang@hnu.edu.cn)。 3 作者单位:德国,卡尔斯鲁厄理工学院人机交互与机器人研究所。 † 通讯作者:杨凯伦和彭坤宇。
第 2 页
显式视觉线索的缺失通常导致自动驾驶车辆在复杂且非结构化环境中的拓扑建图性能下降。
为了解决这一问题,我们探讨了利用中心线固有的视觉线索和内在几何关系,是否能为拓扑建图中的实例建模提供高效指导。中心线通常位于清晰边界之间,具有明确的结构。此外,现有的透视道路地图建模方法 [10], [11] 已取得了显著性能。尽管透视道路地图与拓扑地图的鸟瞰图(BEV)空间之间存在视角差异,但适当的视角变换模块可以有效弥合这一差距。逆透视映射(IPM)在假设先验的情况下是一种有效的解决方案,它无需训练即可提供初始的道路结构地图 [12]。然而,车辆遮挡等因素会引入道路结构地图中的噪声,这自然引出了对高效先验学习模块的需求,以有效利用该地图。随后,人们观察到拓扑地图中中心线的全局结构具有定义明确的几何属性。如图 1 所示,中心线可分为直线型或曲线型,这与现实世界驾驶场景中的直行和转弯路段一致。在几何配置方面,直线型中心线表现出相互平行和垂直的关系。此类几何信息提供了有意义的隐式先验。来自道路结构地图的显式先验与来自中心线内在几何结构的隐式先验在本质上是互补的。它们的联合利用为补偿中心线缺失的视觉特征提供了一种原则性的方法。
受这些观察的启发,我们提出了 HGeo-TopoMap,以全面利用这些多级几何先验。首先,一个针对从透视道路地图导出的道路结构地图定制的几何自适应学习模块。它采用离散编码器进行语义-几何特征提取,并采用先验掩码注意力机制进行高效先验信息选择。然后,设计了一个几何一致性学习模块,通过利用中心线的内在几何属性及其全局几何关系,隐式地对齐特征空间。在 OpenLane-V2 数据集 [13] 上进行的公共中心线和车道段基准测试中的大量实验表明,所提方法有效提高了拓扑地图质量。此外,得益于几何先验,该方法在鲁棒性实验中保持了具有竞争力的性能。
II. 相关工作
A. 拓扑建图
拓扑建图在鸟瞰图(BEV)中构建,将视角视图到 BEV 的视角变换模块视为基本组件。视角变换模块通常通过隐式或显式学习方法实现。在地图构建中,显式方法更为常见 [14]–[16]。
此外,它涉及交通标志和中心线实例的检测,随后学习它们之间的连接关系。交通标志的检测通常采用高效的骨干网络,如 Deformable DETR [17] 和 YOLO [18]。通常,拓扑建图中中心线实例的检测过程与矢量化地图任务 [19]–[21] 高度相似,采用分层回归学习方法。随后,研究人员观察到相连的中心线实例共享端点。为了提高拓扑地图的准确性,他们分别探索了点级和线级检测 [22]–[26]。在检测到交通标志和中心线实例后,图卷积网络 [6] 和多层感知机 [27] 常被用作任务头,以捕捉交通标志和中心线之间的拓扑关系。这些方法基于中心线实例检测进行拓扑推理,其中拓扑准确性取决于检测性能。为了增强拓扑推理,RATopo [28] 提出了一种冗余分配策略,重新排序了注意力层级,实现了“一对多”分配。
同时,其他几种方法 [29]–[33] 利用交通知识来增强拓扑学习性能。Chameleon [32] 利用视觉语言模型和交通提示来增强地图构建。TopoLogic [7] 将中心线的几何距离整合到拓扑学习中。然而,这些工作仅依赖中心线之间的距离关系作为先验指导,而忽略了其他几何空间关系,如平行性和垂直性。为了充分利用这些几何关系,我们引入了一致性学习模块以提升拓扑建图。
B. 拓扑建图的先验
从视觉信息生成地图面临 2D 数据固有的稀疏性问题。因此,嵌入各种先验已成为提高地图质量的关键方法。一些工作 [34]–[42] 采用高精地图(HD maps)或标准定义地图作为先验,以补偿在线地图生成中缺失的信息。其中,一些工作直接与高精地图实例交互进行学习,而另一些工作则采用生成方法来减轻噪声。时间线索提供了有价值的先验,有助于缓解视觉信息稀疏的问题 [20], [43]。此外,D2HDMap [44] 和 AerialFusionMapNet [45] 分别利用驾驶路径和航拍图像作为辅助信息来指导高精地图构建。MGMap [46] 和 PercMap [47] 利用透视道路语义和几何知识赋能矢量化地图解码,从而提升泛化能力和准确性。同样,Topo2D [48] 也采用了
综上所述,我们的贡献如下: • 我们引入了一种新颖的分层几何先验,用于提升拓扑中心线建图,该先验可灵活插入不同的基准测试中。 • 我们利用显式道路结构地图和隐式几何关系作为先验信息,缓解了中心线特征不明显的问题。 • 在不同拓扑建图基线下的实验结果验证了所提方法具有一致且显著的改进。
第 3 页
初始参考点:预测中心点
图像编码器 交通解码器 实例头:预测实例点 位置编码器
视图变换器 𝑸𝒕:拉近 远离
× N 拓扑头
:“v” 标签 位置学习 归一化 实例 类别 点头 头 [(x1, y1) , …, (x𝑛, y𝑛)] 和 注意力 FFN-SGNN 几何自注意力 对比头 多类别自适应 几何感知 编码器 滤波器
𝑸l 先验掩码 𝑸l 地图 实例解码器 𝑷𝒄𝐍−𝟏 匹配 注意力 中心点头 GT
图 2:所提出的 HGeo-TopoMap 架构概览。所提出的几何自适应学习模块将道路结构地图先验嵌入到实例解码中,而几何一致性学习模块利用几何对比学习来捕捉隐式的几何关系。
2D 道路结构信息以辅助 3D 车道线检测。B. 概览 此外,LaneSegNet [9] 在辅助任务中使用道路结构信息 拓扑建图涵盖交通标志和中心线实例的检测、视图变换器以及拓扑 来提升中心线检测精度。 关系学习。鉴于其效率和低 然而,这些方法仍然需要额外的学习。考虑到基于图像的 计算成本,选择 TopoLogic [7] 作为本工作的基线 道路语义分割的成熟度,我们认为直接利用这些先验是更 架构。所提出的 高效和自然的选择。因此,本工作利用透视 HGeo-TopoMap 的概览如图 2 所示。 道路地图作为输入,并提出一个几何自适应 给定多视角图像 Ii,多尺度图像特征 Fi 用于中心线检测的模块。 首先通过图像编码骨干网络提取。 交通标志实例的检测由一个专门的 并发地,图像特征从透视 任务头执行,该头基于 Deformable DETR [17] 实现。 视图通过 BEVFormer [15] 投影到 BEV。地图实例 III. 方法论 解码器模块从 BEV 特征 Fbev 中提取中心线实例,该模块采用 DETR 架构, A. 问题表述 从实例查询 Ql 执行解码。此外,图 1) 透视道路地图:地图结构,如分隔线和行人,在透视图像中清晰可见。 卷积网络被整合到前馈反馈 从透视图像中学习道路的便捷性与 网络中,以捕捉中心线查询 Ql 和交通查询 Qt 之间的拓扑连接。最后,多任务 现有语义分割模型的成熟度相匹配。我们采用 Mask2Former [10],它预测类别 头分别预测拓扑矩阵、中心线类别和 概率 Mc ∈RQ×C 和掩码概率 Ml ∈ 中心线点。 RQ×H×W 。将它们聚合为 Sm = Mc⊤ Ml 并取 给定缺乏用于构建地图的显著视觉线索,本工作引入了多级几何先验 逐像素 arg max 得到单热编码的透视道路地图 来提升拓扑建图。设计了两个互补的几何 Mapp ∈{0, 1}C×H×W 。 学习组件以充分利用这些先验。 2) 逆透视映射 (IPM):由于拓扑地图是在 BEV 中构建的,而透视道路地图 基于 BEV 道路结构地图的几何自适应学习模块(见第三节 C)和具有空间先验关系的几何 定义在不同的视角中,因此需要视图变换器。 一致性学习模块(见第三节 D)。 逆透视映射 (IPM) 与模型训练解耦,确保稳定的初始学习和泛化 能力;因此被采纳为本工作的视图变换策略。IPM 假设平坦的道路表面, C. 几何自适应学习 地面高程为零,允许将透视信息直接投影到 BEV。给定具有内参 T nin 和外参 T nec 的多视角透视道路 地图 Mappn,BEV 道路结构地图 Mapbev 通过假设的地平面高度 Z0 获得: Mapbev = X IPM(Mappn, Tnin , Tnec , Z0), (1) n 其中求和以加法方式融合重叠的相机视图,累积跨相机的逐类证据。
C. 几何自适应学习 道路结构地图编码了分隔线和其他道路标记,这些标记与中心线表现出强相关性。利用这种相关性提供了一种可行的手段来补偿中心线缺乏显式视觉线索的问题。从通过传统语义分割获得的透视道路地图开始,可以应用 IPM 将其转换为
第 4 页
BEV道路结构图。然而,生成的地图存在噪声:分割面临边界模糊和不确定性[49],而IPM的平坦地面假设会扭曲远处和高程区域[12]。为了充分利用先验的潜力,本节设计了一个几何自适应学习模块。
道路结构包含各种类别,每种类别与中心线表现出不同的空间关系。例如,中心线位于车道分隔线之间,而它们与停止线垂直。为此,首先设计了一个多类别编码器模块,以学习不同道路结构类别的判别性特征。对于道路结构图,采样属于任何语义类别的网格以提取占用状态 $M_o \in \mathbb{R}^{N_o \times C}$ 和空间位置 $M_p \in \mathbb{R}^{N_o \times 2}$,其中 $N_o$ 是占用网格的数量。
$$ M_o, M_p = \text{Sample}(\text{Map}_{bev}, \text{Map}_{bev} > 0), \quad (2) $$
其中 $\text{Sample}(\cdot, \cdot)$ 收集满足条件的网格单元。然后,通过由线性层和基于余弦的位置编码器 $\text{Sinpos}$ 组成的多类别编码器 $\text{MCE}$ 生成语义特征 $\text{Map}_{emb}$ 和位置特征 $\text{Map}_{pos}$。
$$ M_{emb} = \text{MCE}(M_o), \quad (3) $$
$$ M_{pos} = \text{Sinpos}(M_p). \quad (4) $$
可以作为一种隐式指导,补充显式知识,并共同形成协同关系。为了充分利用拓扑地图中固有的几何先验来指导学习,本节提出了一个几何一致性学习模块。
首先,增强中心线向量点回归,使其具备捕捉几何属性的能力。与从单个参考点预测实例点的无序回归[7]不同,设计了一种分阶段实例点回归策略来学习几何属性。在每个解码层中,回归首先从单个参考点学习至实例中心点。
$$ P_c = \text{CenRegHead}(Q_l^i) + P_r, \quad (6) $$
其中 $\text{CenRegHead}$ 表示由线性层、归一化层和激活层组成的任务头。$P_r$ 是每层中的初始参考点。同时,采用一个实例点头 $\text{InsRegHead}$ 基于中心点学习几何属性,其结构与 $\text{CenRegHead}$ 相似。
$$ P'_l = \text{InsRegHead}(Q_l^i) + P_c. \quad (7) $$
鉴于不同的道路结构与中心线实例表现出不同的几何关系,这些关系可以进一步指导信息特征的学习。然后,中心线点 $P_l \in \mathbb{R}^{N_l \times N_p \times 3}$ 与占用网格 $M_p$ 之间的空间距离作为指导,其中 $N_l$ 是中心线实例的数量,$N_p$ 表示每个实例的向量点数量。具体而言,计算每条中心线上2D向量点 $P_l$ 与占用网格位置之间的欧几里得距离($\text{EucDis}$)以获得距离矩阵。通过为每条中心线实例选择到最近占用网格的距离,生成最终的距离掩码:
$$ D_m = \min(\text{EucDis}(P_l, M_p), \text{dim}=1) \in \mathbb{R}^{N_l \times N_o}. \quad (5) $$
最后,该距离掩码用于通过先验掩码注意力机制引导地图实例与道路结构图之间的自适应交互。查询表示中心线实例 $Q_l$,键由 $\text{Map}_{emb} + \text{Map}_{pos}$ 形成。因此,注意力掩码定义为 $\exp(-D_m/k)$,其中 $k$ 表示缩放因子。
此外,在标准交叉注意力之上设计了一种几何感知注意力机制。具体而言,实例中心点的位置编码被嵌入到地图实例查询中,以促进快速的几何学习。
$$ Q_l^{i'} = Q_l^i + \text{Sinpos}(P_c), \quad (8) $$
$$ Q_l^{i+1} = \text{CrossAttn}(Q_l^{i'}, F_{bev}, P_r). \quad (9) $$
D. 几何一致性学习
BEV道路结构图作为显式几何先验,但不应忽视拓扑地图本身固有的几何规律。拓扑地图中的中心线描述并代表车辆轨迹,通常分为直线或转弯两类。这意味着不同的中心线表现出不同的几何属性,即直线或曲线。此外,相邻车道的中心线明显平行,提供了另一种几何先验。这种相互几何关系可以作为隐式指导,补充显式知识,并共同形成协同关系。
借助这种几何感知解码模块,每条中心线实例能够同时从中心点回归实例点并获取几何属性,如图3所示。
然后,利用中心线实例之间的先验关系来指导实例的一致性学习。改进后的解码器不仅学习几何属性,还学习源自中心点回归的空间方向。如图3 (b) 所示,平行的中心线表现出源自中心点回归的一致性空间方向,表明其实例查询之间存在隐式特征对齐。受此观察启发,对比学习
第 5 页
引入了一种策略来挖掘几何空间关系,以指导实例检测,从而提升拓扑建图的性能。该模块基于几何属性选择正负样本,然后增大具有不同几何属性或空间朝向的实例之间的特征距离,同时减小共享相同几何和空间关系的实例之间的距离。具体而言,拓扑地图的中心线实例首先根据其几何曲率被分类为直线和弯曲两组,即 $G_s$ 和 $G_c$。在典型的拓扑地图中,直线中心线可以大致分为两组,其空间朝向之间存在显著的角度差异。因此,在直线组内,它们根据向量点的斜率进一步聚类为两个子集,即 $G_{l1}$ 和 $G_{l2}$。
$$ G = \{G_{l1}, G_{l2}, G_c\}. \quad (10) $$
为了保证每个几何属性的实例特征得到充分利用以进行指导,对比学习方案被同时应用于所有组。锚点在对比学习中起着指导学习方向的核心作用。因此,正确匹配到真实值(ground truth)的实例查询 $q_i \in Q_l$ 被指定为每个子组内的锚点 ‘v’。
$$ v = \{q_i | q_i \in G_i, \text{match}(q_i, GT) = \text{True}\}. \quad (11) $$
正样本 $S_{pos}$ 从同一组内其他高分实例中选择,而低分实例则被丢弃以防止误导。负样本 $S_{neg}$ 从具有不同几何特征的其他组 $G_{other}$ 中抽取,低分实例同样被丢弃。
$$ S_{pos} = \{q_j | q_j \in G_i, q_j \neq v, e_j > t_s\}, \quad (12) $$ $$ S_{neg} = \{q_j | q_j \in G_{other}, e_j > t_s\}, \quad (13) $$
实例可靠性阈值 $t_s$ 遵循其他工作 [6], [7] 中用于选择可靠实例的标准。$e_j$ 是每个实例的得分。
为了提取每个实例的空间朝向特征,应用了一个由多个线性层组成的轻量级对比学习头来处理实例查询。最后,InfoNCE 损失被同时应用于所有子组:
$$ L_g = – \sum_{G_i \in G} \sum_{v \in V_i} \log \frac{\exp(z_v^\top z_{k^+})}{\Omega(v)} \quad (14) $$
其中 $\Omega(v) = \exp(z_v^\top z_{k^+}) + \sum_{k^- \in N^-(v)} \exp(z_v^\top z_{k^-})$ 聚合了正样本和所有负样本对,$z_{k^+}$ 和 $z_{k^-}$ 分别表示正样本和负样本的投影嵌入。
E. 总体损失
标准拓扑建图任务涉及三个损失项,即交通检测损失 $L_{det}$、中心线实例检测损失 $L_l$ 和拓扑推理损失 $L_{topo}$,它们与 TopoLogic 及其他现有方法类似地采用。在此基础上,实例中心点损失 $L_c$ 为:
$$ L_c = L_1(P_c, GT_c), \quad (15) $$
其中 $GT_c$ 是每个中心线实例的真实中心点 $GT$。因此,完整的损失函数由以下方程给出。
$$ L = L_{det} + L_l + L_{topo} + \alpha * L_c + \beta * L_{gcl}, \quad (16) $$
其中 $\alpha$ 和 $\beta$ 是用于平衡拓扑建图任务中多级先验影响的权重。
IV. 实验
A. 数据集与指标
OpenLane-V2 [13] 是一个为自动驾驶拓扑推理建立的大规模数据集。该数据集提供了多样化的标注,涵盖中心线、交通标志、中心线间拓扑以及中心线-交通标志拓扑。此外,LaneSegNet [9] 为每条中心线提供了辅助车道标注。所提出的方法在该数据集的中心线和车道段基准上进行评估。
OpenLane-V2 为中心线基准提供了标准化的评估协议。中心线实例的准确性通过 DETl 进行测量,即在不同 Fréchet 距离阈值下的平均精度。交通标志检测 DETt 采用交并比(IoU)作为相似度度量。TOPll 和 TOPlt 分别用于评估车道间拓扑矩阵的相似性以及车道与交通元素之间的相似性。最后,OLS 指标用于衡量整体拓扑地图的准确性。
在车道段基准中,使用与 LaneSegNet 相同的指标进行评估。车道 AP 和行人 AP 检测均采用平均精度,而 TOPlsls 用于拓扑推理。
TABLE I: OpenLane-V2 基准上拓扑建图中心线的结果 [7]。*表示数据是在开源情况下以相同实现获得的。‘VT’ 表示视图变换器模块。
| Method | VT | Perspective Priors | DETl | DETt | TOPll | TOPlt | OLS | #Params | | :— | :—: | :— | :—: | :—: | :—: | :—: | :—: | :—: | | TopoNet [6] | ✓ | – | 28.6 | 48.6 | 10.9 | 23.8 | 39.8 | 62.6M | | TopoMLP [27] | ✓ | – | 28.8 | 53.3 | 7.8 | 30.1 | 41.2 | – | | TopoLogic [7] | ✓ | – | 29.9 | 47.2 | 23.9 | 25.4 | 44.1 | 62.1M | | Topo2D [48] | ✗ | Centerlines | 29.1 | 50.6 | 22.3 | 26.2 | 44.5 | 56.2M | | TopoLogic* [7] | ✓ | – | 29.7 | 43.6 | 25.0 | 25.5 | 43.5 | 62.1M | | Ours | ✓ | Structure Maps | 31.3 | 48.2 | 26.2 | 26.3 | 45.5 | 64.5M |
第 6 页
表 II:拓扑建图车道段在 OpenLane-V2 基准上的结果 [9]。*表示数据由开源代码在同一实现中得出。 方法 mAP APls APped TOPlsls TopoNet [6] 23.0 23.9 22.0 1.0 MapTR [19] 27.0 25.9 28.1 – MapTRv2 [2] 28.5 26.6 30.4 – LaneSegNet [9] 31.7 28.4 34.9 20.8 LaneSegNet* [9] 28.3 27.7 28.8 20.1 Ours 34.0 32.3 35.7 22.6
表 III:核心模块的消融结果。 GCL GAL DETl DETt TOPll TOPlt OLS ✓ 29.7 43.6 25.0 25.5 43.5 ✓ ✓ 30.6 44.4 26.1 26.2 44.3 ✓ ✓ 31.3 48.2 26.2 26.3 45.5
表 IV:损失权重的消融结果。 权重 DETl DETt TOPll TOPlt OLS 0.01 30.8 45.6 26.5 25.6 44.6 0.1 30.6 44.4 26.1 26.2 44.3
表 V:融合位置的消融结果。 GAL 层 mAP APls APped TOPlsls ✓ 1 31.7 29.9 33.5 22.2 ✓ 3 33.7 31.7 35.8 22.4 ✓ 5 32.4 31.4 33.4 22.4
GAL 层 DETl DETt TOPll TOPlt OLS ✓ 1 31.3 48.2 26.2 26.3 45.5 ✓ 3 31.3 47.7 26.3 25.7 45.2 ✓ ✓ 30.6 44.4 26.1 26.2 44.3 ✓ ✓ 31.3 48.2 26.2 26.3 45.5
来自先验道路结构图,它为实例解码提供粗略的行人位置引导。此外,车道间拓扑推理准确率提高了 +1.8%。这些发现验证了分层先验引导不仅提升了中心线实例检测性能,还增强了拓扑关系推理。
B. 实现细节 拓扑建图的感知范围为 102.4×51.2 米,对应大小为 200×100 的 BEV 特征图。透视道路图大小为 388×512,由在 Mapillary Vistas 数据集 [50] 上预训练的 Mask2Former 生成。道路结构图是通过对透视道路图应用逆透视映射 (IPM) 生成的。为了保持视图变换器的保真度,我们将其有效范围限制为 60×30 米。此外,在几何自适应学习 (GAL) 模块中定义 k=0.1。将 α=1 和 β=0.1 设置为损失权重。所有实验均在 NVIDIA RTX A6000 GPU 上以 4 的批量大小训练 24 个 epoch。不同任务的优化器与各自基线保持一致,学习率根据批量大小自动缩放。
C. 与最先进方法的比较 拓扑建图中心线基准的比较:该基准涵盖中心线和交通标志的检测,以及两个拓扑推理任务。选择 TopoLogic [7] 作为基线,因其具有良好的精度-效率权衡。实验结果如表 I 所示。与基线相比,提出的分层先验方法将总体车道分数 (OLS) 指标提高了 +2.0%。具体而言,中心线实例准确率提高了 +1.6%,进而使拓扑推理准确率提高了 +1.2%。这些结果表明,分层几何先验可以有效引导中心线实例检测,并缓解视觉线索缺失的问题。
拓扑建图车道段基准的比较:除了中心线实例检测外,该基准还包括车道和行人检测的辅助任务,正如 LaneSegNet [9] 最初提出的那样。因此,本节选择 LaneSegNet 作为基线,实验结果如表 II 所示。显然,所提方法在车道分割方面取得了优越的性能,达到 34.0% mAP。与基线相比,所提方法提高了 +5.7% mAP。这一提升很大程度上源于先验道路结构图,它为实例解码提供粗略的行人位置引导。此外,车道间拓扑推理准确率提高了 +1.8%。这些发现验证了分层先验引导不仅提升了中心线实例检测性能,还增强了拓扑关系推理。
D. 消融研究 核心模块:进行消融实验以评估我们提出的几何自适应学习 (GAL) 模块和几何一致性学习 (GCL) 模块的有效性。表 III 报告了 GCL 和 GAL 均对中心线实例检测有积极贡献,分别提高了 +0.9% 和 +0.7%。相应地,总体 OLS 指标也分别提高了 +0.8% 和 +1.2%。这些发现清楚地验证了显式和隐式先验的互补性质显著提高了拓扑建图的准确性。
几何一致性学习损失权重:几何一致性学习模块采用具有权重因子 α 的一致性损失,以约束中心线实例之间空间关系的学习。本节研究不同权重幅度的影响,以确定最佳约束强度。表 IV 表明,当权重值为 0.01 时,达到最佳的整体拓扑图准确率。然而,当权重设置为 0.1 时,交通标志准确率略有下降,而实例检测准确率保持相当。在这种情况下,拓扑推理实现了更平衡的性能。
几何自适应学习位置:BEV 道路结构图被集成到迭代中心线实例解码管道中。我们对其插入位置进行消融,以确定其最佳引导学习的位置。表 V 报告了两个基线的结果,它们显示出不同的趋势。车道段基线报告称,在中间解码器层嵌入地图可获得最佳结果,实现 33.7% 的中心线检测准确率 mAP。但中心线基线在早期嵌入时表现最佳。这种差异可归因于它们不同的解码范式。前者使用基于回归的学习,其中早期特征未对齐。后者直接在每一层预测实例,使得早期注入对空间校正更有效。
第 7 页
多视角图像 GT TopoLogic 我们的方法 多视角图像 GT LaneSegNet 我们的方法
图 4:在拓扑建图的两个基线方法 TopoLogic [7] 和 LaneSegNet [9] 上的定性比较。
表 VI:GCL 模块中几何感知解码 (GAD) 和对比学习 (CL) 的消融结果。
| GAD | CL | DETl | DETt | TOPlt | TOPll | OLS | | :— | :— | :— | :— | :— | :— | :— | | | | 29.7 | 43.6 | 25.0 | 25.5 | 43.5 | | ✓ | | 29.8 | 43.4 | 25.9 | 25.7 | 43.7 | | ✓ | ✓ | 30.6 | 44.4 | 26.1 | 26.2 | 44.3 |
表 VII:TopoLogic 向量化映射任务中 GAL 模块的消融结果。
| 方法 | GAL | APped | APdiv | APboun | mAP (OLS) | | :— | :— | :— | :— | :— | :— | | StreamMapNet [20] | | 61.7 | 66.3 | 62.1 | 63.4 | | 我们的方法 | ✓ | 90.6 | 87.3 | 55.9 | 77.9 |
多车道合并。这种能力对于自动驾驶汽车的安全部署至关重要,因为合并区域已知是碰撞的高风险区域。此外,所提出的方法实现了更精确的道路元素(如行人)重建,这归因于先验地图的引导。
F. 鲁棒性分析
向量化映射的先验效应:为了全面评估 BEV 道路结构地图引导机制的广泛适用性,本节将评估扩展到向量化地图任务。选择 StreamMapNet [20] 作为此评估的基线,结果报告在表 VII 中。显然,鉴于地图包含对应于向量化地图的分隔线和行人类别,整合此先验使地图精度大幅提升了 +14.5%。
E. 可视化结果
可视化结果如图 4 所示。实验结果表明,所提出的方法实现了更详细的映射能力。值得注意的是,它在复杂场景(如多车道合并)中更准确地识别了中心线结构。这种能力对于自动驾驶汽车的安全部署至关重要,因为合并区域已知是碰撞的高风险区域。此外,所提出的方法实现了更精确的道路元素(如行人)重建,这归因于先验地图的引导。
几何一致性学习分析:几何一致性学习模块由几何感知解码器和几何对比学习组件组成。在本节中,我们分别评估了它们各自的效能。表 VI 报告了两个组件均有效,其中几何对比学习组件在 OLS 指标上带来了 0.6% 的提升。
向量化映射的先验效应:为了全面评估 BEV 道路结构地图引导机制的广泛适用性,本节将评估扩展到向量化地图任务。选择 StreamMapNet [20] 作为此评估的基线,结果报告在表 VII 中。显然,鉴于地图包含对应于向量化地图的分隔线和行人类别,整合此先验使地图精度大幅提升了 +14.5%。
拓扑建图依赖于多视角图像,这使得地图质量对输入的完整性敏感。真实场景中的传感器损坏通常会导致视角缺失,危及车辆安全。为了全面评估所提出方法的鲁棒性,本节进一步评估了在视角缺失情况下的地图构建性能。如图 5 所示,各种缺失视角场景下的实验表明,缺少前视摄像头会导致最显著的性能下降。这一发现与自动驾驶对前向感知 inherent 的依赖是一致的。尽管如此,所提出的方法表现出比基线明显更好的鲁棒性。值得注意的是,在左后视角缺失的设置下,它在中心线检测精度上实现了 7.5% 的提升。无论是正常还是缺失视角
第 8 页
实验结果一致表明,所提方法更适用于现实场景。
V. 结论
本文引入了一种分层先验模块以提升拓扑建图。它分别通过几何自适应学习和几何一致性学习促进拓扑建图。分层先验模块在两个基准上的有效性得到验证,其在地图精度方面持续带来显著增益。此外,在鲁棒性实验中,所提方法保持了高性能。
虽然从透视视图导出的道路结构地图为 BEV 建图提供了有价值的先验指导,但在复杂场景下,单帧地图中仍存在信息缺失问题。为解决这一问题,未来的工作将探索结合优化算法的时间线索,以生成最优的道路结构地图。
参考文献
[1] Q. Li, Y. Wang, Y. Wang, and H. Zhao, “HDMapNet: An online HD map construction and evaluation framework,” in Proc. ICRA, 2022, pp. 4628–4634. [2] B. Liao et al., “MapTRv2: An end-to-end framework for online vectorized HD map construction,” International Journal of Computer Vision, vol. 133, no. 3, pp. 1352–1374, 2025. [3] Y. Yao et al., “A concise survey on lane topology reasoning for HD mapping,” in Proc. IV, 2025, pp. 468–475. [4] Z. Zhou, L. Ye, J. Wang, K. Wu, and K. Lu, “HiVT: Hierarchical vector transformer for multi-agent motion prediction,” in Proc. CVPR, 2022, pp. 8813–8823. [5] J. Gu, C. Sun, and H. Zhao, “DenseTNT: End-to-end trajectory prediction from dense goal sets,” in Proc. ICCV, 2021, pp. 15 283–15 292. [6] T. Li et al., “Graph-based topology reasoning for driving scenes,” Science China Information Sciences, vol. 69, no. 5, p. 152103, 2026. [7] Y. Fu et al., “TopoLogic: An interpretable pipeline for lane topology reasoning on driving scenes,” in Proc. NeurIPS, 2024, pp. 61 658–61 676. [8] N. Carion, F. Massa, G. Synnaeve, N. Usunier, A. Kirillov, and S. Zagoruyko, “End-to-end object detection with transformers,” in Proc. ECCV, 2020, pp. 213–229. [9] T. Li et al., “LaneSegNet: Map learning with lane segment perception for autonomous driving,” in Proc. ICLR, 2024. [10] B. Cheng, I. Misra, A. G. Schwing, A. Kirillov, and R. Girdhar, “Masked-attention mask transformer for universal image segmentation,” in Proc. CVPR, 2022, pp. 1280–1289. [11] E. Xie, W. Wang, Z. Yu, A. Anandkumar, J. M. Alvarez, and P. Luo, “SegFormer: Simple and efficient design for semantic segmentation with transformers,” in Proc. NeurIPS, 2021, pp. 12 077–12 090. [12] S. Li, K. Yang, H. Shi, S. Wang, Y. Yao, and Z. Li, “GenMapping: Unleashing the potential of inverse perspective mapping for robust online HD map construction,” IEEE Open Journal of Intelligent Transportation Systems, vol. 7, pp. 1492–1506, 2026. [13] H. Wang et al., “OpenLane-V2: A topology reasoning benchmark for unified 3D HD mapping,” in Proc. NeurIPS, 2023, pp. 18 873–18 884. [14] J. Philion and S. Fidler, “Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3D,” in Proc. ECCV, 2020, pp. 194–210. [15] Z. Li et al., “BEVFormer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,” in Proc. ECCV, 2022, pp. 1–18. [16] N. Gosala and A. Valada, “Bird’s-eye-view panoptic segmentation using monocular frontal view images,” IEEE Robotics and Automation Letters, vol. 7, no. 2, pp. 1968–1975, 2022. [17] X. Zhu, W. Su, L. Lu, B. Li, X. Wang, and J. Dai, “Deformable DETR: Deformable transformers for end-to-end object detection,” in Proc. ECCV, 2020, pp. 213–229. [18] B. Liao et al., “MapTR: Structured modeling and learning for online vectorized HD map construction,” in Proc. ICLR, 2023. [19] T. Yuan, Y. Liu, Y. Wang, Y. Wang, and H. Zhao, “StreamMapNet: Streaming mapping network for vectorized online HD map construction,” in Proc. WACV, 2024, pp. 7341–7350. [20] S. Zeng et al., “PriorDrive: Enhancing online HD mapping with unified vector priors,” in Proc. AAAI, 2026, pp. 12 313–12 321. [21] Y. Yang et al., “Topo2Seq: Enhanced topology reasoning via topology sequence learning,” in Proc. AAAI, 2025, pp. 9318–9326. [22] M. E. Kalfaoglu, H. I. Ozturk, O. Kilinc, and A. Temizel, “TopoBDA: Towards bezier deformable attention for road topology understanding,” Neurocomputing, p. 132360, 2025. [23] Y. Fu, X. Liu, T. Li, Y. Ma, Y. Zhang, and F. Dai, “TopoPoint: Enhance topology reasoning via endpoint detection in autonomous driving,” in Proc. NeurIPS, 2025, pp. 118 229–118 250. [24] Y. Bai, Z. Chen, B. Song, E. Cheng, and H. Ling, “TopoHR: Hierarchical perspective centerline representation for cyclic topology reasoning in driving scenes with point-to-instance relations,” in Proc. CVPR, 2026, pp. 18 161–18 170. [25] Y. Li et al., “Reusing attention for one-stage lane topology understanding,” in Proc. IROS, 2025, pp. 16 977–16 984. [26] D. Wu, J. Chang, F. Jia, Y. Liu, T. Wang, and J. Shen, “TopoMLP: A simple yet strong pipeline for driving topology reasoning,” in Proc. ICLR, 2024, pp. 45 604–45 615. [27] H. Li, S. Huang, L. Xu, Y. Gao, B. Mu, and S. Liu, “RATopo: Improving lane topology reasoning via redundancy assignment,” in Proc. MM, 2025, pp. 777–786. [28] C. Lv, M. Qi, L. Liu, and H. Ma, “T2SG: Traffic topology scene graph for topology reasoning in autonomous driving,” in Proc. CVPR, 2025, pp. 17 197–17 206. [29] Y. Luo et al., “RelTopo: Multi-level relational modeling for driving scene topology reasoning,” arXiv preprint arXiv:2506.13553, 2025. [30] M. E. Kalfaoglu, H. I. Öztürk, O. Kilinc, and A. Temizel, “TopoMaskV3: 3D mask head with dense offset and height predictions for road topology understanding,” in Proc. CVPRW, 2026, pp. 675–684. [31] Z. Zhang et al., “Chameleon: Fast-slow neuro-symbolic lane topology extraction,” in Proc. ICRA, 2025, pp. 3752–3758. [32] S. Liang et al., “Persistent autoregressive mapping with traffic rules for autonomous driving,” in Proc. AAAI, 2026, pp. 6862–6870. [33] S. M. Bateman et al., “Exploring real world map change generalization of prior-informed HD map prediction models,” in Proc. CVPRW, 2024, pp. 4568–4578. [34] A. Shi, Y. Cai, X. Chen, J. Pu, Z. Fu, and H. Lu, “GlobalMapNet: An online framework for vectorized global HD map construction,” arXiv preprint arXiv:2409.10063, 2024. [35] Z. Jiang et al., “P-MapNet: Far-seeing map generator enhanced by both SDMap and HDMap priors,” IEEE Robotics and Automation Letters, vol. 9, no. 10, pp. 8539–8546, 2024. [36] P. Jia et al., “DiffMap: Enhancing map segmentation with map prior using diffusion model,” IEEE Robotics and Automation Letters, vol. 9, no. 11, pp. 9836–9843, 2024. [37] J. Ye et al., “SMART: Advancing scalable map priors for driving topology reasoning,” in Proc. ICRA, 2025, pp. 3298–3304. [38] M. Pei et al., “SEPT: Standard-definition map enhanced scene perception and topology reasoning for autonomous driving,” IEEE Robotics and Automation Letters, vol. 10, no. 7, pp. 7126–7133, 2025. [39] K. S. Pham, C. Witte, J. Behley, J. Betz, and C. Stachniss, “Coherent online road topology estimation and reasoning with standard-definition maps,” in Proc. IROS, 2025, pp. 9886–9893. [40] P. Jia et al., “Enhancing lane segment perception and topology reasoning with crowdsourcing trajectory priors,” IEEE Robotics and Automation Letters, vol. 10, no. 6, pp. 5417–5424, 2025. [41] H. Xu, Y. Xiao, W. Li, and Y. Hu, “Generating synthetic deviation maps for prior-enhanced vectorized HD map construction,” in Proc. IV, 2025, pp. 419–426. [42] R. Li et al., “AMap: Distilling future priors for ahead-aware online HD map construction,” in Proc. CVPR, 2026, pp. 24 906–24 917. [43] S. Shon, C. Tsuchiya, D. Bhanderi, D. Ilstrup, H. Cheng, and C. Ostafew, “D2HDMap: Non-visible driveline map prior for online vectorized HD map prediction,” in Proc. IV, 2026. [44] D. Lengerer, M. Pechinger, K. Bogenberger, and C. Markgraf, “Aerial-FusionMapNet: Online HD map construction with aerial-onboard BEV
Proc. ICLR, 2021. 融合,” 收录于 Proc. ITSC, 2026。 [18] J. Redmon, S. Divvala, R. Girshick, 和 A. Farhadi, “你只需看一次:统一的实时目标检测,” 收录于 Proc. CVPR, 2016, pp. 779–788。 [46] X. Liu, S. Wang, W. Li, R. Yang, J. Chen, 和 J. Zhu, “MGMap:用于在线矢量化高精地图构建的掩码引导学习,” 收录于 Proc. CVPR, 2024, pp. 14 812–14 821。
第 9 页
[47] C. Zhang, Q. Song, F. Li, J. Li, and R. Huang, “Improving hierarchical representations of vectorized HD maps with perspective clues,” IEEE Robotics and Automation Letters, vol. 10, no. 12, pp. 12 533–12 540, 2025. [48] H. Li, Z. Huang, Z. Wang, W. Rong, N. Wang, and S. Liu, “Enhancing 3D lane detection and topology reasoning with 2D lane priors,” arXiv preprint arXiv:2406.03105, 2024. [49] K. Sirohi, S. Marvi, D. Büscher, and W. Burgard, “Uncertainty-aware panoptic segmentation,” IEEE Robotics and Automation Letters, vol. 8, no. 5, pp. 2629–2636, 2023. [50] G. Neuhold, T. Ollmann, S. R. Bulò, and P. Kontschieder, “The mapillary vistas dataset for semantic understanding of street scenes,” in Proc. ICCV, 2017, pp. 5000–5009.