Pictura:如何用 CUDA 光栅化器实现大规模纯视觉驾驶自博弈
现有驾驶自博弈依赖特权向量状态,导致视觉策略存在表征鸿沟。Pictura 提出自定义 CUDA 光栅化器,在单卡上实现高速透视渲染,直接训练 Alberti 策略。实验表明其在零样本迁移中表现优异,且行为更具视觉因果性。需注意其简化几何渲染带来的域差距。
现有驾驶自博弈依赖特权向量状态,导致视觉策略存在表征鸿沟。Pictura 提出自定义 CUDA 光栅化器,在单卡上实现高速透视渲染,直接训练 Alberti 策略。实验表明其在零样本迁移中表现优异,且行为更具视觉因果性。需注意其简化几何渲染带来的域差距。
中心线在图像中往往缺乏显式标记,导致传统拓扑建图方法在复杂路况下失效。HGeo-TopoMap 提出分层几何先验,结合 IPM 道路结构图与隐式几何一致性学习,有效引导实例解码。实验表明,该方法在 OpenLane-V2 数据集上显著优于 TopoLogic 等基线,尤其在视角缺失情况下表现稳健。需注意其对平坦地面假设的依赖。
本文介绍HyWorldVLA,一种用于自动驾驶的视觉-语言-动作模型。针对纯像素级模型对噪声敏感、纯潜在级模型缺乏解释性的问题,HyWorldVLA采用混合世界建模,结合视频VAE压缩与联合注意力机制。实验显示其在NAVSIM v1/v2基准上达到SOTA,PDMS达90.59,且在雨雾噪声下表现优异。需注意单目摄像头在转弯场景的视野限制及损失权重平衡。
本文介绍SafeGen框架,解决现有模拟器生成安全关键场景时存在的Sim-to-Real差距问题。通过VLM推理识别潜在脆弱性并定义灾难性终点,再利用FLF2V模型生成物理合理且时间连贯的对抗性视频。实验显示,该方法在nuScenes数据集上显著降低VLMAD的感知对齐与规划合规性,并提升模型微调后的准确率。需注意生成内容的高逼真性可能带来的伦理风险及评估指标的主观性。
本文介绍VGOcc方法,针对3D占据预测中稀疏高斯缺乏显式几何信息的问题,提出Visual-Geometric Gaussians表示。通过冻结VGGT基础模型提取视觉和几何线索,结合VGBirth和PFLearn模块优化高斯初始化与特征学习。在nuScenes数据集上,SC IoU达到34.07,SSC mIoU达到21.75,优于GaussianFormer-2。方法依赖准确相机标定,且存在计算开销,适用于对精度和效率有平衡要求的自动驾驶场景。
本文分析Orbis 2分层驾驶世界模型。针对单一层级模型长程预测误差累积问题,提出高层抽象预测与低层细节生成解耦架构。使用压缩DINO latent与Diffusion Forcing预训练,在nuPlan/Waymo上实现低FVD与低FVD-slope。需注意Cosmos-v2.5数据未公开及Epona泛化局限。
本文介绍M4World,一种基于DiT的多视角多模态驾驶世界模型。针对现有模型在物体级细粒度可控性和长时程生成稳定性上的不足,M4World通过融合3D几何、语义、图像描述和文本属性的控制接口,实现了空间布局与视觉外观的双重控制。训练采用五阶段配方,包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD及迭代长视频微调,支持4步自回归流式生成。实验显示,在10秒视频上FID为34.8,FVD为288.7,优于MagicDriveV2。在60秒长视频生成中,通过潜在上下文刷新保持稳定性。针对“运载树木的卡车”长尾场景,通过LoRA少样本适配,使BEV检测Recall从1.0
本文介绍OpenLongTail框架,通过恢复自车轨迹并结合Plücker射线、时间深度扭曲和跨视图记忆库,将单目长尾视频转化为多视图资产。实验显示,在AlpaSim中,合成数据使Alpamayo R1策略得分提升至0.748,碰撞率0%。需注意生成成本较高及分布对齐限制。