PE-Field 4D:用位置编码让视频扩散模型理解3D几何

论文代表图:figure-01-p001-01

本文提出PE-Field 4D,解决视频扩散Transformer在视角变换中几何结构丢失的问题。核心方法是将参考内容的投影位置编码注入交叉注意力机制,实现几何感知生成。在DAVIS数据集上,该方法在Dyn-MEt3R和MEt3R指标上优于ReCamMaster、GEN3C等基线。需注意,方法依赖ViPE估计深度,几何重建误差可能影响最终效果。

FoundationGeo:通过空间尺度场与射线校正实现单目度量几何

方法概览:两阶段框架

单目度量深度估计面临尺度歧义、空间尺度漂移及射线方向偏差。FoundationGeo采用两阶段框架:第一阶段利用DINOv3初始化的ViT编码器学习高保真仿射不变相对几何;第二阶段引入空间尺度场(Spatial Scale Field)进行空间变化的度量校准,并引入射线方向校正场(Ray-Direction Correction Field)修正3D不一致性。针对训练数据中相机内参(特别是焦距)分布与测试数据不匹配的问题,通过Blender合成多样化焦距数据增强模型鲁棒性。实验显示,该方法在七个基准数据集上平均AbsRel为14.8%,δ1为80.8%,显著超越MoGe-2等基线。