快速导读:提出P2Voxel框架,将网格标记化重新定义为局部表面证据采样,通过枢轴点和方向符号紧凑表示体素,并利用金字塔自适应分配实现高效、可重建的网格标记化。
三维网格是计算机图形学中最标准的表面表示形式,但其不规则的顶点和面片连接使得它难以直接适配现代生成模型所需的规则化标记序列。P2Voxel提出了一种全新的网格标记化视角:不再将标记化视为对全局场或边缘交叉的采样,而是将其重新定义为“局部表面证据采样”——每个标记只负责描述其所在体素内的局部表面信息。
该框架包含三个核心组件:Pivot Voxelization用4维标记(枢轴点坐标+方向符号)紧凑表示每个活跃体素;Pyramid Pivot Voxelization根据空间复杂度自适应分配多分辨率标记;Pyramid VAE则在金字塔枢轴块上学习紧凑潜码。在ABO、Objaverse和Wild三个数据集上的实验表明,P2Voxel在标记效率与重建质量的帕累托前沿上显著优于基于SDF体积采样和Dual Contouring的方法。
英文题目:P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization
论文出处:arXiv 每日论文精选 · arXiv:2608.07549
原始论文:PDF / 论文页面
这篇论文解决什么问题?
三角网格是三维形状的标准表示,广泛应用于建模、渲染和仿真。然而,网格的不规则拓扑结构——顶点、边、面的任意连接——使其难以被Transformer等现代生成模型直接处理。因此,网格标记化成为连接网格表示与生成模型的关键桥梁。
现有方法大致分为两类:基于SDF的体积采样方法(如Dora、Vecset)在规则网格上密集存储符号距离值,标记冗余度高,大量标记落在远离表面的空区域;基于Dual Contouring的边缘采样方法(如FaithC、TRELLIS 2)记录体素边缘与表面的交点及法向约束,虽保真度高但标记维度大(FaithC需18维),且重建依赖复杂的Hermite约束。
这两类方法之间存在一个根本性的权衡:SDF方法标记结构化但冗余,Dual Contouring方法标记紧凑但维度高且重建非确定性。P2Voxel试图打破这一权衡,寻找一种既紧凑又可确定性重建的标记化方案。
核心创新
- 将网格标记化形式化为局部表面证据采样问题,区别于场中心体积采样和边缘交叉表面采样。
- 提出Pivot Voxelization,用4维标记(枢轴点+方向符号)紧凑表示体素,可诱导确定性Sparse MC重建。
- 提出Pyramid Pivot Voxelization,自适应分配多分辨率枢轴标记,平衡重建保真度与标记效率。
- 提出Pyramid VAE,基于块可重建性学习多分辨率潜码,实现可扩展的网格压缩。
方法概览
P2Voxel包含三个组件:1) Pivot Voxelization:基于局部平面假设,用表面枢轴点p和方向符号s表示每个活跃体素,诱导角点SDF值用于Sparse Marching Cubes重建;2) Pyramid Pivot Voxelization:基于空间复杂度假设,通过块级评分和自适应采样图分配多分辨率枢轴标记,对复杂区域细化,平滑区域粗化;3) Pyramid VAE:基于块可重建性假设,在金字塔枢轴块上学习紧凑多分辨率潜码,避免全局密集场建模。
- Pivot Voxelization(第4页,Figure 2):基于局部平面假设——在高分辨率下,每个体素内的表面可近似为平面。对每个活跃体素,计算其内部表面片段的质心作为枢轴点p,并记录该点处SDF的符号s作为方向指示。这4维标记(p的3维坐标+s的1维符号)可诱导出体素角点的SDF值,进而通过Sparse Marching Cubes确定性重建表面。
- Sparse Marching Cubes重建(第4页):从枢轴标记出发,假设体素内存在一个以p为中心、法向由s决定的理想平面,计算该平面到体素各角点的有符号距离dδ,将这些角点SDF值输入标准Marching Cubes即可提取等值面。这一过程是确定性的,无需求解全局优化问题。
- Pyramid Pivot Voxelization(第5页,Figure 3):基于空间复杂度假设——几何信息在空间中非均匀分布,平坦区域可用粗粒度标记,复杂区域需细粒度标记。将空间划分为宏块,计算每个块的几何复杂度评分sB,据此构建自适应采样图M,为不同块分配4、8、16、32等不同分辨率级别的枢轴标记。
- 采样图构建与过滤(第5页):通过设定切割比率控制各分辨率级别的标记分配比例。消融实验(Table 4,第9页)显示,从S1到S4逐渐放宽切割阈值,激活体素数从约117k增至208k,CDL1从2.3154降至2.2229,验证了自适应分配的有效性。
- Pyramid VAE架构(第6页,Figure 4):基于块可重建性假设——每个金字塔块可从其枢轴标记局部重建表面。编码器将多分辨率枢轴标记聚合为紧凑的金字塔潜码,解码器在采样图M的引导下重建各分辨率的枢轴标记。编码器和解码器的详细架构分别见Table 8(第17页)和Table 9(第18页)。
- 训练策略(第18页,Table 10):Pyramid VAE在ABO训练集上训练,使用Chamfer Distance和方向分类损失联合优化。训练超参数包括学习率、批次大小等,详见Table 10。
- 与现有方法的关系(第3页,Figure 1):P2Voxel明确区别于场中心体积采样(SDF方法)和边缘交叉表面采样(Dual Contouring方法),提出第三种范式——局部表面证据采样。每个枢轴标记是体素内表面存在的“证据”,而非全局场的采样点或边缘约束。
- 运行时分析(第14页,Table 5):金字塔体素化需预计算多分辨率标记,512分辨率下采样图构建约8.39秒,体素化约5.96秒。这些测量包含Python端到端I/O开销,存在GPU加速空间。
逐图理解论文
现有方法的困境

Figure 1对比了三种网格标记化范式:(a)网格本身不规则,(b)SDF体积采样在规则网格上密集存储距离值,(c)Dual Contouring记录边缘交点,(d)P2Voxel的枢轴体素化用枢轴点和方向符号表示局部表面证据。注意观察(d)中每个活跃体素仅需一个标记,且标记直接编码表面位置和朝向。
核心洞察:局部表面证据采样

Figure 2详细展示了Pivot Voxelization的流程:对水密网格进行体素化,每个活跃体素用枢轴点p和方向符号s表示,理想平面可评估角点距离dδ用于Sparse-MC重建。重点关注枢轴点如何从体素内表面片段计算得到。
金字塔自适应分配

Figure 3展示了Pyramid Pivot Voxelization的自适应分配过程:通过块级评分sB构建采样图M,为不同区域分配4、8、16、32等不同分辨率级别。注意观察复杂区域获得更精细的采样,平坦区域使用粗粒度标记。
结论与意义

Figure 5是效率-质量帕累托前沿图,横轴为采样基元数量(对数尺度),纵轴为CDL1/CDL2、EMD和F-score。红色菱形(P2Voxel)在相同成本下实现更优质量,或在相同质量下使用更少标记。Pivot-512以更少活跃体素达到与FaithC相当的重建质量。
实验如何设计?
- 数据集:在ABO、Objaverse和Wild三个数据集上评估,覆盖家具、通用物体和野外扫描等不同场景。水印网格使用Dora的UDF-to-SDF管道生成,评估对水印提取分辨率不敏感(Table 7,第16页)。
- 对比方法:包括SDF采样方法(Dora、Vecset、Hunyuan3D-2.1)和Dual Contouring方法(FaithC、TRELLIS 2)。所有对比均排除下游生成组件,仅评估采样策略与重建质量。
- 评估指标:使用Chamfer Distance(CDL1/CDL2)、Earth Mover's Distance(EMD)和F-score(τ=0.002)衡量重建质量,以采样基元数量作为存储和计算成本的代理。
- P2Voxel配置:评估三种配置——Pivot-512(单尺度512)、Pyramid-512(128/256/512三级金字塔)和Pyramid-1024(128/256/512/1024四级金字塔)。
- 消融实验:分析枢轴采样分辨率(64-1024)对重建质量和伪影率的影响(Table 3,第9页),以及金字塔切割比率对标记分配的影响(Table 4,第9页)。
- Pyramid VAE评估:在ABO训练集上训练,评估跨数据集泛化能力(Table 2,第8页)。
关键结果与论文证据
- Pivot-512在ABO上使用880k标记,CDL1=2.1166,F-score=0.4889,与18维FaithC相当,但标记维度仅4维(Table 1,第8页)。
- Pyramid-1024将标记数压缩至385k(2.2×压缩),CDL1=2.1583,F-score=0.4747,仅小幅下降(Table 1,第8页)。
- Pyramid-512实现最激进压缩,标记数仅135k(6.5×压缩),CDL1=2.3045,F-score=0.4292(Table 1,第8页)。
- 效率-质量帕累托分析(Figure 5,第7页):P2Voxel(红色菱形)在CDL1/CDL2、EMD和F-score上均优于SDF方法(蓝色圆点)和Dual Contouring方法(绿色方块),实现更优的帕累托效率。
- 分辨率消融(Table 3,第9页):512分辨率时TopoC伪影率仅0.63%,HighCurv伪影率1.86%,较64分辨率大幅降低,且收益在512后趋缓,表明512是实用的权衡点。
- 切割比率消融(Table 4,第9页):从S1到S4,激活体素数增加,重建质量持续改善,验证了自适应分配的有效性。采样图可视化(Figure 10,第16页)显示预算集中在几何复杂区域。
- Pyramid VAE跨数据集泛化(Table 2,第8页):仅在ABO上训练的Pyramid VAE在Objaverse上CDL1=2.1019,优于TRELLIS 2,展示了良好的泛化能力。
- 水印分辨率稳定性(Table 7,第16页):将水印分辨率从512提升至1024,各指标仅微小波动,结论保持稳定。
阅读时需要注意
- 金字塔体素化非单次自适应实现,需预计算多分辨率标记,运行时开销较大。512分辨率下采样图构建需8.39秒,体素化需5.96秒(Table 5,第14页),限制了实时应用。
- Pyramid VAE仅在ABO训练集上训练,数据量有限,压缩后重建保真度有所牺牲,在更丰富数据上的训练潜力尚未充分探索。
- 局部平面假设在极低分辨率或高曲率、薄结构区域可能失效,需足够分辨率保证。Table 3(第9页)显示64分辨率时伪影率显著升高。
关联工作
- 3DShape2VecSet(VecSet)和Dora是SDF体积采样的代表性基线,使用表面元素集合表示形状,但标记冗余度高。
- FaithC使用18维标记记录体素边缘状态,保真度高但标记维度大;TRELLIS 2使用7维结构化潜码进行3D生成。
- MeshAnything V2和BPT是显式网格生成方法,分别通过相邻网格标记化和块索引聚合缩短序列,但未从标记化范式层面重新思考。