Axolotl3D:统一框架实现遮挡感知与多模态3D形状补全

三分钟导读:Axolotl3D提出了一种多模态、遮挡感知的3D生成框架,通过联合条件输入图像、可见性掩码、相机参数和部分点云,实现了单视图生成、稀疏多视图重建、遮挡补全及几何感知编辑的统一处理。

英文题目:Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

论文出处:arXiv 每日论文精选 · arXiv:2607.20660

原始论文:PDF / 论文页面

对应视频标题:Axolotl3D:统一框架实现遮挡感知与多模态3D形状补全|推荐指数:★★★★★

这篇论文解决什么问题?

现有的3D生成模型通常假设完整可见性和单视图输入,缺乏在遮挡、多视图或编辑场景下处理异构条件信号的统一框架,导致在真实世界捕获和内容创作管道中适用性受限。

核心创新

  • 提出统一的多模态条件框架,同时处理图像、可见性掩码、相机参数和部分点云,支持单视图、多视图、遮挡补全和编辑。
  • 设计掩码偏置交叉注意力机制,利用可见性掩码动态屏蔽遮挡区域的视觉token,防止其干扰几何推理。
  • 开发合成数据增强策略,从大规模3D网格数据中模拟多样化的条件场景,增强模型对部分和异构观测的鲁棒性。
  • 利用部分点云作为几何锚点,确保已知区域的形状保真度,并通过相机参数实现多视图在共享3D坐标系中的一致性对齐。

方法概览

基于Hunyuan3D-DiT架构,采用多模态交叉注意力机制融合视觉特征(DINOv2编码图像+Plücker嵌入相机参数)和几何特征(VecSetX编码点云);引入掩码偏置交叉注意力以忽略遮挡区域;通过合成数据增强策略(稀疏视图、遮挡、大区域点dropout、编辑模拟)进行统一训练。

逐图理解论文

背景与动机

背景与动机
Fig. 2: Overview of Axolotl3D. Given multi-modal inputs—posed images, visibil- ity masks, and partial points—our method encodes each modality and fuses them into multi-modal condition tokens. We fine-tune Hunyuan3D-DiT on these tokens to pro- duce completed shape latents, which are decoded by the ShapeVAE.

尽管Hunyuan3D 2.1等模型能生成高质量几何体,但它们在处理部分观察、遮挡或多视图一致性方面存在局限。现有方法如Amodal3R或ShapeR通常针对特定任务孤立设计,缺乏统一的约束3D补全框架。Axolotl3D旨在填补这一空白,通过统一框架提升模型在真实世界捕获和内容创作管道中的适用性。

创新:合成数据增强策略

创新:合成数据增强策略
Fig. 3: Data Augmentation: Examples of our on-the-fly data augmentation.

开发合成数据增强策略,从大规模3D网格数据中模拟多样化的条件场景,包括稀疏视图、遮挡、大区域点dropout和编辑模拟。这一策略增强了模型对部分和异构观测的鲁棒性,使其在训练过程中能够学习到更通用的几何补全能力。

实验设置与数据集

实验设置与数据集
Table 1: Quantitative Evaluation, marking best and second-best. Our method shows superior performance against state-of-the-art and performs comparably to ShapeR, with lower variance and stronger single-view results.

在Toys4K和OmniObject3D数据集上进行定量评估,涵盖单视图和多视图(6视图),有无遮挡场景。评估模型对预测深度(Depth Anything v3)和相机噪声的鲁棒性。消融研究分析点条件、掩码注意力和相机条件对性能的影响。

鲁棒性评估:预测深度

鲁棒性评估:预测深度
Table 2: Quantitative results with single- view predicted depth on Toys4k.

在预测深度鲁棒性测试中,Axolotl3D在Toys4K单视图下F-score为0.8738,显著优于ShapeR的0.6956和Hy3D-Omni的0.6594。这表明模型对预测深度的噪声具有较好的鲁棒性,能够在一定程度上容忍深度估计误差。

定性结果与可视化

定性结果与可视化
Fig. 4a and 4b show qualitative results on challenging occlusion senarios (see Sup- plement for results without occlusion). Axolotl3D leverages conditioning points to produce faithful reconstructions, retaining details in known regions that other methods may simplify. With our data augmentation, our method learns to exploit the natural symmetry of objects, handling difficult regions—such as the deer in Fig. 4a—that others struggle to reconstruct. In certain examples, baselines pro- duce unwanted structures, whereas our method preserves structural consistency with the provided guidance. Even in failure cases, when our method fails to com- plete all missing areas, our approach maintains high visual quality in the regions constrained by the conditioning points.

定性结果显示,Axolotl3D在遮挡场景下能够保留已知区域的细节,并生成合理的补全结构。与基线方法相比,模型在复杂遮挡和稀疏视图下表现更稳定,能够利用自然对称性处理困难区域。

实验与关键结果

  • 在Toys4K和OmniObject3D数据集上进行定量评估,涵盖单视图和多视图(6视图),有无遮挡场景。
  • 评估模型对预测深度(Depth Anything v3)和相机噪声的鲁棒性。
  • 消融研究分析点条件、掩码注意力和相机条件对性能的影响。
  • 应用演示:基于编辑视图的3D形状编辑,以及结合SAM 2和MapAnything的单视图图像到3D生成。
  • Toys4k单视图无遮挡F-score: 0.9221 (vs ShapeR 0.7920, Hy3D-Omni 0.7811)(第 10 页)
  • Toys4k多视图(6)无遮挡F-score: 0.9768 (vs ShapeR 0.9433, Hy3D-Omni 0.9211)(第 10 页)
  • Toys4k单视图有遮挡F-score: 0.9046 (vs ShapeR 0.7453, Hy3D-Omni 0.6593)(第 10 页)
  • Toys4k多视图(6)有遮挡F-score: 0.9689 (vs ShapeR 0.9190, Hy3D-Omni 0.8920)(第 10 页)
  • OmniObject3D单视图无遮挡F-score: 0.8716 (vs ShapeR 0.7135, Hy3D-Omni 0.7401)(第 10 页)
  • 预测深度鲁棒性测试中,Axolotl3D在Toys4k单视图下F-score为0.8738,显著优于ShapeR (0.6956)和Hy3D-Omni (0.6594)(第 10 页)

阅读时需要注意

  • 模型训练使用固定相机距离和内参,对相机视角变化的鲁棒性有限。
  • 极度细薄的结构可能无法完全连接,且表面细节可能比实际更平滑或更厚。
  • 模型倾向于忠实遵循输入点,对噪声点云(如高斯泼溅中的异常值或深度估计误差)的鲁棒性有待提高。
  • 仅生成形状,不预测纹理。
  • 未针对极稀疏或具有尖锐边缘的点云(如SfM输出)进行专门训练。
  • 在严重深度估计错误的情况下,性能会下降,存在忠实度与鲁棒性之间的权衡。
  • 单视图场景下若缺乏显式相机信息,性能下降明显。
  • 基线方法如ShapeR在单视图输入下对点云数量减少更敏感。

关联工作

  • Hunyuan3D 2.1:作为Axolotl3D的基础骨干网络(DiT backbone)。(第 5 页)
  • ShapeR:并发工作,多视图点云生成方法,在定量结果中作为主要基线进行比较。(第 10 页)
  • Amodal3R:单/多视图遮挡补全基线,不接受点条件。(第 10 页)
  • Hunyuan3D-Omni:单视图多模态生成基线,对遮挡处理较弱。(第 10 页)
  • SAM 3D:单视图点条件生成基线,使用相机空间点图。(第 10 页)
  • VecSetX:用于编码部分点云的几何编码器。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Axolotl3D:一个用于忠实三维形状补全的统一框架

Anita Hu1 和 Maria Shugrina1

英伟达 https://research.nvidia.com/labs/sil/projects/axolotl3d

遮挡多视图 或 单视图 部分点云 补全 且 编辑

Axolotl3D

通用多模态条件 多样化应用

图 1:Axolotl3D 能够在多样化应用中实现可控、感知遮挡的三维生成,并保持一致且忠实的形状补全。2026年7月22日

摘要。近期的三维生成模型利用大规模先验和单视图扩散架构,从单张图像中生成高质量的几何结构。然而,它们假设完全可见性和单视图输入,限制了在多视图、遮挡或编辑场景中的适用性。尽管先前的工作分别解决了这些挑战,但缺乏一个统一的框架,以在多样化的条件信号下实现可控的三维补全。我们提出了 Axolotl3D,这是一个多模态且感知遮挡的三维生成模型,同时对图像、可见性掩码、相机参数和部分点云进行联合条件约束。点云作为几何锚点,促进忠实的形状补全,而相机参数确保在共享三维坐标系中的一致多视图对齐。统一的训练策略从大规模三维数据中合成多样化的条件机制,从而实现鲁棒的跨模态推理。在 Toys4K 和 OmniObject3D 上的实验表明,在干净和遮挡设置下均达到了最先进的性能,并在真实世界重建和几何一致的编辑中取得了强劲的结果。

关键词:形状补全 · 多模态生成 · 三维编辑

1 引言

近期三维生成建模的进展,利用大规模三维数据集和基于扩散的架构(例如,Hunyuan3D 2.1 [20],Trellis [51,52]),使得从单张图像中合成细节丰富且视觉上引人注目的几何结构成为可能。这些方法展示了在大量合成和扫描物体集合上训练的三维先验的强大能力。然而,尽管它们具有强大的生成能力,这些方法在现实场景中仍然受到限制,其中

第 2 页

2 A. Hu 和 M. Shugrina

物体通常在稀疏多视图设置下被捕获,存在部分遮挡,或者需要对现有网格进行几何感知的编辑。通过假设完全可见性和单视图输入,现有方法无法在遮挡情况下进行推理、整合多视图或强制执行几何约束,从而限制了其在真实捕获和内容创建流水线中的适用性。

几个研究方向孤立地解决了这些挑战。诸如 Amodal3R [49] 的工作专注于恢复遮挡几何,而 ReconViaGen [4] 强调跨视图一致性。包括 Instant3dit [1]、PrEditor3D [10] 在内的编辑方法实现了精确的用户引导形状修改。更近期的方法,如 AmodalGen3D [61],开始结合多视图推理与遮挡处理。虽然在各自范围内有效,但这些方法仍然碎片化,限制了其在广泛的条件控制和编辑场景中的适用性。我们认为,相反地,这些问题共享一个共同的底层结构:每个问题都需要从不完整的观察中完成 3D 物体,同时强制执行与显式几何约束的一致性。从这个角度来看,它们可以被视为受约束 3D 补全的不同表现形式,从而 motivating 一个统一且可控的生成框架。

我们引入了 Axolotl3D,这是一个多模态且感知遮挡的 3D 生成模型,它同时对图像、每视图可见性掩码、相机参数和点进行条件控制。为了促进几何忠实度,部分点云——从网格表面采样或从预测深度投影——作为几何锚点。相机参数有助于将这些 3D 点和多视图图像对齐到共享坐标系中,使模型能够一致地整合视觉和几何证据。为了实现稳健的跨模态推理,我们进一步提出了一种统一的训练策略,该策略从大规模 3D 网格数据集中合成多样化的条件控制机制。通过模拟部分观察、遮挡以及混合图像–几何输入,我们训练模型在单视图、稀疏多视图和编辑场景中实现泛化。

我们在 3D 物体数据集(包括 Toys4K [42] 和 OmniObject3D [50])上评估了我们的方法,在单视图和多视图设置下,以及有无合成遮挡的情况下。在所有场景中,Axolotl3D 在几何精度和重建保真度方面均优于最先进的方法。此外,我们通过使用来自 MapAnything [22] 的预测点和相机从图像重建物体,并使用由 Stable Diffusion Inpainting [38] 修复的视图进行几何一致的对象编辑,展示了其在现实世界流水线中的适用性。

总之,我们的贡献有三方面:

– 我们引入了一个统一的多模态、感知遮挡的 3D 生成框架,该框架在单个模型内支持单视图生成、稀疏多视图重建、遮挡补全和几何感知编辑。 – 我们提出了一种跨模态训练策略,该策略从大规模 3D 数据中模拟多样化的条件控制场景,使模型能够在部分和异构观察下进行稳健推理。

第 3 页

Axolotl3D 3

– 我们在基准数据集上取得了最先进的性能,生成了高保真的几何结构,并有效处理了遮挡问题,同时在现实世界应用中展现了有效性。

2 相关工作

多视图 3D 生成:尽管最近的图像到 3D 生成模型 [20,51,52] 能够从单张图像生成高质量的网格,但很少有工作解决稀疏、未标定姿态的多视图形状生成问题。虽然单视图模型可以适配多视图输入——例如,像 Trellis [52] 那样在去噪过程中循环视图——但如果不联合建模跨视图交互,几何一致性仍然有限。另一种两阶段策略首先进行新视角合成(NVS),然后再进行 3D 生成:EscherNet [26] 从一张或多张参考图像生成一致的新视角,以便后续使用 NeuS [45] 进行重建,而 SpaRP [53] 输出六个固定视角,用于使用 One-2-3-45++ [28] 进行 3D 生成。这些流程可能比较脆弱,因为合成视图中的微小不一致可能会损害保真度和细节。随着大规模 3D 基础模型 [22, 44, 46] 的出现,我们现在可以直接从图像预测显式 3D 属性——如相机参数、深度图和点图——为下游任务提供强有力的先验。VGGT [44] 在新视角合成中展现了令人印象深刻的跨视图一致性,其特性被 ReconViaGen [4] 利用以实现准确的多视图生成。受此进展的启发,我们将生成模型条件化于显式几何信号——点云和相机参数——从而灵活应用于已标定和未标定姿态的多视图场景。一项并发工作 ShapeR [40] 也从多视图图像、稀疏点云和相机位姿生成 3D 形状,但它是专门为 SLAM [9] 输出量身定制的。

几何控制生成:一些最近的 3D 生成方法结合了几何线索来引导生成的形状。3DShape2VecSet [58] 引入了用于形状的固定长度潜在表示(VecSet),并展示了包括从部分点云进行 3D 生成在内的应用。CLAY [59] 支持多种条件模态,包括稀疏点、体素、边界框和多视图图像,但它并非设计用于处理部分点云或遮挡视图。PoseMaster [54] 生成受骨架和图像条件约束的可动 3D 角色。最近,Hunyuan3D-Omni [21] 统一了点云、边界框、体素和骨架输入上的几何控制生成,尽管它仅接受单张图像,且无法稳健地处理不完整的观测。相比之下,我们的方法同时处理多视图图像和点云输入,支持这两种模态中的遮挡。

全视域物体补全:全视域物体补全旨在从部分观测(通常是图像和分割掩码)中恢复完整的 3D 形状。相关的一系列工作专注于单图像生成,从单目输入生成完整的 3D 场景和物体。诸如 CAST [55] 之类的方法

第 4 页

4 A. Hu 和 M. Shugrina

以及 SAM 3D [5] 生成对象级重建结果,并在场景中对其进行对齐,使用单目深度估计器处理部分点云和方向线索。MIDI [19] 联合生成场景中的所有对象,使模型能够捕捉对象间关系并保持空间一致性,而无需单独的布局优化步骤。在对象层面,Amodal3R [49] 利用遮挡和可见性掩码,通过掩码加权的多头交叉注意力和遮挡感知条件层,从单张图像重建被遮挡的几何结构。遮挡感知视图合成方法,如 EscherNet++ [60] 和 DeOcc-1-to-3 [36],从遮挡输入生成新视图以促进全模态补全。然而,重建的几何结构往往缺乏精细细节,揭示了基于 NVS 管道的局限性。最近的一项工作 AmodalGen3D [61] 将 Amodal3R [49] 扩展到未标定多视图输入,并整合来自 π3 [46] 的部分点云,生成几何上更忠实于真实的重建结果。相比之下,我们的方法针对已标定设置,但在未标定的消融实验中仍表现出强劲的结果。

编辑:方法采用不同策略进行 3D 编辑,从多视图修复到潜在空间网格操作。Instant3dit [1] 和 PrEditor3D [10] 通过从四个固定视角进行多视图图像修复,随后进行 3D 重建,实现文本引导的编辑。ObjFiller-3D [11] 使用视频扩散扩展了这一范式,消除了对视角的限制并提高了跨视图一致性。最近,并发工作 VecSet-Edit [18] 直接在 VecSet 潜在空间中启用由单张图像引导的局部网格编辑,更好地保留了未触碰区域的外观。虽然这些方法对针对性编辑非常有效,但它们无法在没有初始对象或引导信号的情况下处理通用的对象补全。

3 方法

我们考虑从部分且异构的观察中完成 3D 对象的任务,这在 3D 捕获或编辑等场景中很常见。对于多视图重建,已知信息通常包含多个遮挡视图和部分几何结构,例如在使用 [13,24,44] 等技术处理图像序列之后。对于针对性形状编辑,补全应尊重固定的几何区域并接收额外的引导,例如对象的编辑视图。为了支持此类应用,我们的目标是根据以下输入预测完整且几何一致的 3D 形状:一组图像 {Ii}Ni=1,对应的掩码 {Mi}Ni=1 和相机参数 {Ci}Ni=1,以及部分点云 P。每个掩码 Mi 指定 Ii 中提供有效观察的区域。对于全模态补全,Mi 编码可见性;而对于对象编辑,它指示需要保留的区域,同时用户提供完全有效的 Mi 以驱动几何更新。通过将所有的视觉、几何和用户引导信号视为对象的部分观察,我们的公式将单视图和多视图生成、全模态补全以及几何感知编辑统一在一个框架下。

第 5 页

Axolotl3D 5

Condition Tokens Input View(s) KV

DINOv2 + FFN + Noisy Hunyuan3D DiT Latent Condition Emb. Camera Plucker Emb. … VAE Linear … Attention Attention Condition Points Decoder Self Cross VecSetX FFN + Attention Mask Visible Area Mask(s) Condition Emb. Image Mask Points Mask

Patchify and flatten

图 2: Axolotl3D 概述。给定多模态输入——位姿图像、可见性掩码和部分点云——我们的方法对每种模态进行编码,并将它们融合为多模态条件令牌。我们在这些令牌上微调 Hunyuan3D-DiT 以生成完整的形状潜在表示,随后由 ShapeVAE 进行解码。

3.1 模型架构

Axolotl3D 建立在最新的图像到 3D 扩散模型 Hunyuan3D 2.1 [20] 之上。其形状生成模型包含一个形状自编码器(Hunyuan3D-ShapeVAE),用于将网格编码为紧凑的潜在表示,以及一个图像条件的基于流的扩散变换器(Hunyuan3D-DiT),该变换器经过训练以预测该潜在空间中的形状令牌,随后将其解码为网格。我们调整此 DiT 骨干网络以联合处理所有异构输入,用多模态交叉注意力机制替换了原始的单图像交叉注意力机制,从而同时整合视觉和几何线索。所提出架构的概述如图 2 所示。

视觉编码:遵循原始架构 [20],每个输入图像 $I_i$ 使用 DINOv2 [33] 编码为 $\text{enc}(I_i)$,产生丰富的空间对齐视觉特征,适用于多视图推理。我们的模型最多接受 $N = 6$ 张图像,缺失的视图通过零填充和掩码处理。为了实现共享 3D 坐标系中视觉特征的跨视图对齐,我们的模型还接收相应的相机参数 $C_i$,使用普吕克嵌入 [41] 表示为 $\text{pl}(C_i)$。具体而言,对于每个像素 $(u, v)$,其普吕克嵌入为:

$$ \mathbf{p}_{u,v} = \left\{ \mathbf{o} \times \mathbf{d}_{u,v},\; \mathbf{d}_{u,v} \right\} \in \mathbb{R}^6 \quad (1) $$

其中 $\mathbf{o}$ 是相机中心,$\mathbf{d}_{u,v}$ 是从相机中心到像素的相应射线方向。这些 $\text{pl}(C_i)$ 首先进行平均池化以匹配图像特征 $\text{enc}(I_i)$ 的空间分辨率,然后通过线性层投影以匹配其通道维度,得到 $\text{enc}(C_i)$。通过将 $\text{enc}(C_i)$ 加到 $\text{enc}(I_i)$ 上,我们获得最终的视觉嵌入 $\text{enc}_V (I_i, C_i)$,从而用相机信息丰富图像特征。每个掩码 $M_i$ 被划分为不重叠的 $14 \times 14$ 个图块(DINOv2 的图块大小),其中每个图块对应于下采样掩码 $B_i$ 中的一个像素,该下采样掩码与 $\text{enc}(I_i)$ 的分辨率匹配。如果 $B_i$ 中的像素完全未被遮挡,则将其设置为 1,否则为 0。请注意,背景

第 6 页

6 A. Hu 和 M. Shugrina

被视为无遮挡,以强制执行自由空间约束。这些掩码 $B_i$ 将注意力偏向无遮挡区域(见后文),类似于 Amodal3R [49]。

几何编码:为了提供额外的几何基础并确保忠实补全,部分点云 $P$ 形成额外的条件输入。我们使用 VecSetX [57] 将 $P$ 编码为 $\text{enc}(P)$,这是 [58] 的后续工作,它将输入点映射到紧凑的固定长度潜在代码集合中。它在 ShapeNet-v2 [3] 上预训练,能够产生保留局部细节的高保真重建。

多模态融合:我们现在处理几何特征 $\text{enc}(P)$ 和相机增强的多视图特征 $\{\text{enc}_V (I_i, C_i)\}_{i=1}^N$,以生成多模态特征令牌 $F$。每个模态的特征被展平为点令牌 $F_p \in \mathbb{R}^{T_p \times C_p}$ 和组合视觉令牌 $F_v \in \mathbb{R}^{NT_v \times C_v}$,其中 $N$ 是视图数量(6),$T_v$ 和 $T_p$ 是令牌长度,$C_v$ 和 $C_p$ 是每个模态的通道维度。然后,$F_p$ 和 $F_v$ 中的每个令牌都使用其各自的每模态门控前馈网络(FFN)进行处理,其设计与 [5,14] 中使用的类似(见补充材料),将令牌映射到统一的通道维度 $C = 1024$。这产生了更丰富的、模态特定的特征,强调重要信号并为多模态融合准备令牌。两个可学习的嵌入,每个模态(视觉和几何)形状为 $C$,以元素方式添加到相应模态的每个令牌中,以区分视觉和几何输入, resulting in final tokens $F_{p'} \in \mathbb{R}^{T_p \times C}$ 和 $F_{v'} \in \mathbb{R}^{NT_v \times C}$。

掩码偏置交叉注意力:我们将 $F_{p'}$ 和 $F_{v'}$ 沿令牌维度连接,形成一组长度为 $T = T_p + NT_v$、通道维度为 $C$ 的多模态条件令牌 $F$,这些令牌用于我们 DiT 中的多头交叉注意力模块,该模块经过训练以跨时间步去噪形状潜在变量 $Z \in \mathbb{R}^{L \times C'}$(背景见 [16])。令 $Q = ZW_Q$,$K = FW_K$,$V = FW_V$ 为潜在令牌和条件令牌的查询、键和值投影。对于具有 $H$ 个头部的多头交叉注意力,注意力计算如下:

$$ \text{CrossAttention} = \text{Softmax}\left(\frac{QK^\top}{\sqrt{D}}B\right)V, \quad (2) $$

其中每个头部的维度为 $D = C'/H$,$B \in \mathbb{R}^{L \times T}$ 是从分块图像掩码 $B_i$ 派生的注意力偏置。具体而言,对应于遮挡视觉令牌的条目设置为 $-\infty$,防止它们对注意力产生贡献,而无遮挡令牌被分配为 0(无偏置)。点令牌由于其固定长度的表示而未加掩码,也被设置为 0。

3.2 合成数据增强

我们在大量带纹理的 3D 网格上训练模型,合成多样化的条件机制以进行鲁棒的跨模态推理。在数据集预处理期间,我们将每个网格 $M_k$ 归一化为单位立方体 $[-1, 1]^3$ 并采样

第 7 页

Axolotl3D 7

表面点 稀疏视图与遮挡 大面积点丢弃 编辑

原始图像 条件图像 条件图像 条件图像

图 3:数据增强:我们即时数据增强的示例。

密集表面点云 $P_{surface}^k$(见补充材料)。我们还在球面上采样 150 个相机 $C_k$,并遵循 [52] 渲染对应的图像 $I_k$。在训练过程中,我们采样并增强这些数据以生成输入的部分点云 $P$ 和多视图 $\{I_i\}_{i=1}^N, \{M_i\}_{i=1}^N, \{C_i\}_{i=1}^N$,其中 $N = 6$,根据以下以相等概率选择的场景进行(如果需要,可以调整以优先处理特定情况)。每种增强的示例见图 3。

稀疏视图与遮挡:为了支持非模态补全并促进跨模态对应关系的学习,我们模拟具有不同级别遮挡的稀疏视图观察设置。我们选择一个随机视图 $I_0 \in I_k$ 作为未观察到的视图,并从基于相机后向向量之间角度定义的(以 90° 为阈值)非邻近视图中采样最多 $N$ 个条件相机 $C_i \in C_k$。每个采样的视图 $I_i$ 以概率 $p_{occl}$ 被遮挡。当发生遮挡时,我们遵循 LaMa [43] 使用笔触或边界框生成随机掩码 $\tilde{M}_i$。然后,我们移除在采样视图中不可见或投影到被遮挡掩码覆盖区域中的 $P_{surface}^k$ 中的点(详细信息见补充材料),从而产生逼真的斑驳点云。此外,我们进一步引入掩码概率 $p_{mask}$,以避免过度依赖基于点的线索并促进互补的多模态学习。以该概率,相同的遮挡掩码 $\tilde{M}_i$ 被应用于多视图输入 $I_i$ 及其掩码 $M_i$。通过此过程,我们可以进一步将此任务划分为单视图和多视图设置,在训练中以相等概率采样。我们将两种设置的 $p_{mask}$ 均设为 0.5。在单视图设置中,由于可见性有限导致许多点缺失,我们设置 $p_{occl} = 0.25$,而在多视图设置中,我们设置 $p_{occl} = 1.0$。

大面积点丢弃:此增强模拟对象的大区域从相机视点缺失且未观察到的场景,要求模型从有限的点和间接图像观察中推断缺失的几何形状。与之前的情况相比,这提供了更极端的点丢弃,训练模型不过度依赖可用的点。首先,我们随机选择一个丢弃轴(x、y 或 z)和一个方向(正或负),然后沿该轴采样一个阈值。在选定方向上超出阈值的 $P_{surface}^k$ 中的点被移除,丢弃概率随距阈值的距离线性降低,从而创建缺失几何形状的平滑梯度以及更自然的局部观察。之后,基于其法线与丢弃方向的对齐情况进一步过滤点,以模仿真实的可见性效果,丢弃概率与

第 8 页

8 A. Hu 和 M. Shugrina

法线与向下方向之间的余弦相似度。为了防止缺失区域被直接观察到,这在实际世界的稀疏视角场景中更为现实,我们过滤掉那些反向向量在丢弃方向 90◦ 范围内的相机视角。然后从剩余的相机中采样最终的条件视角集合。使用投影位置和深度比较来移除在任何条件相机视角中不可见的点。

编辑:在局部编辑场景中,通常使用边界框或其他简单几何图元来指定要修改的区域,如 Instant3dit [1] 的 3D 界面所示,编辑通常由参考图像或文本提示引导 [1, 10, 18]。在本工作中,我们专注于基于图像的引导,其中可能提供额外的视角以帮助保留未编辑区域的细粒度细节并维持跨视角一致性。我们通过选择随机相机视角作为“修改”视角来模拟这种用户引导的形状修改。然后,我们在 Psurfacek 中一个在该视角可见的随机选择点周围放置一个 3D 边界框。边界框内的所有点都从 Psurface,k 中移除,从而创建一个用于修复的区域。然后随机采样额外的相机视角,以提供对未修改区域的观察,通过在所有 Ii, Mi 中投影边界框来掩码编辑区域(详见补充材料)。这创建了一个任务,其中只有修改后的视角显示带有编辑的完整对象,而其余视角仅显示编辑区域周围的外部几何结构。

4 实验

4.1 数据和设置

训练数据:我们在 TRELLIS-500K [52] 的 407k 个形状上进行训练,这些形状包含来自 ObjaverseXL [8]、ABO [6]、3D-FUTURE [12] 和 HSSD [25] 的美学过滤对象。我们使用在 G-Objaverse 标签 [62] 上训练的分类器从 ObjaverseXL 子集中移除建筑物和场景,因为这些通常描绘多对象场景(见补充材料)。形状经过缩放,并使用固定距离和内参的回转相机进行渲染 [52]。几何体按照 Hunyuan3D 2.1 [20] 进行预处理,包括归一化、水密处理、SDF 和表面采样。训练时的增强方法见 §3.2。

实现:对于我们的骨干网络,我们采用 Hunyuan3D 2.1 [20] 并从预训练权重进行微调,利用其强大的 3D 生成先验。§3.1 中的额外层和嵌入从头开始训练:线性层使用 Kaiming 均匀初始化 [15],而嵌入使用正态初始化 N(0, 1/√n),其中 n 是条件嵌入维度(1024)。我们使用无分类器引导 (CFG) [17],丢弃率为 0.1,并使用 AdamW [29] 优化器,学习率为 1e −5。模型在 8 块 A100 GPU 上以 16 的批量大小训练 500k 步。在推理时,CFG 引导尺度设置为 5,采样步数为 50。

第 9 页

Axolotl3D 9

评估数据:为了进行定量评估(§4.3),我们使用 Toys4K [42] 和 OmniObject3D [50]。Toys4K 包含 105 个类别中的 4k 个合成物体,而 OmniObject3D 包含 190 个类别中的 6k 个扫描物体。为了模拟真实的 3D 一致遮挡,我们从一组形状基元中添加随机遮挡物(见补充材料)。与训练不同,我们通过从每个采样视图的渲染深度图进行反投影来获取点条件,并排除被遮挡的区域。我们将点云下采样至 8,192 个点用于 ShapeR 和我们的方法,而 Hy3D-Omni 最多支持 2,048 个点,SAM3D 使用形状为 518x518x3 的点图。我们还提供了使用 2,048 个输入点的比较,并使用来自 Depth Anything v3 [27] 的预测深度评估鲁棒性,均在有无相机扰动的情况下进行。预测深度通过每场景的缩放和平移与真实深度对齐,然后使用真实相机参数进行反投影。相机外参受到高斯噪声扰动(旋转 10°,平移比例 10%),而焦距抖动范围为 ±5%。为了进行定性可视化(§4.4),我们专注于 Toys4K 中具有更丰富外观细节的几何挑战性物体(OmniObject3D 的结果见补充材料)。对于应用(§4.6),我们展示了使用 MVImgNet 图像 [56] 和 MapAnything [22] 进行的单视图生成,以及在 Toys4K 物体上的编辑结果。

4.2 基线与指标

基线:我们将我们的方法与最近的最先进方法 [49], [21], [5] 以及一项同期工作 [40] 进行比较。我们省略了 AmodalGen3D [61],因为其代码未公开。Amodal3R [49] 能够进行单视图和多视图补全,是唯一不接受点条件的唯一方法。Hunyuan3D-Omni (Hy3D-Omni) [21] 和 SAM 3D [5] 都是接受点条件的单视图方法,其中 SAM 3D 的点图位于相机空间。同期的 ShapeR [40] 是唯一也接受点的多视图方法。由于 Hy3D-Omni 未针对遮挡进行训练,我们在推理前使用 Pix2Gestalt [34] 补全部分视图。虽然它只接受单张图像,但仍可以使用来自多个视图的点。因此,除了 SAM 3D 外,我们在多视图和单视图条件生成上评估了所有模型。在多视图场景中,Hy3D-Omni 将可用视图中最佳视图作为图像输入(基于最大物体覆盖率选择;见补充材料)。最后,为了向 ShapeR 提供所需的提示,我们使用 TRELLIS-500K [52] 中包含的 Toys4k [42] 的标题和 OmniObject3D [50] 的物体类别。

指标:为了评估重建形状的保真度和完整性,我们选择了互补的几何指标。F-score(在 0.05 阈值下)衡量点级对应关系,平衡精确率和召回率以评估准确性和覆盖率。64³ 分辨率下的体素交并比 (vIoU) 评估粗略体积一致性,对主要占用错误敏感。查默距离 (CD) 捕捉细粒度几何偏差,并对缺失或扭曲的区域进行惩罚。由于并非所有方法都使用世界空间点作为输入,我们首先使用 ICP [2] 将生成的网格和真实网格(归一化到 [-1, 1])对齐。在计算指标之前,从两个网格中均匀采样 1M 个点。

第 10 页

10 A. Hu 和 M. Shugrina

表 1:定量评估,标记最佳和次佳结果。我们的方法相比最先进方法表现出优越的性能,并与 ShapeR 相当,且具有更低的方差和更强的单视图结果。

Toys4k OmniObject3D 场景: 无遮挡 有遮挡 无遮挡 有遮挡 方法 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 单视图:

Amodal3R [49] 0.7310 0.2129 0.5460 0.6877 0.1886 0.6144 0.4847 0.1459 1.1406 0.4724 0.1382 1.1174 ± 0.2365 ± 0.1139 ± 0.6305 ± 0.2381 ± 0.1063 ± 0.6495 ± 0.2646 ± 0.0897 ± 0.9197 ± 0.2587 ± 0.0845 ± 0.9336

SAM 3D [5] 0.7160 0.2039 0.5672 0.6764 0.1836 0.6375 0.4808 0.1440 1.1984 0.4666 0.1407 1.2409

± 0.2491 ± 0.1049 ± 0.6464 ± 0.2504 ± 0.1018 ± 0.6871 ± 0.2715 ± 0.0932 ± 0.9989 ± 0.2709 ± 0.0932 ± 1.0098

Hy3D-Omni [21] 0.7811 0.2496 0.4491 0.6593 0.1802 0.8123 0.7401 0.2007 0.4913 0.6028 0.1406 0.9018

± 0.2065 ± 0.1471 ± 0.4261 ± 0.2614 ± 0.1297 ± 0.8209 ± 0.1984 ± 0.1147 ± 0.4132 ± 0.2386 ± 0.1036 ± 0.7425

ShapeR [40] 0.7920 0.2573 0.3981 0.7453 0.2285 0.4622 0.7135 0.2160 0.4820 0.6816 0.2012 0.5338 (同期工作) ± 0.2127 ± 0.1235 ± 0.4121 ± 0.2249 ± 0.1208 ± 0.4321 ± 0.2210 ± 0.1008 ± 0.3853 ± 0.2306 ± 0.0961 ± 0.4236

我们的方法 0.9221 0.3470 0.2157 0.9046 0.3265 0.2402 0.8716 0.2792 0.2854 0.8613 0.2724 0.2971

± 0.1044 ± 0.0988 ± 0.1820 ± 0.1140 ± 0.1037 ± 0.2079 ± 0.1187 ± 0.0856 ± 0.2269 ± 0.1191 ± 0.0848 ± 0.2228

多视图 (6):

Amodal3R [49] 0.8134 0.2516 0.3935 0.7529 0.2166 0.4999 0.5250 0.1585 1.0733 0.5046 0.1484 1.1127

± 0.2012 ± 0.1236 ± 0.5012 ± 0.2198 ± 0.1154 ± 0.6021 ± 0.2741 ± 0.0968 ± 0.9534 ± 0.2667 ± 0.0905 ± 0.9520

Hy3D-Omni [21] 0.9211 0.3860 0.2111 0.8920 0.3355 0.2738 0.9549 0.3638 0.1677 0.9353 0.3314 0.2005

± 0.1138 ± 0.1587 ± 0.2108 ± 0.1482 ± 0.1581 ± 0.3667 ± 0.0797 ± 0.1397 ± 0.1580 ± 0.1043 ± 0.1377 ± 0.2317

ShapeR [40] 0.9433 0.4476 0.1649 0.9190 0.4002 0.2040 0.9629 0.4412 0.1329 0.9532 0.4123 0.1443 (同期工作) ± 0.1303 ± 0.1449 ± 0.3096 ± 0.1528 ± 0.1553 ± 0.3416 ± 0.0985 ± 0.1318 ± 0.2112 ± 0.0989 ± 0.1313 ± 0.1842

我们的方法 0.9768 0.4424 0.1351 0.9689 0.4187 0.1448 0.9842 0.4127 0.1389 0.9755 0.3967 0.1467

± 0.0445 ± 0.1077 ± 0.0543 ± 0.0534 ± 0.1121 ± 0.0685 ± 0.0425 ± 0.0903 ± 0.1240 ± 0.0473 ± 0.0889 ± 0.1030

表 2:在 Toys4k 上使用单视图预测深度的定量结果。 表 3:在 Toys4k 上使用 2048 个输入点且带遮挡的定量结果。

无相机扰动 有相机扰动 单视图 多视图 方法 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 SAM3D 0.7062 0.1993 0.5898 Hy3D-Omni 0.6594 0.1802 0.8119 0.8920 0.3356 0.2738 N/A N/A N/A ± 0.2538 ± 0.1049 ± 0.6643 ± 0.2614 ± 0.1297 ± 0.8208 ± 0.1482 ± 0.1581 ± 0.3667 Hy3D-Omni 0.6837 0.1729 0.5926 ShapeR 0.6956 0.2004 0.5377 0.9126 0.3734 0.2119 N/A N/A N/A ± 0.2170 ± 0.1249 ± 0.4585 (同期工作) ± 0.2317 ± 0.1106 ± 0.4505 ± 0.1466 ± 0.1505 ± 0.3078 ShapeR 0.5626 0.1407 0.7767 0.5605 0.1409 0.7750 我们的方法 0.8738 0.2766 0.2838 0.9653 0.3996 0.1521 (同期工作) ± 0.2408 ± 0.0847 ± 0.5569 ± 0.2398 ± 0.0863 ± 0.5518 ± 0.1291 ± 0.0958 ± 0.2303 ± 0.0568 ± 0.1103 ± 0.0696 我们的方法 0.7616 0.1903 0.4235 0.7620 0.1901 0.4230

± 0.1731 ± 0.0908 ± 0.3135 ± 0.1712 ± 0.0908 ± 0.3138

4.3 定量结果

我们在表 1 中展示了定量结果。在单视图条件下,我们的方法显著优于包括同期工作 ShapeR 在内的基线方法。在多视图条件下,我们的方法相比最先进方法表现出优越的性能,并与 ShapeR 相当。在所有场景中,我们的方法实现了更低的标准差,显示出更一致和稳定的性能。

我们在表 2 中评估了使用无遮挡的单目预测深度对真实输入的鲁棒性。我们的方法在所有指标上均实现了最佳的几何保真度,优于基线方法。与表 1 中的真实深度设置相比,在预测深度下性能差距缩小,我们的方法、ShapeR 和 Hy3D-Omni 显示出较大的性能下降,这反映了几何引导重建对单目深度估计误差的敏感性。相比之下,SAM3D 直接在预测深度上训练,表现出较小的相对退化,但由于未能忠实于输入几何结构,整体性能仍然较低。我们还在表 2 中模拟了相机扰动,其中我们的方法和 ShapeR 都具有弹性

第 11 页

Axolotl3D 11

通过利用普吕克嵌入(Plücker embeddings)来缓解相机噪声。由于其他基线方法不依赖相机参数进行条件控制,因此未对其进行评估。我们在表 Tb. 3 中额外报告了所有方法使用 2,048 个输入点时的结果。与表 Tb. 1 相比,我们的方法在较弱的几何条件下表现出稳定的性能,而 ShapeR 在单视图情况下的性能下降幅度较大。

4.4 定性结果

图 4a 和 4b 展示了在具有挑战性的遮挡场景下的定性结果(无遮挡场景的结果见补充材料)。Axolotl3D 利用条件点生成忠实于原貌的重建结果,保留了其他方法可能会简化的已知区域细节。借助数据增强,我们的方法学会了利用物体的自然对称性,处理其他方法难以重建的困难区域——如图 4a 中的鹿。在某些示例中,基线方法产生了不需要的结构,而我们的方法则保持了与提供指导一致的结构完整性。即使在失败案例中,当我们的方法未能补全所有缺失区域时,其在受条件点约束的区域仍保持了较高的视觉质量。

图 5 评估了在单视图预测深度下的鲁棒性。虽然 SAM3D 能产生高质量的重建结果,但其生成的形状往往偏离输入点几何结构。Hy3D-Omni 偶尔会出现物体方向不一致的问题,这可能是由于缺乏显式的相机条件控制所致。ShapeR 对预测深度点中的噪声最为敏感,导致网格质量出现明显退化。相比之下,我们的方法产生的重建结果与输入观测结果更为一致,同时在适度的深度噪声下保持鲁棒性,尽管在严重的深度估计错误情况下性能会有所下降。

为了对方法进行压力测试,我们在图 6 中展示了随着遮挡程度增加时的示例。如图中的自行车轮所示,我们的方法通过利用相似无遮挡区域的信息,有效地处理了严重的遮挡情况。我们还包含了一些具有挑战性的案例,例如马,其中细结构有时未能完全连接,这突显了需要改进的领域。

4.5 消融实验

我们进行了消融实验,以分析 Axolotl3D 各个组件的贡献,并在表 Tb. 4 和图 7 中报告了结果。对于这些实验,我们在单视图和多视图遮挡场景下使用 Toys4k 数据集进行评估。

点条件的影响:为了分析几何条件的重要性,我们移除了点条件以及多模态融合层,仅将视觉编码的输出传递给交叉注意力层(见 §3.1)。移除点条件导致定量性能出现最大幅度的下降,且补全后的物体在视觉上更差,这表明显式的几何条件对于保持已知区域的准确性以及生成整体更一致和完整的 3D 几何结构至关重要。

第 12 页

12 A. Hu 和 M. Shugrina

输入视图 输入点云 Amodal3R SAM3D Hy3D-Omni ShapeR 本文方法 真实标签

(a) 单视图输入结果

输入视图 输入点云 Amodal3R Hy3D-Omni ShapeR 本文方法 真实标签

(b) 多视图输入结果

图 4: 定性比较:与基线方法相比的单视图和多视图补全结果。输入视图中的遮挡物以灰色显示。请放大查看细节。

第 13 页

Axolotl3D 13

输入视图 输入点 SAM3D Hy3D-Omni ShapeR ours

图 5: 预测深度对比:与 SAM3D 不同,我们的方法优先考虑对输入点的遵循,从而产生更忠实的结果补全,但在严重的深度预测误差下性能会下降——这是一种性能权衡。请放大查看细节。

掩码注意力的影响:为了评估可见性感知注意力(visibility-aware attention)的贡献,我们从应用于交叉注意力层(cross-attention layers)的图像掩码中移除了注意力偏置。移除掩码会导致定量指标轻微下降,而视觉差异仍然很小,主要体现为全局几何的细微变化,例如厚度的轻微变化。精细的表面细节和外观基本保持不变,因为这些是由未掩码的图像 token 捕获的。这表明掩码主要作为防止被遮挡区域潜在干扰的 safeguards,影响的是全局结构推理,而非感知上明显的特征。

相机条件的影响:为了考察显式相机参数化的影响,我们将相机 Plücker embeddings 替换为每视图可学习的嵌入(per-view learnable embeddings),以区分来自每个视图的 patch tokens。在多视图设置中,指标与完整模型接近,表明当有多个视图可用时,网络基本上可以从视觉线索中推断出相对相机位置。在单视图场景中,性能下降更为明显,因为模型在没有显式相机信息的情况下难以将 3D 点与图像特征对齐。这凸显了在稀疏观测下实现可靠物体补全时,相机条件的重要性。

4.6 应用

形状编辑:我们的方法也可以有效地应用于 3D 形状编辑(图 8a)。用户选择一个视图,对其进行掩码和编辑,例如使用图像修复模型如 [38]。这构成了我们模型的单视图条件。

第 14 页

14 A. Hu 和 M. Shugrina

输入视图 输入点云 输出 输入视图 输入点云 输出 输入视图 输入点云 输出 真实标签

图 6: 补全压力测试:模型在具有不同数量遮挡物(3、5、7)的挑战性单视图和多视图示例上的表现。放大查看细节。

表 4: 消融研究。最佳和次佳结果已相应高亮显示。

单视图 多视图 变体 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 无点云 0.8074 ± 0.1738 0.2253 ± 0.0969 0.3589 ± 0.2993 0.9097 ± 0.0989 0.2881 ± 0.0971 0.2231 ± 0.1344 无掩码 0.8968 ± 0.1311 0.3225 ± 0.1068 0.2517 ± 0.2568 0.9655 ± 0.0597 0.4151 ± 0.1192 0.1463 ± 0.0751 无相机参数 0.9002 ± 0.1224 0.3228 ± 0.1048 0.2509 ± 0.2414 0.9689 ± 0.0582 0.4153 ± 0.1149 0.1462 ± 0.0878 完整模型 0.9036 ± 0.1164 0.3262 ± 0.1039 0.2423 ± 0.2167 0.9688 ± 0.0535 0.4185 ± 0.1123 0.1450 ± 0.0685

输入视图 输入点云 无点云 无掩码 无相机参数 完整模型 真实标签

图 7: 消融示例:比较完整模型与消融变体的补全结果。输入视图中的遮挡物以灰色显示。放大查看细节。

为了提供条件点,我们从原始形状的表面采样,并丢弃投影到编辑视图掩码区域内的点。图 8a 展示了有效的 3D 编辑,这些编辑忠实于形状未编辑的部分。

图像到 3D:虽然我们的方法是在从网格采样的点上训练的,但它可以与 [22] 等方法结合使用,以扩展其在点云不可用场景中的适用性。例如,为了从单张图像生成 3D 形状(图 8b),我们使用 SAM 2 [37] 对图像进行分割,并使用 MapAnything [22] 估计物体点云和相机参数。物体点云是

第 15 页

Axolotl3D 15

原始视图 编辑视图 编辑点 输出 原始视图 编辑视图 编辑点 输出

(a) 通过图像修复使用用户编辑的单视图图像进行形状编辑。

输入视图 输入点 输出 输入视图 输入点 输出 输入视图 输入点 输出

(b) 结合 SAM 2 [37] 分割和 MapAnything [22] 输出的图像到 3D 生成。

图 8:应用:Axolotl3D 能够实现精确的对象编辑以及缺失区域补全后的准确单视图生成。请放大查看细节。

在对齐并归一化后,将其输入到我们的方法中(见补充材料),从而从单视图生成高保真的 3D 结果(图 8b)。

仿真:准确且高保真的补全对于物理应用(如分割捕获场景的物理仿真,如 [7,13] 所示)同样重要。此类应用示例见补充材料。

5 结论

我们提出了 Axolotl3D,这是一个统一的多模态、遮挡感知 3D 生成框架,能够从部分观测中补全和编辑对象。通过联合利用图像、可见性掩码、相机参数和部分点云,我们的模型在整合视觉和 3D 证据的同时强制执行几何一致性。与以往孤立关注特定任务的方法不同,Axolotl3D 提供了一个单一框架,能够处理多样化的重建和编辑场景。实验表明,在有无遮挡的稀疏视图条件下,该方法均取得了最先进的性能。这些结果突显了其在现实世界 3D 重建和可控几何感知编辑方面的潜力。尽管 Axolotl3D 经过训练以忠实遵循输入点,但未来的工作可以探索在保持这种忠实度的同时增强对噪声点云的鲁棒性,并支持更多样化的相机位置和纹理。

第 16 页

16 A. Hu 和 M. Shugrina

参考文献

1. Barda, A., Gadelha, M., Kim, V.G., Aigerman, N., Bermano, A.H., Groueix, T.: Instant3dit: 用于快速编辑 3D 对象的多视图修复。在:IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集。 页码 16273–16282(2025 年 6 月) 2. Besl, P.J., McKay, N.D.: 3D 形状配准方法。在:传感器融合 IV:控制范式与数据结构。第 1611 卷,页码 586–606。SPIE(1992 年) 3. Chang, A.X., Funkhouser, T., Guibas, L., Hanrahan, P., Huang, Q., Li, Z., Savarese, S., Savva, M., Song, S., Su, H., 等:Shapenet:一个信息丰富的 3D 模型存储库。arXiv 预印本 arXiv:1512.03012(2015 年) 4. Chang, J., Ye, C., Wu, Y., Chen, Y., Zhang, Y., Luo, Z., Li, C., Zhi, Y., Han, X.: Reconviagen:通过生成实现准确的多视图 3D 对象重建。 在:第十四届国际学习表征会议(2026 年), https://openreview.net/forum?id=z0QLeooEEf 5. Chen, X., Chu, F.J., Gleize, P., Liang, K.J., Sax, A., Tang, H., Wang, W., Guo, M., Hardin, T., Li, X., 等:Sam 3d:将图像中的任何事物转化为 3D。arXiv 预印本 arXiv:2511.16624(2025 年) 6. Collins, J., Goel, S., Deng, K., Luthra, A., Xu, L., Gundogdu, E., Zhang, X., Vicente, T.F.Y., Dideriksen, T., Arora, H., Guillaumin, M., Malik, J.: Abo:用于真实世界 3D 对象理解的数据集与基准。在:IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集。 页码 21126–21136(2022 年 6 月) 7. Dagli, R., Xiang, D., Modi, V., Loop, C., Tsang, C.F., Chen, A.H., Hu, A., State, G., Levin, D.I., Shugrina, M.: Vomp:预测体积机械属性场。arXiv 预印本 arXiv:2510.22975(2025 年) 8. Deitke, M., Liu, R., Wallingford, M., Ngo, H., Michel, O., Kusupati, A., Fan, A., Laforte, C., Voleti, V., Gadre, S.Y., 等:Objaverse-xl:拥有 1000 万+ 3D 对象的宇宙。神经信息处理系统进展 36,35799–35813 (2023 年) 9. Engel, J., Koltun, V., Cremers, D.: 直接稀疏里程计。IEEE 模式分析与机器智能汇刊 40(3),611–625(2018 年)。https://doi.org/ 10.1109/TPAMI.2017.2658577 10. Erkoç, Z., Gümeli, C., Wang, C., Nießner, M., Dai, A., Wonka, P., Lee, H.Y., Zhuang, P.: Preditor3d:快速且精确的 3D 形状编辑。在:计算机视觉与模式识别会议论文集(CVPR)。页码 640–649(2025 年 6 月) 11. Feng, H., Liu, J., Tang, J., Wu, G., Chen, B., Lai, J., Wang, G.: Objfiller-3d: 通过视频扩散模型实现一致的多视图 3D 修复。arXiv 预印本 arXiv:2508.18271(2025 年) 12. Fu, H., Jia, R., Gao, L., Gong, M., Zhao, B., Maybank, S., Tao, D.: 3d-future:带有纹理的 3D 家具形状。国际计算机视觉杂志 129(12), 3313–3337(2021 年)。https://doi.org/10.1007/s11263-021-01534-z 13. Fuji Tsang, C., Hu, A., Perel, O., Kolve, C., Shugrina, M.: Artisangs:结合 AI 与人工回路的交互式高斯溅射选择工具。arXiv 预印本 arXiv:2602.10173(2026 年) 14. Grattafiori, A., Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., Let- man, A., Mathur, A., Schelten, A., Vaughan, A., 等:Llama 3 模型群。arXiv 预印本 arXiv:2407.21783(2024 年)

第 17 页

Axolotl3D 17

15. He, K., Zhang, X., Ren, S., Sun, J.: Delving deep into rectifiers: Surpassing human-level performance on imagenet classification. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV). pp. 1026–1034 (2015). https://doi.org/10.1109/ICCV.2015.123 16. Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. In: Advances in Neural Information Processing Systems. vol. 33, pp. 6840– 6851 (2020), https://proceedings.neurips.cc/paper_files/paper/2020/file/ 4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf 17. Ho, J., Salimans, T.: Classifier-free diffusion guidance. In: NeurIPS 2021 Workshop on Deep Generative Models and Downstream Applications (2021), https: //openreview.net/forum?id=qw8AKxfYbI 18. Hsiao, T.F., Ruan, B.K., Liu, Y.L., Shuai, H.H.: Vecset-edit: Unleashing pre- trained lrm for mesh editing from single image. arXiv preprint arXiv:2602.04349 (2026) 19. Huang, Z., Guo, Y.C., An, X., Yang, Y., Li, Y., Zou, Z.X., Liang, D., Liu, X., Cao, Y.P., Sheng, L.: Midi: Multi-instance diffusion for single image to 3d scene genera- tion. In: Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR). pp. 23646–23657 (June 2025) 20. Hunyuan3D, T., Yang, S., Yang, M., Feng, Y., Huang, X., Zhang, S., He, Z., Luo, D., Liu, H., Zhao, Y., et al.: Hunyuan3d 2.1: From images to high-fidelity 3d assets with production-ready pbr material. arXiv preprint arXiv:2506.15442 (2025) 21. Hunyuan3D, T., Zhang, B., Guo, C., Liu, H., Yan, H., Shi, H., Huang, J., Yu, J., Li, K., Wang, P., et al.: Hunyuan3d-omni: A unified framework for controllable generation of 3d assets. arXiv preprint arXiv:2509.21245 (2025) 22. Keetha, N., Müller, N., Schönberger, J., Porzi, L., Zhang, Y., Fischer, T., Knapitsch, A., Zauss, D., Weber, E., Antunes, N., Luiten, J., Lopez-Antequera, M., Bulò, S.R., Richardt, C., Ramanan, D., Scherer, S., Kontschieder, P.: MapA- nything: Universal feed-forward metric 3D reconstruction. In: International Con- ference on 3D Vision (3DV). IEEE (2026) 23. Kerbl, B., Kopanas, G., Leimkuehler, T., Drettakis, G.: 3d gaussian splatting for real-time radiance field rendering. ACM Transactions On Graphics (TOG) 42(4) (2023). https://doi.org/10.1145/3592433, https://doi.org/10.1145/3592433 24. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G.: 3d gaussian splatting for real-time radiance field rendering. ACM Transactions On Graphics (TOG) 42(4) (July 2023), https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/ 25. Khanna, M., Mao, Y., Jiang, H., Haresh, S., Shacklett, B., Batra, D., Clegg, A., Undersander, E., Chang, A.X., Savva, M.: Habitat synthetic scenes dataset (hssd- 200): An analysis of 3d scene scale and realism tradeoffs for objectgoal navigation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 16384–16393 (June 2024) 26. Kong, X., Liu, S., Lyu, X., Taher, M., Qi, X., Davison, A.J.: Eschernet: A generative model for scalable view synthesis. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 9503–9513 (June 2024) 27. Lin, H., Chen, S., Liew, J.H., Chen, D.Y., Li, Z., Zhao, Y., Peng, S., Guo, H., Zhou, X., Shi, G., Feng, J., Kang, B.: Depth anything 3: Recovering the visual space from any views. In: The Fourteenth International Conference on Learning Representations (2026), https://openreview.net/forum?id=yirunib8l8 28. Liu, M., Shi, R., Chen, L., Zhang, Z., Xu, C., Wei, X., Chen, H., Zeng, C., Gu, J., Su, H.: One-2-3-45++: Fast single image to 3d objects with consistent multi- view generation and 3d diffusion. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 10072–10083 (June 2024)

第 18 页

18 A. Hu 和 M. Shugrina

29. Loshchilov, I., Hutter, F: 解耦权重衰减正则化。在:国际学习表征会议 (ICLR) (2019),https://openreview.net/ forum?id=Bkg6RiCqY7 30. Modi, V., Fuji Tsang, C., Shugrina, M., Daviet, G: 使用 nvidia kaolin 和 warp 库处理高斯泼溅、物理仿真和可视化。在: 计算机图形学和交互技术会议特别兴趣小组论文集。SIGGRAPH Labs ’25,ACM,纽约,纽约,美国 (2025)。https://doi.org/10.1145/3721251.3736529, https://doi.org/10.1145/3721251.3736529 31. Modi, V., Sharp, N., Perel, O., Sueda, S., Levin, D.I: Simplicits:无网格、几何无关的弹性仿真。ACM 图形学汇刊 (TOG) 43(4),1–11 (2024) 32. Moenne-Loccoz, N., Mirzaei, A., Perel, O., de Lutio, R., Martinez Esturo, J., State, G., Fidler, S., Sharp, N., Gojcic, Z: 3d 高斯光线追踪:粒子场景的快速追踪。ACM 图形学汇刊 (TOG) 43(6),1–19 (2024) 33. Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., 等: Dinov2:在无监督情况下学习鲁棒的视觉特征。arXiv 预印本 arXiv:2304.07193 (2023) 34. Ozguroglu, E., Liu, R., Surís, D., Chen, D., Dave, A., Tokmakov, P., Vondrick, C: pix2gestalt:通过合成整体进行全向分割。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。 页码 3931–3940 (2024 年 6 月) 35. Qi, C.R., Yi, L., Su, H., Guibas, L.J: Pointnet++:度量空间中点集的深层分层特征学习。在:神经信息处理系统进展。 卷 30 (2017),https://proceedings.neurips.cc/paper_files/paper/2017/ file/d8bf84be3800d12f74d8b05e9b89836f-Paper.pdf 36. Qu, Y., Dai, S., Li, X., Wang, Y., Shen, Y., Cao, L., Ji, R: Deocc-1-to-3:通过自监督多视图扩散从单张图像进行 3d 去遮挡。arXiv 预印本 arXiv:2506.21544 (2025) 37. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., Mintun, E., Pan, J., Alwala, K.V., Carion, N., Wu, C.Y., Girshick, R., Dollar, P., Feichtenhofer, C: SAM 2:在图像和视频中进行任何分割。在:第十三届国际学习表征会议 (2025),https://openreview.net/forum?id=Ha6RTeWMd0 38. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B: 使用潜在扩散模型进行高分辨率图像合成。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。页码 10684– 10695 (2022 年 6 月) 39. Schonberger, J.L., Frahm, J.M: 重新审视运动恢复结构。在:IEEE 计算机视觉与模式识别会议 (CVPR) 论文集 (2016 年 6 月) 40. Siddiqui, Y., Frost, D., Aroudj, S., Avetisyan, A., Howard-Jenkins, H., DeTone, D., Moulon, P., Wu, Q., Li, Z., Straub, J., Newcombe, R., Engel, J: Shaper: 从日常捕获中鲁棒地生成条件 3d 形状。arXiv 预印本 arXiv:2601.11514 (2026) 41. Sitzmann, V., Rezchikov, S., Freeman, B., Tenenbaum, J., Durand, F: 光场网络:具有单次评估渲染的神经场景表示。 在:神经信息处理系统进展。 卷 34,页码 19313– 19325 (2021),https://proceedings.neurips.cc/paper_files/paper/2021/file/ a11ce019e96a4c60832eadd755a17a58-Paper.pdf

第 19 页

Axolotl3D 19

42. Stojanov, S., Thai, A., Rehg, J.M.: Using shape to categorize: Low-shot learn- ing with an explicit shape bias. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 1798–1808 (June 2021) 43. Suvorov, R., Logacheva, E., Mashikhin, A., Remizova, A., Ashukha, A., Silvestrov, A., Kong, N., Goka, H., Park, K., Lempitsky, V.: Resolution-robust large mask inpainting with fourier convolutions. In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). pp. 2149–2159 (January 2022) 44. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: Visual geometry grounded transformer. In: Proceedings of the IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition (CVPR). pp. 5294–5306 (June 2025) 45. Wang, P., Liu, L., Liu, Y., Theobalt, C., Komura, T., Wang, W.: Neus: Learning neural implicit surfaces by volume rendering for multi-view reconstruction. arXiv preprint arXiv:2106.10689 (2023) 46. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: $\pi^3$: Permutation-equivariant visual geometry learning. In: The Fourteenth International Conference on Learning Representations (2026), https: //openreview.net/forum?id=DTQIjngDta 47. Wang, Z., Zhang, Z., Xu, J., Wang, J., Pang, T., Du, C., Zhao, H., Zhao, Z.: Orient anything v2: Unifying orientation and rotation understanding. In: The Thirty- ninth Annual Conference on Neural Information Processing Systems (2026), https: //openreview.net/forum?id=n3armuTFit 48. Wu, Q., Martinez Esturo, J., Mirzaei, A., Moenne-Loccoz, N., Gojcic, Z.: 3dgut: Enabling distorted cameras and secondary rays in gaussian splatting. Conference on Computer Vision and Pattern Recognition (CVPR) (2025) 49. Wu, T., Zheng, C., Guan, F., Vedaldi, A., Cham, T.J.: Amodal3r: Amodal 3d reconstruction from occluded 2d images. In: Proceedings of the IEEE/CVF Inter- national Conference on Computer Vision. pp. 9181–9193 (2025) 50. Wu, T., Zhang, J., Fu, X., Wang, Y., Ren, J., Pan, L., Wu, W., Yang, L., Wang, J., Qian, C., Lin, D., Liu, Z.: OmniObject3D: Large-vocabulary 3d object dataset for realistic perception, reconstruction and generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 803–814 (June 2023) 51. Xiang, J., Chen, X., Xu, S., Wang, R., Lv, Z., Deng, Y., Zhu, H., Dong, Y., Zhao, H., Yuan, N.J., Yang, J.: Native and compact structured latents for 3d generation. Tech report (2025) 52. Xiang, J., Lv, Z., Xu, S., Deng, Y., Wang, R., Zhang, B., Chen, D., Tong, X., Yang, J.: Structured 3d latents for scalable and versatile 3d generation. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 21469–21480 (2025) 53. Xu, C., Li, A., Chen, L., Liu, Y., Shi, R., Su, H., Liu, M.: Sparp: Fast 3d ob- ject reconstruction and pose estimation from sparse views. In: Proceedings of the European Conference on Computer Vision (ECCV). p. 143–163 (2024) 54. Yan, H., Luo, K., Li, W., Liang, Y., Li, S., Huang, J., Guo, C., Tan, P.: Posemaster: Generating 3d characters in arbitrary poses from a single image. arXiv preprint arXiv:2506.21076 (2025) 55. Yao, K., Zhang, L., Yan, X., Zeng, Y., Zhang, Q., Xu, L., Yang, W., Gu, J., Yu, J.: Cast: Component-aligned 3d scene reconstruction from an rgb image. ACM Transactions On Graphics (TOG) 44(4) (2025). https://doi.org/10.1145/3730841, https://doi.org/10.1145/3730841

第 20 页

20 A. 胡和 M. Shugrina

56. Yu, X., Xu, M., Zhang, Y., Liu, H., Ye, C., Wu, Y., Yan, Z., Zhu, C., Xiong, Z., Liang, T., Chen, G., Cui, S., Han, X.: Mvimgnet: A large-scale dataset of multi- view images. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 9150–9161 (June 2023) 57. Zhang, B.: VecSetX. https://github.com/1zb/VecSetX (2025) 58. Zhang, B., Tang, J., Niessner, M., Wonka, P.: 3dshape2vecset: A 3d shape repre- sentation for neural fields and generative diffusion models. ACM Transactions On Graphics (TOG) 42(4), 1–16 (2023) 59. Zhang, L., Wang, Z., Zhang, Q., Qiu, Q., Pang, A., Jiang, H., Yang, W., Xu, L., Yu, J.: Clay: A controllable large-scale generative model for creating high- quality 3d assets. ACM Transactions On Graphics (TOG) 43(4) (2024). https: //doi.org/10.1145/3658146 60. Zhang, X., Irshad, M.Z., Yezzi, A., Tsai, Y.C., Kira, Z.: Eschernet++: Simultaneous amodal completion and scalable view synthesis through masked fine-tuning and enhanced feed-forward 3d reconstruction. arXiv preprint arXiv:2507.07410 (2025) 61. Zhou, J., Tai, Y.W.: Amodalgen3d: Generative amodal 3d object reconstruction from sparse unposed views. arXiv preprint arXiv:2511.21945 (2025) 62. Zuo, Q., Gu, X., Dong, Y., Zhao, Z., Yuan, W., Qiu, L., Bo, L., Dong, Z.: High- fidelity 3d textured shapes generation by sparse encoding and adversarial decoding. In: Proceedings of the European Conference on Computer Vision (ECCV). pp. 52– 69 (2024). https://doi.org/10.1007/978-3-031-72684-2_4

第 21 页

补充材料

目录

A 模型架构 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 A.1 门控前馈网络 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 B 训练数据处理 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 B.1 表面点采样 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 B.2 数据增强函数 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22 B.3 训练数据过滤 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22 C 实验细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24 C.1 遮挡掩码生成 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24 C.2 Hunyuan3D-Omni 的视图选择 . . . . . . . . . . . . . . . . . . . . . 25 C.3 基于 MapAnything 的图像到 3D 生成 . . . . . . . . . . . . . . . . . . . . . . . 26 C.4 3D 捕获与仿真 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 D 额外结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 D.1 不使用 ICP 的定量结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 D.2 物体编辑对比 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 D.3 定性对比 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 E 局限性与未来工作 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

A 模型架构

A.1 门控前馈网络

我们采用了 LLaMA-3 [14] 和 SAM 3D [5] 中使用的门控前馈块。给定输入 $x \in \mathbb{R}^d$,前馈层定义为:

$$ \text{FFN}(x) = W_2 \left( \text{SiLU}(W_1 x) \odot (W_3 x) \right) \quad (3) $$

其中 $W_1, W_3 \in \mathbb{R}^{d \times h}$,$W_2 \in \mathbb{R}^{h \times d_{\text{out}}}$。这里,$h$ 是隐藏维度,$d$ 和 $d_{\text{out}}$ 分别是输入和输出维度,$\odot$ 表示逐元素乘法,且 $\text{SiLU}(z) = z \cdot \sigma(z)$。

B 训练数据处理

B.1 表面点采样

在预处理用于训练的网格时,我们生成表面点云 $P_{\text{surface}}^k$,以配合我们的数据增强流程来生成条件点。为了模拟真实世界深度传感器捕获的点,我们移除了完全或大部分被网格较大部件包围的内部组件,以避免从隐藏几何体中采样。然后,从剩余的外部表面及其法线中均匀采样点。为了识别内部组件,首先将网格分割为连通分量。每个分量被体素化并填充以表示其完整体积,然后在全局体素

第 22 页

22 A. Hu and M. Shugrina

网格以进行比较。对于每个组件,我们将其与所有比它大的组件进行比较,以确定是否应将其移除。令 $V_i$ 和 $V_j$ 分别表示组件 $i$ 和 $j$ 占据的体素集合。对于正在与较大组件 $j$ 进行比较的组件 $i$,我们将重叠分数定义为

$$ f_{i,j} = \frac{|V_i \cap V_j|}{|V_i|}. \quad (4) $$

如果存在较大的组件 $j$ 使得 $f_{i,j} \ge 0.95$,则移除组件 $i$。

B.2 数据增强函数

此处我们提供数据增强期间所用算法的详细信息。我们假设一种未提供逐视图深度图的设置,这在 3D 生成模型(如 TRELLIS [52])的渲染管线中很常见。

令网格表面点 $P_{\text{surface}}$ 由点 $\{p_i\}_{i=1}^S$ 和对应的法向量 $\{n_i\}_{i=1}^S$ 组成,其中 $S$ 是点的数量。算法 1 对点进行过滤,以生成给定相机视图(内参 $K$ 和外参 $E$)的二进制点可见性掩码 $V \in \{0, 1\}^S$。我们首先利用点法向量和相机向后向量执行背面剔除。接下来,对于每个点 $p_i$,函数 $\text{Project}(p_i, E, K)$ 返回对应的归一化图像坐标 $(u_i, v_i)$ 和深度 $d_i$。由于点的稀疏性,通过将点投影到低分辨率图像网格并存储每个单元格中的最小深度,构建一个粗略的 z-buffer $Z$。这提供了图像中点可见性的近似值。为了结合遮挡掩码 $M_{\text{occ}}$(一个二进制掩码,其中 1 表示被遮挡的像素),将 z-buffer 上采样为 $Z_{\text{up}}$,以匹配 $M_{\text{occ}}$ 的分辨率。最后,标记那些深度与 z-buffer 的差值在阈值 $\epsilon = 0.05$ 以内且在 $M_{\text{occ}}$ 中未被遮挡的点为可见。该算法应用于所有 $N$ 个条件视图,并将生成的掩码 $\{V_j\}_{j=1}^N$ 通过逐点逻辑或(logical OR)组合,以获得最终的可见性掩码,从而得到条件点 $P$。

算法 2 在编辑场景中使用,用于从 3D 边界框生成可见性掩码 $\{M_i\}_{i=1}^N$。对于每个边界框 $B \in \mathbb{R}^{8 \times 3}$,将角点投影到图像上,并使用投影点的凸包来创建可见性掩码。虽然这有效地近似了被遮挡区域,但它可能会过度遮挡边界框角点位于物体后方或内部的区域。

B.3 训练数据过滤

我们在来自 TRELLIS-500K 数据集 [52] 的 407k 个形状上训练我们的模型,该数据集由来自 ObjaverseXL [8]、ABO [6]、3D-FUTURE [12] 和 HSSD [25] 的美学过滤对象组成。虽然 TRELLIS-500K 中的 ObjaverseXL 子集已经过美学过滤,但它仍然包含许多对应于场景级资产而非单个对象的条目,而单个对象是我们工作的重点。为了

第 23 页

Axolotl3D 23

算法 1 在相机视图中选择可见点 要求:3D 点 $P_{surface} = \{p_i\}_{i=1}^S$,法向量 $\{n_i\}_{i=1}^S$ 要求:相机外参 $E$,内参 $K$ 要求:可选遮挡掩码 $M_{occ} \in \mathbb{R}^{H \times W}$ 输出:点可见性掩码 $V \in \{0, 1\}^S$ 1: $b \leftarrow E_{3,1:3}$ ▷ 相机后向向量 2: for $i = 1$ to $S$ do ▷ 背面剔除(法向量过滤) 3: $f_i \leftarrow (n_i^\top b > 0)$ 4: end for 5: for $i = 1$ to $S$ do ▷ 将点投影到图像坐标并计算深度 6: $(u_i, v_i, d_i) \leftarrow \text{Project}(p_i, E, K)$ 7: end for 8: $h \leftarrow H/8, \ w \leftarrow W/8$ 9: 初始化 $z$-缓冲区 $Z \in \mathbb{R}^{h \times w}$ 为 $+\infty$ 10: for $i = 1$ to $S$ do ▷ 粗略 $z$-缓冲区构建 11: $x_i, y_i \leftarrow \text{clip}(\lfloor u_i \cdot (w – 1) \rfloor, 0, w – 1), \text{clip}(\lfloor v_i \cdot (h – 1) \rfloor, 0, h – 1)$ 12: $Z[y_i, x_i] \leftarrow \min(Z[y_i, x_i], d_i)$ 13: end for 14: $Z_{up} \leftarrow \text{BilinearUpsample}(Z, H, W)$ ▷ 将 $z$-缓冲区上采样至全分辨率 15: if $M_{occ}$ 未提供 then ▷ 若未提供,则将遮挡掩码设为全可见 16: $M_{occ} \leftarrow 0_{H \times W}$ 17: end if 18: 初始化 $V \leftarrow 0_S$ ▷ 所有像素初始为可见 19: for $i = 1$ to $S$ do ▷ 若点在深度阈值内且未被遮挡,则设点为可见 20: $x_i, y_i \leftarrow \text{clip}(\lfloor u_i \cdot (W – 1) \rfloor, 0, W – 1), \ \text{clip}(\lfloor v_i \cdot (H – 1) \rfloor, 0, H – 1)$ 21: if $|d_i – Z_{up}[y_i, x_i]| < \epsilon \land M_{occ}[y_i, x_i] < 1$ then 22: $V[i] \leftarrow 1$ 23: end if 24: end for 25: return $V$

算法 2 从 3D 边界框创建可见性掩码 要求:边界框点 $B \in \mathbb{R}^{8 \times 3}$ 要求:相机外参 $E$,内参 $K$ 输出:二元可见性掩码 $M \in \{0, 1\}^{H \times W}$ 1: 初始化 $M \leftarrow 1_{H \times W}$ ▷ 所有像素初始为可见 2: for $j = 1$ to $8$ do ▷ 将边界框点投影到图像坐标 3: $(u_j, v_j) \leftarrow \text{Project}(B_j, E, K)$ 4: $x_j, y_j \leftarrow \text{clip}(\lfloor u_j \cdot (W – 1) \rfloor, 0, W – 1), \ \text{clip}(\lfloor v_j \cdot (H – 1) \rfloor, 0, H – 1)$ 5: end for 6: $p_{corners} \leftarrow \text{stack}(x_j, y_j)$ ▷ 框角的像素坐标 7: $hull \leftarrow \text{ConvexHull}(p_{corners})$ ▷ 沿凸包有序排列的点列表 8: $\text{FillContours}(M, hull, 0)$ ▷ 将凸包内的所有掩码像素设为 0 9: return $M$

第 24 页

24 A. Hu 和 M. Shugrina

图 9:训练数据过滤:被移除物体的示例。

图 10:3D 一致掩码:带有生成遮挡物的掩码示例。

为解决此问题,我们利用 G-Objaverse [62] 数据集,该数据集为原始 Objaverse 数据集提供了人工提供的类别标签。它定义了 10 个通用类别,包括:人形(41,557)、动物(28,882)、日用品(220,222)、家具(19,284)、建筑与户外(116,545)、交通工具(20,075)、植物(7,195)、食物(5,314)、电子产品(13,252)以及低质量(107,001)。为了专注于单物体资产,我们移除了“建筑与户外”类别中的条目。我们通过在一个预训练的 DINOv3 嵌入之上训练一个分类器头来实现这一点。给定物体的渲染视图,分类器预测其通用类别,我们通过跨多个视图平均预测结果来获得稳健的每物体分类。这种方法使我们能够自动过滤掉用于训练的类似场景的物体,从我们下载的 TRELLIS-500K 子集中移除了 66k 个物体。被移除物体的示例如图 9 所示。

C 实验细节

C.1 遮挡掩码生成

为了进行定量和定性评估,我们通过从一组基本形状(立方体、圆柱体、球体和圆锥体)中添加随机遮挡物来模拟真实的 3D 一致遮挡。在 Amodal3R [49] 中,3D 一致掩码是通过随机游走策略生成的,该策略迭代地选择网格的相邻面。与直接从网格表面采样(这可能会暴露被遮挡区域的几何结构)不同,我们使用遮挡物形状来防止模型从掩码中推断出隐藏的结构。对于每个网格,我们以相等的概率从基本形状集合中采样 3 个遮挡物。 对于每个网格,我们以相等的概率从基本形状集合中采样三个遮挡物。为了创建遮挡物,我们首先计算物体的轴对齐包围盒及其体积 $V_{obj}$。然后我们采样一个线性缩放因子 $s \sim U(0.25, 5)$,并将目标遮挡物体积定义为

$V_{occ} = s^3 \cdot V_{obj}$. (5)

第 25 页

Axolotl3D 25

为了确定遮挡物的位置,我们从网格表面均匀采样 100k 个点,并应用体素下采样(体素大小为 0.1)以获得空间分布的候选位置集合。随机选择一个点作为遮挡物中心,确保遮挡物放置在物体几何体附近。

给定目标体积 $V_{\text{occ}}$,每种遮挡物类型的尺寸按以下方式采样:

– 长方体。独立采样长宽比 $r_x, r_y, r_z \sim U(0.6, 1.4)$,并将边长缩放以匹配目标体积 $V_{\text{occ}}$,从而得到

$$ l_i = r_i \left( \frac{V_{\text{occ}}}{r_x r_y r_z} \right)^{\frac{1}{3}}, \quad i \in \{x, y, z\}. $$

这确保了 $l_x \cdot l_y \cdot l_z = V_{\text{occ}}$。

– 球体。半径直接由目标体积计算得出:

$$ r = \left( \frac{3V_{\text{occ}}}{4\pi} \right)^{\frac{1}{3}} $$

– 圆柱体。高度与直径之间的长宽比采样为 $a \sim U(2.0, 6.0)$。半径随后为

$$ r = \left( \frac{V_{\text{occ}}}{2\pi a} \right)^{\frac{1}{3}} $$

高度为 $h = 2ar$。

– 圆锥体。高度与半径之比采样为 $a \sim U(1.5, 4.0)$。半径为

$$ r = \left( \frac{3V_{\text{occ}}}{\pi a} \right)^{\frac{1}{3}} $$

高度为 $h = ar$。

每个遮挡物以采样位置为中心,用于在每个相机视角中渲染最终的遮挡掩码。示例掩码如图 10 所示。

C.2 Hunyuan3D-Omni 的视角选择

在评估过程中,我们使用 Hunyuan3D-Omni (Hy3D-Omni) [21] 作为单视图和多视图补全的基线。尽管 Hy3D-Omni 设计为仅接受单视图图像作为输入,但它可以对来自多视图的点云进行条件处理。为了利用这一能力,我们在对多视图点进行条件处理的同时,选择提供信息量最丰富的单输入图像。下面详细介绍我们的视角选择策略。

对于每个视角,结合遮挡掩码 $M_{\text{occ}}$ 和前景物体掩码 $M_{\text{obj}}$,我们计算两个指标:

$$ F_m = \frac{\sum M_{\text{occ}}}{\sum M_{\text{obj}}}, \quad F_c = \frac{\sum M_{\text{obj}}}{\text{(6)}} $$

第 26 页

26 A. Hu 和 M. Shugrina

图 11:图像到 3D 的流水线:完全自动化,使用 SAM 2 [37] 进行分割,MapAnything [22] 生成点和相机参数,以及 Orient Anything v2 [47] 进行点对齐。

其中 $F_m$ 表示被遮挡的前景像素比例,$F_c$ 表示被物体占据的图像像素比例,且 $\text{res}$ 代表图像分辨率。对于无遮挡场景,选择物体覆盖率最大的视图,即最大化 $F_c$ 的视图。在有遮挡的场景中,通过选择最大化 $F_c – F_m$ 的视图,同时最大化物体覆盖率和可见性。此过程确保所选图像为 Hy3D-Omni 提供最可见且信息最丰富的物体视图。

C.3 使用 MapAnything 进行图像到 3D 的转换

在我们的论文中,我们展示了直接使用 MapAnything [22] 输出进行 3D 形状生成的结果。在此,我们提供关于流水线的更多细节,特别是关于物体方向的部分。首先使用 SAM 2 [37] 对输入图像进行分割,以获得物体分割和地面分割。然后将输入图像传递给 MapAnything [22] 以生成点和相机参数。使用分割掩码获取物体点和地面点。为了匹配训练数据中物体的方向(+Y 向上,+Z 向前),首先使用地面点估计地面平面,并旋转点使其法线与 +Y 轴对齐。然后将物体点投影到 X–Z 平面上,并使用奇异值分解 (SVD) 将其主要水平轴(第一主成分)与 +Z 对齐。或者,当没有地面点时,可以对视图应用 Orient Anything v2 [47] 来预测方向,如图 11 所示,但可能需要手动校正。最后,对点进行居中并缩放到 $[-1, 1]$。根据预测点的表面质量,我们应用体素下采样和异常点去除以减少预测输出中的表面伪影。有关局限性的进一步讨论,请参见 §E。

第 27 页

Axolotl3D 27

C.4 3D Capture & Simulation

精确的几何结构对于数字孪生中的机器人仿真或捕获环境中的交互等应用至关重要。在此,我们展示了从真实世界捕获场景中提取物体,并在训练好的高斯泼溅(Gaussian Splatting)场景中进行仿真的过程。

从捕获数据生成网格:对于每个物体,我们手动选择一组代表性视图,并使用 SAM 2 [37] 对物体进行分割。随后对分割区域进行裁剪和填充,以形成输入图像。由于多视图深度预测方法常常存在视图对齐不一致的问题,我们改为使用 Depth Anything 3 [27] 从单张图像估计深度。为了能够与高斯泼溅 [23] 场景表示进行比较,我们将预测的深度进行缩放和平移,以使其与从高斯泼溅场景渲染出的深度对齐。然后,使用物体分割掩码对对齐后的深度图进行掩码处理,并利用高斯泼溅场景中对应的相机参数进行反投影,以获得对齐的条件点。这些点随后被手动定向为 +Y 向上、+Z 向前,并重新缩放到 [-1, 1] 范围,以匹配我们方法的输入约定。预测输出将应用逆变换,以恢复到原始场景坐标系。根据预测深度的质量,我们应用体素下采样和异常点去除以减少噪声。为了结合裁剪的多视图图像条件,我们按照主论文消融实验部分所述,在不使用相机条件的情况下应用我们的方法。

仿真:我们遵循 Kaolin 动手实验室 [30],利用与表示无关的物理仿真 [31] 和混合泼溅-网格渲染 [32,48] 来展示我们的结果;泼溅物体的分割遵循类似于 [13] 的算法。最终的仿真结果展示在补充视频中。与包含大量缺失区域的高斯泼溅物体分割不同,我们的几何结构是完整的,可用于对捕获环境进行更准确的物理仿真。

D 附加结果

D.1 无 ICP 的定量结果

为了公平起见,我们对所有方法应用 ICP,因为 Amodal3R 不使用点条件,而 SAM3D 使用相机空间点图。不进行对齐的指标将主要反映坐标系不匹配,而非重建准确性。表 5 展示了未应用 ICP 的结果。所有方法的分数均有所下降,但相对排名基本保持不变。

第 28 页

28 A. Hu 和 M. Shugrina

表 5:在 Toys4k 上未进行 ICP 对齐的定量评估。

场景: 单视图 多视图 方法 F-score ↑ vIoU ↑ CD↓×10 F-score ↑ vIoU ↑ CD↓×10 存在遮挡: Hy3D-Omni 0.6166 0.1800 0.8635 0.8646 0.3346 0.3092

± 0.2762 ± 0.1291 ± 0.8270 ± 0.1809 ± 0.1574 ± 0.3803 ShapeR 0.6851 0.2282 0.5237 0.8901 0.3998 0.2448 (同期工作) ± 0.2545 ± 0.1203 ± 0.4498 ± 0.1896 ± 0.1554 ± 0.3854 ours 0.8898 0.3277 0.2559 0.9615 0.4196 0.1540

± 0.1328 ± 0.1035 ± 0.2207 ± 0.0762 ± 0.1126 ± 0.0865 无遮挡: Hy3D-Omni 0.7512 0.2486 0.4858 0.9071 0.3849 0.2333

± 0.2257 ± 0.1462 ± 0.4408 ± 0.1351 ± 0.1591 ± 0.2254 ShapeR 0.7386 0.2566 0.4549 0.9294 0.4470 0.1897 (同期工作) ± 0.2445 ± 0.1230 ± 0.4318 ± 0.1546 ± 0.1450 ± 0.3343 ours 0.9118 0.3481 0.2278 0.9767 0.4438 0.1372

± 0.1171 ± 0.0986 ± 0.1942 ± 0.0468 ± 0.1078 ± 0.0571

D.2 物体编辑对比

在图 12 中,我们展示了在物体编辑任务中与基于点条件基线方法的对比。这些基线方法并未针对物体编辑进行显式训练,因此难以处理更具挑战性的编辑任务。Hunyuan3D-Omni (Hy3D-Omni) 缺乏相机条件约束,导致物体方向存在歧义。相比之下,我们的方法尊重条件点以保留未编辑区域,同时联合利用相机参数和输入图像以生成高保真的编辑结果。

D.3 定性对比

在本节中,我们提供了与基线方法的额外定性对比,以进一步展示我们方法的性能。图 13 和 14 展示了在 OmniObject3D 数据集上遮挡和无遮挡条件下的结果。图 15 展示了 Toys4k 上的无遮挡场景。

E 局限性与未来工作

尽管 Axolotl3D 在遮挡处理和下游应用中表现出强大的性能,但仍有一些方面有待进一步改进,我们计划在未来的工作中进行探索。

– 相机和视角鲁棒性:目前,我们的模型是在固定的相机距离和内参下训练的,这要求物体必须完全在视野内。未来的工作可以引入更多样化的相机位置和图像增强,或使用真实世界采集的数据集,以提高对相机视角的鲁棒性。

第 29 页

Axolotl3D 29

编辑视图 编辑点云 Hy3D-Omni ShapeR 本文方法

图 12: 与基线方法在 2048 个输入点下的物体编辑对比。

– 表面质量与细节:尽管我们的方法整体能生成高质量的重建结果,但极细的结构有时可能会断开,且细微的表面细节可能会被平滑处理或比实际情况更厚。利用更强大的基础模型或图像编码器有望实现更精细几何结构的更好重建。 – 对噪声的鲁棒性:我们当前的模型旨在忠实遵循几何线索,尚未显式训练以处理噪声输入。扩展模型以应对不同的噪声特性是实现更广泛应用的重要方向。此类特性的示例包括 3D 重建模型中的视角未对齐 [22,44]、高斯泼溅(Gaussian splats)[23] 中常见的不规则表面和离群点、过度平滑的表面、透视引起的畸变,以及在单目深度估计 [27] 中观察到的深度不连续处附近的伪影。 – 处理多样化的点云特性:我们的方法使用最远点采样(Furthest Point Sampling)[35] 将部分点云下采样至 8192 个点进行训练,并对较小输入进行填充。虽然这允许处理适度稀疏的输入,但模型并未针对非常稀疏的点或锐利边缘的点(即来自运动恢复结构 [39] 的点)进行显式训练。使模型能够处理更广泛的点分布和特性,将进一步扩大其在更复杂真实世界数据集上的适用性。 – 纹理补全:Axolotl3D 仅专注于形状生成,不预测纹理,这可以在未来的工作中进行探索。

总体而言,这些局限性突显了进一步增强 Axolotl3D 的令人兴奋的机会,将其适用性和鲁棒性扩展到更广泛的挑战性场景中。

第 30 页

30 A. Hu 和 M. Shugrina

输入视图 输入点云 Amodal3R SAM3D Hy3D-Omni ShapeR 本文方法 真实标签

(a) 单视图输入结果

输入视图 输入点云 Amodal3R Hy3D-Omni ShapeR 本文方法 真实标签

(b) 多视图输入结果

图 13: 在 OmniObject3D 上的定性比较:与基线方法在存在遮挡情况下的单视图和多视图补全结果对比。

第 31 页

Axolotl3D 31

输入视图 输入点云 Amodal3R SAM3D Hy3D-Omni ShapeR 本文方法 真实标签

(a) 单视图输入结果

输入视图 输入点云 Amodal3R Hy3D-Omni ShapeR 本文方法 真实标签

(b) 多视图输入结果

图 14: 在 OmniObject3D 上的定性比较:与基线方法在无遮挡情况下的单视图和多视图补全结果对比。

第 32 页

32 A. Hu 和 M. Shugrina

输入视图 输入点 Amodal3R SAM3D Hy3D-Omni ShapeR 本文方法 真实值

(a) 单视图输入结果

输入视图 输入点 Amodal3R Hy3D-Omni ShapeR 本文方法 真实值

(b) 多视图输入结果

图 15: 在 Toys4k 上的定性比较:与基线方法在无遮挡情况下的单视图和多视图补全结果

发表评论