Hallo4D:基于多模态大模型共识的3D/4D生成时空一致性优化

三分钟导读:Hallo4D提出了一种无需重新训练的模型无关框架,利用大型多模态语言模型(LMMs)检测并纠正3D和4D生成中的时空幻觉,通过共识驱动的重一致性优化和运动显著性采样显著提升一致性。

英文题目:Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.12752

原始论文:PDF / 论文页面

对应视频标题:Hallo4D:基于多模态大模型共识的3D/4D生成时空一致性优化|推荐指数:★★★★★

这篇论文解决什么问题?

现有3D/4D生成方法主要依赖2D扩散监督,缺乏显式的几何一致性约束,导致空间幻觉(如Janus问题)和4D中的时间伪影(如抖动、身份闪烁)。

核心创新

  • 提出无需重新训练或修改架构的模型无关时空一致性优化框架。
  • 开发基于LMMs的生成-检测-校正范式,利用多模型投票确保几何保真度。
  • 设计4D初始化方案和基于光流的运动显著性采样策略(OF-Range)。
  • 引入对比语义曝光对齐(CSEA)和对数动态范围(LDR)损失以稳定光照。

方法概览

提出生成-检测-校正范式:1) 利用LMMs识别多视图/多帧渲染中的不一致性并生成增强负提示;2) 通过Prompt-Enhanced Re-consistency模块生成多个候选修正,由MLLM共识选择器通过投票选出最优结果;3) 引入Multi-view Appearance Alignment (AAttn)和OF-Range采样策略;4) 使用CSEA和LDR损失解决曝光不稳定问题。

逐图理解论文

背景:SDS方法的局限与4D挑战

背景:SDS方法的局限与4D挑战
Fig. 2: Pipeline overview of the 3D consistency optimization stage. We jointly optimize our model using LSDS and LCG. For LSDS, a focal view is selected based on camera pose and used as keys and values to align all views via attention. For LCG, hallucinations are identified using LMMs and translated into enhanced negative prompts. These prompts guide the generation of multiple candidate corrections, from which an MLLM consensus selector determines the optimal result via multi-model voting to enforce re-consistency.

基于Score Distillation Sampling的3D生成方法虽有效,但易产生未观察视角的幻觉。4D生成进一步面临跨视角和跨帧的时空一致性挑战。现有方法多为特定架构设计,缺乏通用性。Hallo4D作为Hallo3D的扩展,不仅处理3D空间一致性,还引入共识机制以应对4D时空一致性,并可与3DGS等表示方法结合。

创新:LMM驱动的幻觉检测与校正

创新:LMM驱动的幻觉检测与校正
Fig. 4: A multi-modal reasoning case study designed to evaluate the capabilities of LMMs in spatial structure reasoning, multi-view inconsistency diagnosis, and temporal inconsistency localization. The first round of dialogue demonstrates that LMMs possess the necessary reasoning abilities, while the second round illustrates that LMMs can produce responses in specific formats, enabling the subsequent extraction of both negative prompts and the associated target views or specific frames to be processed using regular expressions.

核心创新在于利用LMMs进行空间结构推理和多视图不一致诊断。LMMs不仅能识别不一致,还能生成特定格式的响应,便于提取负提示和目标视图。Prompt-Enhanced Re-consistency仅在图像语义结构完整时应用,通过U-Net注意力可视化可见,随着扩散进行,注意力逐渐减少对不一致区域的关注,从而纠正幻觉。

创新:4D时空一致性优化策略

创新:4D时空一致性优化策略
Fig. 3: Pipeline overview of the 4D spatiotemporal consistency stage. We first identify the views and frames with the most severe inconsistencies through initialization to guide early-stage training. During training, we employ OF-Range, an optical flow-based inter-frame sampling strategy that improves both the efficiency and effectiveness of the 4D generation process.

针对4D生成,Hallo4D设计了4D初始化方案和基于光流的运动显著性采样策略。初始化阶段识别不一致最严重的视图和帧,引导早期训练。OF-Range策略通过光流信息选择关键帧,提高4D生成的效率和效果。这种策略确保了跨帧的平滑过渡和身份一致性,减少了时间伪影。

创新:光照稳定与曝光对齐

创新:光照稳定与曝光对齐
Fig. 6: Illustration of over-exposure and under-exposure situation. Baselines exhibit view-dependent collapse in non-frontal views, producing white-out/black-out frames, whereas Hallo4D, with losses of CSEA and LDR, maintains stable exposure and preserves structure across viewpoints.

为解决多视角下的曝光不稳定问题,Hallo4D引入对比语义曝光对齐和对数动态范围损失。基线模型在非正面视角下易出现过曝或欠曝,导致视图依赖崩溃。Hallo4D通过CSEA和LDR损失,维持稳定的曝光并保留结构,确保跨视角的视觉一致性,避免白出或黑出帧。

实验:文本驱动3D生成结果

实验:文本驱动3D生成结果
Fig. 7: Qualitative comparison in text-driven 3D generation of Hallo4D and baseline models. For intuitive comparison, we use the same and complementary viewpoints to present the results, where our method shows significant improvements.

在文本驱动3D生成任务中,Hallo4D与GaussianDreamer等基线对比。定量结果显示,CLIP Score从21.31提升至24.68。定性比较显示,Hallo4D在相同和互补视角下显著改善了生成质量,减少了结构重复和幻觉,证明了其在文本到3D任务中的有效性。

实验与关键结果

  • 在文本驱动和图像驱动的3D生成任务上与GaussianDreamer, SJC, DreamFusion-IF等基线对比。
  • 在4D生成任务上与Consistent4D, DreamGaussian4D, 4D-FY等基线对比。
  • 进行消融实验验证各模块(AAttn, LMM-D, Re-Cons, Init-4D, OF-Range)的有效性。
  • 用户研究评估一致性、质量和对齐度。
  • 文本驱动3D生成:CLIP Score (B/32) 从21.31提升至24.68 (GaussianDreamer+Hallo4D)(第 13 页)
  • 图像驱动3D生成:CLIP Score (B/32) 从31.77提升至32.14 (DreamGaussian+Hallo4D)(第 15 页)
  • 4D生成:CLIP Score (B/32) 从22.34提升至25.31 (Cons.4D+Hallo4D)(第 15 页)

阅读时需要注意

  • LMM推理带来额外的计算开销。
  • 框架主要针对单前景主体和固定轨道相机场景进行优化。
  • 依赖预训练扩散模型和LMMs,可能继承其固有偏差。
  • LMMs仅作为轻量级的一致性检查器,不进行完整的3D重建。
  • Prompt-Enhanced Re-consistency仅在图像语义结构完整时应用。

关联工作

  • Hallo3D:前身工作,仅处理3D空间一致性,Hallo4D扩展至4D时空一致性并引入共识机制。(第 4 页)
  • DreamFusion:基础SDS方法,Hallo4D在其基础上引入图像空间校正和一致性约束。(第 4 页)
  • 3DGS:3D表示方法,Hallo4D作为优化框架可与其结合。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Hallo4D:用于一致时空生成的多模态幻觉缓解方法

洪波王1,2 · 华波黄1,2 · 杰曹1,2 · 进刘1,3 · 浩洋童1,2 · 然何1,2

摘要 尽管近期在3D生成方面的进展实现了令人印象深刻的视觉合成,但大多数现有方法仍然主要依赖缺乏几何一致性强制机制的基于2D扩散的监督,通常导致空间幻觉,如结构重复或几何错位。这些挑战在4D生成中尤为突出,因为在视点之间和随时间推移保持一致性要困难得多,并且经常导致时间伪影,如抖动、身份闪烁和结构漂移。为了克服这些局限性,我们提出了Hallo4D,这是一个统一且与模型无关的框架,旨在缓解3D和4D内容生成中的时空幻觉。Hallo4D引入了一种生成-检测-校正范式,利用大型多模态语言模型(LMMs)的推理能力来定位和总结来自多视图、多帧渲染的空间和时间不一致性。为了防止单次编辑带来的误差累积并确保鲁棒的几何保真度,这些见解指导共识驱动的空间一致性优化,其中LMM选择器通过多模型投票评估多个候选校正方案。这一过程无需重新训练或架构修改即可实现。为了进一步增强时间一致性,Hallo4D结合了一种基于光流的运动显著性关键帧采样策略,从而实现更有针对性和高效的细化。该框架还包括一个由LMM引导的初始化方案和一个基于注意力的外观对齐模块,以改善早期优化并提高跨视图保真度。此外,我们通过两种损失来解决曝光不稳定性问题:对比语义曝光对齐(CSEA),这是一种前景掩码对比目标,有利于曝光良好的语义,同时惩罚过曝和欠曝;以及对数动态范围(LDR)损失,用于正则化亮度对比度。结合并排可见性剪除以去除视外杂波并减少伪欠曝,这些补充措施减轻了非正面视角下的曝光驱动崩溃。大量实验表明,Hallo4D在各种生成设置中始终优于强大的基线方法,为一致性感知的3D和4D内容生成提供了一种可扩展且通用的解决方案。更多可视化内容请访问我们的项目页面:https://wafer-bob.github.io/Hallo3D-4D/。[cs.CV]

关键词 3D生成 · 4D生成 · 时空一致性 · 多模态推理

1 引言

三维内容生成已成为AI驱动视觉理解和模拟的基础能力。随着基于扩散的监督的出现,最近的方法可以从最小输入中合成高保真度的3D资产,使用文本提示(Poole等人,2022;Jun和Nichol,2023)、单视图图像(Liu等人,2023b)或稀疏多视图数据(Jiang等人,2023a;Shi等人,2024)。一个特别成功的方向是利用2D扩散模型作为监督先验,通过训练3D表示以匹配渲染视图的分布与预训练图像扩散模型的分布。这通过分数蒸馏采样(SDS)(Poole等人,2022)实现,该算法迭代更新3D参数以最小化与学习到的2D先验在视图级别的差异。虽然非常有效,但这些方法完全依赖于视图相关的2D监督,这通常

第 2 页

2 H. Wang et al.

Baselines Hallo4D

Baselines Hallo4D

View 1 Baselines Hallo4D

View 2 Baselines

Hallo4D

图 1: Hallo4D 与基线方法在 3D 和 4D 生成结果上的对比。我们的方法在时空一致性方面取得了显著改进。

导致在未观测视角中出现幻觉或重复结构——这种失败模式通常被称为双面人问题(Janus problem)(Armandpour et al., 2023)。这一问题反映了当前流水线的一个核心弱点:缺乏显式建模并强制跨视角几何一致性的机制。随后的几项工作试图通过引入 3D 感知先验 (Zhao et al., 2023; Liu et al., 2024c) 或显式强制多视图一致性 (Yang et al., 2023) 来解决此问题,但这些方案仍受限于监督信号的不足,并且在实现鲁棒生成方面仍面临挑战。

重要的是,虽然现有工作主要侧重于改进静态 3D 内容内的空间一致性,但现实世界场景要求连贯性同时跨越空间和时间。动画 (Xu et al., 2024b) 和跟踪 (Wu et al., 2024c) 等应用需要对随时间连续演变的动态几何进行建模,这自然要求 4D 内容生成能够捕捉物理世界的时空连续性。然而,从静态几何过渡到动态几何引入了一系列新的挑战,目前的 4D 生成方法尚未能以统一的方式解决这些问题。一些方法基于动态 NeRF 框架 (Pumarola et al., 2020; Li et al., 2022),通过将规范表示与变形场解耦来对随时间变化的运动进行建模,从而实现了高质量的 4D 内容。然而,它们对潜在空间编码的依赖往往损害了帧间的几何一致性,导致诸如抖动和重影等时间伪影 (Zheng et al., 2024; Jiang et al., 2023b)。与此同时,其他方法采用显式神经结构 (Cao and Johnson, 2023) 来建模变形,提高了推理效率和对局部非刚性运动的鲁棒性。

第 3 页

Hallo4D:用于一致时空生成的多模态幻觉缓解方法 3

然而,在复杂的动态场景中保持高保真纹理并确保稳定的时空一致性仍然极具挑战性 (Ren et al., 2023; Bahmani et al., 2024b; Singer et al., 2023)。为了缓解上述局限性,我们提出了 Hallo4D,这是一个用于检测和缓解 3D 和 4D 内容生成中幻觉的时空一致性优化框架。我们方法的核心在于观察到 LMMs 展现出强大的空间推理能力,使它们能够识别并总结动态场景中跨视角和时间步出现的各种不一致性。利用这一能力,Hallo4D 实施了一种新颖的“生成-检测-修正”范式,该范式直接在多视角、多帧渲染结果上运行——无需任何额外的训练数据或特定任务的监督。通过将此范式与基于共识驱动的扩散 2D 编辑技术相结合,该技术评估多种候选修正方案以防止误差累积,我们的框架可以无缝应用于广泛的现有 3D 和 4D 生成模型,而无需修改其架构或重新训练流程。除了一致性修正外,Hallo4D 还进一步提升了 3D 的外观质量和 4D 的时序连贯性。我们引入了一种基于注意力的对齐模块以增强跨视角纹理一致性,以及一种基于运动显著性的关键帧采样策略以提高时序稳定性和效率。此外,我们通过两种曝光感知损失——对比语义曝光对齐 (CSEA) 和对数动态范围 (LDR) 损失,并应用联合视锥可见性剪枝来抑制视外杂乱并减少伪欠曝现象;这些补充措施缓解了非正面视角下的曝光驱动崩溃。这些组件共同支持在各种场景中可靠且高质量的生成。

具体而言,对于 3D 生成,我们首先从多个视角渲染图像,并构建一个 3D 不一致感知查询以询问 LMM。通过标准化的响应,LMM 识别跨视角不一致性并生成增强型负向提示,随后用于指导针对性的图像空间优化。该过程利用多视角外观对齐策略,其中焦点视图提供键和值特征以进行交叉注意力机制,确保不同视角间的纹理一致性。对于 4D 生成,我们引入了三种额外的机制以应对更严峻的时空挑战。首先,一种由 LMM 引导的初始化阶段。该阶段联合分析静态 3D 资产和动画序列,以检测跨视角和跨时间步的不一致性。识别出的幻觉被转化为针对性的初始化损失,确保早期优化由稳定的监督信号引导,并减少后续阶段中误差累积的风险。其次,一种基于光流的运动显著性采样策略,用于关键帧采样。这种基于光流的策略优先考虑具有显著运动的帧,同时保持时间分散性。通过专注于动态信息丰富的帧并避免在静态区域进行冗余更新,OF-Range 提高了 4D 训练期间的时序连贯性并增强了计算效率。第三,一种曝光感知的语义对齐模块。该模块通过引入两种互补的损失来防止视角依赖崩溃:对比语义曝光对齐 (CSEA),这是一种前景掩码对比目标,旨在与曝光良好的语义对齐,同时惩罚过曝和欠曝;以及对数动态范围 (LDR) 项,用于正则化对数亮度域中的对比度。结合联合视锥可见性剪枝以移除视外杂乱并缓解伪欠曝,该模块在非正面视角下稳定了优化过程并提高了整体鲁棒性。

在 3D 和 4D 阶段,识别出的不一致性均通过提示增强重一致性模块进行修正,该模块使用基于扩散的图像空间编辑,条件为增强型负向提示。在 3D 和 4D 阶段,识别出的不一致性均通过基于提示增强的共识驱动重一致性模块进行修正。与可能引入复合误差的单一确定性编辑不同,该模块由增强型负向提示引导生成多种候选修正方案,并采用 LMM 共识选择器通过多模型投票确定最优的几何忠实结果。为了确保理论有效性,我们建立了 SDS 的图像空间重构形式,支持这些修正而不破坏底层训练动态。大量实验表明,Hallo4D 在空间、时序和感知质量指标上始终优于强大的基线方法,证明了其在 diverse 3D 和 4D 生成任务中的鲁棒性和广泛适用性。

我们的贡献。我们将贡献总结如下:

– 我们提出了 Hallo4D,这是一个统一的时空一致性框架,用于检测和缓解 3D 和 4D 生成中的幻觉。Hallo4D 无需额外数据或重新训练即可运行,确保了其在 diverse 模型中的广泛适用性。

– 我们开发了一种新颖的“生成-检测-修正”范式,利用 LMMs 进行不一致性检测,并通过基于共识的图像空间优化进行修正。我们证明,LMMs 不仅能推断空间结构并诊断多视角和时序不一致性,还能作为有效的集成选择器,通过多模型投票确保鲁棒的几何保真度。

– 我们设计了一种 4D 初始化方案以及一种基于光流的运动显著性采样策略,以提高

第 4 页

4 H. Wang et al.

证明早期阶段的优化并增强 4D 生成中的时间稳定性。此外,我们引入两种曝光感知损失,并结合视锥体可见性剪枝以减少非正面视角下的曝光不稳定性。 – 大量实验表明,Hallo4D 在各种 3D 和 4D 任务中,相比强大的基线方法,持续提升了视觉质量和时空一致性。

与我们先前工作 Hallo3D (Wang et al., 2024a) 的区别,该工作发表于 NeurIPS 2024。本文提出了 Hallo4D,它是 (Wang et al., 2024a) 的重大扩展,在范围、建模能力和理论依据方面均有重大进展:

– 方法论增强:Hallo4D 将仅空间校正扩展为统一的时空优化。关键在于,我们将 Hallo3D 的确定性单次编辑升级为共识驱动提示增强重一致性机制,通过多模型投票缓解误差累积。结合 LMM 引导的初始化和基于运动显著性的关键帧采样,这确保了高质量且时间连贯的 4D 生成。此外,引入了两种新颖的曝光感知损失(CSEA 和 LDR)以稳定光照并减少非正面视角下的欠曝光伪影。据我们所知,这是首个用于 4D 生成的即插即用、模型无关的一致性优化策略。

– 功能泛化:LMMs 的作用在应用范围和深度上得到了进一步泛化。LMMs 最初用于检测 3D 输出中的空间不一致性,现在被证明能有效识别 4D 序列中的时间不一致性,展示了其在推理多视图几何和跨帧动态方面的能力。此外,我们通过将 LMM 衍生的信号整合到早期优化阶段,将其用途扩展到事后分析之外,使其更广泛地参与一致性感知生成。

– 理论依据与扩展评估:我们提供了新的理论分析,解释了图像空间一致性方法为何能有效迁移到 3D 和 4D 几何细化,为我们的校正策略提供了更强的概念基础。此外,我们将实证评估范围扩大到包括此前未涵盖的高质量基线 (Wang et al., 2023; Long et al., 2023),证明了所提框架在不同生成设置下的通用性和鲁棒性。

2 相关工作

2.1 3D 内容生成

扩散模型的问世彻底改变了文本到 3D 的生成,使得从文本描述中合成高保真 3D 资产成为可能。DreamFusion (Poole et al., 2022) 开创了这个领域,利用分数蒸馏采样 (SDS) 优化 3D 结构,结合 MipNeRF 360 (Barron et al., 2022) 进行神经渲染,并使用 Imagen (Saharia et al., 2022) 进行高质量的文本到图像生成。虽然基于 NeRF 的方法 (Mildenhall et al., 2022; Lorraine et al., 2023; Zhou et al., 2023; Wang et al., 2023; Li et al., 2023; Gao et al., 2023; Lin et al., 2023) 提高了照片级真实感和光照效果,但其高昂的计算成本限制了可扩展性。为了解决这个问题,3D 高斯溅射 (3DGS) (Kerbl et al., 2023) 提出了一种高效的替代方案,通过可优化的 3D 场景表示实现实时渲染。随后的改进 (Chen et al., 2023; Yi et al., 2023; Di et al., 2025) 提高了组合性和效率。在优化方面,CoGrad3D (Tong et al., 2026) 将空间感知的时间步调度与跨视角的正交梯度融合相结合,进一步提高了视图一致性和纹理保真度。除了传统方法外,基于 GAN 的模型 (Attaiki et al., 2024; Li et al., 2024b) 将 GAN 与扩散模型集成,实现了快速生成并消除了迭代优化。同时,场景级方法 (Zhou et al., 2024b; Li et al., 2024c) 提高了结构和语义连贯性,扩展了文本到 3D 合成的能力。

来自特定视角的图像为 3D 生成提供了更强的视觉一致性。基于图像的方法 (Tang et al., 2023a; Fu et al., 2023; Liu et al., 2023c; Tang et al., 2023b; AlBahar et al., 2023; Qian et al., 2023; Long et al., 2023) 通常通过利用准确的多视图监督而优于基于文本的方法。3D 感知图像生成技术 (Xiang et al., 2023; Deng et al., 2022) 增强了跨视角的渲染一致性,但仍因训练数据稀缺而面临挑战。最近引入 3D 先验的基于扩散的模型 (Jun and Nichol, 2023; Nichol et al., 2022) 提高了几何真实感,减少了感知误差,并推进了图像到 3D 合成的保真度。更最近,基于结构化 3D 潜在变量的前馈生成模型 (Xiang et al., 2025) 显著提高了直接 3D 资产生成的可扩展性和保真度。

2.2 4D 内容生成

生成 4D 内容 (Miao et al., 2025),即在 3D 合成中引入时间动态,需要平衡运动真实性、效率和控制能力,以创建

第 5 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 5

连贯、高保真的动态场景。早期的工作基于 NeRF 模型 (Du et al., 2021; Pumarola et al., 2020) 或基于几何的理论方法 (Laga et al., 2021),但这些方法在计算成本和时序不一致性方面存在困难。更近期的基于扩散的技术 (Bahmani et al., 2024b,a; Ling et al., 2024) 引入了分数蒸馏采样 (SDS) 和轨迹条件控制,显著提高了运动连贯性和结构稳定性。与此同时,视频驱动的方法 (Chu et al., 2024; Jiang et al., 2023b; Yang et al., 2025; Pan et al., 2025) 重新定义了多物体交互、视角一致性和逐帧特征解耦,解决了场景复杂性方面的挑战。另一方面,物理感知方法 (Zhang et al., 2024; Huang et al., 2024) 引入了现实世界约束,增强了物体动态的真实性。

随着生成模型的进步,对高效场景表示的需求日益增长。传统的体素技术计算成本高昂,导致了高斯溅射 (Gaussian splatting) (Wu et al., 2024a; Lin et al., 2024; Ren et al., 2023; Zeng et al., 2024; Ling et al., 2024) 的兴起,它在保持保真度的同时实现了实时渲染。基于扩散的运动合成 (Blattmann et al., 2023; Sun et al., 2024) 进一步提高了可扩展性,而由大语言模型 (LLM) 引导的组合方法 (Xu et al., 2024a) 为更精细的场景控制添加了结构先验。除了效率之外,结构化的运动控制仍然至关重要。混合表示 (Li et al., 2024e; Xie et al., 2024) 增强了多视角一致性和稀疏运动控制,而高分辨率 4D 合成 (Li et al., 2024d) 提高了大规模环境中的细节保留能力,增强了复杂动态设置下的适应性和真实性。最近,多视角视频扩散模型如 CAT4D (Wu et al., 2025) 和前馈式 4D 生成框架 (Chen et al., 2025) 使得从单目输入直接创建 4D 内容成为可能,进一步拓宽了动态内容生成的适用范围。

2.3 时空一致性增强

确保一致性是生成连贯的 3D 和 4D 内容的基础。在 3D 生成中,主要焦点在于保持多视角一致性,然而,一个关键挑战源于对 2D 扩散模型的依赖,这通常会引入特定视角的幻觉。为了缓解这一问题,微调方法 (Shi et al., 2024; Zhao et al., 2023; Yang et al., 2023; Liu et al., 2024c; Jiang et al., 2023a) 将 3D 约束纳入扩散模型,提高了 3D 主体 (Ruiz et al., 2023; Raj et al., 2023)、透明物体 (Zhang and Agrawala, 2024) 和多视角 (Seo et al., 2023; Ji et al., 2026) 的一致性。除了微调之外,提示优化 (Hong et al., 2023; Armandpour et al., 2023)、对象级自我修正 (Sun et al., 2026a) 和偏好优化 (Sun et al., 2026b) 完善了对齐,而几何修正 (Liu et al., 2023a) 和视频启发框架 (Voleti et al., 2024) 提供了替代解决方案。此外,Liu et al. (2024b); Liang et al. (2023) 等方法增强了动态和复杂 3D 内容的一致性和保真度,近期的思维驱动方法 (Jiao et al., 2026; Guo et al., 2026; Liu et al., 2026; Fan et al., 2026) 利用大型多模态语言模型 (LMMs) 的推理能力来强制视觉和 3D 生成的结构一致性。然而,这些方法在非正交视角和不同架构的适应性方面仍面临挑战。

基于 3D 中的多视角对齐,最近的 4D 生成工作越来越注重确保帧间的时序一致性。时空锚定和特征同步等技术 (Zeng et al., 2024; Grammatikopoulou et al., 2023) 提高了帧间连贯性并实现了更一致的运动生成。与此同时,时序一致的扩散模型和快速时空优化策略 (Zhou et al., 2024a; Liang et al., 2024b) 减少了闪烁伪影。进一步的进展针对长程时序对应和形变最小化 (Yang et al., 2024a; Ouyang et al., 2024),而其他方法 (Xu et al., 2024c; Wang et al., 2024b) 则专注于生成更平滑、更稳定的运动轨迹。运动跟踪和流细化方面的进展 (Chen et al., 2024; Liang et al., 2024a) 也促进了动态内容生成鲁棒性的提升。虽然大多数现有方法专注于解决特定模型内的一致性问题的努力,但旨在提高通用性的工作 (Qiu et al., 2023b; Wang et al., 2025; Liu et al., 2025) 仍局限于有限领域内的 3D 或 4D 生成。相比之下,我们提出的 Hallo4D 利用 LMMs 和图像空间优化,在 3D 和 4D 生成任务中实现了可扩展且高效的一致性增强。

3 预备知识

3.1 扩散模型

扩散模型 (Ho et al., 2020) 具有从 0 到 T 的扩散步骤的前向扩散过程,它通过以下步骤在 T 步内将原始样本 $x_0$ 退化为纯噪声 $x_T$:

$$ x_t = \sqrt{\bar{\alpha}_t}x_0 + \sqrt{1 – \bar{\alpha}_t}\epsilon, \quad \epsilon \sim \mathcal{N}(0, I), \quad (1) $$

其中 $\bar{\alpha} := (\bar{\alpha}_1, \dots, \bar{\alpha}_T) \in \mathbb{R}^{T}_{\ge 0}$ 控制噪声调度。反向过程随后从 $x_T$ 重建 $x_0$。这一范式现在支撑着广泛的视觉合成和恢复任务,包括图像恢复和增强 (Li et al., 2025) 以及忠实图像超分辨率 (Wang et al., 2026)。在文本引导的扩散 (Taga and Nishimoto, 2022) 中,以文本提示 $P$ 为条件

第 6 页

6 H. Wang et al.

Score Distillation Sampling Appearance Attention Focal View K

V AAttn 2D Diffusion

Q × 4 × 4 3D Content Multi-view Renderings " A cartoon fox" Inquiry LMM

Consensus-Driven Re-consistency via Prompt Enhancement Video “Whichdiffertwo theadjacentmost?"frames Input Inquires

“ , the latter is more severe, suffering distorted facial features ……"

LMM Output Analysis 2D Diffusion Image “Are there any Inconsistency?"

Input Inquires Pos: "A cartoon fox" “ Abnormal three ears , ……" Input Image Neg: " Abnormal 3 ears , …" Output Images Consensus Voting Selected Images Output Analysis LMM

Fig. 2: Pipeline overview of the 3D consistency optimization stage. We jointly optimize our model using LSDS and LCG. For LSDS, a focal view is selected based on camera pose and used as keys and values to align all views via attention. For LCG, hallucinations are identified using LMMs and translated into enhanced negative prompts. These prompts guide the generation of multiple candidate corrections, from which an MLLM consensus selector determines the optimal result via multi-model voting to enforce re-consistency.

is achieved via a text encoder (e.g., CLIP (Radford et al., ϵ defines the gradient for updating θ, thereby improving the 2021)). The denoiser ϵϕ is trained to predict the noise ϵ given 3D model. The SDS gradient is computed as: the noisy input xt and text condition: ∂x ∇θLSDS(ϕ, x=g(θ)) ≜Et,ϵ w(t) (˜ϵϕ(xt; t, P)−ϵ) ,L(ϕ) = Et∼U(1,T ),ϵ∼N(0,I)∥ϵ −ϵϕ(xt; t, P)∥22, (2) ∂θ (4) To enhance text-image alignment, Classifier-Free Guidance (CFG) (Ho and Salimans, 2021) interpolates between con- where w(t) is a time-dependent weighting function. ditional and unconditional predictions:

˜ϵϕ(xt; t,P, s)=ϵϕ(xt; t, ∅)+s (ϵϕ(xt; t,P)−ϵϕ(xt; t, ∅)) , 4 Methodology (3) This section introduces the overall framework and under- where s is the guidance scale and ∅denotes the null prompt. lying principles of Hallo4D. At the core of Hallo4D lies In practice, negative prompts P −(Du et al., 2020) are used a consistency optimization strategy for 3D content gener- instead of ∅to avoid undesired content in the generated sam- ation, which serves as the foundation for addressing a more ples. challenging aspect—achieving spatiotemporal consistency in the 4D domain. Building on this foundation, we first de- scribe our method for enhancing multi-view consistency in 3.2 Score Distillation Sampling 3D generation. We then extend this approach to incorporate temporal coherence, enabling joint optimization across both SDS, first proposed in DreamFusion (Poole et al., 2022), spatial and temporal dimensions. employs vision priors from pre-trained 2D diffusion models to supervise 3D model optimization, establishing itself as a foundational learning paradigm for 3D generation. Given 4.1 Multi-view Appearance Alignment a 3D representation model parameterized by θ and a dif- ferentiable renderer g(θ, c) that generates a rendered image Conventional SDS optimizes isolated single-view images, x from camera pose c, SDS aligns the probability distribu- which contradicts the principle of multi-view simultane- tion of x with the diffusion model prior p(ϕ). Specifically, ity required for consistent 3D representation. This single- SDS introduces a score function ϵϕ(xt; t, P), which predicts view formulation limits cross-view interaction during train- noise ˆϵ for a noisy image xt conditioned on text prompt P. ing, leading to the loss of surface details during denois- The discrepancy between ˆϵ and the injected Gaussian noise ing, as shown in Fig.10. To address this, we propose a

第 7 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 7

4D 优化的初始化

“一只卡通狐狸 增强 : 提示 大型多模态 正在跳舞” 多模态 语言模型 三只异常耳朵 文本提示 3D 内容 360º 视频 查询 LMM 共识与再一致性

多模态 白色:眼睛过度 提示增强 语言模型 :扭曲 再一致性 2D 图像 面部特征 时间 = (可选,取决于 基线) 动画视频 查询 LMM 共识与再一致性

4D 优化

… 采样 增强 … 提示 :粗糙 结果: 多模态 OF-Range 再一致性 语言模型 纹理

4D 内容 4D 帧采样 查询 LMM 共识与再一致性

图 3:4D 时空一致性阶段的流程概览。我们首先通过初始化识别出不一致性最严重的视图和帧,以指导早期训练。在训练过程中,我们采用基于光流的帧间采样策略 OF-Range,提高了 4D 生成过程的效率和效果。

通过引入外观注意力机制 AAttn(·) 到去噪函数 ˜ϵϕ(·) 中,替换 U-Net 架构 (Ronneberger et al., 2015) 中的原始自注意力,实现了多视图外观对齐策略。 具体而言,受近期扩散模型进展 (Liu et al., 2024a; Cao et al., 2023) 的启发,这些研究表明自注意力空间中的查询特征主要塑造图像结构和布局,而键值和值特征影响纹理,我们的方法利用了这一见解。如图 2 左下角所示,我们基于相机位姿选择一个焦点视图 i,使用该视角的图像在注意力模块中提供键值和值特征。这些特征用于计算所有视图的查询特征,从而确保外观对齐。交叉注意力定义如下公式: QKTi 其中 AAttn(·) 是外观注意力,Ki 和 AAttn(Q, Ki, Vi) = Softmax √ · Vi, (5) d Vi 分别对应于从焦点视图 i 渲染的图像的键值和值特征,Q 为所有视图的查询特征。键值和值源自焦点视图,而四个视图中的每一个计算不同的查询。通过联合渲染和处理来自多个视角的图像,我们的方法实现了视图感知的去噪,并增强了视图间的外观一致性,优于传统的单视图 SDS 方法 (Poole et al., 2022; Wang et al., 2022)。

4.2 多模态幻觉检测 现有的 3D 生成方法常常受到空间不一致性的困扰,这主要是由于 2D 预训练模型在理解 3D 几何结构方面存在固有的局限性。在 4D 生成中,这一问题变得更加突出,因为时间动态进一步放大了空间伪影。此外,虽然 3D 生成受益于相对标准化的 SDS 框架 (Poole et al., 2022),但 4D 生成缺乏统一的范式。其多样化的条件输入——从文本、图像和视频到 3D 资产——结合任务的高维性质,导致了碎片化且泛化能力较差的解决方案。这种各方法间缺乏连贯性阻碍了它们直接应用于现有框架,凸显了对可插拔且广泛兼容的一致性优化策略的需求。

为了弥补这一差距,我们提出了一种不一致性检测模块——多模态幻觉检测,该模块利用 LMMs 分析多视图和多帧渲染结果——作为 4D 生成的共同基础。得益于近期 LMMs (Li et al., 2024a) 强大的跨模态推理和时间理解能力,并与近期在多模态幻觉评估和检测方面的进展 (Chen et al., 2026) 相一致,我们的方法基于以下假设:LMMs 能够有效检测并帮助缓解时空不一致性。为了验证这一假设,我们设计了一个基于查询的两阶段评估,评估三个关键方面:空间结构推理、多视图不一致性诊断以及时间不一致性定位。如图所示

第 8 页

如图4所示,大型多模态语言模型 (LMMs) 即使没有显式的几何监督,也能准确识别3D渲染图和视频帧之间的不一致性。重要的是,我们对 LMMs 的使用是刻意受限的:在受控设置下(单一前景主体、固定轨道相机、标准化提示词),它们仅作为轻量级的视图/帧级一致性检查器,需要进行模式层面的比较,而非完整的3D重建。这与它们的预训练方式相一致,即从多视图/3D数据中提供跨视图先验。具体而言,LLaVA-OneVision-72B (Li et al., 2024a) 是在与多视图/3D相关的语料库上训练的,包括 (Dai et al., 2017; Caesar et al., 2020; Shridhar et al., 2020; Suhr et al., 2019; Jhamtani and Berg-Kirkpatrick, 2018; Hosseinzadeh and Wang, 2021; Azuma et al., 2022),从而提供了由我们流水线利用的跨视图和3D定位先验。为了稳定并标准化输出,我们采用带有参考模板的单步思维链提示 (Chain-of-Thought prompting) (Brown et al., 2020),从中提取指定的目标视图/帧以及相应的负向提示词。

这引发了在基于分数蒸馏采样 (SDS) 的训练中应用图像空间校正的理论有效性的担忧。最近的工作 (Kingma et al., 2021; Deng et al., 2024) 表明,扩散模型可以被重新解释为直接预测图像,而不是对噪声进行去噪。受此观点的启发,我们重新审视 SDS 的基础公式,以探讨是否可以将其一致地扩展到图像空间。

从 DDPM 开始,通过将公式 (1) 的表达式代入公式 (4) 以替换 $\epsilon$,我们得到以下方程:

$$ \nabla_\theta L_{SDS}(\phi, x) \triangleq \mathbb{E}_{t,\epsilon} w(t) \left[ \hat{\epsilon}_\phi(x_t; t, P) – \frac{x_t – \sqrt{\alpha_t} x_0}{\sqrt{1-\alpha_t}} \right] \tag{9} $$

$$ \triangleq \mathbb{E}_{t,\epsilon} w'(t) \left[ x_0 – \hat{x}_{\phi,0} \right] \frac{\partial x}{\partial \theta}, $$

其中

$$ \hat{x}_{\phi,0} = x_t – \sqrt{1-\alpha_t} \hat{\epsilon}_\phi(x_t; t, P), \quad w'(t) = \frac{\sqrt{1-\alpha_t}}{\sqrt{\alpha_t}} w(t). \tag{10} $$

在我们的框架中,我们考虑三种类型的输入:单张渲染图像 $x_r$、从3D物体渲染生成的多视图视频 $x_v$,以及按时间顺序排列的前视图视频 $x_f$,每种输入都配有一个3D感知查询提示 $P_I = \{P_{Ir}, P_{Iv}, P_{If}\}$。LMM 处理这些输入以生成增强型负向提示词 $P^E_-$,随后用于指导图像空间校正。基于这一基础,我们推导出了 SDS 的图像空间公式,从而确立了直接在渲染图像上操作的方法论有效性。然而,现有的图像编辑方法主要集中于操纵空提示词 (null prompt) (Mokady et al., 2023) 或修改

计算由下式给出: 验证正向提示(Hertz et al., 2022),这些方法在改变从3D模型渲染的2D图像的几何结构方面通常无效。为了克服这一局限性,我们提出了一种新颖的模块,称为提示增强重一致性(Prompt-Enhanced Re-consistency),它引入 $P_E^-$ 以增强渲染输出的几何保真度。

$P_E = D_\psi(x_r, PI_r), \quad (6)$

其中 $D_\psi$ 表示由 $\psi$ 参数化的 LMM。对于4D生成,LMM 还会对视图和帧进行不一致性推理:

$P_E^- = D_\psi(x_v, PI_v), \quad (7)$

$P_E^- = D_\psi(x_f, PI_f), \quad (8)$

其中 $v^*$ 是多视图渲染中的不一致视图,$\tau^*$ 是动画视频中检测到的不一致帧,$\tau_{a1}$ 和 $\tau_{a2}$ 是具有显著运动差异的相邻帧,且 $\tau_m \in \{\tau_{a1}, \tau_{a2}\}$ 是产生不一致性的帧。为了清晰起见,我们省略了不同 $P_E$ 变体之间的显式区分。

具体而言,为了保留 $x_0$ 的原始语义信息,我们采用 DDIM (Song et al., 2022) 将图像 $x_0$ 逆向其噪声表示 $x_T$,如下所示。

$\hat{x}_{t-1} = \frac{\sqrt{\alpha_{t-1}}}{\alpha_t} \hat{x}_t + \delta_t \tilde{\epsilon}_\phi(\hat{x}_t; t, P, P_E^-), \quad (11)$

$\delta_t = \sqrt{\frac{1-\alpha_{t-1}}{1-\alpha_t}} \left( \sqrt{1-\frac{\alpha_t}{\alpha_{t-1}}} – \sqrt{1-\alpha_t} \right), \quad (12)$

随后,我们应用 DDIM 采样从 DDIM 逆表示 $x_T$ 重新生成图像的一致版本,记为 $\hat{x}_0$。这种方法还确保重新生成的图像在提高其多视图一致性的同时保留其核心语义完整性,并且可以通过数学归纳法轻松推导出:

$\hat{x}_0 = \sqrt{\frac{\alpha_0}{\alpha_T}} x_T + \sum_{i=1}^T \kappa_i \tilde{\epsilon}_\phi(\hat{x}_t; t, P, P_E^-), \quad (13)$

$\kappa_i = \sqrt{\frac{\alpha_0(1-\alpha_{i-1})}{\alpha_{i-1}}} – \sqrt{\frac{\alpha_0(1-\alpha_i)}{\alpha_i}}, \quad (14)$

4.3 基于共识的提示增强重一致性

在4.2节中引入了增强型负提示 $P_E^-$ 后,提高一致性的一个自然方法是直接在渲染视图上应用2D图像编辑技术。然而,出现了一个概念上的差距:虽然图像编辑在像素空间中操作,但大多数基于 SDS 监督3D模型的3D生成管线通过噪声空间进行监督。这种明显的不匹配

第 9 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 9

空间结构推理能力 这张图像是由 AI 生成的 3D 渲染图,你可以观察图中物体的空间结构,查看其身体形态、透视、表面纹理、颜色等是否存在不一致之处。 整张照片,尤其是舞者的面部,都很模糊。图中的主体令人困惑,可能存在结构不一致的问题。 你是一位图形修复大师。基于上述分析,将 3D 不一致问题总结为负向提示词,以修复我提供的图像。参考如下: 负向提示词:“多头、不自然的灯光、平滑的外观、扭曲的颜色、长脖子”。 负向提示词:“模糊的背景、重复的特征、边缘不清晰、缺乏细节清晰度、人工物体”。

多视图不一致诊断能力 该视频由 3D 对象不同视角的 AI 生成渲染图组成。请验证视图间的一致性……(同上) 第四视图表现出明显的双面人问题(Janus problem),鹰显示了两个头部,表明存在其他视图中没有的严重语义不一致。 你是一位图形修复大师。基于上述分析,指出不一致的视图,并将 3D 不一致问题总结为负向提示词,以修复该视图。参考如下: 视图:“3”;负向提示词:“多头、不自然的灯光、平滑的外观、扭曲的颜色、长脖子”。 视图:“4”;负向提示词:“重复的鹰头、语义不一致、结构伪影、解剖结构错误”。

时间不一致定位能力 该视频由 AI 生成,描绘了一个运动的 3D 对象。请验证帧间的一致性……(同上)此外,检查是否存在任意两个连续帧之间运动差异过大,可能导致其中一帧不稳定或崩溃的情况。 第 3 帧表现出明显的崩溃,面部严重扭曲并伴有运动模糊伪影。此外,第 2 帧由于从第 1 帧到第 2 帧的大运动过渡,手部出现模糊。 你是一位视频理解大师。基于上述分析,指出不一致的帧,识别具有大运动差异的连续帧,并指出哪一帧表现出严重问题……(同上) 不一致视图:“4”;负向提示词:“多头、不自然的灯光、平滑的外观、扭曲的颜色、长脖子”。 高运动相邻帧:“3; 3, 4”;负向提示词:“多头、不自然的灯光、平滑的外观”。 不一致视图:“3”;负向提示词:“面部崩溃、头部扭曲、多层面部特征”。 高运动相邻帧:“2; 1, 2”;负向提示词:“运动模糊、涂抹的手、低清晰度手部区域”。

图 4:一个多模态推理案例研究,旨在评估 LMMs 在空间结构推理、多视图不一致诊断和时间不一致定位方面的能力。第一轮对话表明 LMMs 具备必要的推理能力,而第二轮则说明 LMMs 能够以特定格式生成响应,从而使得后续可以使用正则表达式提取负向提示词以及相关的目标视图或特定帧进行处理。

与此同时,单次图像编辑的一个实际局限性在于,它可能会引入随机编辑噪声或局部过度校正,并且反复依赖单一编辑输出会累积误差,特别是在编辑模型不完美的情况下。为了减少对任何单一编辑的过度依赖,我们借鉴 LMMs 共识选择器(LMM Consensus Selector)的思想,在提示增强重一致性(Prompt-Enhanced Re-consistency)中增加了一个基于共识的选择模块。与其只生成一个 $\hat{x}_0$,我们通过改变编辑随机性(包括 DDIM 采样噪声和时间步长)来生成一组候选编辑图像:

$$ \mathcal{X}_{cand} = \{\hat{x}_0^{(1)}, \hat{x}_0^{(2)}, \dots, \hat{x}_0^{(n)}\}, \quad (15) $$

然后,我们引入一个由 LMMs 组成的评估器集成 $\mathcal{D}_{eval}^{\psi} = \{\mathcal{D}_{eval}^{\psi_1}, \dots, \mathcal{D}_{eval}^{\psi_m}\}$,每个评估器独立地对候选图像进行评分,评分依据包括:(i) 结构完整性,(ii) 提示词对齐,以及 (iii) 在与我们检测器相同的受限设置下的跨视图/时间合理性。每个评估器选择其首选候选者的索引:

$$ \gamma_k = \arg \max_{\gamma} S(\gamma)_k, \quad S(\gamma)_k = \mathcal{D}_{eval}^{\psi_k}(\hat{x}_0^{(\gamma)}, \mathcal{P}_S) \quad (16) $$

其中 $k \in [m]$,$S(\gamma)_k$ 表示第 $k$ 个 LMM 对第 $\gamma$ 张图像分配的分数,$\mathcal{P}_S$ 表示提供给 LMMs 的评分提示词。然后我们聚合评估器之间的投票:

$$ \text{Vote}(\hat{x}_0^{(\gamma)}) = \sum_{k=1}^{m} \mathbb{I}[\gamma_k = \gamma], \quad (17) $$

最终修正图像通过多数投票选择:

$$ \hat{x}_0^* = \arg \max_{\gamma} \text{Vote}(\hat{x}_0^{(\gamma)}), \quad (18) $$

这种共识机制明确针对单一编辑引入细微伪影且

第 10 页

10 H. Wang et al.

Over-Exposure

Baselines

图 5: 提示增强一致性(Prompt-Enhanced Reconsistency)中的注意力可视化。左侧:图像显示了一个不一致的渲染视图。中间和右侧:图像可视化了基于 DDIM 反转的图像编辑模型中 U-Net 的注意力,中间和最右侧的图像分别对应早期($t \rightarrow T$)和晚期($t \rightarrow 0$)的扩散步骤。显然,随着扩散的进行,注意力逐渐减少了对不一致区域的关注。

Under-Exposure

Baselines

Hallo4D

Hallo4D

图 6: 过曝光(over-exposure)和欠曝光(under-exposure)情况的示意图。基线方法在非正面视图中表现出视图依赖性崩溃,产生白屏/黑屏帧;而 Hallo4D 通过 CSEA 和 LDR 损失,在不同视角下保持了稳定的曝光并保留了结构。

很难通过数值检测,但被多个独立的 LMM 一致惩罚,从而提高了鲁棒性并减少了优化迭代过程中错误累积的风险。

最后,我们在图像空间中,使用 $x_0$ 和 $\hat{x}_0$ 之间的 MSE 损失 $L_{CG}$ 来训练 3D 模型 $\theta$:

$L_{CG} \triangleq \mathbb{E} [|\hat{x}^*_0 – x_0|^2]$, (19)

其中 $w_1$ 设置为平衡 $L_{SDS}$ 和 $L_{CG}$ 的幅度。通过结合公式 (9) 和公式 (19),只要 $\hat{x}_0$ 表现出比 $x^\phi_0$ 更强的视图一致性和与真实语义更好的对齐,我们的方法的有效性就可以从理论上得到证明。为了支持这一点,我们可视化了公式 (13) 中间步骤的注意力图,如图 5 所示。可以看出,在编辑的早期阶段,注意力覆盖了图像中的整个狐狸;而在后期阶段,对不一致区域(如狐狸头顶的第三只耳朵)的关注显著减少。这表明基于负面提示的图像编辑技术有效地纠正了渲染图像中的不一致性,产生了与真实语义更好地对齐的细化 $\hat{x}_0$。整体过程如图 2 所示。

此外,值得注意的是,我们仅在渲染图像展现出完整的语义结构时才应用提示增强一致性(Prompt-Enhanced Reconsistency)。我们的检测器 $D_\psi$ 评估图像的语义完整性。如果语义结构被认为不完整或不清晰,$D_\psi$ 返回 None,从而排除进一步的处理。这确保了增强仅应用于已充分准备的图像。这种增强过程对语义完整性状态的依赖直接影响 3D 模型最终训练损失的构建,如下文详述:

$L(\theta) = \begin{cases} L_{SDS} + w_1 L_{CG}, & \text{if } D_\psi(x, P_I) \neq \text{None}, \\ L_{SDS}, & \text{otherwise}, \end{cases}$ (20)

通过纳入 $L_{CG}$,该损失仅在 $D_\psi$ 确认图像的语义就绪状态时才应用,我们确保模型专注于增强结构良好的图像。这种 $L_{CG}$ 的选择性应用防止了进一步恶化已经质量较差的图像。同时,它避免了将资源错误地分配给那些无法从预期增强中受益的图像,从而提高了我们训练过程的效率和有效性。

4.4 4D 优化的初始化

如第 4.2 节所述,与 3D 对应物相比,4D 生成面临着更严峻的时空一致性挑战。通过我们的实验,我们进一步观察到,4D 生成中多样化的输入模态——无论是来自 3D 对象还是动画视频——都可能独立引入导致错误传播并降低最终输出质量的 inconsistency。这凸显了在模型训练期间进行早期干预的必要性。为了解决这个问题,我们提出了一种用于 4D 优化的初始化策略,该策略预处理 3D 内容和动画视频中的不一致性,从而减轻后续 4D 训练过程中的错误累积。

具体而言,对于 4D 生成输入中的 3D 对象,我们以 45° 的间隔采样八个周围视图,并按顺序连接它们以形成视频。然后,该视频

第 11 页

Hallo4D: 用于一致时空生成的多模态幻觉缓解 11

输入到 LMM 中,LMM 被查询以识别存在不一致的视角,并将问题总结为负面提示,从而得到 $v^*, PE^-$。对于动画视频,直接将其输入 LMM,要求 LMM 识别出不一致帧 $\tau^*$、具有显著运动的相邻帧对 $\tau_{a1}, \tau_{a2}$,以及该帧对中因大幅运动导致不一致的具体帧 $\tau_m$。这些不一致线索随后被总结为相应的 $PE^-$。该过程在公式 (7) 中形式化,并在图 3 中说明。此外,我们将提示增强重一致性模块(Prompt-Enhanced Re-Consistency module)应用于识别出的不一致视角或帧,并遵循公式 (19) 计算相应的损失项 $L_{CG-init}$,该损失项在训练迭代的前 10% 期间以加权方式应用于基线之上。公式如下: $$ L_{4D}(\theta) = \begin{cases} L(\theta) + w_2 L_{CG-init}, & \text{if } e < 10\%E, \\ L(\theta), & \text{otherwise}, \end{cases} \quad (21) $$ 其中 $w_2$ 是平衡不同损失项规模的加权因子,$e$ 表示当前训练轮次,$E$ 表示总训练轮次。

fed into the LMM, which is queried to identify the view exhibiting inconsistency and to summarize the issue as a negative prompt, yielding $v^*, PE^-$. For the animated video, it is directly input to the LMM, which is asked to identify the inconsistent frame $\tau^*$, the pair of adjacent frames with significant motion $\tau_{a1}, \tau_{a2}$, and the specific frame $\tau_m$ within the pair where the inconsistency occurs due to large motion. These inconsistency cues are then summarized into the corresponding $PE^-$. The process is formalized in Eq. (7) and illustrated in Fig. 3. In addition, we apply the Prompt-Enhanced Re-Consistency module to the identified inconsistent views or frames, and following Eq. (19) compute the corresponding loss term $L_{CG-init}$, which is weighted and applied during the first 10% of training iterations on top of the baseline. The formulation is as follows: $$ L_{4D}(\theta) = \begin{cases} L(\theta) + w_2 L_{CG-init}, & \text{if } e < 10\%E, \\ L(\theta), & \text{otherwise}, \end{cases} \quad (21) $$ where $w_2$ is a weighting factor that balances the scale of different loss terms, $e$ denotes the current training epoch, and $E$ represents the total number of training epochs.

4.5 OF-Range based Sampling Strategies

Although multi-modal hallucination detection via LMMs enables accurate identification of spatiotemporal inconsistencies, querying LMMs incurs non-negligible computational overhead, making full-frame or full-view detection impractical at every training epoch. In 3D generation, we alleviate this by randomly selecting one view per epoch. However, this strategy is unreliable for 4D keyframe selection: as noted in Sec. 4.4, the known frames $\tau_m$ and $\tau^*$ are easily oversampled, reducing optimization efficiency. Meanwhile, extensive research (Lai et al., 2018; Huang et al., 2023; Yang et al., 2024b) underscores the importance of effective frame selection for maintaining temporal consistency. A natural solution is to detect keyframes based on geometric changes across time. However, synthesized 3D objects often exhibit free-form motion without rigid-body assumptions, and localized deformations cannot be reliably captured by explicit geometric features.

Therefore, we propose OF-Range, an optical flow-based inter-frame sampling strategy that improves both the efficiency and effectiveness of the 4D generation process. Specifically, we begin by rendering a sequence of front-view frames from the 4D asset, resulting in a frame set. For each frame $\tau$, we extract Shi-Tomasi corner (Jianbo Shi and Tomasi, 1994) features $C_\tau = \{c_j\}$ from geometrically stable interior regions, leveraging cross-frame coherence while avoiding transient surfaces that may introduce reconstruction ambiguity. Optical flow vectors $\{v_j\}$ between consecutive frames are then computed using the Lucas-Kanade method (Lucas and Kanade, 1981). These are used to define a deformation-sensitive motion saliency score: $$ S_\tau = \frac{\sum_j \exp(-\lambda d(c_j, \Gamma_\tau)) |v_j|}{\sum_j \exp(-\lambda d(c_j, \Gamma_\tau))}, \quad (22) $$ where $\exp(-\lambda d(c_j, \Gamma_\tau))$ is a spatial confidence weight that decays exponentially with the Euclidean distance $d(c_j, \Gamma_\tau)$ from each feature point $c_j$ to the nearest unstable boundary region $\Gamma_\tau$. This weighting mechanism suppresses noisy motion near volatile areas while amplifying deformation cues from stable regions.

Given that most 4D generation models operate on short sequences (typically $n < 15$) due to GPU memory constraints, it is crucial to prevent selection bias and avoid repeatedly sampling frames near the previously identified keyframes $\tau_m$ and $\tau^*$. To this end, we formulate keyframe selection as a regularized stochastic optimization problem: $$ \hat{\tau} = \arg \max_{\tau} \{ \mathbb{E}[S_\tau] – \gamma I(\tau_m \neq \tau^*) \cdot Q_\tau + G_\tau \}, \quad (23) $$ $$ Q_\tau = \min(|\tau – \tau_m|, |\tau – \tau^*|) / n, \quad (24) $$ where $Q_\tau$ penalizes the selection of frames temporally close to existing keyframes, and $G_\tau \sim \text{Gumbel}(0, 1)$ introduces stochasticity to encourage diverse sampling across epochs. This strategy jointly accounts for motion saliency, temporal diversity, and stochastic exploration, leading to more robust and efficient keyframe selection for 4D training.

4.6 Adaptive Exposure-Aware Semantic Alignment

Hard cases remain a persistent obstacle in 4D generation, with one of the most severe failure modes being view-dependent collapse under non-frontal viewpoints. In our empirical studies, we repeatedly observe that exposure instability—either as a primary error or via propagation through the generation pipeline—can precipitate catastrophic overexposure or underexposure, yielding outputs that are nearly uniform extreme white or black. In such cases, the underlying semantics are largely lost, where recovery is challenging for inversion-based post-hoc procedures. These exposure-driven failure modes are illustrated in Fig. 6.

To address these hard cases, we augment our existing strategy with a contrast-aware reward specifically aimed at stabilizing exposure in challenging views. Because background handling varies across baselines, we first factor out background effects by deriving a soft foreground prior from the alpha channel, $M \in [0, 1]^{H \times W}$, and compositing a foreground-only image $x_{fg}$ onto a neutral canvas $C$: $$ x_{fg} = M \odot x + (1 – M) \odot C, \quad (25) $$ This concentrates optimization on the object—routing gradients primarily through foreground pixels—while the neutral canvas suppresses spurious background influence. To

第 12 页

12 H. Wang et al.

GaussianDreamer SJC DreamFusion-IF Magic3D ProlificDreamer Baselines 90º 270º 90º 270º 90º 270º 90º 270º 90º 270º Hallo4D prompt: An elegant flamingo standing tall with long legs and pinkish-white feathers. Baselines 45º 225º 45º 225º 45º 225º 45º 225º 45º 225º Hallo4D prompt: A sculpture of a dog in medieval style, sitting upright under a spotlight. Baselines 285º 105º 285º 105º 285º 105º 285º 105º 285º 105º Hallo4D prompt: An electric sports car with aerodynamic curves and glossy blue appearance.

图 7: Hallo4D 与基线模型在文本驱动 3D 生成中的定性比较。为了直观比较,我们使用相同且互补的视角来展示结果,其中我们的方法显示出显著的改进。

为了以稳定且可微的方式组合来自多个曝光相关损失分量的信号,我们定义带有参数 $\mu$ 的对数-和-指数算子 (log-sum-exp operator) LSE 为:

$$ \text{LSE}(Z; \mu) = \mu \log \sum_{z \in Z} \exp(z/\mu), \quad (26) $$

该算子表现为一个平滑的最大值函数:对于较小的 $\mu$,它近似于 $Z$ 中最严重的违规项,而较大的 $\mu$ 则产生更柔和的聚合。因此,它提供了一种可调机制,将惩罚集中在最成问题的曝光趋势上,同时不引入不可微性。

具体而言,基于 CLIP 的奖励 $R_c$ 是在仅包含前景的图像 $x_{fg}$ 上使用曝光感知的文本提示计算的。

$$ R_c^+ = \text{CLIP}(P, x_{fg} | P \in \mathcal{P}_\Lambda), \quad (27) $$

其中 $\mathcal{P}_\Lambda = \{\mathcal{P}_\Lambda^+, \mathcal{P}_\Lambda^{\text{over}}, \mathcal{P}_\Lambda^{\text{under}}\}$ 分别表示曝光良好、过曝和下曝的提示,并定义 $R_c^- = \text{CLIP}(P, x_{fg})$ 为相应的 CLIP 分数。这些奖励作为对数-和-指数算子的输入,该算子提供了一种平滑、稳定的手段,用于跨曝光模式组合证据。由此产生的对比语义曝光对齐 (Contrastive Semantic Exposure Alignment, CSEA) 损失鼓励与曝光良好的语义进行强对齐,同时抑制与过曝和下曝语义的对齐,从而产生一个单一的可微目标,将学习集中在最成问题的曝光趋势上。

$$ L_{\text{CSEA}} = -R_c^+ + \text{LSE}(R_c^{\text{over}}, R_c^{\text{under}}; \mu), \quad (28) $$

我们优化一个对比式、曝光感知的目标,将图像拉向曝光良好的描述,同时将其推离过曝和下曝的线索。在优化过程中,梯度被掩码到前景区域,使得背景亮度不会成为目标减少的杠杆:

$$ \nabla_x L_{\text{CSEA}} = M \odot (\partial L_{\text{CSEA}} / \partial x_{fg}), \quad (29) $$

这种门控消除了由背景驱动的退化现象,稳定了物体表面的更新,并确保损失的改进对应于真实的物体级修正,而非曝光技巧。

第 13 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 13

DreamGaussian Hallo4D Zero-1-to-3 Hallo4D Wonder3D Hallo4D

DreamGaussian Hallo4D Zero-1-to-3 Hallo4D Wonder3D Hallo4D

图 8:Hallo4D 与基线模型在图像驱动 3D 生成中的定性比较。为了直观比较,我们放大了具有显著差异的区域,结果表明我们的方法取得了显著改进。

此外,我们通过基于对数动态范围 (LDR) 的损失函数,将渲染外观正则化为目标对比度带宽:

LLDR = | std log(ϑ + Y ) −σ0|, (30)

其中 std(·) 是在前景像素上评估的每图像标准差,Y 表示线性 RGB 域中的逐像素亮度,ϑ > 0 是一个小的稳定器,用于防止暗区出现奇异梯度,σ0 指定了期望的对数亮度标准差。最小化 LLDR 使对比度分布趋向于期望的带宽,抑制对比度不足以及会将高光或阴影推向饱和的过度对比度。

在大量实验中,我们发现存在表观欠曝光实际上是伪欠曝光的情况:在非正面视角的视锥体内出现大片纯黑色的浮动几何体,遮挡了主体。同时,我们经常观察到相机视锥外存在漂浮的杂乱物体。对于视锥外的情况,现有的 3D/4D 管线未对这些区域施加约束——这些图元从未被渲染,未接收 SDS 监督,且在模型导出前保持不可见。为了降低不可预测的生成崩溃风险并有效利用有限的内存,在每次验证过程中,我们应用确定性可见性剪枝,仅保留其中心位于由评估轨迹定义的相机视锥并集 (UoF) 内的图元,并丢弃其余部分。虽然引入此操作是为了抑制视锥外的杂乱物体,但这种简单的 UoF 剪枝也通过移除遮挡非正面视角的纯黑色浮动几何体,缓解了上述伪欠曝光问题,从而提高了 4D 生成管线的鲁棒性。

表 1:文本驱动 3D 生成中的定量比较。

| Methods | CLIP Scores ↑ | | | User Study ↑ | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | | B/32 | B/16 | L/14 | Cons. | Qual. | Align. | | GSD | 21.31 | 22.67 | 23.70 | 6.00 | 5.53 | 5.57 | | +Hallo4D | 24.68 | 27.11 | 30.22 | 9.01 | 8.82 | 8.95 | | SJC | 20.13 | 21.36 | 23.95 | 4.53 | 4.77 | 5.63 | | +Hallo4D | 24.39 | 26.41 | 28.17 | 7.79 | 7.92 | 7.53 | | DF-IF | 14.09 | 15.98 | 18.19 | 4.63 | 4.17 | 4.70 | | +Hallo4D | 22.19 | 23.82 | 26.80 | 6.41 | 7.50 | 7.12 | | Magic3D | 14.93 | 16.41 | 17.99 | 5.13 | 4.60 | 5.17 | | +Hallo4D | 22.14 | 24.35 | 27.83 | 7.61 | 8.06 | 7.40 | | P.Dreamer | 22.45 | 24.18 | 26.85 | 4.17 | 8.50 | 7.26 | | +Hallo4D | 25.71 | 28.42 | 31.49 | 7.64 | 9.37 | 9.23 |

5 实验

在本节中,我们在 3D 和 4D 生成任务上对 Hallo4D 进行了全面评估,展示了与基线模型的对比结果以证明其有效性。为了进一步展示 Hallo4D 在增强 3D 多视图一致性和 4D 时空一致性方面的能力,我们还进行了广泛的用户研究。最后,我们进行了消融实验,以验证所提出框架中每个组件的必要性。

5.1 实验设置

实现细节。我们将公式 (20) 中的 w1 设置为 0.1,并在训练过程中将公式 (21) 中的 w2 从 0.1 衰减至 0.01。此外,

第 14 页

14 H. Wang et al.

Consistent4D Baselines

Hallo4D

DreamGaussian4D Baselines

Hallo4D

4D-FY Baselines

Hallo4D

Fig. 9: Qualitative comparison in 4D generation of Hallo4D and baseline models. Among them, Consistent4D and DreamGaussian4D are image-to-4D methods, while 4D-FY is a text-to-4D generation approach.

由于存在 LCG-init,我们对公式 (23) 中的 $R_\tau$ 应用衰减权重,将其从 1 降低至 0.0001。为了在图 5 中选择焦点视图,我们使用相机的垂直视场角 (Fovy),选择 Fovy 超过基线默认值 120% 的第一个视图。对于 LMM 推理,我们采用简化的设置,仅使用一次交互以提高效率——将图 4 中的两阶段对话合并为一次。为了与现有基线中使用的通用负面提示保持一致 (Yi et al., 2023; Wang et al., 2022; Poole et al., 2022; Tang et al., 2023a; Lin et al., 2023; Liu et al., 2023b),我们采用:“不自然的颜色、照明不佳、低质量、伪影、平滑纹理”。对于 MLLM 共识选择器,我们在每次传递中生成四个候选图像,并采用四个 LMM 的集成进行评分。对于曝光调整,我们将 LSE 温度设置为 $\mu = 0.06$。$P_\Lambda$ 中的提示由 LMM 在优化前进行定制。我们在线性 RGB 域中计算亮度,公式为 $Y = 0.2126R + 0.7152G + 0.0722B$,并经验性地选择 $\vartheta = 0.01$ 和 $\sigma_0 = 0.9$。我们使用 LLaVA-OneVision-72B (Li et al., 2024a) 作为该任务的 LMM 骨干网络。所有实验均在 NVIDIA A100 GPU 上进行。

基线。我们将我们的方法与几种成熟的基线进行了评估,这些基线在各种框架中均表现出强大的性能。其中包括文本到 3D 模型,如 GaussianDreamer (Yi et al., 2023)、Score Jacobian Chain (SJC) (Wang et al., 2022)、DreamFusion-IF (Poole et al., 2022)、Magic3D (Lin et al., 2023) 和 ProlificDreamer (Wang et al., 2023),以及图像到 3D 模型,如 DreamGaussian (Tang et al., 2023a)、Zero-1-to-3 (Liu et al., 2023b) 和 Wonder3D (Long et al., 2023)。我们还包含了基于 NeRF (Mildenhall et al., 2022) 和 3DGS (Kerbl et al., 2023) 的方法,以进行全面比较。对于 4D 生成,我们采用了该领域最具代表性和最高效的模型——DreamGaussian4D (Ren et al., 2023)、4DFY (Bahmani et al., 2024b) 和 Consistent4D (Jiang et al., 2023b)——作为我们的基线,包括文本到 4D 和图像到 4D 方法。为了公平比较,我们保持了相同的参数配置和种子值,并使用基线开源实现中的默认超参数。我们使用了 Threestudio 库 (Guo

第 15 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 15

表 2:图像驱动 3D 生成的定量比较。

| Methods | CLIP Scores ↑ <br> B/32 | CLIP Scores ↑ <br> B/16 | CLIP Scores ↑ <br> L/14 | Objective Metrics <br> CD ↓ | Objective Metrics <br> Vol. IoU ↑ | Objective Metrics <br> PSNR ↑ | Objective Metrics <br> SSIM ↑ | Objective Metrics <br> LPIPS ↓ | User Study ↑ <br> Cons. | User Study ↑ <br> Qual. | User Study ↑ <br> Align. | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | DreamGaussian | 31.77 | 32.13 | 32.94 | 0.0185 | 0.5861 | 16.502 | 0.8543 | 0.2025 | 8.40 | 9.23 | 8.55 | | +Hallo4D | 32.14 | 35.03 | 35.68 | 0.0185 | 0.6116 | 16.530 | 0.8801 | 0.1734 | 9.29 | 9.66 | 9.13 | | Zero-1-to-3 | 24.45 | 25.17 | 26.01 | 0.0370 | 0.4824 | 13.433 | 0.7210 | 0.3926 | 7.25 | 6.10 | 8.30 | | +Hallo4D | 25.13 | 25.71 | 26.89 | 0.0287 | 0.5614 | 14.939 | 0.7531 | 0.3335 | 7.86 | 7.25 | 9.01 | | Wonder3D | 27.31 | 28.08 | 28.92 | 0.2147 | 0.5218 | 12.258 | 0.7831 | 0.3823 | 8.69 | 8.21 | 8.76 | | +Hallo4D | 28.04 | 28.58 | 29.74 | 0.1917 | 0.5946 | 14.312 | 0.8010 | 0.3019 | 9.09 | 9.40 | 9.26 |

表 3:4D 生成的定量比较。

| Methods | CLIP Scores ↑ <br> B/32 | CLIP Scores ↑ <br> B/16 | CLIP Scores ↑ <br> L/14 | User Study ↑ <br> Cons. | User Study ↑ <br> Qual. | User Study ↑ <br> Align. | | :— | :— | :— | :— | :— | :— | :— | | Cons.4D | 22.34 | 23.05 | 23.72 | 5.17 | 6.91 | 8.60 | | +Hallo4D | 25.31 | 26.12 | 26.84 | 8.02 | 8.65 | 9.32 | | DG4D | 28.62 | 29.03 | 29.87 | 6.16 | 6.25 | 8.02 | | +Hallo4D | 32.14 | 33.02 | 33.71 | 8.82 | 8.94 | 9.49 | | 4DFY | 19.83 | 20.46 | 21.07 | 3.42 | 4.93 | 7.11 | | +Hallo4D | 28.52 | 29.21 | 29.65 | 8.17 | 8.51 | 9.08 |

et al., 2023) 用于 SJC 和 Magic3D,以及其他方法的官方代码库。

指标。在 3D 和 4D 生成中,缺乏真实参考数据长期以来阻碍了用于评估视角一致性和时空一致性的广泛接受的定量指标的发展。在回顾了大量现有文献后,我们采用 CLIP-Score (Radford et al., 2021) 作为主要评估指标。此外,对于图像到 3D 的任务,我们遵循先前工作 (Long et al., 2023; Wu et al., 2024b) 建立的实验设置,这得益于 GSO (Downs et al., 2022) 和 Objaverse (Deitke et al., 2022) 数据集的可用性。这包括使用 Chamfer Distance (CD) 和 Volume IoU (Vol. IoU) 评估真实形状与重建形状之间的几何准确性,并使用 PSNR、SSIM (Zhou Wang et al., 2004) 和 LPIPS (Zhang et al., 2018) 评估视觉质量。

5.2 与基线方法的定性比较

我们在三项主要任务中全面比较了 Hallo4D 与一系列基线方法:文本到 3D(图 7)、图像到 3D(图 8)和 4D 生成(图 9)。对于每项任务,我们直接将基线模型的原始输出与应用我们的 Hallo4D 优化后的输出进行比较。为了确保公平评估,我们没有修改基线的原始配置或生成过程。在所有场景中,Hallo4D 在几何保真度和一致性方面均显示出显著改进。在 3D 任务中,它产生了更清晰的纹理、更稳定的结构,并显著缓解了典型的 Janus problem(双面人问题),例如多头或多余肢体扭曲。在 4D 生成中,Hallo4D 实现了更高的时空连贯性,帧间不一致性或身份闪烁现象更少。值得注意的是,对于文本驱动的 4D 生成,Hallo4D 相比 4D-FY 显示出明显优势,显著减少了几何坍塌和时间漂移。这些结果突显了 Hallo4D 在不同生成条件和模态下的鲁棒性和泛化能力。

5.3 与基线方法的定量比较

计算结果。遵循 (Yi et al., 2023; Qiu et al., 2023a; Tang et al., 2023a),我们使用 ChatGPT (OpenAI, 2022) 生成了 80 个独特的 3D 提示词,并在 z 轴周围以 360 度配置均匀排列 16 台相机以评估 CLIP-Score。对于 3D 生成,使用所有视图的平均 CLIP-Score 来评估多视图一致性;而对于 4D 生成,我们计算所有帧的平均 CLIP-Score 以评估时空一致性。对于图像条件模型,我们从 GSO (Downs et al., 2022) 和 Objaverse (Deitke et al., 2022) 中选择了 60 个对象,替换了过于简单的实例,以确保更具挑战性和全面的评估。每个对象均以 256×256 的分辨率从正面渲染,并用作输入以计算 CD、Vol. IoU、PSNR、SSIM (Zhou Wang et al., 2004) 和 LPIPS (Zhang et al., 2018),从而评估几何准确性和视觉质量。需要注意的是,图像驱动生成中对应于正面视图的真实值的存在通常会导致更高的生成质量。文本到 3D、图像到 3D 和 4D 生成的定量结果分别展示在表 1、表 2、

第 16 页

16 H. Wang et al.

Hallo4D Hallo4D

w/o AAttn dark bright w/o Init-4D

w/o LMM-D

w/o Re-Cons. w/o OF-Range

w/o &

Fig. 10: Hallo4D 的消融研究。我们通过从完整模型中依次移除每个模块来进行定量消融研究,证实了模块化设计在实现高质量时空生成方面的必要性和有效性。

Table 4: 定量消融研究。 提供了一种直观且沉浸式的评估时空 一致性的方法。最终得分是通过平均用户 CLIP 分数 ↑ 用户研究 ↑ 评分获得的,如表 1、表 2 和 Modules 表 3 的最后一列所示。结果表明,Hallo4D 相比基线模型取得了显著改进,进一步验证了 3D Baseline 21.27 22.67 23.71 6.00 5.53 5.57 我们方法的有效性。 w/o AAttn 23.98 25.88 29.36 7.64 7.79 7.93

w/o LMM-D 23.65 25.10 28.71 7.25 7.32 7.53 w/o Re-Cons. 22.46 23.59 26.92 6.83 7.01 6.80 5.4 消融研究 w/o & PE− 22.23 23.23 25.58 6.54 6.69 6.43 Hallo4D 24.45 26.83 30.00 8.87 8.67 8.87 我们对 Hallo4D 的各个模块进行了消融实验,如图 10 所示。从完整模型开始,我们独立移除每个模块以评估 4D Baseline 28.62 29.03 29.87 6.16 6.25 8.02 其影响。为了清晰起见,我们将 AAttn 表示为多视图外观对齐(Multi-view Appearance Alignment),将 LMM-D 表示为多模态幻觉检测(Multi-modal Hallucination Detection),将 Re-Cons. 表示为提示增强的一致性(Prompt-Enhanced Re-Consistency),将 Init-4D 表示为 4D 优化的初始化(Initialization for 4D Optimization)。值得注意的是,在“w/o Re-Cons.”设置下的 3D 生成中,LMM 输出 PE− 仍然应用于 LSDS 以证明 LCG 的必要性。我们进一步包含了一个“w/o & PE− ”设置,其中完全不使用 P E−,以更清晰地隔离并验证 Re-Cons. 模块的有效性。 and Tab. 3, respectively. The results show that Hallo4D con- where P E− is not used at all, to more clearly isolate and ver- sistently outperforms all baselines across all evaluation met- ify the effectiveness of the Re-Cons. module. rics, demonstrating its effectiveness in enhancing spatiotem- In Fig. 10, we evaluate the contribution of each mod- poral consistency for both 3D and 4D generation. ule. Removing AAttn leads to noticeable brightness imbal- User study. We conducted a user study with 58 vol- unteers specializing in artificial intelligence to evaluate the ance and unnatural color shifts, which affect texture fi- quality of generated 3D and 4D content. To facilitate com- delity. Modules LMM-D and Re-Cons. are critical for en- prehensive comparison, participants were asked to rate each suring cross-view consistency: without LMM-D, the lion’s model on three criteria—“Multi-view Consistency,” “Over- head is visibly deformed or missing across views; without all Quality,” and “Alignment with Prompt”—using a 10- Re-Cons., duplicated facial features and extra limbs appear. point scale. For 3D generation, each asset was rendered at When both Re-Cons. and PE− are removed (“w/o & PE− ”), 15° intervals and compiled into a video to visualize view these artifacts become more pronounced, reinforcing the ne- consistency. For 4D generation, we incorporated continuous cessity of LMM-guided correction. The “w/o Init-4D” set- camera rotation during playback, allowing simultaneous ob- ting results in significant degradation of both spatial and servation of spatial and temporal changes. This design of- temporal consistency in 4D generation, highlighting the cru- cial role of initialization in improving early-stage optimiza-

第 17 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 17

此外,移除 OF-Range 模块会削弱来自动画视频的运动线索的影响,导致时间对齐能力下降。

此外,我们进行了全面的消融研究,以验证所提出模块的有效性。具体而言,CESA & LDR 表示自适应曝光感知语义对齐(Adaptive Exposure-Aware Semantic Alignment),而 Consensus 表示 LMM 共识选择器(LMM Consensus Selector)。请注意,我们采用增量消融设置;因此,排除 CESA & LDR 的基线配置也必然省略了 Consensus 模块。消融结果表明,每个组件的顺序集成稳步提高了模型在 4D 生成中的性能。这些模块对于提升整体生成质量至关重要,因为它们提供了针对解决不同技术挑战的特定策略。

为了补充这些定性发现,表 4 展示了定量结果,进一步证实了 Hallo4D 框架中每个模块的必要性和有效性。

6 结论

在本工作中,我们提出了 Hallo4D,这是一个统一且与模型无关的框架,旨在缓解 3D 和 4D 内容生成中的时空幻觉。通过利用 LMMs 的空间和时序推理能力,我们的“生成-检测-校正”范式识别出视图和帧之间的不一致性,并相应地引导图像空间优化。关键在于,为了确保鲁棒的几何保真度并防止单次编辑中固有的误差累积,这些洞察指导了一种由共识驱动的图像空间优化机制。该方法利用 MLLM 共识选择器通过多模型投票来评估多个候选校正方案。为了进一步增强 4D 一致性,Hallo4D 结合了基于光流的关键帧采样策略、LMM 引导的初始化方案以及基于注意力的外观对齐模块。为了解决曝光不稳定性问题,我们引入了两种互补的损失函数——对比语义曝光对齐(CSEA)和对数动态范围(LDR)项——并应用视锥并集可见性剪枝来抑制视外杂乱并减少伪欠曝光。无需重新训练或架构更改,我们的方法在空间和时间维度上均提升了生成质量。大量实验证实,Hallo4D 始终优于强大的基线方法,为一致性感知的 3D 和 4D 生成提供了一种可扩展且有效的解决方案。

参考文献

AlBahar B, Saito S, Tseng HY, Kim C, Kopf J, Huang JB (2023) Single-Image 3D Human Digitization with Shape-

Guided Diffusion. In: SIGGRAPH Armandpour M, Sadeghian A, Zheng H, Sadeghian A, Zhou M (2023) Re-imagine the Negative Prompt Algorithm: Transform 2D Diffusion into 3D, alleviate Janus problem and Beyond. arXiv:230404968 2304.04968 Attaiki S, Guerrero P, Ceylan D, Mitra NJ, Ovsjanikov M (2024) GANFusion: Feed-forward text-to-3D with diffu- sion in GAN space. In: WACV, 2412.16717 Azuma D, Miyanishi T, Kurita S, Kawanabe M (2022) ScanQA: 3D Question Answering for Spatial Scene Un- derstanding. In: CVPR Bahmani S, Liu X, Yifan W, Skorokhodov I, Rong V, Liu Z, Liu X, Park JJ, Tulyakov S, Wetzstein G, Tagliasacchi A, Lindell DB (2024a) TC4D: Trajectory-conditioned text- to-4D generation. In: ECCV, 2403.17920 Bahmani S, Skorokhodov I, Rong V, Wetzstein G, Guibas L, Wonka P, Tulyakov S, Park JJ, Tagliasacchi A, Lindell DB (2024b) 4D-fy: Text-to-4D Generation Using Hybrid Score Distillation Sampling. In: CVPR Barron JT, Mildenhall B, Verbin D, Srinivasan PP, Hedman P (2022) Mip-NeRF 360: Unbounded Anti-Aliased Neu- ral Radiance Fields. In: CVPR Blattmann A, Dockhorn T, Kulal S, Mendelevitch D, Kil- ian M, Lorenz D, Levi Y, English Z, Voleti V, Letts A, Jampani V, Rombach R (2023) Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv:231115127 2311.15127 Brown TB, Mann B, Ryder N, Subbiah M, Kaplan J, Dhari- wal P, Neelakantan A, Shyam P, Sastry G, Askell A, Agar- wal S, Herbert-Voss A, Krueger G, Henighan T, Child R, Ramesh A, Ziegler DM, Wu J, Winter C, Hesse C, Chen M, Sigler E, Litwin M, Gray S, Chess B, Clark J, Berner C, McCandlish S, Radford A, Sutskever I, Amodei D (2020) Language Models are Few-Shot Learners. In: NeurIPS Caesar H, Bankiti V, Lang AH, Vora S, Liong VE, Xu Q, Kr- ishnan A, Pan Y, Baldan G, Beijbom O (2020) nuScenes: A multimodal dataset for autonomous driving. In: CVPR Cao A, Johnson J (2023) HexPlane: A Fast Representation for Dynamic Scenes. In: CVPR Cao M, Wang X, Qi Z, Shan Y, Qie X, Zheng Y (2023) MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing. In: ICCV, 2304.08465 Chen J, Wu Y, Tan J, Ma H, Furukawa Y (2024) Map- Tracker: Tracking with strided memory fusion for con- sistent vector HD mapping. In: ECCV, 2403.15951 Chen Z, Wang F, Liu H (2023) Text-to-3D using Gaussian Splatting. In: CVPR Chen Z, Liu T, Zhuo L, Ren J, Tao Z, Zhu H, Hong F, Pan L, Liu Z (2025) 4DNeX: Feed-Forward 4D Generative Modeling Made Easy. arXiv:250813154 2508.13154

References

AlBahar B, Saito S, Tseng HY, Kim C, Kopf J, Huang JB (2023) Single-Image 3D Human Digitization with Shape-

第 18 页

18 H. Wang et al.

Chen Z, Min Y, Zhang J, Yan B, Wang J, Wang X, Shan S Hertz A, Mokady R, Tenenbaum J, Aberman K, Pritch (2026) A Survey of Multimodal Hallucination Evaluation Y, Cohen-Or D (2022) Prompt-to-Prompt Image Editing and Detection. IJCV 2507.19024 with Cross Attention Control. In: ICLR Chu WH, Ke L, Fragkiadaki K (2024) DreamScene4D: Ho J, Salimans T (2021) Classifier-Free Diffusion Guidance. Dynamic multi-object scene generation from monocular In: NeurIPS videos. In: NeurIPS, 2405.02280 Ho J, Jain A, Abbeel P (2020) Denoising Diffusion Proba- Dai A, Chang AX, Savva M, Halber M, Funkhouser T, bilistic Models. In: NeurIPS Nießner M (2017) ScanNet: Richly-annotated 3D Recon- Hong S, Ahn D, Kim S (2023) Debiasing Scores and structions of Indoor Scenes. In: CVPR Prompts of 2D Diffusion for View-consistent Text-to-3D Deitke M, Schwenk D, Salvador J, Weihs L, Michel O, Van- Generation. In: NeurIPS derBilt E, Schmidt L, Ehsani K, Kembhavi A, Farhadi A Hosseinzadeh M, Wang Y (2021) Image Change Captioning (2022) Objaverse: A Universe of Annotated 3D Objects. by Learning from an Auxiliary Task. In: CVPR In: CVPR, 2212.08051 Huang T, Zhang H, Zeng Y, Zhang Z, Li H, Zuo W, Lau Deng W, Luo W, Tan Y, Biloš M, Chen Y, Nevmyvaka RWH (2024) DreamPhysics: Learning Physics-Based 3D Y, Chen RTQ (2024) Variational Schrödinger Diffusion Dynamics with Video Diffusion Priors. In: AAAI Models. In: ICML, 2405.04795 Huang Z, He Y, Yu J, Zhang F, Si C, Jiang Y, Zhang Y, Deng Y, Yang J, Xiang J, Tong X (2022) GRAM: Generative Wu T, Jin Q, Chanpaisit N, Wang Y, Chen X, Wang Radiance Manifolds for 3D-Aware Image Generation. In: L, Lin D, Qiao Y, Liu Z (2023) VBench: Comprehen- CVPR sive Benchmark Suite for Video Generative Models. In: Di D, Yang J, Luo C, Xue Z, Chen W, Yang X, Gao Y (2025) CVPR, 2311.17982 Hyper-3DG: Text-to-3D Gaussian Generation via Hyper- Jhamtani H, Berg-Kirkpatrick T (2018) Learning to De- graph. IJCV 2403.09236 scribe Differences Between Pairs of Similar Images. In: Downs L, Francis A, Koenig N, Kinman B, Hickman R, EMNLP Reymann K, McHugh TB, Vanhoucke V (2022) Google Ji C, Ye W, Chen Z, Gao J, Huang X, Wang X, Zhang G, Scanned Objects: A High-Quality Dataset of 3D Scanned Zhang S, He T, Ouyang W, Zhao C (2026) DiffPano++: Household Items. In: ICRA, 2204.11918 Scalable and Consistent Multi-View Panorama Genera- Du Y, Li S, Mordatch I (2020) Compositional visual gener- tion with Spherical Epipolar-Aware Diffusion. IJCV ation with energy based models. In: NeurIPS, vol 33 Jianbo Shi, Tomasi (1994) Good features to track. In: CVPR Du Y, Zhang Y, Yu HX, Tenenbaum JB, Wu J (2021) Neural Jiang Y, Tang H, Chang JHR, Song L, Wang Z, Cao Radiance Flow for 4D View Synthesis and Video Process- L (2023a) Efficient-3DiM: Learning a Generalizable ing. In: ICCV Single-image Novel-view Synthesizer in One Day. In: Fan C, Cheng J, Yang W, Li Z, Zhang W, Hu W, Zhang ICLR Y, Zeng P (2026) MOC-3D: Manifold-Order Consistency Jiang Y, Zhang L, Gao J, Hu W, Yao Y (2023b) Consis- for Text-to-3D Generation. arXiv:260501743 2605. tent4D: Consistent 360◦dynamic object generation from 01743 monocular video. In: ICLR, 2311.02848 Fu Y, Liu S, Kulkarni A, Kautz J, Efros AA, Wang X (2023) Jiao S, Lin Y, Zhong Y, She Q, Zhou W, Lan X, Huang Z, COLMAP-Free 3D Gaussian Splatting. In: CVPR Yu F, Yu Y, Zhao Y, Zhao Y, Wei Y (2026) ThinkGen: Gao G, Liu W, Chen A, Geiger A, Schölkopf B (2023) Generalized Thinking for Visual Generation. In: CVPR, GraphDreamer: Compositional 3D Scene Synthesis from 2512.23568 Scene Graphs. In: CVPR Jun H, Nichol A (2023) Shap-E: Generating Conditional 3D Grammatikopoulou M, Sanchez-Matilla R, Bragman F, Implicit Functions. arXiv:230502463 2305.02463 Owen D, Culshaw L, Kerr K, Stoyanov D, Luengo I Kerbl B, Kopanas G, Leimkuehler T, Drettakis G (2023) 3D (2023) A spatio-temporal network for video semantic seg- Gaussian Splatting for Real-Time Radiance Field Render- mentation in surgical videos. IJCARS 2306.11052 ing. ACM Trans Graph 42(4) Guo YC, Liu YT, Shao R, Laforte C, Voleti V, Luo Kingma DP, Salimans T, Poole B, Ho J (2021) Variational G, Chen CH, Zou ZX, Wang C, Cao YP, Zhang Diffusion Models. In: ICML SH (2023) Threestudio. https://github.com/ Laga H, Padilla M, Jermyn IH, Kurtek S, Bennamoun threestudio-project/threestudio, open- M, Srivastava A (2021) 4D Atlas: Statistical Analysis

Guo Z, Zhang R, Li H, Zhang M, Chen X, Wang S, Feng Y, Shape Data. IEEE Trans Pattern Anal Mach Intell 2101. Pei P, Heng PA (2026) Thinking-while-Generating: Inter- 09403

In: CVPR, 2511.16671 MH (2018) Learning Blind Video Temporal Consistency.

  • source project of the Spatiotemporal Variability in Longitudinal 3D
  • leaving Textual Reasoning throughout Visual Generation. Lai WS, Huang JB, Wang O, Shechtman E, Yumer E, Yang

第 19 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 19

收录于:ECCV, 1808.00449 Liu J, Huang H, Cao J, He R (2024a) ZePo: Zero-Shot Li B, Zhang Y, Guo D, Zhang R, Li F, Zhang H, Zhang K, Portrait Stylization with Faster Sampling. In: ACM MM, Zhang P, Li Y, Liu Z, Li C (2024a) LLaVA-OneVision: 2408.05492 Easy Visual Task Transfer. arXiv:240803326 2408. Liu R, Wu R, Hoorick BV, Tokmakov P, Zakharov S, Von- 03326 drick C (2023b) Zero-1-to-3: Zero-shot One Image to 3D Li H, Ma L, Shi H, Hao Y, Liao Y, Cheng L, Zhou P (2024b) Object. In: ICCV 3D-GOI: 3D GAN omni-inversion for multifaceted and Liu T, Huang Z, Chen Z, Wang G, Hu S, Shen L, Sun multi-object editing. In: ECCV, 2311.12050 H, Cao Z, Li W, Liu Z (2025) Free4D: Tuning-free 4D Li H, Shi H, Zhang W, Wu W, Liao Y, Wang L, Lee Lh, Scene Generation with Spatial-Temporal Consistency. In: Zhou P (2024c) DreamScene: 3D gaussian-based text-to- ICCV, 2503.20785 3D scene generation via formation pattern sampling. In: Liu X, Zhou C, Huang S (2024b) 3DGS-enhancer: En- ECCV, 2404.03575 hancing unbounded 3D gaussian splatting with view- Li M, Zhou P, Liu JW, Keppo J, Lin M, Yan S, Xu X (2023) consistent 2D diffusion priors. In: NeurIPS Instant3D: Instant Text-to-3D Generation. IJCV Liu X, Liu J, Wang H, He R, Huang H (2026) Think- Li R, Pan P, Yang B, Xu D, Zhou S, Zhang X, Li Z, Kadambi Then-Generate: Structural Chain-of-Thought Reasoning A, Wang Z, Tu Z, Fan Z (2024d) 4K4DGen: Panoramic for Consistent 3D Generation. In: CVPR 4D generation at 4K resolution. arXiv:240613527 2406. Liu Y, Lin C, Zeng Z, Long X, Liu L, Komura T, Wang W 13527 (2024c) SyncDreamer: Generating Multiview-consistent Li T, Slavcheva M, Zollhoefer M, Green S, Lassner C, Kim Images from a Single-view Image. In: ICLR C, Schmidt T, Lovegrove S, Goesele M, Newcombe R, Liu Z, Feng Y, Xiu Y, Liu W, Paull L, Black MJ, Schölkopf Lv Z (2022) Neural 3D Video Synthesis from Multi-view B (2023c) Ghost on the Shell: An Expressive Representa- Video. In: CVPR, 2103.02597 tion of General 3D Shapes. In: ICLR Li X, Ren Y, Jin X, Lan C, Wang X, Zeng W, Wang Long X, Guo YC, Lin C, Liu Y, Dou Z, Liu L, Ma Y, Zhang X, Chen Z (2025) Diffusion Models for Image Restora- SH, Habermann M, Theobalt C, Wang W (2023) Won- tion and Enhancement: A Comprehensive Survey. IJCV der3D: Single image to 3D using cross-domain diffusion. 2308.09388 In: CVPR, 2310.15008 Li Z, Chen Y, Liu P (2024e) DreamMesh4D: Video-to-4D Lorraine J, Xie K, Zeng X, Lin CH, Takikawa T, Sharp N, generation with sparse-controlled gaussian-mesh hybrid Lin TY, Liu MY, Fidler S, Lucas J (2023) ATT3D: Amor- representation. In: NeurIPS tized Text-to-3D Object Synthesis. In: ICCV Liang F, Wu B, Wang J, Yu L, Li K, Zhao Y, Misra I, Huang Lucas BD, Kanade T (1981) An Iterative Image Registra- JB, Zhang P, Vajda P, Marculescu D (2024a) FlowVid: tion Technique with an Application to Stereo Vision. In: Taming Imperfect Optical Flows for Consistent Video-to- IJCAI, vol 2 Video Synthesis. In: CVPR Miao Q, Li K, Quan J, Min Z, Ma S, Xu Y, Yang Y, Liu Liang H, Yin Y, Xu D, Liang H, Wang Z, Plataniotis P, Luo Y (2025) Advances in 4D Generation: A Survey. KN, Zhao Y, Wei Y (2024b) Diffusion4D: Fast spatial- arXiv:250314501 2503.14501 temporal consistent 4D generation via video diffusion Mildenhall B, Srinivasan PP, Tancik M, Barron JT, Ra- models. In: NeurIPS, 2405.16645 mamoorthi R, Ng R (2022) NeRF: Representing scenes as Liang Y, Yang X, Lin J, Li H, Xu X, Chen Y (2023) Lucid- neural radiance fields for view synthesis. Commun ACM Dreamer: Towards high-fidelity text-to-3D generation via Mokady R, Hertz A, Aberman K, Pritch Y, Cohen-Or D interval score matching. In: CVPR (2023) Null-text Inversion for Editing Real Images using Lin CH, Gao J, Tang L, Takikawa T, Zeng X, Huang X, Guided Diffusion Models. In: CVPR Kreis K, Fidler S, Liu MY, Lin TY (2023) Magic3D: Nichol A, Jun H, Dhariwal P, Mishkin P, Chen M (2022) High-Resolution Text-to-3D Content Creation. In: CVPR Point-E: A System for Generating 3D Point Clouds from Lin Y, Dai Z, Zhu S, Yao Y (2024) Gaussian-Flow: 4D Re- Complex Prompts. arXiv:221208751 2212.08751 construction with Dynamic 3D Gaussian Particle. CVPR OpenAI (2022) ChatGPT Ling H, Kim SW, Torralba A, Fidler S, Kreis K (2024) Ouyang H, Wang Q, Xiao Y, Bai Q, Zhang J, Zheng K, Zhou Align your gaussians: Text-to-4D with dynamic 3D gaus- X, Chen Q, Chen Q (2024) CoDeF: Content Deformation sians and composed diffusion models. In: CVPR, 2312. Fields for Temporally Consistent Video Processing. In: 13763 CVPR Liu F, Wu D, Wei Y, Rao Y, Duan Y (2023a) Sherpa3D: Pan Z, Yang Z, Zhu X, Zhang L (2025) Efficient4D: Boosting High-Fidelity Text-to-3D Generation via Coarse Fast Dynamic 3D Object Generation from a Single-view 3D Prior. In: CVPR Video. IJCV 2401.08742

第 20 页

20 H. Wang 等

Poole B, Jain A, Barron JT, Mildenhall B (2022) DreamFu- Song J, Meng C, Ermon S (2022) Denoising Diffusion Im- sion: Text-to-3D using 2D Diffusion. In: ICLR plicit Models. In: ICLR Pumarola A, Corona E, Pons-Moll G, Moreno-Noguer F Suhr A, Zhou S, Zhang A, Zhang I, Bai H, Artzi Y (2019) A (2020) D-NeRF: Neural Radiance Fields for Dynamic Corpus for Reasoning About Natural Language Grounded Scenes. In: CVPR, 2011.13961 in Photographs. In: ACL Qian G, Mai J, Hamdi A, Ren J, Siarohin A, Li B, Lee HY, Sun J, Wang H, Cao J, Huang H, He R (2026a) Marmot: Skorokhodov I, Wonka P, Tulyakov S, Ghanem B (2023) Object-Level Self-Correction via Multi-Agent Reason- Magic123: One Image to High-Quality 3D Object Gener- ing. Machine Intelligence Research 2504.20054 ation Using Both 2D and 3D Diffusion Priors. In: ICLR Sun J, Wang P, Wang H, Liu X, Huang H, He R (2026b) Qiu L, Chen G, Gu X, Zuo Q, Xu M, Wu Y, Yuan W, Dong Towards Fine-Grained Attribution: Instance-Aware Pref- Z, Bo L, Han X (2023a) RichDreamer: A Generalizable erence Optimization for Aligning Diffusion Models. In: Normal-Depth Diffusion Model for Detail Richness in CVPR Text-to-3D. In: CVPR, 2311.16918 Sun W, Chen S, Liu F, Chen Z, Duan Y, Zhang J, Wang Qiu S, Anwar S, Barnes N (2023b) PnP-3D: A Plug-and- Y (2024) DimensionX: Create any 3D and 4D scenes Play for 3D Point Clouds. IEEE Trans Pattern Anal Mach from a single image with controllable video diffusion. Intell 45(1) arXiv:241104928 2411.04928 Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal Takagi Y, Nishimoto S (2022) High-resolution image recon- S, Sastry G, Askell A, Mishkin P, Clark J, Krueger G, struction with latent diffusion models from human brain Sutskever I (2021) Learning Transferable Visual Models activity. In: CVPR From Natural Language Supervision. In: ICML Tang J, Ren J, Zhou H, Liu Z, Zeng G (2023a) DreamGaus- Raj A, Kaza S, Poole B, Niemeyer M, Ruiz N, Mildenhall sian: Generative Gaussian Splatting for Efficient 3D Con- B, Zada S, Aberman K, Rubinstein M, Barron J, Li Y, tent Creation. In: ICLR Jampani V (2023) DreamBooth3D: Subject-Driven Text- Tang J, Wang T, Zhang B, Zhang T, Yi R, Ma L, Chen D to-3D Generation. In: ICCV (2023b) Make-It-3D: High-Fidelity 3D Creation from A Ren J, Pan L, Tang J, Zhang C, Cao A, Zeng G, Liu Z (2023) Single Image with Diffusion Prior. In: ICCV DreamGaussian4D: Generative 4D Gaussian Splatting. Tong H, Wang H, Liu J, Wang Q, Cao J, He R (2026) arXiv:231217142 abs/2312.17142, 2312.17142 CoGrad3D: Spatially-Coupled Timestep Optimization Ronneberger O, Fischer P, Brox T (2015) U-Net: Convolu- with Orthogonal Gradient Fusion for 3D Generation. In: tional Networks for Biomedical Image Segmentation. In: AAAI MICCAI, 1505.04597 Voleti V, Yao CH, Boss M, Letts A, Pankratz D, Tochilkin D, Ruiz N, Li Y, Jampani V, Pritch Y, Rubinstein M, Aberman Laforte C, Rombach R, Jampani V (2024) SV3D: Novel K (2023) DreamBooth: Fine Tuning Text-to-Image Diffu- Multi-view Synthesis and 3D Generation from a Single sion Models for Subject-Driven Generation. In: CVPR Image using Latent Video Diffusion. In: ECCV Saharia C, Chan W, Saxena S, Li L, Whang J, Denton Wang H, Du X, Li J, Yeh RA, Shakhnarovich G (2022) E, Ghasemipour SKS, Ayan BK, Mahdavi SS, Gontijo- Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Lopes R, Salimans T, Ho J, Fleet DJ, Norouzi M (2022) Models for 3D Generation. In: CVPR Photorealistic Text-to-Image Diffusion Models with Deep Wang H, Cao J, Liu J, Zhou X, Huang H, He R (2024a) Language Understanding. In: NeurIPS Hallo3D: Multi-modal hallucination detection and miti- Seo J, Jang W, Kwak MS, Ko J, Kim H, Kim J, Kim JH, gation for consistent 3D content generation. In: NeurIPS Lee J, Kim S (2023) Let 2D Diffusion Model Know 3D- Wang H, Huang H, Wang P, Hao J, Zhou C, He R (2026) Consistency for Robust Text-to-3D Generation. In: ICLR Coloring the Noise: Adversarial Sobolev Alignment for Shi Y, Wang P, Ye J, Long M, Li K, Yang X (2024) Faithful Image Super Resolution. In: ICML, 2605. MVDream: Multi-view Diffusion for 3D Generation. In: 23264 ICLR Wang J, Ma Y, Guo J, Xiao Y, Huang G, Li X (2024b) Shridhar M, Thomason J, Gordon D, Bisk Y, Han W, COVE: Unleashing the Diffusion Feature Correspon- Mottaghi R, Zettlemoyer L, Fox D (2020) ALFRED: dence for Consistent Video Editing. In: NeurIPS, 2406. A Benchmark for Interpreting Grounded Instructions for 08850 Everyday Tasks. In: CVPR Wang Y, Liu G, Wang X, Chen Z, Li J, Liang X, Sun F, Zhu Singer U, Sheynin S, Polyak A, Ashual O, Makarov I, J (2025) Video4DGen: Enhancing Video and 4D Gener- Kokkinos F, Goyal N, Vedaldi A, Parikh D, Johnson J, ation through Mutual Optimization. IEEE Trans Pattern Taigman Y (2023) Text-to-4D dynamic scene generation. Anal Mach Intell In: ICML, 2301.11280 Wang Z, Lu C, Wang Y, Bao F, Li C, Su H, Zhu J (2023) Pro- lificDreamer: High-Fidelity and Diverse Text-to-3D Gen-

第 21 页

Hallo4D:用于一致时空生成的多模态幻觉缓解 21

与变分分数蒸馏的生成。在:NeurIPS 生成式 4D 高斯。在:ECCV, 2403.14939 Wu G, Yi T, Fang J, Xie L, Zhang X, Wei W, Liu W, Tian Zhang L, Agrawala M (2024) 使用潜在透明度进行透明图像层去 Q, Wang X (2024a) 用于实时动态场景渲染的 4D 高斯溅射。在:CVPR, 2310.08528 融合。ACM Trans Graph Wu K, Liu F, Cai Z, Yan R, Wang H, Hu Y, Duan Y, Ma K Zhang R, Isola P, Efros AA, Shechtman E, Wang O (2018) (2024b) Unique3D:从单张图像高质量高效生成 3D 网格。在:NeurIPS, 2405. 深度特征作为感知度量的不合理有效性。在:CVPR 20343 Zhang T, Yu HX, Wu R, Feng BY, Zheng C, Snavely N, Wu Wu R, Gao R, Poole B, Trevithick A, Zheng C, Barron JT, J, Freeman WT (2024) PhysDreamer:通过视频生成实现基于物理的 Holynski A (2025) CAT4D:使用多视图视频扩散模型在 4D 中创建任何内容。在:CVPR, 2411. 与 3D 对象的交互。在:ECCV, 18613 Zhao M, Zhao C, Liang X, Li L, Zhao Z, Hu Z, Fan C, Yu Wu Z, Zheng J, Ren X, Vasluianu FA, Ma C, Paudel DP, X (2023) EfficientDreamer:通过正交视图扩散先验实现高保真且鲁棒的 3D Van Gool L, Timofte R (2024c) 单模型与任意模态的视频目标跟踪。在:CVPR 创建。在:CVPR Xiang J, Yang J, Huang B, Tong X (2023) 使用 2D 扩散模型进行 3D 感知图像 Zheng Y, Li X, Nagano K, Liu S, Hilliges O, De Mello S 生成。在:ICCV (2024) 文本和图像引导的 4D 场景生成的统一方法。在:CVPR Xiang J, Lv Z, Xu S, Deng Y, Wang R, Zhang B, Chen D, Zhou L, Shih A, Meng C, Ermon S (2023) DreamPropeller: Tong X, Yang J (2025) 用于可扩展和通用 3D 生成的结构化 3D 潜在变量。在:CVPR, 2412.01506 通过并行采样增强文本到 3D 生成。在:CVPR Xie Y, Yao CH, Voleti V, Jiang H, Jampani V (2024) SV4D: Zhou S, Yang P, Wang J, Luo Y, Loy CC (2024a) Upscale- 通过多帧和多视图一致性生成动态 3D 内容。arXiv:240717470 2407.17470 A-Video:用于真实世界视频超分辨率的时间一致扩散模型。在:CVPR Xu D, Liang H, Bhatt NP, Hu H, Liang H, Plataniotis KN, Zhou X, Ran X, Xiong Y, He J, Lin Z, Wang Y, Sun D, Wang Z (2024a) Comp4D:LLM 引导的组合 Yang MH (2024b) GALA3D:通过布局引导的生成式高斯溅射实现文本到 3D 复杂场景生成。在:ICML, 2402.07207 4D 场景生成。arXiv:240316993 2403.16993 Zhou Wang, Bovik A, Sheikh H, Simoncelli E (2004) 图像质量评估:从误差可见性到结构 Xu Z, Zhang J, Liew JH, Yan H, Liu JW, Zhang C, Feng 相似性。Trans Image Processing 13(4) J, Shou MZ (2024b) MagicAnimate:使用扩散模型进行时间一致 Xu Z, Zhang J, Liew JH, Yan H, Liu JW, Zhang C, Feng 的人像动画。在: CVPR J, Shou MZ (2024c) MagicAnimate:使用扩散模型进行时间一致 的人像动画。在: CVPR Yang J, Cheng Z, Duan Y, Ji P, Li H (2023) ConsistNet: En- 强制多视图图像扩散的 3D 一致性。 在:CVPR Yang L, Liu C, Zhu Z, Liu A, Ma H, Nong J, Liang Y (2025) 并非所有帧特征都同等重要:通过解耦动态-静态特征进行视频到 4D 生成。arXiv:250208377 2502.08377 Yang S, Zhou Y, Liu Z, Loy CC (2024a) Fresco:零样本视频翻译的时空对应关系。 在:CVPR Yang S, Zhou Y, Liu Z, Loy CC (2024b) Fresco:零样本视频翻译的时空对应关系。 在:CVPR Yi T, Fang J, Wang J, Wu G, Xie L, Zhang X, Liu W, Tian Q, Wang X (2023) GaussianDreamer:通过桥接 2D 和 3D 扩散模型,从文本快速生成 3D 高斯。在:CVPR Zeng Y, Jiang Y, Zhu S, Lu Y, Lin Y, Zhu H, Hu W, Cao X, Yao Y (2024) STAG4D:时空锚定生成

发表评论