三分钟导读:Lumera提出了一种从单张图像重建可编辑3D场景的流水线,通过SpatialLM解析对象3D框和参数化灯光,结合网格重建与HDR环境估计,生成可直接导入Blender或UE5的结构化场景。
英文题目:Engine-Native Editable 3D World Reconstruction with Objects and Lighting
论文出处:arXiv 每日论文精选 · arXiv:2607.20889
原始论文:PDF / 论文页面
对应视频标题:Lumera:从单图重建引擎原生可编辑3D场景|推荐指数:★★★★★
这篇论文解决什么问题?
现有的单图像3D重建方法通常止步于房间尺度的几何体、烘焙光照或文本驱动生成,缺乏可直接在游戏引擎中编辑的对象实例、参数化灯光和完整场景结构。
核心创新
- 提出Lumera-2K数据集,包含102.6K个可计数的引擎原生参数化灯光标注。
- 将单图像到场景重建定义为引擎原生的结构化解析任务,而非隐式辐射场或自由生成。
- 引入Lumera-Light,将局部光照作为可测量的场景实体进行预测,而非烘焙外观效果。
- 设计阶段感知的Agent精炼循环,严格限制几何和光照编辑范围,防止错误传播。
方法概览
Lumera流水线包含四个部分:1) Lumera-2K数据集,提供UE5项目中的对象框、标签和参数化灯光标注;2) Lumera-Box,基于SpatialLM解析对象3D框;3) Lumera-Light,基于SpatialLM解析参数化灯光元组(x,y,z,r,g,b,I);4) 组装阶段,使用SAM3D重建对象网格,IntrinsicHDR估计HDR环境,并通过受限的Agent循环进行 refinement。
逐图理解论文
数据集:Lumera-2K

Lumera-2K数据集包含102.6K个可计数的引擎原生参数化灯光标注。这些标注来自UE5项目,提供对象框、标签和参数化灯光信息,填补了缺乏包含可计数参数化灯光标注的大规模3D场景数据集的空白。
方法:Lumera-Box

Lumera-Box基于SpatialLM解析对象3D框。它将单图像到场景重建定义为引擎原生的结构化解析任务,通过Schema-conditioned生成,输出包含类别、位置和尺寸的3D对象布局,实现类别感知和方向感知的定位。
方法:组装与精炼

组装阶段使用SAM3D重建对象网格,利用IntrinsicHDR估计HDR环境。随后通过受限的Agent循环进行精炼,严格限制几何和光照编辑范围,防止错误传播,确保场景结构的完整性和一致性。
实验:3D框解析

在Lumera-2K验证集和测试集合并集上,Lumera-Box在mAP、IoU-B、F-score和语义一致性上领先。其mAP为0.1141,IoU-B为0.2472。尽管WildDet3D在关系召回率上更强,但Lumera-Box整体表现更优。
实验:灯光预测

在575个非空场景上,Lumera-Light的灯光召回率接近1,但个体灯光定位困难。在0.5米阈值下,F1仅为0.209,中位位置误差为0.261米。强度估计粗糙,对数MAE为0.431,表明语义和几何召回率是瓶颈。
实验与关键结果
- 在Lumera-2K val+test合并集(2,630视图)上进行3D框解析基准测试,对比DetAny3D, SpatialLM, N3D-VLM, WildDet3D。
- 在575个非空场景上进行参数化灯光预测评估,使用位置匈牙利匹配和颜色/强度指标。
- 定性比较与MIDI, CAST, SceneGen, VIGA, Sam3D等方法的重建效果。
- Lumera-Box: mAP 0.1141, IoU-B 0.2472, F-score 0.2762, Sem. 0.3827, GCC 0.6676(第 6 页)
- Lumera-Light: 非空场景召回率 0.998, 0.5m阈值下F1 0.209, 中位位置误差 0.261m, 强度Pearson r 0.628(第 6 页)
- WildDet3D在SRF (0.5748) 和 Anchor Recall (0.8811) 上优于Lumera-Box(第 6 页)
阅读时需要注意
- 个体灯光定位困难,特别是在视窗外或相机附近的灯光,F1在0.5m阈值下仅为0.209。
- 灯光强度估计粗糙,对数MAE为0.431(约2.7倍乘性误差)。
- 关系恢复(SRF, Anchor Recall)仍未解决,WildDet3D在此方面更强。
- Agent精炼循环对初始解析较差的室外场景帮助有限。
- 泛化能力受限于UE风格资产,对非UE资产泛化有限。
- Lumera-Box在检测指标上领先,但在关系结构指标上弱于WildDet3D。
- 灯光预测的瓶颈在于语义和几何召回率,而非格式错误。
- Agent精炼仅作为受限编辑器,不能替代结构化解析。
关联工作
- SpatialLM:基础架构,Lumera-Box和Lumera-Light均基于其微调。(第 2 页)
- WildDet3D:最强基线,在关系召回率上优于Lumera-Box。(第 6 页)
- SAM3D:用于从图像裁剪重建对象网格。(第 5 页)
- IntrinsicHDR:用于从图像估计HDR环境探针。(第 5 页)
- VIGA:灵感来源,用于设计阶段感知的Agent精炼循环。(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
具有对象和灯光的引擎原生可编辑 3D 世界重建
陈俊豪∗,清华大学 陈兴浩∗,南开大学 张恒浩∗,电子科技大学 乔子浩,中山大学 张赛宁,南洋理工大学 李永志,南洋理工大学 黄如奇,清华大学 李思思,Ophilus.AI 盛一民,Ophilus.AI 朱建一,Ophilus.AI 赵浩†,清华大学
项目页面:https://haidilao0328.github.io/Lumera/ 2026 7月 23日 [cs.CV]
图 1. 给定单张图像,Lumera 解析对象级 3D 框和引擎原生参数化灯光,重建每个对象的网格,估计 HDR 环境探针,并组装可在 Blender 或 UE5 中加载的可编辑场景。
可编辑 3D 场景的创建需要能够被检查、移动并导入标准引擎的对象实例和灯光,然而现有的单图像方法大多止步于房间尺度的几何结构、烘焙/全局光照或基于文本的生成。我们引入 Lumera(Light-aware Unified Engine-native Reconstruction and Assembly,即“感知灯光的统一引擎原生重建与组装”),这是一个基准和参考管线,用于从单张图像中进行引擎原生、感知灯光的 3D 场景解析。Lumera-2K 由 2,513 个 UE5 项目构建而成,包含 373 万个组件、6,300 万个对象实例、10.26 万个引擎原生参数化灯光以及 9.51 万个相机视角。基于此数据,Lumera-Box 和 Lumera-Light 利用 VLM 解析对象框和参数化灯光元组 $(x, y, z, r, g, b, I)$,这些元素与每个对象的网格重建、HDR 环境估计以及有界的Agent精炼循环相结合。在针对 DetAny3D、SpatialLM、N3D-VLM 和 WildDet3D 的隔离基准测试中,Lumera-Box 获得了最强的整体检测、几何、语义和布局分数(合并 mAP↑0.1141,IoU-B↑0.2472,F-score↑0.2762),而 WildDet3D 在锚点召回率↑方面仍然更强。对于灯光,Lumera-Light 恢复了几乎所有非空场景(召回率↑0.998),但在单个灯光定位方面仍然有限(在 0.5 米误差范围内 F1↑0.209);匹配的灯光具有
∗ 同等贡献。 † 通讯作者。
作者联系方式:陈俊豪,清华大学,yisuanwang@gmail.com;陈兴浩,南开大学,Xinghao-Chen@outlook.com;张恒浩,电子科技大学,hhfzhang@outlook.com;乔子浩,中山大学,Qiao20050212@gmail.com;张赛宁,南洋理工大学,saining002@e.ntu.edu.sg;李永志,南洋理工大学,YONGZHI001@e.ntu.edu.sg;黄如奇,清华大学,ruqihuang@sz.tsinghua.edu.cn;李思思,Ophilus.AI,sisi@ophilus.ai;盛一民,Ophilus.AI,yimin@ophilus.ai;朱建一,Ophilus.AI,chris@ophilus.ai;赵浩,清华大学,zhaohao@air.tsinghua.edu.cn。
第 2 页
2 • Chen 等
中位位置误差↓0.261 m,中位 Δ𝐸2000 ↓4.59,以及强度 Pearson 𝑟↑= 0.628。这些结果确立了参数化灯光作为可测量的可编辑场景目标,并暴露了关系结构、灯光召回率/强度以及跨引擎泛化方面剩余的瓶颈。 引擎原生重建与组装),这是一个基准和参考管线,用于从单张图像及其恢复的点云中进行引擎原生、光照感知的 3D 场景解析。Lumera 将解析作为引擎原生重建的前端:它预测对象框、文本标签和参数化灯光作为结构化实体,重建前景对象和 HDR 环境,并将它们组装成可编辑的引擎场景。核心思想是将问题围绕可编辑实体进行分解:将框和灯光预测为结构化令牌,独立重建每个前景对象,在引擎表示中组装场景,并仅将Agent作为对允许字段的有界编辑器。 CCS 概念:• 计算方法 → 计算机图形学; 场景理解;空间推理。 它们组装成可编辑的引擎场景。核心思想是将问题围绕可编辑实体进行分解:将框和灯光预测为结构化令牌,独立重建每个前景对象,在引擎表示中组装场景,并仅将Agent作为对允许字段的有界编辑器。 附加关键词和短语:可编辑 3D 场景,游戏引擎数据, 参数化灯光,场景解析,单图像 3D 重建 结构令牌,独立重建每个前景对象, 在引擎表示中组装场景,并使用Agent 1 引言 仅作为对允许字段的有界编辑器。 将单张图像转换为可编辑的 3D 场景是一个长期的 图形学目标,对游戏制作、虚拟制作、 仿真、机器人技术和资产创建具有直接价值。最近,它 也成为可控视频生成的先决条件 [Chen 等 2026c; Ma 等 2025; Xue 等 2025]:一类越来越多的视频 扩散模型 [Gu 等 2025; Huang 等 2026a; Kim 等 2025] 现在以显式 3D 场景为条件,包括粗略几何、 对象放置、相机轨迹和 3D 跟踪视频,以实现 精确的相机控制、对象操作和时间一致性。无论下游工具是 Blender、UE5 还是 3D- 条件视频模型,要求都是相同的:输出 必须是比合理的像素或融合的几何代理更丰富的内容。用户 需要可以移动的对象实例、可以替换或细化的网格,以及可以检查和编辑位置、颜色和强度的灯光。这在游戏规模场景中尤其具有挑战性,其中单个视图可能包含密集的前景资产、混合的室内/室外结构、大的度量范围、复杂的遮挡以及许多与全局照明相互作用的局部灯光。 现有方法涵盖了该问题的重要部分,但留下了可编辑场景表示的不完整。多实例图像到 3D 系统 [Chen 等 2026e; Huang 等 2025; Yao 等 2025; Zhai 等 2024] 对以对象为中心的场景进行建模,但它们主要在房间规模设置上展示,且不预测引擎原生灯光。前馈几何模型 [Leroy 等 2024; Lin 等 2025; Wang 等 2025a] 产生强大的深度、相机和点云先验,但其输出不是可编辑的对象和灯光实体。基于Agent和文本驱动的生成器 [Pfaff 等 2026; Xia 等 2026; Yin 等 2026; Zhang 等 2026] 可以通过工具调用创建或编辑场景,但它们通常从提示符合成新场景,而不是解析所描绘的场景。光照估计方法恢复环境贴图、球谐函数或内在分量,这些对于重新光照很有用,但不能作为独立的点、聚光灯、矩形或定向灯光组件导入。对称地,3D 条件视频生成器 [Chen 等 2026a; Gu 等 2025; Kim 等 2025] 假设已经存在合适的 3D 场景条件,然而,为所描绘的游戏规模图像(包含许多实例、混合的室内/室外范围和引擎原生灯光)生成这样的条件,正是当前单图像解析器无法做到的。 我们认为,缺失的步骤是将图像到场景重建视为游戏引擎结构化解析。游戏引擎已经存储了下游工具所需的实体:对象组件、变换、相机、材质、SkyLight 探针和可计数的参数化灯光。因此,我们引入 Lumera(Light-aware Unified Engine-native Reconstruction and Assembly,光照感知统一引擎原生重建与组装),这是一个基准和参考管线,用于从单张图像及其恢复的点云中进行引擎原生、光照感知的 3D 场景解析。Lumera 将解析作为引擎原生重建的前端:它预测对象框、文本标签和参数化灯光作为结构化实体,重建前景对象和 HDR 环境,并将它们组装成可编辑的引擎场景。核心思想是将问题围绕可编辑实体进行分解:将框和灯光预测为结构化令牌,独立重建每个前景对象,在引擎表示中组装场景,并仅将Agent作为对允许字段的有界编辑器。 Lumera 管线有四个耦合部分,每个部分都与这种以实体为中心的表述相关。首先,Lumera-2K 提供了现有数据集所缺乏的超视域:2,513 个 UE5 项目,包含 373 万个组件、6300 万个对象实例、10.26 万个参数化灯光和 9.51 万个相机视图。其次,Lumera-Box 将 SpatialLM [Mao 等 2026] 适应于游戏域的对象框,从彩色点云生成定向 3D 框和标签。第三,Lumera-Light 使用单独的 SpatialLM 检查点来发出引擎灯光元组 (𝑥,𝑦,𝑧,𝑟,𝑔,𝑏, 𝐼),使局部照明成为可测量的场景实体,而不是烘焙的外观效果。第四,组装阶段将框投影到图像掩码上,使用 SAM3D [Chen 等 2025a] 重建每对象网格,使用 IntrinsicHDR [Dille 等 2024] 估计 HDR 环境,并运行受 VIGA 启发的 Generator/Verifier 循环 [Yin 等 2026],其几何阶段仅可编辑对象偏航/缩放,其灯光阶段仅可编辑现有灯光、环境强度和曝光。 实验表明,这种表述已经有用,并且也暴露了清晰的剩余瓶颈。在合并的 Lumera-2K val+test 分割上,Lumera-Box 在主要检测和几何指标上优于 DetAny3D、零样本 SpatialLM、N3D-VLM 和 WildDet3D,包括 mAP↑0.1141、IoU-B↑0.2472 和 F-score↑0.2762,同时也改善了场景语义和图一致性(场景语义分数↑0.3827,GCC↑0.6676)。WildDet3D 在 SRF↑和锚点召回率↑上仍然更强,表明关系恢复尚未解决。对于灯光,Lumera-Light 达到非空场景召回率↑0.998,但单个灯光定位仍然困难:在 0.5 m 阈值下 F1↑为 0.209,中位位置误差↓为 0.261 m,中位 Δ𝐸2000 ↓为 4.59,强度 Pearson 𝑟↑为 0.628。一个有界细化案例研究改进了一个 55 实例的场景,但未能挽救较差的初始室外解析,确认Agent循环应作为有界编辑器进行评估,而不是作为结构化解析的替代品。 我们的贡献是: • 一个新任务和数据集。我们定义了游戏规模、光照感知的图像到场景解析,其中目标输出包括对象框、对象网格、引擎原生参数化灯光和 HDR 环境探针。我们引入了 Lumera-2K,这是一个源自 UE5 的数据集,具有密集的对象、相机、HDRI 和可计数灯光注释,用于可编辑场景监督。 • 一个光照感知的解析、重建和组装管线。我们提出了 Lumera 管线,它结合了基于 SpatialLM 的解析器 Lumera-Box 和 Lumera-Light,以及基于框引导的每对象网格重建、HDR 环境估计和具有可执行范围验证和回滚的阶段感知Agent细化。
第 3 页
具有对象和灯光的游戏引擎原生可编辑3D世界重建 • 3
• 针对游戏规模可编辑场景的基准测试。我们报告了对齐的而非可计数的灯光组件。我们的3D框和参数化灯光基准测试针对DetAny3D、SpatialLM、N3D-VLM和WildDet3D,引入了参数化灯光预测的定量指标,并为点云解析和重建比较提供了后验参考定性审计。 2.3 Agentic3D AIGC 2 相关工作 闭环和Agentic3D系统使用LLM或VLM工具调用来生成或编辑3D场景,通常从大型资产库中检索 [Deitke et al. 2023; Fu et al. 2021b; Zhang et al. 2.1 场景重建与生成 2025c]。提示驱动的代理场景生成器 [Che et al. 2026; 神经辐射场和3D高斯溅射 [Huang et al. 2024b; Pfaff et al. 2026; Xia et al. 2026; Yang et al. 2024b] 从语言提示或高层计划合成新场景,而代理场景编辑器 [Chen et al. 2025c; Hu et al. 2024; Huang et al. 2024a; Kerbl et al. 2023; Liu et al. 2024; Lu et al. 2024; Mildenhall et al. 2021; Sun et al. 2025b; Wei et al. 2024; Yin et al. 2026; Zhang et al. 2026] 使用工具调用通过Blender代码或布局调整修改现有场景。我们的流水线仅在结构化解析后复用代理思想,作为对对象和灯光白名单的有界编辑器,而非自由生成器。 Müller et al. 2022] 使视图合成非常有效,但 它们的输出是辐射场或像素基元,而不是可以在游戏引擎中编辑的对象和灯光实体。前馈式 3D基础模型 [Bochkovskiy et al. 2025; Chen et al. 2026b; Fu et al. 2024; Leroy et al. 2024; Lin et al. 2025; Miao et al. 2026; Wang et al. 2025a, 2024a; Weng et al. 2026b; Yang et al. 2024a; Yin 等] 提供了强大的深度和相机先验, et al. 2023; Zhou et al. 2026] 提供强深度和相机先验, 多实例图像到3D方法 [Chen et al. 2026e; Huang et al. 2025; Yao et al. 2025; Zhai et al. 2024] 恢复以对象为中心的场景, 以及整体布局方法 [Ardelean et al. 2025; Li et al. 2021a; Maninis et al. 2023; Nie et al. 2020; Zhang et al. 2025a; Zhao et al. 2017] 估计房间结构或全局几何形状,但这些系统主要局限于房间规模,且不暴露引擎原生的灯光实体。无限场景和图像驱动的场景生成方法 [Chen et al. 2025b; Chung et al. 2023; Cohen-Bar et al. 2023; Yu et al. 2025, 2024] 从提示或参考图像扩展出合理的世界,但输出是自由合成的场景,而非所描绘的场景。相比之下,我们的任务是将观察到的游戏规模图像解析为可编辑的对象和灯光实体;因此我们仅将前馈深度和每对象网格重建作为几何前端,并将最终场景视为显式的引擎表示,而非辐射场或生成的世界。
3 Lumera-2K 数据集 3.1 场景感知相机规划 2.2 结构化数据生成 Lumera-2K 是一个用于灯光感知、可编辑场景解析的游戏引擎数据集。我们从互联网上公开可用的免费资产中收集的2,513个UE5项目中,提取对象框、开放词汇对象标签、每相机激活参数化灯光、SkyLight HDRI探针和规划好的相机视图。该数据集包含373万个组件、6300万个对象实例、10.26万个参数化灯光和9.51万个相机视图,每场景平均值为1,483/25,067/40.8/37.86。与常见的3D场景数据集 [Dai et al. 2017; Fu et al. 2021a; Mao et al. 2026; Roberts et al. 2021; Yang et al. 2024b] 不同,Lumera-2K 提供了可计数的引擎灯光标注,而不仅仅是烘焙光照或全局HDR信号。完整的数据集比较见表1;导出字段和相机规划细节见附录C和A。 UE5项目中自带的相机对于监督来说过于稀疏,平均每场景仅3.0个相机。因此,我们使用无头UE5流水线将每个项目扩展到16–100个信息丰富的视图。规划器将前景对象聚类到兴趣区域,从房间分割中采样室内相机,从对象/建筑锚点采样室外相机,拒绝面向墙壁或近乎空的视图,并贪婪地选择一组多样化的相机: 越来越多的工作将3D内容生成为结构化令牌,而不是体素、像素或隐式场,因为结构化输出紧凑、可解释,并且可以直接在下游工具中编辑。自回归网格生成器 [Siddiqui et al. 2024; Tang et al. 2025; Wang et al. 2024b; Weng et al. 2026a] 将面和顶点作为令牌发出,自回归绑定 [Liu et al. 2025; Song et al. 2026, 2025; Sun et al. 2025a, 2026; Zhang et al. 2025b] 将关节和骨架树预测为序列,参数化CAD/B-rep [Li et al. 2025; Wu et al. 2021] 和LEGO [Pun et al. 2025] 生成器发出受限的命令流,矢量图形模型 [Chen et al. 2026d; Yang et al. 2026] 通过代码合成生成SVG/Lottie代码。同样的思想已被转移到3D场景理解中,其中空间语言解码器 [Avetisyan et al. 2024; Mao et al. 2026; Wang et al. 2024c; Xu et al. 2024; Zheng et al. 2025] 将布局和定向框序列化为令牌,结构化描述模型 [Huang et al. 2026b; Mao et al. 2026; Wang et al. 2025b] 从视频或3D输入发出文本级场景描述。并行地,逆渲染和光照估计方法 [Dille et al. 2024] 恢复环境贴图、球谐函数或本征分量,但这些是连续的外观信号。我们的3D框和参数化灯光输出是同一结构化令牌范式的实例,其中参数化灯光作为新的结构化预测目标引入,与更熟悉的网格、绑定、CAD和SVG案例并列。
3.2 标签和灯光 游戏资产通常具有内部名称,如 SM_chair_01 或 BP_Seat_A。我们渲染隔离的对象视图,将它们与弱的资产名称提示和一个上下文场景图像结合,并要求VLM返回简洁的视觉标签。提示要求图像
第 4 页
4 • Chen 等
表 1. 主要 3D 场景数据集的规模和标注覆盖范围。数值报告为总数(每场景均值);† 标记为我们从公开发布中推导出的数字。仅当数据集发布每盏灯的参数化标注(位置、类型、强度、色温)且具有可计数实例时,“Lights”列才打勾;烘焙的 HDR 纹理和内在分解不计入在内。“Labels”列仅当为每个对象提供自由格式/开放词汇文本描述时才打勾。
类别 数据集 室内/室外 场景数 组件总数(均值) 对象总数(均值) 灯光总数(均值) 视角总数(均值) HDRI 总数 标签
ScanNet [Dai 等 2017] 室内 1,513 — 36,213 (24.1) ✗ ✓2.49M (1,648†) ✗ ✗ ScanNet++ [Yeshwanth 等 2023] 室内 460 — — ✗ ✓280K DSLR (609†) ✗ ✓ 扫描/重建 Matterport3D [Chang 等 2017] 室内 90 — 50,811 (564.6†) ✗ ✓10,800 全景 (120) ✗ ✓ Replica [Straub 等 2019] 室内 18 — — ✗ ✗ ✗ ✗ HM3D / HM3DSem [Ramakrishnan 等 2021] 室内 1,000 — 142,646 (661) ✗ ✗ ✗ ✗
3D-FRONT [Fu 等 2021a] 室内 18,968 — — (6.5†) ✗ ✗ ✗ ✗ Structured3D [Zheng 等 2020] 室内 21,835 — — ✗ ✓196,515 (9†) ✗ ✗ 合成/设计 Hypersim [Roberts 等 2021] 室内 461 — 58,693† (127.3) ✗ ✓77,400 (167.9†) ✗ ✗ OpenRooms [Li 等 2021b] 室内 1,287 — — ✗ ✓118,233 (91.9†) ✓414 ✗ SpatialLM-Dataset [Mao 等 2026] 室内 12,328 — — ✗ ✗ ✗ ✓
ProcTHOR [Deitke 等 2022] 室内 10,000 — ∼747K† (74.7) ✗ ✗ ✗ ✗程序化 HSSD [Khanna 等 2024] 室内 211 — ∼69,567† (329.7) ✗ ✗ ✗ ✗
Holodeck [Yang 等 2024b] 室内 120 — — (23.0) ✗ ✗ ✗ ✓ SAGE [Xia 等 2026] 室内 10,000 — 565K (56.5†) ✗ ✗ ✗ ✓LLM/Agent MANSION [Che 等 2026] 室内 1,000 — — ✗ ✗ ✗ ✓ SceneSmith [Pfaff 等 2026] 室内 210 — ∼19.4K† (71.1/214.1) ✗ ✗ ✗ ✓
游戏引擎 Lumera-2K (本文) 室内/室外 2,513 3.73M (1,483) 63.00M (25,067) ✓102.6K (40.8) ✓95.1K (37.86) ✓2,513 ✓
证据主导项目命名,并经过规范化步骤抑制诸如墙、地板和编辑器占位符等外壳标签。 对于灯光,我们在场景和相机粒度上遍历 PointLight、SpotLight、DirectionalLight、RectLight 和 SkyLight 组件。发布版本保留了原生属性,如位置、方向、强度单位、衰减、SpotLight 锥体参数、RGB 颜色和色温。在此使用的监督任务中,每个影响区域与相机视锥相交的非 SkyLight 活动灯光被抽象为公式 (6) 中的七维元组 $(x,y,z,r,g,b, I)$,使灯光监督与视图级对象框对齐,同时保留直接导入 DCC 工具的能力。 每个对象实例由一个有向 3D 框表示 $𝑏𝑖= (p𝑖,𝜃𝑖, s𝑖) ∈R3 × [−𝜋, 𝜋) × R3>0$, (3) 其中 $p𝑖$ 是中心,$𝜃𝑖$ 是偏航角,$s𝑖$ 是尺寸。序列化实体块为 $\tau_{box𝑖} = \Phi(l𝑖) \parallel \Phi(p𝑖) \parallel \Phi(\theta𝑖) \parallel \Phi(s𝑖)$。块按照确定的 $z$-主序规则排序,并包裹在 SpatialLM 的布局分隔符中: $S_{box𝑣} = <|layout_s|> \bigcup_{𝑖=1}^{N_{box}} \tau_{box𝑖} <|layout_e|>$。 (4) 在指令前缀“Detect boxes.”和附录 B 中的模式指导下,参数为 $\theta_{box}$ 的 Lumera-Box 最小化 $L_{box} = -E_{D_{box}^{train}} \sum_{𝑡} \log p_{\theta_{box}} (s_{★𝑡} | s_{★<𝑡}, P𝑣, T_{box})$。 (5) 在推理时,我们解码序列,逆转换 $\Phi$,并恢复每个发出实例的 $(l𝑖, p𝑖, \theta𝑖, s𝑖)$。
4 方法 设计原则。Lumera 将游戏规模的图像到场景重建视为引擎原生的结构化解析,随后进行受限的重建和组装。输出不是隐式辐射场或无约束生成的场景,而是由对象网格(带有刚性变换)、参数化灯光、HDR 环境探针和可编辑场景元数据组成的显式引擎场景。这种分解避免了密集的全对实例模型:框和灯光被解码为实体序列,对象网格从图像裁剪中独立重建,最终的Agent循环仅允许编辑少量白名单字段。 对于 UE5 场景 $S$ 的第 $𝑣$ 个计划相机视图,监督信号为 $D𝑣= (P𝑣, Y_{txt𝑣}, Y_{box𝑣}, L𝑣)$, (2) 其中 $P𝑣 \subset R3 \times [0, 255]3$ 是从渲染的 G-buffer 深度反投影的彩色点云,$Y_{txt𝑣} = \{l𝑖\}$ 和 $Y_{box𝑣} = \{b𝑖\}$ 分别是可见的前景标签和有向框,$L𝑣= \{\ell𝑗\}$ 是源或影响区域与视图视锥相交的活动引擎灯光集合。我们微调两个独立的 SpatialLM-1.1-Qwen-0.5B [Mao 等 2026] 检查点,统称为 Lumera 解析器。它们共享基础架构、点云编码器和位置标记离散化 $\Phi(\cdot)$,但使用独立的数据流、任务模式、权重和解码设置。
4.1 Lumera-Box: 3D 框解析 Lumera-Box 保持 SpatialLM 架构不变,仅改变监督域。这很重要,因为主要在室内扫描和合成房间上训练的 SpatialLM 难以迁移到具有室外范围、长尾资产和较弱的房间外壳规律性的密集游戏引擎场景中。我们在微调期间使用三种实用的适应方法:抑制墙、地板、窗户、地形和编辑器占位符标签的前景词汇表;来自同一 UE 项目的多视图相机监督;以及减少频繁资产类别主导地位的类别重平衡。
4.2 Lumera-Light: 参数化灯光解析 Lumera-Light 使用相同的骨干网络和标记化机制,但使用独立的灯光流 $D_{lit}^{train}$、指令前缀“Detect lights.”、模式、权重 $\theta_{lit}$ 和解码参数。我们将框和灯光解耦,原因有三。首先,在大多数视图中,框比灯光密集得多,因此联合训练可能会使稀有的灯光信号被高频框标记所掩盖。其次,独立的检查点允许改进或修复任一任务,而不会相互污染
第 5 页
使用对象和灯光的引擎原生可编辑 3D 世界重建 • 5
图 2. Lumera 流程。上部:结构化解析。几何前端从输入图像重建彩色点云;Lumera-Box 和 Lumera-Light 是两个独立的 SpatialLM 监督微调(SFT)检查点,用于解析定向对象框和参数化灯光元组 $(x, y, z, r, g, b, I)$。中部:实例化与组装。将框投影回图像以提示实例掩码;SAM3D 为每个对象裁剪重建纹理网格,IntrinsicHDR 估计 HDR 环境探针,并由先验驱动的引导过程将这些实体组装到初始 Blender 场景 $s_0$ 中。下部:有界细化。生成器和验证器Agent在单独的几何和灯光阶段中迭代。几何阶段仅能编辑对象偏航角和缩放,而灯光阶段仅能编辑现有的参数化灯光、环境强度和曝光度。静态作用域检查、场景差异验证和回滚机制强制执行这些约束。
其他。第三,下游组装将框和灯光作为单独的可编辑实体集进行消费,因此不需要联合解码。
主论文预测一个紧凑的、可导入引擎的灯光元组,并将其视为最终场景;它充当 3D 实体与输入图像之间的指标桥梁。对于每个预测的框 $B_i$,我们将框投影到参考图像中以获得矩形提示 $\hat{r}_i$,将其与预测的文本标签 $l_i$ 结合,并运行 SAM 系列提示条件分割器:
$$ m_i = \text{Segment}(I_v; \hat{r}_i, l_i). \quad (9) $$
其中 $p_j$ 是位置,$c_j$ 是 RGB 颜色,$I_j$ 是强度。Lumera-2K 还存储原生的 UE5 元数据,如类型、方向、衰减半径、圆锥角和色温;这些字段由适配器发布并使用,但不是第一个 SFT 目标的一部分,以保持预测空间的稳定性。灯光实体块为 $\tau_{\text{lit}_j} = \Phi(p_j) \parallel \Phi(c_j) \parallel \Phi(I_j)$,目标序列为
$$ S_{\text{lit}_v} = \langle |\text{layout\_s}| \rangle \bigcup_{j=1}^{N_{\text{lit}_v}} \tau_{\text{lit}_j} \langle |\text{layout\_e}| \rangle. \quad (7) $$
Lumera-Light 最小化类似的自回归目标
$$ \mathcal{L}_{\text{lit}} = -\mathbb{E}_{D_{\text{lit}}^{\text{train}}} \sum_{t} \log p_{\theta_{\text{lit}}} (s^{\star}_t | s^{\star}_{<t}, P_v, T_{\text{lit}}), \quad (8) $$
解码返回每个预测灯光的 $(p_j, c_j, I_j)$。
4.3 网格恢复与环境光照
Depth Anything 3 [Lin et al. 2025] 为结构化解析提供相机、深度和彩色点云。该几何结构不被视为最终场景;它充当 3D 实体与输入图像之间的指标桥梁。对于每个预测的框 $B_i$,我们将框投影到参考图像中以获得矩形提示 $\hat{r}_i$,将其与预测的文本标签 $l_i$ 结合,并运行 SAM 系列提示条件分割器:
$$ m_i = \text{Segment}(I_v; \hat{r}_i, l_i). \quad (9) $$
如果由于遮挡、校准噪声或框漂移导致投影掩码与框内点 $P_i = \{p \in P_v | p \in B_i\}$ 不一致,则 3D 框保持实例身份和刚性边界,而掩码仅改进 RGB 裁剪。网格模块接收带有可选局部上下文的 Alpha 遮罩裁剪。
SAM3D [Chen et al. 2025a] 从每个裁剪中重建纹理网格;对于多视图输入,我们选择遮挡最少的代表性视图。网格在归一化对象坐标系中恢复,并通过以下公式放回场景中:
$$ T_i = \text{Trans}(p_i) \text{Rot}(\theta_i) \text{Scale}(s_i). \quad (10) $$
此版本侧重于前景资产;大型外壳(如墙壁、地板、天花板和地形)由单独的外壳管道处理。参数化灯光辅以全局光照:IntrinsicHDR [Dille et al. 2024] 从图像估计 HDR 全景图或 SkyLight 立方体贴图,产生显式局部灯光加上 HDR 环境探针的标准引擎组合。
第 6 页
6 • Chen 等人
4.4 阶段感知的Agent精炼
初始场景仍可能存在偏航角、缩放、局部放置和光照残差。这些错误难以通过单次 VLM 调用修复,且整个管线无法通过渲染器、解析器、分割器和网格生成器进行微分。因此,我们借鉴 VIGA 的分析-合成循环 [Yin et al. 2026],但使其具备阶段感知能力并可执行。该循环增加了四个约束:基于解析实体的先验驱动初始化、独立的几何和光照阶段、对每次执行编辑的静态和动态验证,以及一个结构化验证器报告,其字段映射到下一个生成器动作。
组装场景初始化为 $s_0 = \text{Bootstrap}(\Pi)$,其中 $\Pi = (B, \{\text{Mesh}_i\}, L_0, H_{\text{HDR}})$。这里的 $L_0$ 可以是预测的光源,也可以是通过附录 H 中的适配器从真实值 (GT) UE5 光照导出中获得的光源。生成器 $G$ 和验证器 $V$ 共享滑动对话状态 $M_0 = \{\Theta_{\sigma 0}, I_{\text{ref}}, s_0\}$。在阶段 $\sigma$ 的迭代 $t$ 时,
$$ (s_{t-1}, M_t) \xrightarrow{G; \text{exec}_\sigma; V} (s_t, M_{t+1}). \quad (11) $$
$G$ 在当前作用域下提出动作,受限执行器返回场景和违规集合,$V$ 生成结构化报告,并使用滑动窗口更新历史记录。
每个阶段都有一个编辑作用域 $E_\sigma = (F_\sigma, A_\sigma)$,其中 $F_\sigma$ 是冻结实体集,$A_\sigma$ 是允许的变更集:
$$ \sigma = \text{geom} : A_\sigma = \{\Delta \theta_i, \Delta s_i\}, \quad \Delta p_i \equiv 0, \quad (12) $$
$$ \sigma = \text{light} : A_\sigma = \{\Delta l_j, \Delta E_{\text{env}}, \Delta \gamma\}. \quad (13) $$
几何阶段默认冻结相机、光源、材质、网格拓扑、对象身份和对象位置;光照阶段冻结相机、网格、对象变换、拓扑和材质。光照阶段只能修改 $s_0$ 中已存在的光源、环境强度和曝光度。这种划分减少了常见的失败模式,即 VLM 在尝试修复光照时改变几何结构,或为补偿缺失的几何结构而改变光照。
对于提出的动作 $a_t$,执行器应用三项检查:对越界代码的静态扫描、针对字段级白名单的结构化预/后场景差异检查,以及特定阶段的前置条件检查,例如缺失的光源载体。令 $V_t$ 为这些违规的并集。执行过程为
$$ (s_t, V_t) = \text{exec}_\sigma(s_{t-1}, a_t) := \begin{cases} (\text{exec}(s_{t-1}, a_t), \emptyset), & V_t = \emptyset, \\ (s_{t-1}, V_t), & V_t \neq \emptyset. \end{cases} \quad (14) $$
如果发生违规,框架会恢复执行前的快照,并将违规写入验证器报告。报告包含自由文本视觉差异、编辑建议、当前阶段作用域的镜像、任何执行违规以及两个可执行编辑列表:$E_{\text{obj}}^t$ 用于对象偏航角/缩放修复,$E_{\text{lit}}^t$ 用于光源/环境/曝光修复。附录 H 提供了完整的 13 字段报告模式、动作空间细节、JSON 修复层、提示词和伪代码。
5 实验
5.1 设置与协议
Lumera-Box 和 Lumera-Light 从公共 SpatialLM-1.1-Qwen-0.5B [Mao et al. 2026] 权重开始,并在 Lumera-2K 的解耦框和光照流上进行微调。分割是在 UE 项目级别进行的,产生了包含室内和室外场景的验证集 (1,316 个视图) 和测试集 (1,314 个视图) 子集。对齐后的框基准测试在清理协议下比较了 DetAny3D、零样本 SpatialLM、N3D-VLM、WildDet3D 和 Lumera-Box,该协议移除了无效标签、非正尺寸、重复 ID 和 ID 回退情况。我们报告检测、度量几何、语义和结构指标。光照基准测试在多个阈值下使用以位置优先的匈牙利匹配评估 Lumera-Light;颜色和强度在匹配对上进行测量。下游组装使用 Depth Anything 3 [Lin et al. 2025]、SAM 系列分割器 SAM3D [Chen et al. 2025a]、IntrinsicHDR [Dille et al. 2024] 以及具有 $T_g = T_l = 12$ 轮次的阶段感知生成器/验证器循环。完整的实现细节、阈值扫描和提示词见附录。
5.2 3D 框解析
表 2 报告了合并后的 val+test 分割 (2,630 个视图) 上的主要清理框基准测试结果。Lumera-Box 是整体最强的方法,在检测、度量几何、语义和图一致性方面均领先。WildDet3D 在 SRF↑ 和锚点召回率↑ 方面仍然更强,表明关系锚点覆盖仍然是一个互补性的弱点。
与整体结构最强的基线 WildDet3D 相比,Lumera-Box 将 mAP↑ 提高了 +0.1120,IoU-B↑ 提高了 +0.2332,F-score↑ 提高了 +0.2196,中心 MAE↓ 降低了 -3.0680 m,场景语义分数↑ 提高了 +0.0645。N3D-VLM 具有最高的基线 IoU↑,但 Chamfer↓ 和中心误差↓ 非常大,表明存在全局平移或缩放不稳定性。这些数字支持主要观点,即游戏域监督很重要,而 SRF↑ 和锚点召回率↑ 表明关系恢复尚未解决。图 6 可视化了与 SpatialLM、N3D-VLM 和 WildDet3D 相比的相同趋势。
5.3 参数化灯光与可编辑组装
表 4 给出了 575 个非空场景 (284 个验证集和 291 个测试集) 所需的主文本光照结果。Lumera-Light 几乎总能检测到场景中存在光源,但单个光源的检测仍然困难:在 0.5 m 阈值下,F1↑ 为 0.209,存在许多误报和漏报。
匹配的光源定位中位位置误差↓ 为 0.261 m,且具有可用的颜色估计,但强度仍然粗糙,对数尺度 MAE↓ 为 0.431 (约 2.7 倍乘法误差),Pearson 相关系数 $r↑ = 0.628$。
表 5 显示了定位阈值扫描。较宽松的阈值将 F1↑ 从 0.5 m 时的 0.209 提高到 2.0 m 时的 0.456,这意味着模型通常能预测粗略的光源邻域,但未能足够精确地定位光源。格式不是限制因素:在 2,536 个被接受的预测光源中,只有两个具有无效的 RGB 值,且我们未观察到正则表达式不匹配、非有限值、重复 ID 或 ID 回归。瓶颈是个别光源的语义和几何召回率,特别是那些影响可见但光源几何形状模糊的屏幕外或近相机光源。完整的颜色/强度分解见附录 E。
图 5 提供了相应的后参考定性审计,展示了我们推断的参数化灯光与真实值 (GT) 灯光布局的对比。
第 7 页
使用对象和灯光进行引擎原生可编辑 3D 世界重建 • 7
表 2. 在清洗协议下,合并后的 Lumera-2K 验证+测试集上的主要 3D 框解析基准。箭头标记指标方向。
模型 mAP↑ IoU-B↑ IoU-AABB↑ Chamf-L2↓ F-score↑ C-MAE↓ Sem.↑ SRF↑ GCC↑ AWLE↓ Anc.R↑
DetAny3D 0.0000 0.0004 0.0023 15.1763 0.0030 12.2640 0.0184 0.0084 0.2203 0.0854 0.0256 SpatialLM 0.0000 0.0030 0.0082 9.2587 0.0240 8.5801 0.0031 0.0018 0.2470 0.0127 0.0061 N3D-VLM 0.0015 0.0223 0.0286 3430.2389 0.0431 2188.3289 0.1451 0.0868 0.4375 48.1075 0.2139 WildDet3D 0.0021 0.0141 0.0144 6.4004 0.0566 7.0573 0.3181 0.5748 0.6127 0.4707 0.8811 Lumera-Box 0.1141 0.2472 0.2734 3.4644 0.2762 3.9893 0.3827 0.4377 0.6676 0.1773 0.5607
表 3. Lumera-Box 与 WildDet3D 在合并集上的对比。Δ 遵循指标方向,因此对于 ↑ 指标,正值表示更好,对于 ↓ 指标,负值表示更好。
指标 Lumera-Box WildDet3D Δ 距离↓降至基线的 71.8%。在初始框较差的室外场景中, IoU-B↑ 0.2472 0.0141 +0.2332 循环带来的收益很小,这证实了Agentic优化是对可用解析的编辑,而非 IoU-AABB↑ 0.2734 0.0144 +0.2590 结构化解析的替代品。基于真实标签(GT)的灯光消融实验见附录 F; Chamf-L2↓ 3.4644 6.4004 −2.9360 参考图后的页面进一步将完整重建与 CAST、MIDI、SceneGen 和 VIGA F-score↑ 0.2762 0.0566 +0.2196 进行了比较。 C-MAE↓ 3.9893 7.0573 −3.0680 Sem.↑ 0.3827 0.3181 +0.0645 GCC↑ 0.6676 0.6127 +0.0549 SRF↑ 0.4377 0.5748 −0.1371 Anc.R↑ 0.5607 0.8811 −0.3204
表 4. Lumera-Light 在 575 个非空场景上的表现。除非另有说明,匹配以位置优先,阈值为 0.5 米。
指标 值 Nonempty scene recall↑ 0.998 图 3. 基于模式条件的 3D 场景对象框和灯光解析。顶部:框解析。 Count MAE↓/ exact count↑ 2.30 / 0.442 彩色点云与任务提示和 Bbox 模式配对,使模型能够生成结构化 P↑/ R↑/ F1↑@ 0.5 m 0.218 / 0.201 / 0.209 的对象布局,形式为 Bbox(class, x, y, z, yaw, sx, sy, sz)。 Joint success rate↑ 0.099 这代表了类别感知、方向感知的 3D 对象定位,作为自回归布局代码 XYZ mean / median / P90 (m)↓ 0.263 / 0.261 / 0.295 预测。底部:灯光解析。使用相同的点云条件生成框架,模型被提示 Δ𝐸2000 mean / median↓ 4.98 / 4.59 使用 Light 模式,并预测参数化灯光元组 Intensity log10 MAE↓/ Pearson 𝑟↑ 0.431 / 0.628 Light(x, y, z, r, g, b, I),捕捉灯光位置、颜色和强度。 Pairwise dist. consistency↑ 0.901 该图强调框检测和灯光估计并非建模为单独的检测头,而是作为统一 SpatialLM 风格的 3D 到代码生成任务的两个特定于模式的实例。
表 5. 灯光检测随位置阈值的扫描。颜色 Δ𝐸2000 ↓是在匹配的灯光上测量的。
6 结论 我们介绍了 Lumera,这是一个基准和参考管线,用于 Thr. TP↑ FP↓FN↓ P↑ R↑ F1↑ JSR↑Dist.↓Δ𝐸↓ 引擎原生、感知灯光的 3D 场景解析、重建和组装, 源自单张图像。主要贡献是将引擎原生的参数化灯光引入 0.25 289 2247 2459 0.114 0.105 0.109 0.051 0.164 4.45 可编辑场景重建问题:Lumera-2K 将它们记录为结构化实体, 0.50 553 1983 2195 0.218 0.201 0.209 0.099 0.266 5.72 Lumera-Light 从场景点云预测它们,并且组装管线 1.00 885 1651 1863 0.349 0.322 0.335 0.168 0.441 6.63 在 Blender 或 UE5 中保持它们的可编辑性。当前系统 2.00 1205 1331 1543 0.475 0.439 0.456 0.248 0.727 6.85 在严格的 3D 框精度、偏航角估计、视外或近相机光源的灯光 召回率以及超越 UE 风格资产的泛化能力方面仍存在明显局限 可编辑组装。在一个由 GT 驱动的包含 55 个实例的室内场景中, 有界优化循环在 12 轮几何迭代内收敛:VLM 评分↑从 6.1 提高到 8.3, Chamfer 距离↓降至基线的 71.8%。在初始框较差的室外场景中, 循环带来的收益很小,这证实了Agentic优化是对可用解析的编辑,而非 结构化解析的替代品。基于真实标签(GT)的灯光消融实验见附录 F; 参考图后的页面进一步将完整重建与 CAST、MIDI、SceneGen 和 VIGA 进行了比较。
第 8 页
8 • Chen 等
图 4. 图像条件驱动的 3D 场景生成案例研究。给定单张输入图像,我们的方法能够在不同环境中重建出具有合理对象布局、几何结构和光照的连贯 3D 场景。
为什么需要一个光照感知数据集和基准测试:它们以一种下游工具实际可用的表示形式,揭示了游戏规模可编辑重建中尚未解决的部分。
第 9 页
引擎原生可编辑的包含对象与灯光的3D世界重建 • 9
参考文献 计算机视觉。10933–10942。 Andreea Ardelean, Mert Özer, 和 Bernhard Egger。2025。Gen3dsr:通过单视图的分而治之实现泛化3d Huan Fu, Rongfei Jia, Lin Gao, Mingming Gong, Binqiang Zhao, Steve Maybank, 和 场景重建。在2025年国际3D视觉会议(3DV)上。IEEE,616–626。 Dacheng Tao。2021b。3d-future:带纹理的3D家具形状。国际 计算机视觉杂志 129, 12 (2021), 3313–3337。 Armen Avetisyan, Christopher Xie, Henry Howard-Jenkins, Tsun-Yi Yang, Samir Aroudj, Yang Fu, Sifei Liu, Amey Kulkarni, Jan Kautz, Alexei A Efros, 和 Xiaolong Wang。2024。 Suvam Patra, Fuyang Zhang, Duncan Frost, Luke Holland, Campbell Orme, 等。 Colmap-free 3d gaussian splatting。在IEEE/CVF计算机视觉与模式识别会议论文集上。 2024。Scenescript:使用自回归结构化语言模型重建场景。在欧洲计算机视觉会议上。Springer,247–263。 Zekai Gu, Rui Yan, Jiahao Lu, Peng Li, Zhiyang Dou, Chenyang Si, Zhen Dong, Qifeng Alexey Bochkovskiy, Amaël Delaunoy, Hugo Germain, Marcel Santos, Yichao Zhou, Liu, Cheng Lin, Ziwei Liu, 等。2025。Diffusion as shader: 3d-aware video diffusion Stephan Richter, 和 Vladlen Koltun。2025。Depth pro:不到一秒钟的锐利单目度量 用于多功能视频生成控制。在计算机图形学和交互技术特别兴趣小组会议论文集上。1–12。 深度。在国际学习表征会议,第2025卷。75602–75637。 Ziniu Hu, Ahmet Iscen, Aashi Jain, Thomas Kipf, Yisong Yue, David A Ross, Cordelia Angel Chang, Angela Dai, Thomas Funkhouser, Maciej Halber, Matthias Niebner, Schmid, 和 Alireza Fathi。2024。Scenecraft:一个用于合成3D场景的LLMAgent Manolis Savva, Shuran Song, Andy Zeng, 和 Yinda Zhang。2017。Matterport3D: 作为Blender代码。在第四十一届国际机器学习会议上。 从室内环境的RGB-D数据中学习。在2017年国际3D视觉会议(3DV)上。IEEE,667–676。 Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, 和 Shenghua Gao。2024b。2d Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, 高斯溅射用于几何精确的辐射场。在ACM SIGGRAPH Xueqian Wang, 和 Jian Su。2026。MANSION:用于长程任务的多层语言到3D场景 2024会议论文集。1–11。 生成。arXiv预印本 arXiv:2603.11554 (2026)。 Ian Huang, Guandao Yang, 和 Leonidas Guibas。2024a。Blenderalchemy:使用视觉语言模型编辑3D Boyuan Chen, Hanxiao Jiang, Shaowei Liu, Saurabh Gupta, Yunzhu Li, Hao Zhao, 和 图形。在欧洲计算机视觉会议上。 Shenlong Wang。2025b。Physgen3d:从单张图像打造微型交互式世界。在IEEE/CVF计算机视觉与 Springer,297–314。 模式识别会议论文集上。6178–6189。 Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Junhao Chen, Mingjin Chen, Jianjin Xu, Xiang Li, Junting Dong, Mingze Sun, Puhua Jiwen Yu, Yu Wang, 和 Xihui Liu。2026a。CineScene:隐式3D作为电影视频生成的有效场景 Jiang, Hongxiang Li, Yuhang Yang, Hao Zhao, Xiao-Xiao Long, 和 Ruqi Huang。 表示。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集上。25381–25392。 2026c。DanceTogether:生成无身份漂移的交互式多人视频。在第十四届国际学习表征会议。 Weikai Huang, Jieyu Zhang, Sijun Li, Jiafei Duan, Yunqian Cheng, Jaemin Cho, Matthew https://openreview.net/forum?id=7VEECFBzmm Wallingford, Rustin Soraki, Chris Dongjoo Kim, Shuo Liu, 等。2026b。WildDet3D: Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, 扩展野外可提示的3D检测。 (2026)。 Xiaoxiao Long, Fei Ma, Qi Tian, Hao Zhao, 和 Ruqi Huang。2026d。LottieGPT: Zehuan Huang, Yuan-Chen Guo, Xingqiao An, Yunhan Yang, Yangguang Li, Zi-Xin 对矢量动画进行标记以实现自回归生成。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集上。 Zou, Ding Liang, Xihui Liu, Yan-Pei Cao, 和 Lu Sheng。2025。Midi:多实例 31639–31651。 扩散用于单图像到3D场景生成。在IEEE/CVF计算机视觉与模式识别会议论文集上。 Junhao Chen, Xiang Li, Xiaojun Ye, Chao Li, Zhaoxin Fan, 和 Hao Zhao。2025c。Idea23d: 23646–23657。 协作式LMMAgent使能从交错的多模态输入生成3D模型。在第31届计算语言学国际会议论文集上。 Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, 等。2023。 4149–4166。 3d gaussian splatting用于实时辐射场渲染。ACM Trans. Graph. 42, Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Cong- 4 (2023), 139–1。 cong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, 和 Yufei Wang。2026e。One Video, One Mukul Khanna, Yongsen Mao, Hanxiao Jiang, Sanjay Haresh, Brennan Shacklett, Dhruv World:将单目视频转化为物理4D场景。arXiv:2606.31388 [cs.CV] Batra, Alexander Clegg, Eric Undersander, Angel X Chang, 和 Manolis Savva。2024。 https://arxiv.org/abs/2606.31388 Habitat合成场景数据集(hssd-200):对3D场景规模和真实性 Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen 权衡的分析,用于ObjectGoal导航。在IEEE/CVF计算机视觉与模式识别会议论文集上。16384–16393。 Cui, Lap-Pui Chau, 和 Yi Wang。2026a。HVG-3D:弥合真实与仿真领域以进行3D条件手-对象交互视频合成。在Proceed- Geonung Kim, Janghyeok Han, 和 Sunghyun Cho。2025。VideoFrom3D:通过互补图像和视频扩散模型生成3D场景视频。在Proceedings ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). of the SIGGRAPH Asia 2025 Conference Papers. 1–11。 15986–15997。 Vincent Leroy, Yohann Cabon, 和 Jérôme Revaud。2024。Grounding image matching Mingjin Chen, Junhao Chen, Huan-ang Gao, Xiaoxue Chen, Zhaoxin Fan, 和 Hao in 3d with mast3r。在欧洲计算机视觉会议上。Springer,71–91。 Kejie Li, Daniel DeTone, Yu Fan Steven Chen, Minh Vo, Ian Reid, Hamid Rezatofighi, Zhao。2026b。Ultraman:用于从单张图像进行3D人体重建的超快高分辨率纹理生成。Machine Vision and Applications 37, 2 Chris Sweeney, Julian Straub, 和 Richard Newcombe。2021a。Odam:使用姿态RGB视频进行对象检测、 (2026), 24。 关联和映射。在IEEE/CVF国际计算机视觉会议论文集上。5998–6008。 Xingyu Chen, Fu-Jen Chu, Pierre Gleize, Kevin J Liang, Alexander Sax, Hao Tang, Pu Li, Wenhao Zhang, Weize Quan, Biao Zhang, Peter Wonka, 和 Dongming Yan。 Weiyao Wang, Michelle Guo, Thibaut Hardin, Xiang Li, 等。2025a。Sam 3d:3dfy 2025。BrepGPT:使用Voronoi半图块进行自回归B-rep生成。ACM 图像中的任何事物。arXiv预印本 arXiv:2511.16624 (2025)。 Transactions on Graphics (TOG) 44, 6 (2025), 1–18。 Jaeyoung Chung, Suyoung Lee, Hyeongjin Nam, Jaerin Lee, 和 Kyoung Mu Lee。 Zhengqin Li, Ting-Wei Yu, Shen Sang, Sarah Wang, Meng Song, Yuhan Liu, Yu-Ying Yeh, 2023。Luciddreamer:无需领域的3D高斯溅射场景生成。arXiv预印本 arXiv:2311.13384 (2023)。 Rui Zhu, Nitesh Gundavarapu, Jia Shi, 等。2021b。Openrooms:一个用于照片级真实室内场景数据集的开放框架。在IEEE/CVF会议 Dana Cohen-Bar, Elad Richardson, Gal Metzer, Raja Giryes, 和 Daniel Cohen-Or。 计算机视觉与模式识别论文集上。7190–7199。 2023。Set-the-scene:用于生成可控NeRF场景的全局-局部训练。在IEEE/CVF国际计算机视觉会议论文集上。2920–2929。 Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, Jiashi Angela Dai, Angel X Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, 和 Feng, 和 Bingyi Kang。2025。Depth anything 3:从任何视角恢复视觉空间。arXiv预印本 arXiv:2511.10647 (2025)。 Matthias Nießner。2017。Scannet:室内场景的丰富标注3D重建。在IEEE计算机视觉与模式识别会议论文集上。 Isabella Liu, Zhan Xu, Wang Yifan, Hao Tan, Zexiang Xu, Xiaolong Wang, Hao Su, 和 5828–5839。 Zifan Shi。2025。Riganything:无需模板的自回归绑定以生成多样化的3D Matt Deitke, Dustin Schwenk, Jordi Salvador, Luca Weihs, Oscar Michel, Eli VanderBilt, 资产。ACM Transactions on Graphics (TOG) 44, 4 (2025), 1–12。 Ludwig Schmidt, Kiana Ehsani, Aniruddha Kembhavi, 和 Ali Farhadi。2023。Obja- Junchen Liu, Wenbo Hu, Zhuo Yang, Jianteng Chen, Guoliang Wang, Xiaoxue Chen, verse:一个带注释的3D对象宇宙。在IEEE/CVF计算机视觉与模式识别会议论文集上。13142–13153。 Yantong Cai, Huan-ang Gao, 和 Hao Zhao。2024。Rip-nerf:使用Ripmap编码的柏拉图立体进行抗锯齿辐射场。在ACM SIGGRAPH 2024会议 Matt Deitke, Eli Vander Bilt, Alvaro Herrasti, Luca Weihs, Jordi Salvador, Kiana Ehsani, 论文集上。1–11。 Winson Han, Eric Kolve, Ali Farhadi, Aniruddha Kembhavi, 等。2022。ProcTHOR:使用过程生成的大规模具身AI。在第36届 Tao Lu, Mulin Yu, Linning Xu, Yuanbo Xiangli, Limin Wang, Dahua Lin, 和 Bo Dai。2024。 国际神经信息处理系统会议上。5982–5994。 Scaffold-gs:用于视图自适应渲染的结构化3D高斯。在IEEE/CVF计算机视觉与模式识别会议论文集上。20654–20664。 Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, 等。2023。 Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, 等。2025。可控 3d gaussian splatting用于实时辐射场渲染。ACM Trans. Graph. 42, 视频生成:综述。arXiv预印本 arXiv:2507.16869 (2025)。
Sebastian Dille, Chris Careaga, 和 Yağız Aksoy。2024。单图像 HDR 重建。在欧洲计算机视觉会议 (European Conference on Computer Vision) 上。Springer,161–177。
Kevis-Kokitsi Maninis, Stefan Popov, Matthias Nießner, 和 Vittorio Ferrari。2023。
Huan Fu, Bowen Cai, Lin Gao, Ling-Xiao Zhang, Jiaming Wang, Cao Li, Qixun Zeng, IEEE/CVF 国际计算机视觉会议论文集。20189–20199。
Chengyue Sun, Rongfei Jia, Binqiang Zhao, 等人。2021a。3d-front:带有布局和语义的 3D 家具房间。在 IEEE/CVF 国际计算机视觉会议论文集上。
Yongsen Mao, Junhao Zhong, Chuan Fang, Jia Zheng, Rui Tang, Hao Zhu, Ping Tan, 和 Zihan Zhou。2026。Spatiallm:为结构化室内建模训练大语言模型
第 10 页
10 • Chen 等人
建模。神经信息处理系统进展 38,45165–45195。 模型。arXiv 预印本 arXiv:2411.09595 (2024)。 Miao Xingyu, Dong Junting, Zhao Qin, Yang Yuhang, Chen Junhao, 和 Long Yang。 Wei Yuxi, Wang Zi, Lu Yifan, Xu Chenxin, Liu Changxing, Zhao Hao, Chen Siheng, 2026。从帧到序列:时间一致的人体中心密集 和 Wang Yanfeng。2024。通过协作 llm Agent进行自动驾驶的可编辑场景仿真。在 IEEE/CVF 计算机 预测。arXiv:2602.01661 [cs.CV] https://arxiv.org/abs/2602.01661 视觉与模式识别会议论文集。15077–15087。 Ben Mildenhall, Pratul P Srinivasan, Matthew Tancik, Jonathan T Barron, Ravi Ra- vision and pattern recognition. 15077–15087. mamoorthi, 和 Ren Ng。2021。Nerf:将场景表示为神经辐射场以进行视图合成。ACM 通讯 65, 1 (2021), 99–106。 Xiaoguang Han。2026a。GarmentGPT:通过离散潜在标记化进行组合式服装图案生成 Thomas Müller, Alex Evans, Christoph Schied, 和 Alexander Keller。2022。Instant via Discrete Latent Tokenization. In The Fourteenth International Conference on neural graphics primitives with a multiresolution hash encoding. ACM transactions Learning Representations. https://openreview.net/forum?id=XzXKnazRBF on graphics (TOG) 41, 4 (2022), 1–15。 Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Yinyu Nie, Xiaoguang Han, Shihui Guo, Yujian Zheng, Jian Chang, 和 Jian Jun Zhang。 Chen, 和 Hao Zhao。2026b。前馈 3D 编辑从语义部分 2020。Total3dunderstanding:从单张图像联合进行室内场景的布局、物体姿态和网格重建。在 IEEE/CVF 计算机视觉与模式识别会议论文集。55–64。 Transformation. arXiv:2605.27351 [cs.CV] https://arxiv.org/abs/2605.27351 Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, 和 Russ Tedrake。2026。 Rundi Wu, Chang Xiao, 和 Changxi Zheng。2021。Deepcad:用于计算机辅助设计模型的深度生成网络 Scenesmith:Agent生成仿真就绪的室内场景。arXiv 预印本 arXiv:2602.09153 (2026)。 Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung- Ava Pun, Kangle Deng, Ruixuan Liu, Deva Ramanan, Changliu Liu, 和 Jun-Yan Zhu。 Yi Lin, Wei-Chiu Ma, Shenlong Wang, 等。2026。Sage:面向具身智能的可扩展Agent 3D 场景 2025。从文本生成物理稳定且可构建的砖结构。在 IEEE/CVF 国际计算机视觉会议论文集。14798– generation for embodied ai. arXiv 预印本 arXiv:2602.10116 (2026)。 14809。 European Conference on Computer Vision. Springer, 131–147。 Santhosh K Ramakrishnan, Aaron Gokaslan, Erik Wijmans, Oleksandr Maksymets, Haiwei Xue, Xiangyang Luo, Zhanghao Hu, Xin Zhang, Xunzhi Xiang, Yuqin Dai, Alex Clegg, John Turner, Eric Undersander, Wojciech Galuba, Andrew Westbury, Jianzhuang Liu, Zhensong Zhang, Minglei Li, Jian Yang, 等。2025。人体运动 Angel X Chang, 等。2021。Habitat-matterport 3d 数据集 (hm3d):1000 个用于具身智能的大规模 video generation: A survey. IEEE Transactions on Pattern Analysis and Machine 3D 环境。arXiv 预印本 arXiv:2109.08238 (2021)。 Intelligence (2025)。 Mike Roberts, Jason Ramapuram, Anurag Ranjan, Atulit Kumar, Miguel Angel Bautista, Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, 和 Nathan Paczan, Russ Webb, 和 Joshua M Susskind。2021。Hypersim:用于整体室内场景理解的 photorealistic Hengshuang Zhao。2024a。Depth anything v2。神经信息处理系统进展 synthetic dataset for holistic indoor scene understanding. In Proceedings of the Processing Systems 37 (2024), 21875–21911。 IEEE/CVF international conference on computer vision. 10912–10922。 Yiying Yang, Wei Cheng, Sijin Chen, Xianfang Zeng, Fukun Yin, Jiaxu Zhang, Liao Yawar Siddiqui, Antonio Alliegro, Alexey Artemov, Tatiana Tommasi, Daniele Sirigatti, Wang, Gang Yu, Xingjun Ma, 和 Yu-Gang Jiang。2026。Omnisvg:统一可扩展 Vladislav Rosov, Angela Dai, 和 Matthias Nießner。2024。Meshgpt:使用仅解码器 Transformer 生成 vector graphics generation model. Advances in Neural Information Processing Systems triangle meshes with decoder-only transformers. In Proceedings of the IEEE/CVF 38 (2026), 113670–113696。 conference on computer vision and pattern recognition. 19615–19625。 Yue Yang, Fan-Yun Sun, Luca Weihs, Eli VanderBilt, Alvaro Herrasti, Winson Han, Jiajun Chaoyue Song, Xiu Li, Fan Yang, Zhongcong Xu, Jiacheng Wei, Fayao Liu, Jiashi Feng, Wu, Nick Haber, Ranjay Krishna, Lingjie Liu, 等。2024b。Holodeck:语言 Guosheng Lin, 和 Jianfeng Zhang。2026。Puppeteer:绑定并动画化你的 3D guided generation of 3d embodied ai environments. In Proceedings of the IEEE/CVF 模型。神经信息处理系统进展 38 (2026), 72152–72184。 Conference on Computer Vision and Pattern Recognition. 16227–16237。 Chaoyue Song, Jianfeng Zhang, Xiu Li, Fan Yang, Yiwen Chen, Zhongcong Xu, Jun Hao Kaixin Yao, Longwen Zhang, Xinhao Yan, Yan Zeng, Qixuan Zhang, Lan Xu, Wei Yang, Liew, Xiaoyang Guo, Fayao Liu, Jiashi Feng, 等。2025。Magicarticulate:使 Jiayuan Gu, 和 Jingyi Yu。2025。Cast:基于 RGB 图像的组件对齐 3D 场景重建 your 3d models articulation-ready. In Proceedings of the Computer Vision and Pattern from an rgb image. ACM Transactions on Graphics (TOG) 44, 4 (2025), 1–19。 Recognition Conference. 15998–16007。 Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner, 和 Angela Dai。2023。Scan- Julian Straub, Thomas Whelan, Lingni Ma, Yufan Chen, Erik Wijmans, Simon Green, net++:高保真室内 3D 场景数据集。在 IEEE/CVF 国际计算机视觉会议论文集。12–22。 Jakob J Engel, Raul Mur-Artal, Carl Ren, Shobhit Verma, 等。2019。The replica Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J dataset: A digital replica of indoor spaces. arXiv 预印本 arXiv:1906.05797 (2019)。 Black, Trevor Darrell, Angjoo Kanazawa, 和 Haiwen Feng。2026。Vision-as-inverse- Fan-Yun Sun, Weiyu Liu, Siyi Gu, Dylan Lim, Goutam Bhat, Federico Tombari, Manling graphics agent via interleaved multimodal reasoning. arXiv 预印本 arXiv:2601.11109 Li, Nick Haber, 和 Jiajun Wu。2025b。LayoutVLM:通过视觉语言模型对 3D 布局进行可微优化。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。29469–29478。 (2026)。 Mingze Sun, Junhao Chen, Junting Dong, Yurun Chen, Xinyu Jiang, Shiwei Mao, Puhua Wei Yin, Chi Zhang, Hao Chen, Zhipeng Cai, Gang Yu, Kaixuan Wang, Xiaozhi Chen, Jiang, Jingbo Wang, Bo Dai, 和 Ruqi Huang。2025a。Drive:基于扩散的绑定 和 Chunhua Shen。2023。Metric3d:面向从单张图像进行零样本度量 3D 预测。在 IEEE/CVF 国际计算机 empowers generation of versatile and expressive characters. In Proceedings of the vision. 9043–9053。 Computer Vision and Pattern Recognition Conference. 21170–21180。 Hong-Xing Yu, Haoyi Duan, Charles Herrmann, William T Freeman, 和 Jiajun Wu。 Mingze Sun, Cheng Zeng, Jiansong Pei, Junhao Chen, Chaoyue Song, Shaohui Wang, 2025。Wonderworld:从单张图像进行交互式 3D 场景生成。在 Pro- Tianyuan Chang, Bin Huang, Zijiao Zeng, 和 Ruqi Huang。2026。Animator-Centric ceedings of the Computer Vision and Pattern Recognition Conference. 5916–5926。 Skeleton Generation on Objects with Fine-Grained Details. In Proceedings of the Hong-Xing Yu, Haoyi Duan, Junhwa Hur, Kyle Sargent, Michael Rubinstein, William T IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 17336– Freeman, Forrester Cole, Deqing Sun, Noah Snavely, Jiajun Wu, 等。2024。Won- 17345。 derjourney:从任意处到任意处。在 IEEE/CVF Jiaxiang Tang, Zhaoshuo Li, Zekun Hao, Xian Liu, Gang Zeng, Ming-Yu Liu, 和 Conference on Computer Vision and Pattern Recognition. 6658–6667。 Qinsheng Zhang。2025。EdgeRunner:用于艺术网格生成的自回归自编码器。在第十三届国际学习表征会议。 Guangyao Zhai, Evin Pınar Örnek, Dave Zhenyu Chen, Ruotong Liao, Yan Di, Nassir https://openreview.net/forum?id=81cta3WQVI Navab, Federico Tombari, 和 Benjamin Busam。2024。Echoscene:室内场景 Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, generation via information echo over scene graph diffusion. In European Conference and David Novotny。2025a。Vggt:视觉几何 grounded transformer。在 Pro- on Computer Vision. Springer, 167–184。 ceedings of the Computer Vision and Pattern Recognition Conference. 5294–5306。 Junyi Zhang, Charles Herrmann, Junhwa Hur, Varun Jampani, Forrester Cole, Deqing Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris Chidlovskii, 和 Jerome Revaud。 Sun, Ming-Hsuan Yang, 等。2025a。Monst3r:一种在存在运动的情况下估计几何的简单方法。 2024a。Dust3r:使几何 3D 视觉变得简单。在 IEEE/CVF 计算机视觉与模式识别会议论文集。20697–20709。 International Conference on Learning Representations, Vol. 2025。82863–82886。 Tai Wang, Xiaohan Mao, Chenming Zhu, Runsen Xu, Ruiyuan Lyu, Peisen Li, Xiao Jia-Peng Zhang, Cheng-Feng Pu, Meng-Hao Guo, Yan-Pei Cao, 和 Shi-Min Hu。2025b。 Chen, Wenwei Zhang, Kai Chen, Tianfan Xue, 等。2024c。Embodiedscan:面向具身智能的整体 One model to rig them all:使用 unirig 进行多样化骨架绑定。ACM Transactions multi-modal 3d perception suite towards embodied ai. In Proceedings of the IEEE/CVF on Graphics (TOG) 44, 4 (2025), 1–18。 Conference on Computer Vision and Pattern Recognition. 19757–19767。 Yi Zhang, Yunshuang Wang, Zeyu Zhang, 和 Hao Tang。2026。Code2worlds:赋能 Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng coding llms for 4d world generation. arXiv 预印本 arXiv:2602.11757 Yu, Dan Xu, 和 Dong Yu。2025b。N3D-VLM:原生 3D 定位使视觉语言模型中的准确 (2026)。 Spatial Reasoning in Vision-Language Models. arXiv 预印本 arXiv:2512.16561 Yibo Zhang, Li Zhang, Rui Ma, 和 Nan Cao。2025c。Texverse:具有高分辨率纹理的 3D 对象宇宙 (2025)。 Hao Zhao, Ming Lu, Anbang Yao, Yiwen Guo, Yurong Chen, 和 Li Zhang。2017。Physics
Zhengyi Wang, Jonathan Lorraine, Yikai Wang, Hang Su, Jun Zhu, Sanja Fidler, and Xiaohui Zeng. 2024b. Llama-mesh: Unifying 3d mesh generation with language inspired optimization on semantic transfer features: An alternative method for room layout estimation. In Proceedings of the IEEE conference on computer vision and
第 11 页
引擎原生可编辑的包含对象与灯光的3D世界重建 • 11
模式识别。10–18。 Duo Zheng, Shijia Huang, 和 Liwei Wang。2025。Video-3d llm:学习位置感知的视频表示以进行3D场景理解。在IEEE/CVF计算机视觉与模式识别会议论文集。8995–9006。 Jia Zheng, Junfei Zhang, Jing Li, Rui Tang, Shenghua Gao, 和 Zihan Zhou。2020。Structured3d:用于结构化3D建模的大型照片级真实数据集。在欧洲计算机视觉会议。Springer,519–535。 Xiaoyu Zhou, Jingqi Wang, Yuang Jia, Yongtao Wang, Deqing Sun, 和 Ming-Hsuan Yang。2026。Ea3d:从流式视频中在线提取开放世界3D对象。神经信息处理系统进展 38 (2026),54805–54825。
第 12 页
12 • Chen 等人
真实值 本文方法 真实值 本文方法 真实值 本文方法
图 5. Lumera-Light 的定性推理结果。Lumera-Light 预测引擎原生的参数化灯光,并与游戏尺度点云中的真实灯光布局进行对比。
图像 真实值 SpatialLM N3D-VLM WildDet3D DetAny3D 本文方法
图 6. Lumera-Box 的定性推理结果。3D 框解析结果与 SpatialLM、N3D-VLM 和 WildDet3D 的对比,其中 Lumera-Box 恢复了更密集且空间对齐更佳的、可编辑的对象布局。
第 13 页
引擎原生可编辑的包含对象与灯光的3D世界重建 • 13
图 7. 图像条件驱动的3D场景生成的定性比较。每一列展示一张输入图像以及由不同方法生成的对应3D场景,包括我们的方法、MIDI、CAST、SceneGen、VIGA 和 Sam3D。与先前方法相比,我们的方法更好地保留了输入图像的场景级布局、对象组成和空间关系。它在室内和室外环境中重建出更完整且连贯的3D场景,而竞争方法通常会产生不完整的几何结构、孤立对象、缺失结构或不一致的排列。
第 14 页
14 • Chen 等
A 相机规划与 UE5 渲染细节 A.5 阶段 5:图像级 QA 过滤 本附录详细说明了第 3.1 节中总结的相机规划与渲染管线。该管线包含五个阶段,所有数值均为我们发布实现中的默认值。
A.1 阶段 1:前景过滤与 XY 聚类 我们通过引擎端的 Python API 遍历所有静态网格体(static-mesh)actor。通过标签子字符串过滤结构背景 actor,包括墙壁、地板、天花板、门、窗户、楼梯、屋顶、地形、草地和天空。我们还移除微小的碎片(AABB 范围小于 18 厘米)和非常大的外壳对象(大于 4 米)。剩余的前景对象在 2.2 米的 XY 网格上进行聚类。每个聚类大致对应一个房间或一个感兴趣的室外区域。我们将聚类数量限制为 32 个,并保留最具多样性的子集。
A.2 阶段 2:室内房间分割与多模式 在大约 1.6 米的相机高度,我们运行 2D 泛洪填充房间分割。墙壁和门洞几何形状被投影到 40 厘米的占用网格中,提取连通自由空间组件,并将每个前景聚类分配给包含它的房间。然后使用三个优先级级别生成候选相机:(i) 室内网格采样,在分割的房间内均匀采样位置,同时保持距离墙壁至少 60 厘米的余量;(ii) 自由内部回退,当泛洪填充失败或房间太小时,在聚类 AABB 内部采样;(iii) 轨道模式,当没有可靠的房间信息时使用,例如在室外,半径为聚类直径的 0.9 和 1.25 倍,并有六个方位角采样。所有候选位置必须满足身体和相机清除约束(≥25 / 20 厘米,通过引擎射线投射检查)并位于场景外壳内。然后,我们将每个位置在视场角 [45◦, 95◦]、六个偏航模板和轻微的向下俯仰上进行扩展。
A.3 阶段 3:视图级遮挡与可见性过滤 对于每个候选视图 𝑣,我们执行两个几何测试。首先,墙壁遮挡测试将相机到每个前景对象中心的 2D 线段与所有墙壁 AABB 相交,从候选可见集中移除被阻挡的对象。其次,近结构拒绝测试采样九个代表性的视锥射线;如果在任何前景对象之前大多数射线击中附近的结构表面(≤2.4 米),则候选对象被拒绝为面向墙壁的视图。接受的候选对象必须看到至少三个前景对象,其中至少一个投影对象框覆盖图像面积的 ≥0.45%。
A.4 阶段 4:具有多样性约束的贪婪覆盖 分数为公式 (1)。位置/方向 NMS 要求任何两个选定的相机相距至少 4 米,并且在偏航上相差至少 12◦。当总覆盖率达到 0.99、边际覆盖率低于 0.008 或选定数量达到硬性上限 150 时,选择停止。然后,我们允许每个聚类添加最多六个高填充率的视图。室内和室外规划器共享此评分接口以及下游 QA 和渲染管线。它们的锚点和采样差异总结在表 7 中。
A.5 阶段 5:图像级 QA 过滤 即使经过几何过滤,候选相机仍可能产生信息量不足的帧,例如紧贴墙壁的视图、大面积纯色图像,或前景对象几乎完全被遮挡的帧。对于每个调整为 160×90 的预览图像,我们计算轻量级统计信息:全局亮度均值和标准差 𝜎𝐿、Sobel 边缘密度 𝑒,以及来自每通道 8 个 bin 的颜色直方图的主导颜色比率 𝜌𝑐。我们还计算中心 80×46 裁剪中的相同统计信息 𝜎𝑐𝐿, 𝑒𝑐, 𝜌𝑐𝑐。阈值规则检测五种故障模式:(i) 全局过暗或过亮的空白帧,(ii) 大面积纯色帧,(iii) 仅中心为纯色且角落有结构的帧,(iv) 全局低细节帧,以及 (v) 解析或渲染故障。通过的视图获得质量分数
𝑞= 0.34 𝜎𝐿+ 0.18 (1−𝜌𝑐) + 0.14 (1−𝜌𝑐𝑐) + 0.34𝑒𝑒, (15)
其中 𝜎𝐿 和 𝑒𝑒 经参考尺度归一化。为了避免丢弃小场景中的纯色和低内容帧,这些帧按质量排序,并部分重新引入以满足最小视图数量和保留率。表 6 报告了 200 个采样场景中的拒绝原因。
A.6 Linux 无头 UE5 渲染 为了减少进程启动开销,我们使用批处理后端:一个持久的 Unreal 进程通过 𝐾 个选定相机切换渲染目标。每次切换后,渲染器等待几帧,以便自动曝光、流式传输、Lumen 全局光照和材质编译在捕获高分辨率截图之前稳定下来;在第一帧之前插入全局预热。为了处理偶尔的 GPU 中断,相机被分块,块之间留有短间隙,并且在需要时管线回退到每进程一相机的模式。
跨场景色调一致性由稳定的渲染预设控制:保留 Lumen 漫反射全局光照,而禁用运动模糊、景深、镜头光晕、Lumen 反射、屏幕空间反射和泛光。我们还固定色调映射质量和曝光直方图设置,并使用曝光偏差来抑制极端亮度。对于每个通过 QA 的相机,我们导出一个包含场景深度、世界法线、基础颜色、金属度/粗糙度和最终 RGB 的 G-buffer 探针,然后使用探针 RGB/深度作为覆盖信号导出多视图 N3D 包。当内存压力较高时,每个导出批次会减少或降级为单相机模式。
表 6. 200 个采样 Lumera-2K 场景的预览 QA 拒绝原因。
| 拒绝原因 | 被拒绝中的占比 | 所有候选中的占比 | | :— | :— | :— | | 大面积纯色区域 | 38.4% | 9.7% | | 仅中心纯色 | 27.1% | 6.9% | | 全局低内容 | 14.6% | 3.7% | | 过暗/过亮空白 | 11.2% | 2.8% | | 渲染故障/缺失 | 8.7% | 2.2% | | 总计 | 100.0% | 25.3% |
第 15 页
使用对象和灯光进行引擎原生可编辑 3D 世界重建 • 15
表 7. 室内与室外相机规划器的关键差异。 D 框评估的补充指标 正文中的表 2 报告了合并后的 val+test 基准测试。 本附录给出了相应的分拆结果以及相对于之前 ckpt5000 框模型的改进。
模块 | 室内规划器 | 室外规划器 —|—|— 锚点 | 房间泛洪填充 + 聚类 | 建筑物/对象聚类 + 粗略地面追踪 候选者 | 房间内网格 / 自由内部 / 轨道 | 轨道 + 立面侧射线 + 网格 高度 | 接地 + 160 cm 眼高 | 多级 {1.6, 6.0, 18.0} m 场景语义分数 NavMesh 依赖 | ✗ | ✗ 视场角范围 | 45–95◦ | 42–88◦ 典型覆盖率 | ≥0.99 | ≥0.75
解释。Lumera-Box 在 val 和 test 上表现稳定:其 mAP↑ 从 0.1237 变为 0.1227,IoU-B↑ 从 0.2482 变为 0.2463,场景语义分数↑ 从 0.3806 变为 0.3847。基线模型的相对顺序也保持稳定:WildDet3D 在 SRF↑ 和锚点召回率↑ 方面始终占主导地位,而 N3D-VLM 在 IoU-B↑/IoU-AABB↑ 方面仍然是最强的基线,但遭受非常大的全局几何误差↓。
B 两个独立 SpatialLM SFT 任务的模式 公式 (4) 和 (7) 定义了 Lumera-Box 和 Lumera-Light 的目标 token 序列。每个任务指令,$T_{box}$ 或 $T_{lit}$,声明了固定的字段顺序和字段类型。表 8 列出了这两种模式。 数值字段被声明为整数,以指导 SpatialLM 的位置 token 离散化 $\Phi(\cdot)$;公式 (3)–(6) 中的连续值通过 $\Phi^{-1}$ 恢复。
表 8. 两个独立 SpatialLM SFT 任务的模式声明。 字段顺序是固定的。数值字段通过位置 token 离散化 $\Phi(\cdot)$ 表示。
| 字段顺序 | BBox 模式 | 灯光模式 | |—|—|—| | 1 | class (str) | position_x | | 2 | position_x | position_y | | 3 | position_y | position_z | | 4 | position_z | color_r | | 5 | angle_z | color_g | | 6 | scale_x | color_b | | 7 | scale_y | intensity | | 8 | scale_z | |
表 9. 从之前的 ckpt5000 框模型到报告的 Lumera-Box 检查点在合并 val+test 分拆上的进展。
| 指标 | ckpt5000 | Lumera-Box | 改进↑ | |—|—|—|—| | mAP↑ | 0.0333 | 0.1141 | +0.0808 | | IoU-B↑ | 0.1259 | 0.2472 | +0.1213 | | F-score↑ | 0.1624 | 0.2762 | +0.1138 | | 场景语义↑ | 0.2343 | 0.3827 | +0.1484 | | SRF↑ | 0.2774 | 0.4377 | +0.1603 | | GCC↑ | 0.5696 | 0.6676 | +0.0980 | | 锚点召回率↑ | 0.3769 | 0.5607 | +0.1838 |
C 引擎原生灯光参数的完整列表 正文仅使用位置、颜色和强度作为 SpatialLM 的监督目标。Lumera-2K 为每个灯光导出五组原生属性并发布所有这些属性: • 状态和视锥体关系:灯光标识符、类型、激活状态、光源在当前相机中是否可见,以及其影响区域是否与视锥体相交。 • 位置和方向:以厘米为单位的_WORLD_ 位置、_WORLD_ 旋转,以及以厘米为单位的相机相对位置 $(x,y,z)$。 • 强度和衰减:UE 强度、强度单位(流明或坎德拉,用于跨引擎转换)以及最大影响半径。 • SpotLight 形状:内锥角和外锥角、光源半径、光源长度、光源宽度和光源高度。 • 颜色和色温:RGB 颜色、开尔文色温,以及指示是否启用色温的布尔值。
我们在 SpatialLM 输出中仅参数化 $(x,y,z,r,g,b, I)$ 以保持训练稳定。其余字段用作初始 UE 到 Blender 灯光适配器中的可控元数据,以及在灯光编辑界面中,并支持未来更细粒度灯光预测的工作。
新的检查点在所有报告的检测、几何、语义和结构指标上均优于之前的模型。这就是为什么正文报告了对齐的 clean_move1 基准测试,而不是早期的 ckpt5000 数值。
E 完整的灯光预测指标 表 10 报告了第 5.3 节中使用的灯光预测指标。评估涵盖 575 个非空场景(284 个验证集和 291 个测试集),并使用基于位置的匈牙利匹配,随后对匹配对进行颜色和强度评估。表 11 给出了位置阈值的扫描结果。
第 16 页
16 • Chen 等
表 10. 在清洗协议下的主要灯光预测指标,除非另有说明,否则使用 0.5 m 阈值。箭头标记指标方向。基准测试中不包含空 GT 场景,因此空场景准确率不适用。
| 组别 | 指标 | 值 | | :— | :— | :— | | 场景存在性 | num_common_files | 575 | | | nonempty_scene_recall↑ | 0.998 | | | catastrophic_miss_rate↓ | 0.002 | | | exact_count_accuracy↑ | 0.442 | | 计数对齐 | count_mae↓ | 2.30 | | | over_pred_rate↓ | 0.252 | | | under_pred_rate↓ | 0.306 | | 检测 @ 0.5 m | precision↑ | 0.218 | | | recall↑ | 0.201 | | | F1↑ | 0.209 | | 联合指标 | joint_success_rate↑ | 0.099 | | | valid matched pairs | 553 | | 几何 (m) | xyz mean / median↓ | 0.263 / 0.261 | | | xyz $P_{90}$ ↓ | 0.295 | | | chamfer / EMD↓ | 7.108 / 6.465 | | | $\Delta E_{2000}$ mean / median↓ | 4.98 / 4.59 | | 颜色 | RGB MAE / RMSE↓ | 12.68 / 17.17 | | | luminance MAE / chroma err.↓ | 11.36 / 7.75 | | | log10 MAE↓ | 0.431 | | 强度 | linear MAE↓ | 1486.3 | | | Pearson $r$↑ | 0.628 | | 场景结构 | pairwise dist. consistency↑ | 0.901 | | | height dist.↓ | 0.093 | | | nn spacing error↓ | 0.139 |
我们在相同的几何优化场景下,比较了四种变体:无重建参数化灯光、通过适配器导入并由灯光循环优化的 GT 参数化灯光、能量设为零的相同灯光集,以及对单个灯光的扰动。这些变体表明,局部灯光具有可见且可独立编辑的效果,而所有灯光运行均收敛且未触发几何回滚。
G 用于逐对象重新标记的 G VLM 提示
第 3.2 节描述了孤立对象渲染以及 GPT-5.4-mini 重新标记。我们列出了 Lumera-2K 中使用的两个提示模板,以明确“图像证据优先,命名提示其次”的策略。
完整提示。 完整提示要求四个字段:标签、置信度、描述和理由,并在需要细粒度审计时使用:
> System. 你为 3D 训练数据集标记孤立的 Unreal Engine 网格资产预览图像。预览图像是主要证据。将 actor、component 和 asset 名称视为弱提示,因为项目命名可能嘈杂或具有误导性。尽可能具体地命名图像中可见的真实物体。
> User. 识别可见网格资产的视觉对象类别。仅返回包含以下键的严格 JSON:label、confidence、description 和 reason。标签必须简洁,使用小写英文,多词使用 snake_case,并且应命名视觉内容而非包前缀、Unreal 类、actor 标签、房间名称、LOD 或数字后缀。
压缩提示。 对于百万级标记,我们通过使用一行系统提示和更短的用户提示来降低令牌成本,仅请求标签和置信度。这是 Lumera-2K 标记的默认设置:
> System. 标记孤立的 UE 网格预览图像。图像优先;名称仅为提示。仅返回 JSON。
> User. 命名可见对象的类别。使用简洁的小写 snake_case。避免使用 UE/编辑器占位符、包名称、房间名称、LOD 和数字。仅返回 JSON: > {"label":"category","confidence":0.0}。
弱命名提示。 两个提示都附加了一个包含资产名称、资产路径、actor 标签以及(在可用时)粗略 3D 框和投影位置提示的提示块。提示块被明确标记为弱证据而非真实值。当图像和名称不一致时,指示模型信任图像,从而减少从项目命名惯例到 $V_{fg}$ 的泄漏,因为感知亮度更接近对数而非线性。
强度指标。 我们在 0.5 m 阈值下匹配的 553 个灯光上评估发光强度。主要指标是对数空间绝对误差: $$ \frac{1}{N} \sum_{i} \log_{10} I_{pred_i} – \log_{10} I_{gt_i} $$ 值 0.431 对应于平均乘性误差 $10^{0.431} \approx 2.7$ 倍。Pearson 相关系数 $r \uparrow = 0.628$ 表明模型具有中等程度的对更亮和更暗灯光进行排序的能力,但强度精度仍远弱于颜色恢复。
F GT 驱动的灯光消融
为了隔离 UE 到 Blender 的灯光适配器和灯光阶段,我们使用一个以日光和 SkyLight 为主的办公室场景,其中有两个室内 PointLights 提供局部增益。从
第 17 页
使用对象和灯光的原生引擎可编辑 3D 世界重建 • 17
H.1 两阶段硬作用域 $E_\sigma$
执行器将每个阶段形式化为 $E_\sigma = (F_\sigma, A_\sigma)$,其中 $F_\sigma$ 是冻结实体集,$A_\sigma$ 是允许的变更集(表 12)。执行后,结构化场景差异(scene diff)会与字段级白名单进行比对。任何超出作用域的变更都会触发回滚,并将违规列表返回给生成器,从而实现公式 (14) 中的负反馈。
表 13 报告了两个阶段中的字段可见性。圆圈标记主要字段;项目符号标记应保持为空或仅携带非关键剩余注释的字段。
表 12. 两阶段硬作用域 $E_\sigma$。冻结列列出了不可更改的实体;允许列列出了允许的变更。
| 阶段 $\sigma$ | $F_\sigma$ 冻结 | $A_\sigma$ 允许 | | :— | :— | :— | | 几何 (Geometry) | {相机, 灯光, 材质, 网格拓扑, 对象列表} | {默认冻结的对象 $\theta_i, s_i$}; 位置 | | 灯光 (Lighting) | {相机, 网格对象, 对象变换, 网格拓扑, 材质} | {现有灯光参数, 灯光几何, 曝光} |
表 13. 结构化验证器报告 $r_t$ 中的字段角色。
| 字段 | 几何 | 灯光 | | :— | :—: | :—: | | 视觉差异 (visual-difference) | ◦ | ◦ | | 编辑建议 (edit-suggestion) | ◦ | ◦ | | 阶段/编辑作用域 (stage / edit-scope) | ◦ | ◦ | | 约束违规 (constraint-violations) | ◦ | ◦ | | 几何反馈 (geometry-feedback) | ◦ | • | | 对象编辑列表 (object-edit list) | ◦ | • | | 灯光反馈 (lighting-feedback) | • | ◦ | | 灯光编辑列表 (light-edit list) | • | ◦ | | 缺失的必要宿主 (missing-required-hosts) | • | ◦ | | 回退阶段/下一步编辑作用域 (fallback-stage/next-edit-scope) | •◦ | ◦◦ |
H.2 Agent动作空间
生成器动作空间 $A_G$。生成器使用六个语义原语:(i) 初始场景引导,在 $t=0$ 时调用一次以构建 $s_0 = \text{Bootstrap}(\Pi)$;(ii) 感知阶段的高级规划;(iii) 受约束的代码执行和渲染,这是几何或灯光的主要动作;(iv) 结构化灯光更新,仅在灯光阶段使用,并直接从 $E_{lit}^t$ 元组应用;(v) 场景状态查询,返回 $s_t$ 的对象、灯光、材质和相机摘要;以及 (vi) 阶段终止。在每个主要动作之前,框架会注入活动元组 $(\sigma, E_\sigma, \phi_\sigma)$ 并应用公式 (14) 中的护栏。
对于每个对象 $o_i$,$E_{obj}^t$ 包含元组: $$ o_i, \Delta\theta_{z,i}, s_{mul,i}, m_i, \pi_i, \rho_i, c_i, \quad (17) $$ 其中 $s_{mul,i}$ 是各向异性缩放乘数;$m_i$ 是粗略幅度标签,轻微、中等或显著,分别对应盒子大小的 0.25×、0.6× 和 1.2×;$\pi_i$ 是优先级;$\rho_i$ 是视觉证据;$c_i$ 是置信度。对于每个灯光目标,$E_{lit}^t$ 包含: $$ \zeta_j, \eta_j, \omega_j, v_j, \rho_j, c_j, \quad (18) $$ 其中 $\zeta_j$ 是目标,即现有灯光、世界探针或曝光;$\eta_j$ 是参数,如能量、颜色或方向;$\omega_j$ 是更新算子,设为、添加或乘以;$v_j$ 是值。
验证器动作空间 $A_V$。验证器继承了 VIGA [Yin et al. 2026] 的多视图检查工具:相机姿态设置、对象聚焦、可见性切换、自然语言视图调整(如“放大”或“向左旋转”)以及场景查询。所有验证器动作都是非破坏性的;它们不写入场景,仅产生用于推理的视觉观察 $o_k^t$。
H.3 UE 到 Blender 灯光适配器
当 L0 来自 GT Lumera-2K 灯光记录时,每个灯光包含 UE5 原生字段,如 lumen/candela 单位、开尔文温度标志、SpotLight 锥角和衰减半径(附录 C)。在写入 Blender 之前,Bootstrap 执行轻量级语义对齐:保留灯光身份和世界姿态;将 UE 单位映射到 Blender Cycles 中的相应物理量;根据温度标志从 RGB 获取颜色或将其转换为开尔文;并将 SpotLight 锥角和衰减参数写入相应的 Blender 字段。该适配器是保损的,且从不创建 L0 中不存在的灯光,使灯光搜索空间与公式 (13) 保持一致。
H.4 完整验证器报告模式 $r_t$
我们将 $r_t$ 形式化为有序 13 元组命名字段: $$ r_t = d_t, e_t, \sigma, E_\sigma, V_t, f_{geom}^t, f_{lit}^t, E_{obj}^t, E_{lit}^t, h_t, \sigma_\star^t, E_\star^t, \beta_t, \quad (16) $$ 其中 $d_t$ 和 $e_t$ 是自由文本视觉差异和编辑建议;$\sigma$ 和 $E_\sigma$ 镜像当前作用域;$V_t$ 复制执行器违规集;$f_{geom}^t$ 和 $f_{lit}^t$ 是特定阶段的本地诊断;$h_t$ 列出所需但缺失的载体(仅在灯光阶段非空);$\sigma_\star^t$ 和 $E_\star^t$ 提出下一阶段和作用域;$\beta_t \in \{0, 1\}$ 是终止位。
这些元组与公式 (14) 中允许的后效应集 $A_\sigma$ 是同构的,因此 $r_t$ 可以直接驱动下一个动作 $a_{t+1}$。
H.5 异构 VLM 工具调用的鲁棒解析
不同的 VLM 提供商生成的工具调用 JSON 具有不同的故障模式,包括全角引号、Markdown 代码围栏、缺失的外层大括号和 Python 字面量。在任何工具调用到达执行器之前,我们运行修复层:标点符号规范化、代码围栏剥离、平衡大括号扫描、Python 字面量回退,以及将原始 JSON 文本重新映射为合法的工具调用。此层使得 GPT-5.2、GLM-4.6V、Qwen-VL 和类似的 VLM 能够共享相同的闭环基础设施。
H.6 阶段提示与阶段转换
我们在几何和灯光阶段分别为 $G$ 和 $V$ 维护单独的系统提示 $\{\Theta_{geom}, \Theta_{light}\}$。切换阶段仅替换 $M_t$ 中的提示头;对话历史的其余部分保持不变。$\Theta_{geom}$。几何提示禁止添加或删除对象、更改材质、移动相机或编辑灯光。它要求模型将 $E_{obj}^t$ 视为本地修复的有序列表,而不是全局重新布局指令,冻结高置信度锚点对象和支持父级,并默认冻结对象位置 $p_i$。
第 18 页
18 • Chen 等人
Θlight。灯光提示词确定了诊断顺序:曝光 → 环境强度 → 主光方向 → 阴影柔和度 → 色温 → 补光平衡。它还区分了启用现有禁用灯光与创建新灯光;后者总是被拒绝。
分阶段停止。几何阶段不会因缺少房间外壳几何结构而提前停止。灯光阶段在判断剩余残差不再以灯光为主导时立即停止。这防止了 VLM 持续编辑灯光以解释缺失墙壁或物体的常见失败情况。
阶段转换。当几何阶段设置 𝛽𝑡=1 或耗尽 𝑇𝑔 轮次时,框架切换到 (𝜎, E𝜎,𝜙𝜎) ←(light, Elight, 1),并用 Θlight 替换提示词头。场景状态 𝑠 和对话历史 𝑀 被继承。这种共享历史、切换作用域的设计避免了冷启动,并允许验证器引用几何阶段中已确认的对象标识。
滑动窗口历史。遵循 VIGA [Yin 等人 2026],我们更新 𝑀𝑡+1 =Tail𝐿(𝑀𝑡∪{𝑎𝑡,𝑟𝑡}),保留系统提示词和最近的 𝐿 个动作/报告对。与回退步骤相邻的记录可以自动跳过,从而在 VLM 上下文窗口内保留 30 多轮细化。
H.7 伪代码
算法 1 阶段感知的双Agent细化。 要求: 参考图像 𝐼ref; 先验元组 Π; 轮次限制 𝑇𝑔,𝑇𝑙; 历史窗口 𝐿 1: 𝑠0 ←Bootstrap(Π); 𝑀0 ←{Θgeom, 𝐼ref,𝑠0} 2: for 𝜎∈{geom, light} do 3: Switch Θ𝜎and (𝜎, E𝜎,𝜙𝜎) 4: for 𝑡= 1 to 𝑇𝜎do 5: 𝑎𝑡←𝐺(𝑀𝑡, 𝐼ref,𝑠𝑡−1; 𝜎, E𝜎,𝜙𝜎) 6: (𝑠𝑡,𝑉𝑡) ←exec𝜎(𝑠𝑡−1,𝑎𝑡) {公式 14} 7: 𝑟𝑡←𝑉(𝐼ref,𝑠𝑡,𝑉𝑡) 8: 𝑀𝑡+1 ←Tail𝐿(𝑀𝑡∪{𝑎𝑡,𝑟𝑡}) 9: if 𝑟𝑡触发终止 then 10: break 11: end if 12: end for 13: end for 14: return 𝑠𝑇
I 局限性与未来工作
结论总结了主要局限性;我们在此进行扩展。
框解析整体最强,但尚未饱和。Lumera-Box 达到合并 mAP↑0.1141,IoU-B↑0.2472,F-score↑0.2762(表 2),在大多数指标-几何和语义得分上明显优于 DetAny3D、SpatialLM、N3D-VLM 和 WildDet3D。然而,严格的 3D 重叠对于游戏规模场景来说远未饱和。一个原因是 2,513 个项目中的 63M 个对象导致的重尾分布。更大的骨干网络、对比目标以及显式的跨实例约束是自然的下一步。
方向和关系恢复仍是弱点。基准测试表明,关系导向的结构尚未解决:在合并分割中,WildDet3D 在 SRF↑上比 Lumera-Box 高出 0.1371,在 anchor recall↑上高出 0.3204。此外,SpatialLM 风格的序列化将偏航角表示为单个位置标记,并未显式处理对称性,例如 0 和 ±𝜋/2 在视觉上可能等效的近方形对象。未来工作应添加偏航角对称类、关系感知损失或基于渲染的比较目标。
输出有效性需要模型级约束。清理后的协议在评分前移除了无效标签、非正尺寸、重复 ID 和 ID 回退情况。尽管新检查点比 ckpt5000 有显著改进(表 9),但仍应在 SFT 推理路径中直接添加约束解码或修复层。
光源载体和强度仍不完整。当前 SFT 目标未完全覆盖可能影响外观的两个光源:SkyLight 和源可能位于可见集之外的近相机强光。IntrinsicHDR 部分补偿了它们,但这限制了准确性。单灯检测仍然较弱(0.5 m 处 F1↑0.209),且强度具有对数尺度 MAE↓0.431,亮度误差约为 2.7 倍。天花板灯光网格和程序化天花板也需要更好的兼容性。将监督扩展到所有影响区域与视锥体相交的灯光(而不仅仅是可见光源),并添加显式的对数强度损失,是直接的下一步。
大型无界场景在几何上仍存在漂移。户外分割的 Chamfer-L2↓约为 17 m,表明在大型无界空间中的度量一致性仍是前端瓶颈。联合相机和几何校准将改善解析和最终组装。
引擎泛化。Lumera-2K 和数据管道是为 UE5 实现的。将提取和适配器层扩展到 Unity、Godot 和其他引擎,对于验证该表示法超越 UE 风格资产和灯光惯例的适用性是必要的。