可微渲染新解:用梯度图诊断场景参数对视觉指标的影响

快速导读:该论文提出了一种通过反向传播标量指标(如眩光指数或神经感知分数)通过可微渲染器,生成场景参数显著性图的方法,以直观揭示影响特定视觉指标的关键物理场景元素。

在计算机图形学和视觉分析中,理解“哪些场景参数驱动了特定视觉指标”是一个长期存在的挑战。传统方法依赖昂贵的参数扫描或黑盒优化,缺乏直观的解释能力。本文提出了一种基于可微光传输的新方法,通过反向传播标量指标生成场景参数显著性图,为设计师和研究人员提供了高效的诊断工具。

该方法的核心创新在于将可微渲染的梯度从优化中间量转化为人类可解释的诊断工具。通过Mitsuba 3和Path Replay Backpropagation (PRB),论文展示了如何计算场景参数(如材质反射率、几何形状)对标量指标(如统一眩光等级UGR、平均亮度)的梯度,并将其映射回图像空间,生成直观的热力图。

英文题目:Scene Parameter Saliency via Differentiable Light Transport

论文出处:arXiv 每日论文精选 · arXiv:2607.21562

原始论文:PDF / 论文页面

对应视频标题:可微渲染新解:用梯度图诊断场景参数对视觉指标的影响|推荐指数:★★★★★

这篇论文解决什么问题?

传统基于物理的渲染主要用于生成图像或优化场景参数,但缺乏对“哪些参数最显著影响特定视觉指标”的直接解释能力。例如,在建筑照明设计中,设计师需要理解复杂的光传输依赖关系(如多次反射),但传统敏感性分析(如Sobol或Morris方法)计算成本高昂,且难以直观映射到3D场景。

神经网络中的梯度显著性方法(如Grad-CAM)已成功用于解释模型决策,但未应用于物理渲染过程。此外,现有工作如MRD(Metamer Rendering Distortion)使用可微渲染进行3D场景理解,但通过优化而非梯度检查,缺乏对参数敏感性的直接量化。

因此,亟需一种高效、直观且物理一致的方法,能够揭示场景参数对视觉指标的影响,从而指导设计决策和视觉分析。

核心创新

  • 提出“指标显著性图”概念,将可微渲染的梯度从优化中间量转变为人类可解释的诊断工具。
  • 证明显著性具有指标特异性:同一场景在不同指标(如UGR vs 平均亮度)下产生截然不同的显著性分布。
  • 通过单次反向传播捕获多跳光传输中的非局部依赖关系,无需昂贵的参数扫描。

方法概览

利用可微渲染器(Mitsuba 3 + PRB),将标量指标 $M$ 通过渲染函数 $R(\theta)$ 反向传播,计算场景参数 $\theta$ 的梯度 $\partial M/\partial \theta$。通过主射线追踪将参数空间梯度映射回图像空间,生成每像素的材质显著性热力图。

  • 利用Mitsuba 3和PRB构建可微渲染管道,支持对场景参数(如材质、几何、光照)的梯度计算。
  • 定义标量指标M(如UGR、平均亮度、ResNet-50分类Logit),并通过渲染函数R(θ)反向传播,计算场景参数θ的梯度∂M/∂θ。
  • 通过主射线追踪将参数空间梯度映射回图像空间,生成每像素的材质显著性热力图。
  • 提出“指标显著性图”概念,强调显著性具有指标特异性,即同一场景在不同指标下产生截然不同的显著性分布。
  • 通过单次反向传播捕获多跳光传输中的非局部依赖关系,避免了传统参数扫描的高计算成本。
  • 在室内场景(客厅、厨房、餐厅)中评估三种指标,验证方法的适用性和有效性。

逐图理解论文

传统方法的局限

传统方法的局限
Figure 1: Expanding the diagnostic toolkit for architectural lighting. While conven- tional analysis provides (b) glare source identification and (c) luminance maps to evaluate discomfort glare, it leaves the designer to guess the root physical causes. By differentiating the psychovisual unified glare rating through the light transport simulation, we obtain (d) a metric saliency map. This highlights the specific scene materials and geometry driving the metric, explicitly guiding design decisions.

图1展示了传统分析与本文方法的对比。传统方法提供眩光源识别和亮度图,但无法揭示根本物理原因。本文通过反向传播UGR生成指标显著性图,高亮驱动指标的具体材质和几何,明确指导设计决策。

方法贡献

方法贡献
Figure 2: Image-Space Saliency Map- ping. Per-pixel material identities (Scene Objects) are coloured by their corre- sponding parameter sensitivities (Scene Gradients) to produce the final metric- specific heatmap.

通过Mitsuba 3和Path Replay Backpropagation (PRB),论文反向传播标量指标(如UGR)生成场景参数显著性图。该方法通过单次反向传播捕获多跳光传输中的非局部依赖关系,无需昂贵的参数扫描。

指标特异性

指标特异性
Figure 3: Visualizing Metric Specificity. While extracting gradients provides precise rank- ing data for scene parameters (top row), mapping this raw data back into the 3D scene (bot- tom row) allows for intuitive spatial visualisation. Across multiple scenes, the UGR evalua- tion isolates highly localised reflective surfaces driving discomfort glare (e.g., the mirror or metallic utensils). In contrast, the mean luminance evaluation shifts focus entirely to large surfaces driving global illumination.

图3展示了指标特异性。UGR评估隔离了驱动不适眩光的局部高反光表面(如镜子、金属餐具),而平均亮度评估则完全聚焦于驱动全局照明的表面。这证明显著性具有指标特异性。

验证与局限

验证与局限
Figure 5: Independent Ablation Validation. Parameters are ranked strictly by computed gradient magnitude (y-axis). Taking a small gradient descent step yields an absolute change in the objective metric (x-axis). The UGR evaluation (a) perfectly mirrors the computed saliency rank, whilst the mean luminance evaluation (b) highlights the noise floor challenges of global stochastic metrics.

图5展示了独立消融验证。参数按计算梯度幅度排名,小步长梯度下降产生目标指标的绝对变化。UGR评估完美镜像计算出的显著性排名,而平均亮度评估突显了全局随机指标的噪声底挑战。

实验如何设计?

  • 使用Mitsuba 3和PRB进行可微渲染,确保梯度计算的准确性和效率。
  • 选择三种标量指标:平均亮度、统一眩光等级(UGR)和ResNet-50分类Logit,覆盖全局和局部视觉特性。
  • 在三个室内场景(客厅、厨房、餐厅)中进行实验,验证方法在不同环境下的鲁棒性。
  • 通过独立参数消融实验(小步长梯度下降),验证计算出的梯度排名与实际指标变化的一致性。
  • 对比不同指标下的显著性图,分析其空间分布差异和物理意义。

关键结果与论文证据

  • UGR显著性图聚焦于局部高反光表面(如镜子、金属餐具),揭示这些表面是驱动不适眩光的关键因素(第7页)。
  • 平均亮度显著性图聚焦于大面积漫反射表面(如墙壁、地板),反映这些表面对全局照明的贡献(第7页)。
  • ResNet-50分类Logit显著性图揭示特定材质作为分类线索,展示方法在语义理解中的潜力(第7页)。
  • UGR消融实验中,前几名参数(如餐具alpha、瓷砖反射率)的实际指标变化与梯度排名完全单调一致(第8页)。
  • 平均亮度消融实验中,低排名参数出现非单调性,归因于随机噪声地板(变化量低于10^-4)(第8页)。
  • 方法通过单次反向传播捕获多跳光传输中的非局部依赖关系,无需昂贵的参数扫描(第4页)。

阅读时需要注意

  • 蒙特卡洛梯度估计器继承路径追踪器的方差,低采样率下显著性值可能噪声较大。
  • 要求指标M必须是可微的,离散指标(如二元眩光源检测)需平滑近似,可能影响结果准确性。
  • 梯度仅反映一阶局部敏感性,未捕捉参数间的二阶交互效应或物理约束限制。
  • 对于全局随机指标(如平均亮度),低显著性参数的排名可能受渲染噪声影响而不稳定。
  • 不同物理域(如反射率 vs 折射率)的统一梯度步长可能导致宏观行为差异,需自适应步长缩放。

关联工作

  • Differentiable Rendering (Mitsuba 3, PRB):基础技术,提供可微渲染管道(第3页)。
  • Grad-CAM / Vanilla Gradient:类比对象,神经网络中的梯度显著性方法(第3页)。
  • MRD (Metamer Rendering Distortion):相关工作,使用可微渲染进行3D场景理解,但通过优化而非梯度检查(第4页)。
  • Sensitivity Analysis (Sobol, Morris):传统方法,计算成本高,需多次模拟(第4页)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 1

基于可微光传输的场景参数显著性

Linas Beresna 西蒙菲莎大学 linas_beresna@sfu.ca 加拿大伯纳比

Eugene Fiume eugene_fiume@sfu.ca

摘要

基于梯度的显著性方法揭示了哪些输入特征对神经网络输出的影响最大,是模型可解释性的标准工具。我们观察到,传统上用于参数优化的可微渲染器会产生一种类似的显著性形式:给定在渲染图像上评估的任何标量指标,单次反向模式微分传递即可产生逐参数梯度,从而识别出对指标影响最大的场景元素。我们将这些梯度场称为指标显著性图(Metric Saliency Maps)。与通过已学习权重传播归因的神经显著性不同,指标显著性通过捕捉图像形成过程中自身固有的参数依赖性(包括半透明和多次反弹光传输)进行传播,使其易于人工检查。我们针对定性不同的目标计算指标显著性图:心理视觉眩光指数、平均场景亮度和神经感知分数。对于同一场景,不同指标的显著性排名存在显著差异,主导一个目标的参数在另一个目标中可能微不足道。显著性图是特定于指标的,而非场景的固有属性。我们的结果表明,可微渲染器产生的导数图像对于场景理解而言,与其旨在生成的原始图像一样具有信息量。

1 引言

计算机视觉的一个核心关切是理解图像与产生它们的场景之间的关系。经典的基于物理的视觉方法直接处理这种关系:基于阴影的形状恢复 [14]、本征图像分解 [3] 和光度立体视觉 [42] 均基于图像形成的物理过程,从像素观测中推断场景属性。这些方法之所以成功,是因为从场景到图像的映射受几何、反射率和照明的支配,具有结构化且(原则上)可逆的特性。

可微渲染 [16, 20, 21] 借助现代计算工具复兴了这一基于物理的视角。通过将渲染管线实现为自动微分程序,可以获得任何图像衍生量相对于场景参数(几何、材质、光照和相机)的梯度。这些梯度已被广泛用于逆渲染 [21, 29]、姿态估计 [38]、形状重建 [8, 23] 和场景生成 [43]。在所有这些应用中,梯度仅服务于单一目的:它被输入到优化器中,迭代更新场景参数以最小化损失函数。

© 2026。本文档的版权归作者所有。 允许以印刷或电子形式免费无更改地分发。

第 2 页

2 LINAS BERESNA 和 EUGENE FIUME:场景参数显著性

(a) 美观度 (b) 眩光掩码 (c) 亮度 (d) 显著性

图 1:扩展建筑照明的诊断工具包。虽然传统分析提供 (b) 眩光源识别和 (c) 亮度图以评估不适眩光,但它让设计师去猜测根本的物理原因。通过对光传输模拟对心理视觉统一眩光等级进行微分,我们获得了 (d) 指标显著性图。这突出了驱动该指标的具体场景材料和几何结构,明确指导设计决策。

我们观察到,这些梯度携带的信息独立于任何优化过程而具有价值。给定在渲染图像上评估的标量指标 $M$ 和由场景参数 $\theta$ 参数化的可微渲染器 $R$,梯度 $\partial M(R(\theta ))/\partial \theta$ 是一个向量,它为每个场景参数分配一个分数,反映其对指标的影响程度。这是场景参数空间上的显著性图。

与神经网络可解释性的类比是直接且明确的。基于梯度的显著性方法,如 Grad-CAM [33] 和原始梯度归因 [34],通过检查 $\partial y/\partial x$ 揭示哪些输入特征对网络的预测影响最大。我们的指标显著性图也是如此,但这里的可微函数是基于物理的渲染器而非学习模型,且“输入特征”是场景参数而非像素值。当 Grad-CAM 询问哪些像素对分类重要时,我们询问哪些场景参数对该指标重要?

神经网络显著性与物理显著性之间的区别不仅仅是表面上的。神经网络显著性通过本质上结构不透明的学习权重传播。指标显著性通过图像形成过程本身传播,包括多反弹光传输,其中的依赖关系具有物理意义。距离光源三次反弹的墙面表面,通过相互反射,可能对眩光指标的影响比灯具本身更大。梯度以单次反向模式微分传递精确编码了这种依赖关系,无需传统建筑与照明设计中灵敏度分析所特有的参数扫描 [36] 或有限差分探测的重复评估 [13, 31]。

我们在定性不同的目标上展示了指标显著性图,包括平均场景亮度、神经感知相似性分数和心理视觉眩光等级。图 1 通过明确映射不适眩光的根本物理原因,说明了这种方法在建筑照明中的应用。对于同一场景,不同指标的显著性排名存在显著差异。主导一个目标的参数对另一个目标而言微不足道,这证实了显著性图是特定于指标的,而非场景的固有属性。这种指标特异性是该工具的实用价值所在,因为它告诉设计师不仅要改变什么,还要关注哪个特定标准。

我们的贡献如下:

1. 我们确定了指标显著性图,即标量目标的逐参数梯度

第 3 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 3

通过可微渲染器,将其作为一种可解释性工具,类似于神经网络中基于梯度的归因方法,且不同于这些梯度传统上在优化中所扮演的角色。

2. 我们证明,通过基于物理的渲染器进行单次反向模式微分,可以揭示跨多种指标的非直观参数敏感性,包括最具影响力的元素在空间上和光学上距离所测量的效应较远的情况。

3. 我们表明,显著性排名是特定于指标的:对同一场景改变目标函数会产生定性不同的图,提供了诊断信息,这是原始图像或任何单一指标值单独无法传达的。

2 相关工作

我们的工作位于可微渲染、基于梯度的可解释性以及基于物理的场景分析的交叉点。我们综述了每个领域,并确定了指标显著性图所解决的空白。

可微渲染。计算相对于场景参数的图像梯度的能力已在各种渲染范式中得到发展。对于光栅化,Neural Mesh Renderer [18]、SoftRas [23]、DIB-R [8] 和 nvdiffrast [20] 引入了对离散可见性函数的可微近似。对于蒙特卡洛路径追踪,Li 等人 [21] 提出了用于边界梯度的边缘采样,Loubet 等人 [25] 引入了基于重参数化的估计器,Nimier-David 等人 [30] 在 Mitsuba 2 中开发了辐射反向传播。Vicini 等人 [29] 和 Path Replay Backpropagation (PRB) 方法 [39] 进一步降低了通过全局照明进行微分的内存和方差成本。Mitsuba 3 [16] 将许多这些技术整合到一个单一框架中。神经场景表示,包括 NeRF [26] 和 3D Gaussian Splatting [19],本质上也是可微的,并已被用于视图合成和重建 [2, 10]。DiffCSG [43] 将可微性扩展到构造实体几何,并特别将其管道的一部分包括每个参数的梯度可视化。在所有这些系统中,梯度被视为由优化器消耗的量。我们提议将它们视为由人类消耗的最终输出。

基于梯度的显著性和归因。在神经网络可解释性文献中,基于梯度的方法是解释模型决策的主要工具。Simonyan 等人 [34] 引入了原始梯度显著性,计算 ∂y/∂x 以突出显示对分类器输出影响最大的输入像素。Grad-CAM [33] 和 Grad-CAM++ [7] 通过用梯度加权特征图激活来改进这一点,产生类判别性热力图。这些方法已扩展到目标检测、分割和视觉问答 [6]。Integrated Gradients [37] 和 SmoothGrad [35] 解决了梯度噪声和饱和问题。一般原则,即对输入的可微函数的导数构成对这些输入的归因,在神经网络中已得到确立。我们将这一相同原则应用于一个不同的可微函数:基于物理的渲染器。“输入”变为场景参数(材质、几何、光照)而不是像素值,“输出”变为任意标量指标而不是类对数几率。

第 4 页

4 LINAS BERESNA 和 EUGENE FIUME:场景参数显著性

基于物理的视觉与场景理解。我们的工作延续了计算机视觉中通过物理模型推理图像形成的传统。从阴影恢复形状 [14]、本征图像分解 [1, 3] 和光度立体视觉 [42] 都是通过反转渲染过程来恢复场景属性。最近,分析合成方法利用可微渲染来优化与观测图像匹配的场景解释 [44]。MRD [4] 使用基于物理的可微渲染,通过寻找场景参数 metamers(物理上不同但产生相同模型激活的场景)来探测视觉模型,提供了一种基于 3D 场景描述而非像素空间的解释性工具。我们的方法与 MRD 的动机相似,即利用可微渲染进行理解而非重建,但通过梯度检查而非优化进行操作,并针对标量场景指标而非神经网络表示。

设计中的敏感性分析。在建筑照明和建筑性能评估中,了解设计参数如何影响统一眩光等级 (UGR) [15]、日光眩光概率 (DGP) [41]、空间日光自主性 [24] 和有效日光照度 [28] 等指标对于知情设计至关重要。传统方法依赖于参数扫描 [13]、基于方差的敏感性分析(Sobol 指数)[36] 或 Morris 筛选 [27],所有这些方法都需要大量的独立仿真评估,并且随着参数数量的增加扩展性较差。虽然已探索使用可微渲染进行灯具布置的基于梯度的照明优化 [22, 32],但梯度服务于优化器而非人类。我们的指标显著性图以单次反向传播的代价提供了局部敏感性表征。

3 方法

该方法包含三个阶段:通过可微管线渲染图像,在该图像上评估标量指标,并通过指标和渲染器进行反向传播以获得每个参数的梯度。然后将这些梯度映射回图像空间进行可视化。我们描述每个阶段以及我们评估的指标。

3.1 可微图像形成

设 $R$ 为一个渲染器,它根据场景参数 $\theta$ 计算图像 $I = R(\theta)$。参数向量 $\theta$ 可能包括表面反射率、粗糙度值、折射率、发射器强度和几何量。我们使用具有多反弹全局光照的基于物理的蒙特卡洛路径追踪器,因此每个像素都是参数的函数,这些参数可能通过相互反射分布在整个场景中。给定在渲染图像上评估的标量指标 $M$,关键要求是整个组合 $M(R(\theta))$ 是可微的:渲染器 $R$ 和指标 $M$ 都必须允许梯度计算,以便我们可以通过指标和光传输模拟联合使用反向模式自动微分获得 $\partial M/\partial \theta$。我们使用带有 PRB [39] 的 Mitsuba 3 [16],尽管任何可微渲染器都可以发挥相同的作用。

3.2 指标显著性计算

给定一个评估光传输模拟属性的标量测量算子 $M : \mathbb{R}^D \rightarrow \mathbb{R}$,设 $I = R(\theta) \in \mathbb{R}^D$ 代表广义传感器响应。通过

第 5 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 5

通过扩展传统的图像形成模型,我可以编码标准的可见图像(其中 $D = H \times W \times C$)以及不可见或抽象的辐射度量属性。因此,组合 $M(R(\theta))$ 定义了场景参数的标量函数。应用链式法则可得参数空间梯度:

$$g = \frac{\partial M(R(\theta))}{\partial \theta} = \frac{\partial M}{\partial I} \frac{\partial I}{\partial \theta}. \quad (1)$$

链式法则将其分为两项:指标对图像的敏感性,这取决于 $M$ 的定义方式;图像对场景参数的敏感性,这取决于光传输。这两项无需独立计算或检查;其乘积通过反向传播自动获得。

每个分量 $g_i = \partial M/\partial \theta_i$ 具有直接的解释意义:它衡量的是在考虑所有直接和间接光路的情况下,$\theta_i$ 的单位扰动会导致 $M$ 发生多少变化。幅度 $|g_i|$ 表示重要性,符号表示方向。我们将参数 $\theta_i$ 的显著性定义为 $|g_i|$,对于向量值参数(例如 RGB 反射率),我们取梯度分量的 $\ell_2$ 范数。

场景参数 – • 镜面(alpha) 3.3 图像空间可视化 •• 白红(反射率) • 绿色(反射率) 如图 2 所示,梯度向量 $g$ 存在于参数空间中:每个分量对应一个命名的场景参数,而非像素。为了生成图像空间可视化,我们需要将每个像素与在该像素处可见的场景参数关联起来。我们通过从相机追踪主光线来实现这一点,并在每次相交时识别光线击中了哪个场景对象(因此是哪个材料参数)。这生成了一个逐像素的材料身份图,类似于计算机视觉中的实例分割掩码或视觉特效合成中的 cryptomatte 通道 [9]。然后,每个像素根据该位置可见材料的显著性进行着色,生成热力图,可与美观渲染图并排比较。

对于应用于整个对象的标量参数(例如表面的单一粗糙度值),显示该对象的每个像素都会获得相同的显著性值。对于空间变化的参数(如纹理贴图),梯度本身也是空间变化的,可以直接映射到表面上。在本工作中,我们专注于均匀的材料参数;空间变化的显著性场留待未来工作。

我们将所有参数的显著性值归一化到 [0,1] 以进行可视化,从而使地图突出显示场景配置内的相对重要性。生成的图像是

图 2:图像空间显著性图生成。逐像素材料身份(场景对象)根据其对应的参数敏感性(场景梯度)着色,以生成最终的指标特定热力图。

第 6 页

6 LINAS BERESNA 和 EUGENE FIUME:场景参数显著性

指标特异性:同一场景在相同条件下渲染,针对不同的指标会产生不同的显著性图。

3.4 指标的选择

为了展示通用性,我们从三个定性不同的家族中评估指标。

平均亮度。这是最简单的指标:渲染图像的平均亮度,使用标准光度系数作为 RGB 通道的加权总和计算得出。这作为一个基线。显著性图应突出显示具有大可见面积和高反射率的表面,这些是影响整体图像亮度的主要参数。

统一眩光等级 (UGR)。一种由 CIE [15] 标准化的心理视觉指标,用于评估建筑照明中的不适眩光。UGR 将眩光源的亮度、立体角和位置权重与背景亮度进行聚合。它是非线性的,涉及对数和比率,其对场景参数的依赖性通过眩光/背景分解和 Guth 位置指数 [11] 来中介。

神经感知分数。为了证明该方法不仅限于手工设计的指标,我们评估了一个由神经网络定义的指标。具体而言,我们从预训练的 ResNet-50 图像分类器 [12] 的预 softmax 类对数几率进行反向传播。这种情况值得注意,因为梯度必须流经神经网络潜在空间和物理光传输模拟, resulting 显著性图反映了这两个系统的联合敏感性。

4 结果

实验设置。我们使用 PRB [39] 配合 Mitsuba 3 [16] 和 DrJit [17] 渲染标准的室内场景,包括餐厅、厨房和客厅。我们追踪路径,最大反弹次数为六次,每像素 1024 个样本。对于每个场景,我们跟踪所有可微材料参数,并评估平均亮度、不适眩光和神经分类对数几率的指标显著性。

4.1 指标特异性

心理视觉指标(如 UGR)依赖于观察者与环境之间复杂的空间关系,而简单指标(如平均亮度)则测量全局场景能量。图 3 展示了我们的管道如何在客厅和厨房环境中适应这些根本不同的目标。

默认情况下,可微引擎生成参数敏感性的原始数学列表。虽然将这些梯度绘制为条形图(顶行)可产生精确的统计排名,但将这些数据与其空间背景隔离开来,使得人类设计师难以解析。通过聚合这些参数梯度并直接映射回 3D 场景几何结构,我们生成了指标敏感性的直观视觉热力图(底行)。

UGR 显著性图明确隔离了使给定相机姿态下的不适眩光最大化的特定反射表面和光源,例如客厅中的镜子或厨房中的金属餐具。这为设计师提供了高度局部化、可操作的缓解视觉不适的目标。为了验证这不仅仅是一个通用的场景

第 7 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 7

客厅:平均亮度 客厅:UGR 厨房:平均亮度 厨房:UGR

图 3:可视化指标特异性。虽然提取梯度可为场景参数提供精确的排序数据(顶行),但将这些原始数据映射回 3D 场景(底行)可实现直观的空间可视化。在多个场景中,UGR 评估隔离了导致不适眩光的高度局部化反射表面(例如镜子或金属餐具)。相比之下,平均亮度评估将焦点完全转移到驱动全局照明的较大表面上。

特征图时,我们将其与平均亮度目标进行比较。如图 3 所示,决定整体场景亮度的参数与导致局部眩光的参数不同。平均亮度图正确地将重点转移到较大的几何区域,如漫反射墙壁、天花板和地板,这证实了无论场景架构如何,我们的空间投影都能准确可视化所选指标背后的物理驱动因素。

4.2 神经与感知分数

我们通过评估语义分类器,展示了该流水线处理高维学习空间的能力。图 4 展示了当从 ResNet-50 的(a)美容渲染折叠椅类别(类别 559)的 logit 进行反向传播时,餐厅场景的指标显著性。梯度从神经网络潜在空间直接流入物理光传输模拟,捕捉了复杂的光学依赖关系。值得注意的是,该场景的左墙由高度反射的铬材料组成。生成的显著性图明确可视化了这种镜面表面如何影响分类分数。它表明,神经网络不仅依赖于直接的几何边缘,还依赖于反射特征和特定的材料粗糙度值,以在概念上识别场景中的物体。

(b) 显著性图

图 4:语义归因映射到 3D 参数空间。显著性图显示了哪些材料作为分类 logit 的线索。

第 8 页

8 LINAS BERESNA 和 EUGENE FIUME:场景参数显著性

4.3 通过独立参数消融进行验证

为了验证我们计算的梯度是否能准确预测目标函数的物理敏感性,我们对非线性 UGR 指标和全局平均亮度指标进行了独立消融测试(图 5)。由于这些指标代表了复杂的光学依赖关系,计算的梯度仅提供严格的局部一阶近似。为了在不与物理材料边界发生冲突(例如,表面粗糙度限制为 1.0)的情况下严格验证这一点,我们对排名靠前的每个参数评估了指标对小型独立梯度下降步骤(学习率 = 0.01)的实际响应。

验证:UGR 局部影响 (LR=0.01) 验证:平均亮度局部影响 (LR=0.01) 餐具 (alpha) 0.660 护墙板 (reflectance) 0.00036 瓷砖 (reflectance) 0.332 护墙板 (eta) 0.00006 餐具 (reflectance) 0.105 沙发腿 (reflectance) 0.00008 水壶 (alpha) 0.073 地板 (eta) 0.00004 抽油烟机 (alpha) 0.054 哑光漆 (reflectance) 0.00001 钢锅 (alpha) 0.002 镜子 (alpha) 0.00001 水壶 (reflectance) 0.002 沙发 (reflectance) 0.00001 抽油烟机 (reflectance) 0.001 玻璃 (alpha) 0.00001 餐具 (k) 0.001 拉丝不锈钢 (alpha) 0.00000 橱柜单元 (reflectance) 0.002 拉丝不锈钢 (reflectance) 0.00000

1.5 3.0 0.0 0.1 0.2 0.3 0.4 0.5 0.6 0.0 4.54 ×10 绝对变化 (| UGR|) 绝对变化 (| 平均亮度|)

(a) 厨房 UGR 验证 (b) 客厅平均亮度验证

图 5:独立消融验证。参数严格按照计算的梯度幅值(y 轴)排序。执行小型梯度下降步骤会在目标指标上产生绝对变化(x 轴)。UGR 评估 (a) 完美反映了计算的显著性排名,而平均亮度评估 (b) 则突显了全局随机指标的噪声底挑战。

如图 5a 所示,对局部 UGR 指标的绝对测量影响完全遵循我们计算的显著性排名,呈单调递减曲线。这证实了在我们的可微框架中,单次反向模式评估成功隔离并排列了导致眩光的真实物理驱动因素,有效地取代了数十次昂贵的有限差分模拟的需求。 在评估全局指标如平均亮度时(图 5b),排名最高的参数正确地主导了物理影响。然而,在较低排名中,我们观察到对严格单调性的轻微偏离。这突显了可微路径追踪中的一个固有挑战:当绝对指标变化低于 10−4 单位时,评估会陷入渲染器的随机噪声底。此外,对本质上不同的物理域(如漫反射率与折射率 $\eta$)应用统一的梯度步长,由于菲涅尔方程的非线性性质,会产生不同的宏观行为。我们将参数特定的自适应步长缩放和二阶海森近似探索留待未来工作。

5 讨论

地图揭示了什么。本工作的核心发现是,指标显著性图揭示了通过单独检查渲染图像或指标值无法直接访问的参数-指标关系。原始图像显示了场景的外观;指标返回一个总结该图像某些属性的单一数值;但两者都无法揭示该数值为何如此,或什么能最有效地改变它。

第 9 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 9

显著性图填补了这一空白。对于同一场景,不同指标下的显著性排名存在显著差异,这证实了该信息确实是指标特定的,无法从任何单次渲染或评估中恢复。

局限性。应注意几个局限性。首先,蒙特卡洛梯度估计器继承了底层路径追踪器的方差。在低采样数下,单个参数的显著性值可能具有噪声。在我们的实验中,中等采样数(64–256 spp)产生了稳定的排名,但细粒度的空间变化显著性场需要更高的采样预算或方差缩减技术。其次,该方法要求指标 $M$ 是可微的。具有硬阈值或离散决策的指标(例如,二元眩光源检测)必须松弛为平滑近似。例如,在我们的框架中评估 UGR 要求我们将标准的二元可见性检查重新表述为平滑的 sigmoid 松弛。松弛的选择会影响生成的显著性图,且松弛指标与原始指标之间的关系值得进一步研究。第三,梯度幅度衡量的是局部一阶敏感性。它没有捕捉参数之间的相互作用(二阶效应),也没有考虑在实际中可能阻止建议更改的参数约束。如果一个参数在物理上是固定的,那么即使其显著性很高,也可能无法操作。高阶方法,如基于 Hessian 的分析 [40],可以在更高的计算成本下提供更丰富的敏感性信息。

渲染模型的范围。我们的演示使用了基于物理的蒙特卡洛路径追踪器,但该原理适用于任何可微的图像形成过程。基于光栅化的可微渲染器 [20, 23]、神经辐射场 [26] 和高斯泼溅 [19] 都会产生可解释为显著性图的参数梯度。我们强调的多反弹设置是该方法最有价值的地方,因为正是在这里,人类关于参数影响的直觉失效了,但对于更简单的场景,更简单的渲染模型同样有效。

未来工作。本文确立了指标显著性图的概念并展示了其效用。仍有几个方向有待探索。在场景和图像空间中可视化梯度信息本身就是一个研究问题:带符号的图、矢量场表示和交互式探索界面可以提供比本文 presented 的幅度热力图更丰富且更具可操作性的信息。实时或交互式计算显著性图将使设计师能够在修改场景时动态探索参数敏感性,从而推动高效可微渲染方面的工作。最后,将显著性图与优化相结合,利用该图指导优化哪些参数以及固定哪些参数,可以将我们方法的解释性与现有逆渲染管道的自动化相结合。

6 结论

我们表明,可微渲染器产生的梯度信息作为直接输出是有价值的,而不仅仅是作为优化的中间量。通过将标量指标反向传播通过渲染管线,我们获得了指标显著性图,揭示了哪些场景参数对指标影响最大。这些图的成本很低(单次

第 10 页

10 林纳斯·贝雷斯卡和尤金·菲乌姆:场景参数显著性

反向传播),通用性(适用于任何可微指标和渲染器),以及信息性(揭示由多重反弹光传输介导的非显而易见依赖关系)。显著性排名是特定于指标的:同一场景在不同目标下会产生定性不同的图。这种指标特异性是其实用贡献,因为它提供了渲染图像或指标值单独无法传达的诊断信息。渲染一直服务于单一目的:使不可见变为可见,将光传输的数学转化为人类可以看见和推理的图像。可微渲染计算同一过程的导数,但迄今为止,这些导数仅被优化算法所消耗,从未被视为主要的可解释性对象。我们建议导数图像应享有与其伴随的原始图像相同的地位:它们是结构化的、可解释的,且专为人类视觉设计。

7 致谢

我们衷心感谢西蒙菲莎大学为本研究提供的资金支持,以及加拿大自然科学与工程研究委员会提供的探索性资助。

此外,我们要感谢 Benedikt Bitterli [5] 提供的渲染资源(包括 Cornell Box、Grey and White Room、Country Kitchen 和 The Breakfast Room 模型)。

参考文献

[1] Jonathan T Barron 和 Jitendra Malik。基于阴影的形状、光照和反射率。IEEE 模式分析与机器智能汇刊,37(8):1670–1687,2014。

[2] Jonathan T Barron, Ben Mildenhall, Matthew Tancik, Peter Hedman, Ricardo Martin-Brualla, 和 Pratul P Srinivasan。Mip-nerf:用于抗锯齿神经辐射场的多尺度表示。在 IEEE/CVF 国际计算机视觉会议论文集,第 5855–5864 页,2021。

[3] Harry Barrow, J Tenenbaum, A Hanson, 和 E Riseman。恢复场景固有特性。计算机视觉系统,2(3-26):2,1978。

[4] Benjamin Beilharz 和 Thomas SA Wallis。MRD:利用基于物理的可微渲染探测视觉模型的 3D 场景理解能力。arXiv 预印本 arXiv:2512.12307,2025。

[5] Benedikt Bitterli。渲染资源,2016。https://benedikt-bitterli.me/resources/。

[6] Angie Boggust, Harini Suresh, Hendrik Strobelt, John Guttag, 和 Arvind Satyanarayan。显著性卡片:一种表征和比较显著性方法的框架。在 2023 ACM 公平、问责与透明度会议论文集,第 285–296 页,2023。

第 11 页

利纳斯·贝雷斯卡和尤金·菲乌姆:场景参数显著性 11

[7] Aditya Chattopadhay, Anirban Sarkar, Prantik Howlader, 和 Vineeth N Balasubrama- nian。Grad-cam++:用于深度卷积网络的广义基于梯度的视觉解释。在 2018 IEEE 计算机视觉应用冬季会议 (WACV),第 839–847 页。IEEE,2018 年。

[8] Wenzheng Chen, Huan Ling, Jun Gao, Edward Smith, Jaakko Lehtinen, Alec Jacobson, 和 Sanja Fidler。学习使用基于插值的可微渲染器预测 3D 物体。神经信息处理系统进展,32,2019 年。

[9] Jonah Friedman 和 Andrew C Jones。完全自动化的支持运动模糊和透明度的 ID 遮罩。在 ACM SIGGRAPH 2015 海报,第 1–1 页。2015 年。

[10] Jian Gao, Chun Gu, Youtian Lin, Zhihao Li, Hao Zhu, Xun Cao, Li Zhang, 和 Yao Yao。可重光照 3D 高斯:具有 BRDF 分解和光线追踪的真实点云重光照。在欧洲计算机视觉会议,第 73–89 页。Springer, 2024 年。

[11] Sylvester K Guth。计算特定室内照明装置的视觉舒适度评级。照明工程,61(10):634,1966 年。

[12] Kaiming He, Xiangyu Zhang, Shaoqing Ren, 和 Jian Sun。用于图像识别的深度残差学习。在 IEEE 计算机视觉和 模式识别会议论文集,第 770–778 页,2016 年。

[13] Lisa Heschong。日光照明与人类表现。ASHRAE 杂志,44(6):65–67, 2002 年。

[14] Berthold K. P. Horn 和 Michael J. Brooks,编辑。从阴影恢复形状。MIT Press, 马萨诸塞州剑桥,美国,1989 年。ISBN 0262081830。

[15] 国际照明委员会。室内照明中的不适眩光。技术报告 CIE 117-1995,CIE,奥地利维也纳,1995 年。ISBN 978-3-900734-70-1。

[16] Wenzel Jakob, Sébastien Speierer, Nicolas Roussel, Merlin Nimier-David, Delio Vicini, Tizian Zeltner, Baptiste Nicolet, Miguel Crespo, Vincent Leroy, 和 Ziyi Zhang。 Mitsuba 3 渲染器,2022 年。https://mitsuba-renderer.org。

[17] Wenzel Jakob, Sébastien Speierer, Nicolas Roussel, 和 Delio Vicini。Dr.jit:一种用于可微渲染的即时编译器。图形学汇刊 (SIGGRAPH 论文集),41(4),2022 年 7 月。doi: 10.1145/3528223.3530099。

[18] Hiroharu Kato, Yoshitaka Ushiku, 和 Tatsuya Harada。神经 3D 网格渲染器。在 IEEE 计算机视觉和模式识别会议论文集,第 3907–3916 页,2018 年。

[19] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, 等。用于实时辐射场渲染的 3D 高斯溅射。ACM 图形学汇刊,42(4): 139–1,2023 年。

[20] Samuli Laine, Janne Hellsten, Tero Karras, Yeongho Seol, Jaakko Lehtinen, 和 Timo Aila。用于高性能可微渲染的模块化基元。ACM 图形学汇刊 (ToG),39(6):1–14,2020 年。

第 12 页

12 利纳斯·贝雷斯卡和尤金·菲乌姆:场景参数显著性

[21] 慈茂·李,米卡·阿塔拉,弗雷多·杜兰德,雅科·莱蒂宁。通过边缘采样进行可微蒙特卡洛光线追踪。ACM 图形学汇刊 (TOG),37(6):1–11,2018。

[22] 卢卡斯·利普,大卫·哈恩,皮埃尔·埃科米耶-诺卡,弗洛里安·里斯特,迈克尔·维默。用于照明设计优化的视角无关伴随光线追踪。ACM 图形学汇刊,43(3),2024年5月。ISSN 0730-0301。doi: 10.1145/3662180。

[23] 刘世晨,李天野,陈伟凯,李浩。软光栅化器:用于基于图像的 3D 推理的可微渲染器。在 IEEE/CVF 国际计算机视觉会议论文集,第 7708–7717 页,2019。

[24] I Lm。批准方法:IES 空间日光自治 (SDA) 和年度日照暴露 (ASE)。照明工程学会。https://www.ies.org/product/ies-spatial-daylight-autonomy-sda-and-annual-sunlight-exposure-ase,2013。

[25] 纪尧姆·卢贝,尼古拉斯·霍尔施鲁赫,文策尔·雅各布。重新参数化不连续积分器以实现可微渲染。图形学汇刊 (SIGGRAPH Asia 论文集),38(6),2019年12月。doi: 10.1145/3355089.3356510。

[26] 本·米尔登哈尔,普拉图尔·P·斯里尼瓦桑,马修·坦尼克,乔纳森·T·巴伦,拉维·拉莫莫蒂,任宁。NeRF:将场景表示为神经辐射场以进行视图合成。ACM 通讯,65(1):99–106,2021。

[27] 马克斯·D·莫里斯。初步计算实验的因子抽样计划。Technometrics,33(2):161–174,1991。

[28] 阿扎·纳比尔,约翰·马尔德耶维奇。有用的日光照度:日光因子的替代品。能源与建筑,38(7):905–913,2006。

[29] 梅林·尼米尔-大卫,德利奥·维奇尼,蒂齐安·泽尔特纳,文策尔·雅各布。Mitsuba 2:一种可重定向的前向和逆向渲染器。图形学汇刊 (SIGGRAPH Asia 论文集),38(6),2019年12月。doi: 10.1145/3355089.3356498。

[30] 梅林·尼米尔-大卫,塞巴斯蒂安·施皮尔勒,贝努瓦·鲁伊斯,文策尔·雅各布。辐射反向传播:一种用于闪电般快速可微渲染的伴随方法。图形学汇刊 (SIGGRAPH 论文集),39(4),2020年7月。doi: 10.1145/3386569.3392406。

[31] 克里斯托夫·莱因哈特。日光性能预测。在用于设计和运行的建筑性能模拟中,第 221–269 页。Routledge,2019。

[32] 安森·萨维奇。通过 Olat 基系数上的梯度下降实现 3D 场景重光照的可微目标。2026。

[33] 拉姆普拉萨特·R·塞尔瓦拉朱,迈克尔·科格斯韦尔,阿布舍克·达斯,拉马克里什纳·维丹塔姆,戴维·帕里克,德鲁夫·巴特拉。Grad-CAM:通过基于梯度的定位从深度网络中获取视觉解释。在 IEEE 国际计算机视觉会议论文集,第 618–626 页,2017。

[34] 凯伦·西蒙扬,安德烈亚·维德尔夫,安德鲁·泽瑟曼。深入卷积网络:可视化图像分类模型和显著性图。arXiv 预印本 arXiv:1312.6034,2013。

第 13 页

LINAS BERESNA 和 EUGENE FIUME:场景参数显著性 13

[35] Daniel Smilkov, Nikhil Thorat, Been Kim, Fernanda Viégas, 和 Martin Wattenberg。 Smoothgrad:通过添加噪声去除噪声。arXiv 预印本 arXiv:1706.03825,2017。

[36] Ilya M Sobol。非线性数学模型的全局敏感性指数及其蒙特卡洛估计。Mathematics and computers in simulation, 55(1-3):271–280, 2001。

[37] Mukund Sundararajan, Ankur Taly, 和 Qiqi Yan。深度网络的公理化归因。在 International conference on machine learning, 第 3319–3328 页。PMLR, 2017。

[38] Jonathan Tremblay, Bowen Wen, Valts Blukis, Balakumar Sundaralingam, Stephen Tyree, 和 Stan Birchfield。Diff-dope:可微深度物体姿态估计。arXiv 预印本 arXiv:2310.00463,2023。

[39] Delio Vicini, Sébastien Speierer, 和 Wenzel Jakob。Path Replay Backpropagation (PRB):使用恒定内存和线性时间对光路进行微分。Transactions on Graphics (Proceedings of SIGGRAPH), 40(4):108:1–108:14, 2021 年 8 月。doi: 10.1145/3450626.3459804。

[40] Zican Wang, Michael Fischer, 和 Tobias Ritschel。高阶可微渲染的随机梯度估计。In Proceedings of the IEEE/CVF International Conference on Computer Vision, 第 28198–28206 页, 2025。

[41] Jan Wienold 和 Jens Christoffersen。使用 CCD 相机评估方法并开发用于日光环境的新眩光预测模型。Energy and buildings, 38(7):743–757, 2006。

[42] Robert J Woodham。通过多图像确定表面方向的测光方法。Optical engineering, 19(1):139–144, 1980。

[43] Haocheng Yuan, Adrien Bousseau, Hao Pan, Quancheng Zhang, Niloy J Mitra, 和 Changjian Li。Diffcsg:通过光栅化实现可微 CSG。In SIGGRAPH Asia 2024 Conference Papers, 第 1–10 页, 2024。

[44] Alan Yuille 和 Daniel Kersten。视觉作为贝叶斯推理:通过合成进行分析?Trends in cognitive sciences, 10(7):301–308, 2006。

发表评论