打破信息瓶颈:基于相机-显示器耦合的端到端颜色直通

三分钟导读:该论文提出了一种端到端的学习框架Color Pass-Through,通过将相机和显示器视为耦合系统,直接学习从捕获图像到显示图像的映射,以解决传统分离校准方法中的信息瓶颈和误差累积问题,实现特定观察者下的感知颜色一致性。

英文题目:Color Pass-Through via Camera-Display Coupling

论文出处:arXiv 每日论文精选 · arXiv:2607.12746

原始论文:PDF / 论文页面

对应视频标题:打破信息瓶颈:基于相机-显示器耦合的端到端颜色直通|推荐指数:★★★★★

这篇论文解决什么问题?

智能手机拍摄场景并在屏幕上显示时,由于传统流水线将高维捕获-显示过程分解为两个单独校准的阶段(相机校准和显示器校准),并通过低维颜色变换连接,导致信息瓶颈和误差累积,使得显示图像的颜色、亮度和对比度与原始场景存在显著差异。

核心创新

  • 将相机和显示器视为耦合系统而非独立校准,通过端到端优化减少误差累积和信息瓶颈。
  • 提出基于重捕获协议的数据收集方法,用于训练像素级神经投影器以近似复杂的相机-显示器非线性映射。
  • 识别并解决相机 metameric-black (零空间) 导致的观察者特定颜色偏差,通过低秩近似和一步校准实现高效校正。
  • 引入AvgPool层和位置编码等架构改进,提升投影器对高频细节的捕捉能力和去马赛克伪影的抑制。

方法概览

提出Color Pass-Through框架,将相机和显示器视为单一耦合系统,通过端到端可学习的神经投影器直接映射显示颜色到原始场景颜色。该方法包含两个主要组件:(1) 相机-显示器投影器 (Camera-Display Projector, bFC),通过重捕获协议(将数字图像渲染到显示器并重新由相机捕获)训练像素级神经网络,学习非线性的相机-显示器映射;(2) 相机零空间颜色校正 (Camera-Null Color Correction),针对观察者与相机不同的情况(如人眼或DSLR),利用高光谱数据估计相机零空间的主成分,并通过学习预测器估计每像素的零空间系数,结合一步观察者特定的校准系数 φ 来补偿残留的颜色偏差。

逐图理解论文

方法概览:相机-显示器耦合

方法概览:相机-显示器耦合
Fig. 3: Overall System of Our Color Pass-Through. (a) Full color pass-through model corresponding to Eq. (11); (b) Objective function and evaluation criteria.

本文提出Color Pass-Through框架,核心思想是将相机和显示器视为一个单一的耦合系统。通过端到端可学习的神经投影器,直接学习从捕获图像到显示图像的映射。该方法包含两个主要组件:一是相机-显示器投影器,通过重捕获协议训练;二是相机零空间颜色校正,用于补偿观察者与相机不同时的颜色偏差。

投影器学习:重捕获协议

投影器学习:重捕获协议
Fig. 4: Learning FC from Recaptured Data. A pixel-wise model is trained to approximate FC via (a) a re-capture protocol and (b) pixel-aligned input–target pairs.

为了训练像素级神经投影器,我们采用重捕获协议。具体而言,将数字图像渲染到显示器上,再由相机重新捕获,从而生成像素对齐的输入-目标对。这种数据收集方式使得模型能够近似复杂的相机-显示器非线性映射,克服了传统查找表方法在高频细节捕捉上的不足。

架构改进:抑制伪影

架构改进:抑制伪影
Fig. 5: Effectiveness of the Learned Model for b FC (·; θ). In contrast to an affine fit (i) or a learned 3D LUT [79] (ii), our model (iii): captures (a) higher-frequency details and (b) achieves better performance. Notably, the learned projector exhibits a “vanishing” region where multiple camera color collapse to the same displayed color.

在投影器架构中,我们引入了AvgPool层和位置编码等改进。AvgPool层有助于抑制去马赛克伪影,使模型能更好地区分边缘像素。实验表明,相比CNN基线如CSRNet,我们的MLP架构在拟合复杂映射时表现更优,且能有效减少彩色边缘伪影,提升重建质量。

零空间校正:解决观察者差异

零空间校正:解决观察者差异
Fig. 6: Effectiveness of the Two Learned Components for Color Pass- Through. (a) When using another camera of the same model as the digital observer: (i) the learned camera–display projection alone is sufficient to achieve pass-through, (ii) no observer calibration for M is required; (b) When observer is different from camera (e.g. a DSLR): (i) the camera–display projection alone is insufficient, (ii) adding the camera-null correction for a target observer M yields consistent color reproduction.

当观察者与相机不同时,例如使用DSLR作为数字观察者,仅靠投影器是不够的。我们识别出相机同色异谱黑,即相机零空间,这是相机无法感知但观察者可见的光谱成分。通过高光谱数据估计零空间的主成分,并利用学习预测器估计每像素的零空间系数,结合一步观察者特定的校准系数phi,实现高效校正。

实验设置与基线对比

实验设置与基线对比
Fig. 8: Separated-view Comparison. The left three columns show images observed through a phone display, while the rightmost column directly observes the real scene. Our method preserves more consistent colors than other baselines.

我们在Huawei Pura 70 Pro和Xiaomi 17 Pro Max上进行评估,使用Sony ILCE-7M4 DSLR作为数字观察者代理。实验涵盖2500K至9000K色温及随机RGB-LED光照条件。基线包括默认智能手机ISP、多光源自动白平衡以及色卡校准方法,旨在全面验证所提方法在多样化场景下的鲁棒性。

实验与关键结果

  • 使用两台相同的智能手机(HUAWEI Pura 70 Pro 或 Xiaomi 17 Pro Max)分别作为相机和显示器,DSLR (Sony ILCE-7M4) 作为数字观察者进行定量评估。
  • 在多种未知光照条件(2500K-9000K色温及随机RGB-LED)下,使用24色ColorChecker色块进行定量比较。
  • 进行用户研究,由10名人类观察者对亮度准确性和颜色准确性进行5点Likert量表评分。
  • 对比基线包括:默认智能手机相机ISP、多光源自动白平衡 (Auto-WB)、色卡校准 (ColorChecker calibration)。
  • 消融实验验证了DSLR作为观察者代理的有效性、投影器的学习效率以及校准系数 φ 的鲁棒性。
  • 在24色ColorChecker色块测试中,Ours方法在Huawei手机上PSNR达到28.65,∆Emean为5.18,STRESS为17.48,优于所有基线。(第 13 页)
  • 在Xiaomi手机上,Ours方法PSNR达到29.10,∆Emean为4.79,STRESS为16.12。(第 13 页)
  • 用户研究中,Ours方法在亮度准确性上平均得分4.32,颜色准确性上平均得分4.03(满分5分),显著高于基线。(第 14 页)
  • 投影器学习模型 (Table 1a) PSNR为32.13,∆Emean为3.34,优于NiLUT和CSRNet。(第 12 页)
  • 零空间系数学习模型 (Table 1b) PSNR(ˆai, ai)为29.68,PSNR(ˆsi, si)为31.95。(第 12 页)

阅读时需要注意

  • 需要针对每个相机-显示器对进行校准,虽然只需一步校准,但仍需初始校准步骤。
  • 假设相机零空间具有低维特性,若实际场景超出此假设,校正效果可能受限。
  • 依赖于高光谱数据来估计相机零空间主成分,数据获取和预处理有一定复杂度。
  • 当前方法主要针对可见光范围,未明确讨论红外或紫外等非可见光谱的影响。
  • 校准系数 φ 是在特定场景下估计的,虽然实验显示其在不同光照下具有鲁棒性,但在极端光照变化下可能需要重新校准。
  • DSLR作为数字观察者代理,虽然与人类视觉趋势一致,但并非完全等同于人眼,定量结果可能与人眼感知存在细微差异。
  • 重捕获协议依赖于相机和显示器的精确对齐,光学流模型用于像素对齐,若对齐误差较大可能影响投影器训练。

关联工作

  • ICC workflows:传统颜色管理标准,采用分离校准,本文指出其存在信息瓶颈和误差累积问题。(第 4 页)
  • Computational color constancy (e.g., Afifi et al. [2]):现有学习白平衡方法,仅校正相机端颜色,未考虑显示器端复现,本文将其作为基线对比。(第 4 页)
  • Display color management (e.g., CIECAM02, GoG models):显示器校准方法,忽略相机捕获过程,本文指出其未解决耦合的捕获-显示问题。(第 5 页)
  • NiLUT [25], CSRNet [39], 3D LUT [79]:现有的像素级颜色变换或查找表方法,本文在投影器学习中与之对比,证明所提MLP架构性能更优。(第 [8, 12] 页)
  • Spectral reconstruction networks (e.g., MST++ [19]):用于估计相机零空间系数的基础网络架构。(第 11 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

通过相机-显示器耦合实现颜色直通

Ruikang Li1, Molin Li2, Jiarui Wu1, Zhe Wei3, Pengpeng Liu3, 和 Tianfan Xue1,†

1 香港中文大学多媒体实验室 (CUHK MMLab) 2 浙江大学 3 华为中央媒体技术研究所

摘要。当真实世界场景被智能手机相机捕获并在其屏幕上查看时,显示图像在颜色、亮度和对比度方面通常与原始场景存在显著差异。尽管现代相机和显示器技术取得了巨大进步,但这种差距依然存在。一个关键原因是,大多数流程将高维的捕获到显示过程分解为两个分别校准的相机和显示器阶段,然后通过低维颜色变换将它们连接起来,从而导致信息瓶颈和不可避免的误差累积。为了应对这一系统性挑战,我们提出了“颜色直通”(Color Pass-Through),这是一种直接在捕获图像上运行的端到端学习框架。我们的关键见解是将相机和显示器视为一个耦合系统,而不是单独校准它们,这带来了实际优势:(1) 它通过端到端优化将整个真实世界场景带到显示器上,以及 (2) 它允许通过完整的捕获到显示路径为每个不同的观察者进行高效的一步校准。我们使用数字观察者和人类观察者对“颜色直通”进行了验证。与代表性基线相比,我们的方法在 5 分制用户研究中平均提高了 2.0 分,在定量指标上提高了 2 倍以上,证明了对原始场景感知颜色的改进复现。参见项目页面:https://lyricccco.github.io/color-pass-through/

关键词:计算摄影 · 颜色直通

1 引言

摄影旨在在显示器上展示时忠实地重现真实场景的颜色。然而,在实践中,我们在现实世界中看到的往往与智能手机屏幕呈现的内容不同。如图 1 (a) 所示,使用智能手机捕获场景并在屏幕上查看可能会引入色度和亮度的变化:玩偶的色调发生漂移,与原始场景相比,显示图像可能显得过亮、去饱和或褪色。历史上,由于传感器动态范围有限以及色域窄、低比特面板,这种感知差距被加剧了。尽管现代传感器和高质量显示器缓解了这种差距,但明显的差异仍然存在

第 2 页

2 R. Li 等

真实场景

智能手机 (a) 默认智能手机相机 (b) 经过学习到的白平衡后

数字 观察者

用于定量评估 和结果可视化

人类 用于定性评估 观察者 和鲁棒性分析 (c) 经过色卡校准后 (d) 我们的方法

图 1: 颜色直通。在多种未知光源下拍摄真实场景并在智能手机屏幕上重新显示,通常会引入感知上的颜色不一致 (a)。学习到的多光源自动白平衡可以减少由光照引起的色偏 (b),而基于场景的色卡校准可以将图像映射到标准颜色空间 (c);但两者都无法复现相同的颜色。相比之下,我们的方法更好地保留了数字观察者和人类观察者的感知场景颜色 (d)。

在标准传感器校准和下游图像后处理下。然而,即使强大的后处理基线也无法缩小这一差距。学习到的多光源自动白平衡可以减少由光照引起的色偏 [2](图 1 (b)),而基于场景的色卡校准可以将捕获的图像映射到标准颜色空间 [70](图 1 (c))。从根本上说,这些方法依赖于对光照或标准颜色空间的受限假设,因此无法为特定相机-显示器对在多样化、无约束的真实场景中提供一致的色彩忠实复现保证。 这一差距在沉浸式系统中甚至更为严重:VR 头显(例如 Vision Pro)中的透视视图在颜色和对比度上与裸眼观察可能存在显著偏差,从而损害舒适感和沉浸感 [11,26],消费级 AR 显示设备中的虚拟试衣镜也存在类似的保真度问题 [74]。 为了理解现有解决方案为何难以缩小这一颜色差距,我们重新审视从捕获到显示的成像管线。标准化的国际色彩联盟 (ICC) 工作流 [42] 依赖三通道颜色表示作为可处理的中间表示(图 2 (a))。在此过程中,它们将流程分解为两个分别校准的阶段:相机校准,将场景辐射度映射到“RGB”,以及显示器校准,将“RGB”映射到发射辐射度。这种分离会累积误差。更根本的是,相机测量本质上只有三维,而现实世界的辐射度是高维的,因此仅靠校准无法克服这一固有的信息瓶颈。 为了缩小这一感知颜色差距,我们提出将相机和显示器视为一个单一的耦合系统,通过端到端可学习的神经投影器进行桥接(图 2 (b))。与其将每个设备校准到参考颜色然后组合

第 3 页

颜色直通 3

中间 色彩空间 辐射通量直通 场景 相机 CIE X 显示器 显示器 场景 显示器 辐射亮度 𝐂 Y Z 𝐃 辐射亮度 辐射亮度 辐射亮度 𝐬𝒊 𝐬𝒊∗ 𝐬𝒊∈ℝ𝑳 𝐬𝒊∗∈ℝ𝑳 校准 校准 (1) ℝ𝟑 (2)

(a) 先前方法使用固定的色彩空间,并采用两次分离的校准。 特定观察者 𝐌∈ℝ𝟑×𝐋 端到端 学习到的投影器 颜色直通 场景 相机 显示器 显示器 辐射亮度 𝐂 𝐃 辐射亮度 场景 显示器 颜色 颜色 𝐬𝒊 𝐬𝒊∗ 𝐌𝐬𝒊∈ℝ𝟑 𝐌𝐬𝒊 ∗∈ℝ𝟑 𝐅 (b) 我们的方法学习一个端到端投影器,针对单一特定观察者进行优化。

图 2: 颜色复现方法与目标的比较。

对于分离的映射,我们直接将显示颜色映射到特定观察者的原始场景 颜色。这种端到端的公式化减少了误差累积,并减轻了信息瓶颈的影响,从而在颜色和亮度方面产生了显著更小的不匹配(图 1 (d))。虽然这看似增加了校准负担,因为必须表征每个相机–显示器对,但它非常适合直通用例,在这些用例中,用户通常在同一部手机或沉浸式设备上查看捕获的场景。因此,我们针对每个相机–显示器对进行校准,而不是针对所有可能的组合进行校准。 我们将耦合的相机–显示器对表示为未知的端到端 非线性投影器(一种设备特定的映射),并使用轻量级的像素级神经网络进行学习。为了获取训练数据,我们引入了一种重捕获协议:每个数字 RGB 样本在目标显示器上渲染,并由配对的相机重新成像,由此产生的测量结果监督相机–显示器 投影器。我们进一步研究了数据集设计和网络架构,确定了一种高效的配置,该配置使用紧凑模型学习投影器,从而实现具有快速推理能力的实用相机–显示器投影。 尽管使用了这种学习到的投影器,但在复杂照明条件下,目标人类观察者仍会看到可见的颜色偏差。这种剩余的不匹配源于相机的同色异谱现象。因此,我们推导了从理想化的辐射通量直通到颜色直通的目标(图 2,右侧),揭示了主要的差异在于相机的同色异谱黑子空间:对相机不可见的光谱成分在显示后仍会影响观察者的感知颜色,即,对相机而言颜色相同,但对人类观察者来说可能看起来完全不同。这一限制是根本性的,因为相机的光谱灵敏度通常与人类视觉响应不同。 经验上,我们发现相机零空间在实际中具有较低的本征维度,并且可以通过单个主要分量很好地近似,这也使得观察者特定的校正保持低维。因此,我们使用学习到的预测器以及一步应用的单个观察者特定的校准系数 ∈R3×1 来补偿剩余的颜色偏差。

第 4 页

4 R. Li 等

贡献。本文提出了一种端到端优化系统,将相机-显示器耦合,以实现针对特定观察者的颜色直通(Color Pass-Through)。

– 学习的相机-显示器投影(Learned Camera-Display Projection)。我们的核心贡献是一个高效的像素级神经网络投影器,它建模了耦合相机-显示器的端到端映射,以及用于数据收集的实际重捕获协议(Re-capture protocol)。 – 相机零空间颜色校正(Camera-Null Color Correction)。我们确定主要的残差误差位于相机的同色异谱黑(Metameric-black,即相机零空间)子空间中,并通过一个带有单步观察者特定校准系数(Calibration coefficient φ)的学习预测器估计其主要分量,以补偿剩余的颜色偏差。 – 实验验证。我们使用 DSLR(一种用于生成所有定量结果和图表的固定数字观察者代理)进行客观测量,并通过用户研究进行主观评估,验证了我们的方法,证明了在各种场景和光源下鲁棒的颜色直通性能。

2 相关工作

传统的颜色再现管线(例如 ICC 工作流)依赖于中间的设备无关参考空间(如 CIE XYZ)来中介设备间的转换。在此范式下,捕获设备(如相机和扫描仪)将传感器测量值映射到参考空间,而输出设备(如显示器和打印机)应用逆映射将设备相关信号转换为预期的颜色。这种设计产生了两个解耦的校准阶段:相机校准和显示器校准。我们关注与我们的设置最相关的工作线,并建议读者参考 [28,36] 以获取更广泛的背景信息。

计算白平衡(Computational color constancy)。大量关于相机校准的工作解决了照片中的场景照明校正问题,假设在不同光照条件下感知颜色保持一致 [16,32,34]。这个问题通常被称为白平衡(white balance)或颜色恒常性。传统方法依赖于手工设计的假设 [18,29,72],而最近基于学习的方法直接从数据中估计照明 [1,4,12,13,15,41,47],形成了计算白平衡领域。然而,由于光的高维性质,全局线性 3×3 变换不足以实现准确的相机颜色恒常性 [22,30,46]。最近的工作通过要么将单光源估计扩展到多光源设置 [3,48,49,68],要么从 RGB 对齐转向光谱建模 [24,52,54] 来解决这一限制。这些方法改进了相机端的颜色校正,但没有建模下游的显示器再现。因此,它们不能保证校正后的图像在特定显示器上显示时,能为目标观察者再现原始场景的感知外观。

显示器颜色管理。显示器校准通常遵循 ICC 工作流,该流程通过设备无关参考空间转换设备相关信号。色适应变换(例如 Bradford 或 von Kries)

第 5 页

颜色直通 5

以补偿光照差异 [40],而诸如 CIECAM02 之类的颜色外观模型进一步考虑了感知观看条件 [59, 80]。显示特性化本身通常使用参数传递函数进行建模,例如增益-偏移-伽马(Gain–Offset–Gamma, GoG)模型 [23, 76],该模型描述了设备输入信号与发射辐射度之间的映射关系。现代设备还会根据环境光照条件调整这些变换(例如 Apple 的 True Tone [8, 21, 66])。这些方法表征了在特定观看条件下的显示端重放效果,但忽略了相机捕获过程,从而未能解决耦合的捕获到显示问题。

3 颜色准确直通推导

我们首先引入一个通过相机 C 和显示器 D 由目标观察者 M 感知的颜色直通理论模型。直接将捕获的图像显示在屏幕上可能会在实际场景颜色和显示颜色之间引入感知差距。为了缩小这一差距,我们在显示前对捕获的图像应用校正映射 F,以抵消失真(图 2 左侧)。

3.1 预备知识:理想化辐射度直通

颜色重放的一种理想情况是辐射度直通:对于每个场景点 i,相应的显示辐射度 s∗i 应精确复现场景辐射度 si,即 s∗i = si。这保证了任何具有光谱灵敏度 M 的观察者都会感知到相同的颜色,因为对于所有 M,Ms∗i = Msi 均成立。 然而,这种理想的辐射度直通通常是不可能的,因为场景辐射度是高维信息,而相机仅记录 3 维颜色。耦合的相机-显示器充当自编码器:它将高维辐射度编码为低维颜色,然后再解码回来,在传输过程中不可避免地会丢弃光谱信息。 一种潜在的解决方案是修改捕获的图像,使显示辐射度与场景辐射度匹配。然而,这通常是不可能的。我们用光谱灵敏度 C ∈R3×L 对相机进行建模,用光谱基色 D ∈RL×3 对显示器进行建模。令 si, s∗i ∈RL 表示像素 i 处离散化的场景和重放辐射度,在 L 个波长处采样,3 为颜色通道数。为了实现辐射度直通(场景辐射度与显示辐射度之间无差距),我们需要设计一个校正函数矩阵 F ∈R3×3 应用于捕获的图像,使得:

\ mat h bf {s} _i\;\equiv\;\mathbf{s}^{*}_i\;\equiv\;\mathbf{D}\mathbf{F}\mathbf{C}\mathbf{s}_i,\quad\foralli,\label(1)

为了使公式 1 对所有 si 成立,复合算子 DFC ∈RL×L 必须是恒等算子。然而,这通常是不可能的:由于校正矩阵 F ∈R3×3,DFC 的秩最多为 3,因此当 L ≫3 时,它不可能等于 RL×L 中的恒等算子。这一秩论证形式化了一个基本限制:仅使用有限数量的通道,无法精确重建任意辐射度。因此,我们针对下文讨论的较弱版本的直通。

第 6 页

6 R. Li et al.

Avg Positional MLP ෠𝐅𝐌𝐂𝒔𝒊 ∈ℝ𝟑 Scene encoding Learned image Point 𝑖 ෡𝓕𝐂 Display 𝐃 𝒔𝒊 ∈ℝ𝑳 Scene radiance 𝒔𝒊 Observer Display radiance 𝒔𝒊∗ Calibrated 𝝋 ∈ℝ𝑳 Null-Space𝝋ෝ𝒂𝒊𝒆image

Camera 𝐂 CNN first principal 𝐂𝒔𝒊 component 𝐞 Display ∈ℝ𝟑 Camera raw image

(a) Full color pass-through model with 𝐌ො𝒔𝒊 ∗= 𝐌𝐃∙෡𝓕𝐂∙𝐂𝒔𝒊−𝝋ෝ𝒂𝒊𝒆

𝐌𝒔𝒊= 𝐌ො𝒔𝒊 ∗

(b) Evaluate color pass-through with specific-observer 𝐌

Fig. 3: Overall System of Our Color Pass-Through. (a) Full color pass-through model corresponding to Eq. (11); (b) Objective function and evaluation criteria.

3.2 Color Pass-Through

While exact radiance pass-through is generally impossible, we instead target a more practical goal: color pass-through: the display radiance need not match the scene radiance exactly; rather, it should appear similar to an observer (Fig. 2 right-side). Here the observer can be either a human or a three-channel camera, both of which possess limited color perceptron. We name this color pass-through. Formally, let M ∈R3×L denote the spectral sensitivities of an observer. To achieve color pass-through, the observed display color Msi ∈R3, for a given scene point should equal the observed scene color Ms∗i ∈R3. Here we still in- troduce a correction FM on captured image to enforce perceptually equivalence:

\ m athb f {M}\mat hb f { s }_i \;\equiv\;\mathbf{M}\mathbf{s}^{*}_i\;\equiv\;\mathbf{M}\mathbf{D}\mathbf{F}_{\mathbf{M}}\mathbf{C}\mathbf{s}_i,\quad\foralli\quad\Rightarrow\quad\mathbf{F}_{\mathbf{M}}\;=\;(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{C}^{\dagger\label(2) where (·)† denotes the Moore–Penrose pseudoinverse. Here MD ∈R3×3 and MC† ∈R3×L. In practice, directly instantiating the correction FM ∈R3×L is difficult because the sensitivity M is an unknown high-dimentional matrix and varies across observers. Consequently, (MD)† cannot be reliably calibrated. We therefore propose to approximate FM through decomposition described below.

4 Learning Color Pass-Through

Since it is hard to directly learn an observer-specifc FM, we derive a robust, prac- tical solution by decomposing it into two objectives: (i) a camera–display projec- tion term FC, which enforces pass-through in the camera measurement space, and (ii) a camera-null color correction term δi, which compensates observer- dependent deviations lies in the spectral space that are invisible to the camera.

第 7 页

颜色直通 7

配对数据重捕获

在 𝐃 上显示 使用 𝐂 重捕获 下采样 裁剪

收集的 RGB 图像 像素级模型训练 重捕获的 RGB 图像 预训练的光流模型

G MLP Avg 位置编码 R, G, B encoding R, B 目标 输入 ෡𝓕𝐂 𝝈𝒊 𝐂𝐃𝝈𝒊 (a) 相机-显示器投影仪 ෡𝓕𝐂 的模型训练与重捕获数据整理协议 (b) 模型的输入与目标

图 4: 从重捕获数据中学习 FC。通过 (a) 重捕获协议和 (b) 像素对齐的输入-目标对,训练像素级模型以近似 FC。

这种分解将 FM 转化为两个可学习的预测器,它们可以独立训练和优化,然后在推理时端到端地组合,以针对特定观察者在一步内校准系数 φ ∈R3×1,如图 3 所示。每个模块的数学推导和实现细节如下所述,最终得出公式 (11)。

4.1 相机-显示器投影

在本节中,我们通过用相机 C 替换实际的人类观察者 M 来简化问题,即 M := C,其中我们假设观察者使用的是同型号相机。在此条件下,公式 (2) 简化为一种特殊情况,即观察者特定的目标 FM 坍缩为相机特定的映射 FC:

\ m athb f {C}\mat hb f { s }_i \;\equiv\;\mathbf{C}\mathbf{s}^{*}_i\;\equiv\;\mathbf{C}\mathbf{D}\mathbf{F}_{\mathbf{C}}\mathbf{C}\mathbf{s}_i,\quad\foralli\quad\Rightarrow\quad\mathbf{F}_{\mathbf{C}}\;=\;(\mathbf{C}\mathbf{D})^{\dagger\label(3)

这为颜色直通提供了一个简单的解,FC = (CD)† ∈R3×3,我们称之为相机-显示器投影仪。它构成了我们模型的核心组件,并且正如我们稍后所示,可以通过简单的训练目标从数据中学习。得到的相机-显示器投影定义为 PC := DFCC ∈ RL×L,因为它是一个满足 P2C = PC 的幂等投影,可以将任何场景辐射度 si 映射为保留相机颜色的相机同色异谱体 s∗i。 原则上,人们可以通过经典的光谱校准来估计 FC(例如,我们可以使用单色仪测量相机 C,使用光谱仪测量显示器 D)。然而,这种校准可能并不准确,因为商用显示器在默认模式下表现出显著的非线性(例如,伽马和色调映射),这些非线性无法完全禁用。因此,单一的仿射变换不足以准确建模相机-显示器投影仪 FC。 这促使我们采用一种数据驱动的替代方案。我们不强制要求线性,而是将 FC = (CD)† 视为一个未知的(可能是非线性的)算子 FC (·),并从重捕获的对中对其进行学习(图 4 (a))。在前向捕获和显示过程中,场景辐射度依次通过相机 C 和显示器 D,形成算子 (CD)。为了近似其逆运算,我们构建了一个反向

第 8 页

8 R. Li et al.

Input Target

20

(i) 17 PSNR 17.27 / ΔE 18.9 14

(ii) 11 PSNR 31.17 / ΔE 3.82 8

(i) Optimizing 3 × 4 (ii) Optimizing 3-D LUT (iii) Optimizing MLP with (iii) 5 affine matrix with regularizations P. E. and AvgPool (ours) PSNR 35.68 / ΔE 2.51 2 (a) Visualize the learned ℝ3 →ℝ3 mappings of practical camera-display projector ෡𝓕𝐂 (b) Optimizing results and error maps

Fig. 5: Effectiveness of the Learned Model for FC (·; θ). In contrast to an affine b fit (i) or a learned 3D LUT [79] (ii), our model (iii): captures (a) higher-frequency details and (b) achieves better performance. Notably, the learned projector exhibits a “vanishing” region where multiple camera color collapse to the same displayed color.

process: digital images are first rendered on the display and then re-captured by the camera, implicitly modeling the pseudo-inverse of CD. Specifically, we construct training data by (i) sampling RGB images as super- vision σi ∈R3, (ii) rendering on D, and (iii) re-capturing the displayed images with C to obtain (CD)σi ∈R3. After pixel-wise alignment using an optical-flow model [71] (Fig. 4 (b)), we train a pixel-wise network to explicitly learn the mapping (CD)σi →σi, yielding a non-linear approximation of (CD)†. We introduce two key architectural refinements that enable a neural surrogate to represent the practically complex projector FC (·). First, following learned color-transfer models [20,53],we use a lightweight multilayer perceptron (MLP) parameterized by θ–two fully connected layers with hidden width 128–augmented with positional encoding to better preserve high-frequency variations. Second, we apply a simple but effective AvgPool layer to the green channel of the input. The motivation is that demosaicing introduces spatial interpolation: each RGB triplet is partially synthesized from neighboring sensor samples. Although pixel-shift cameras could provide per-pixel tri-stimulus measurements [56], we instead adopt this minimal preprocessing step, which we find consistently improves accuracy, detailed in supplementary. With these refinements, we adopt a learned neural projector bFC(·; θ) and optimize θ by minimizing the following objective:

\ the ta { } ;= \ r g \min _ ta_{i}\left\lVert\,\sigma_i\widehat{\mathcal{F}}_{\mathbf{C}}\!\bigl((\mathbf{C}\mathbf{D})\sigma_i;\theta\bigr\right\rVert\label(4) ;\a ^ \ {\the *

Compared to alternative learned fits, our model captures substantially higher- frequency details (Fig. 5 (a)) and yields better quantitative results (Fig. 5 (b)). However, the learned camera–display projector guarantees color pass-through only when camera itself is the observer (Fig. 6 (a)).When the observer differs from the camera—e.g., a DSLR—bFC alone leads to noticeable color shifts in the image displayed on the phone (Fig. 6 (b)), we address this in the next section.

第 9 页

颜色直通 9

在观察者 𝐌≔𝐂 眼中 真实场景 相机 𝐂 学习函数 显示器 𝐃 手机屏幕 无需执行 相机零空间校正 相机 𝐂

(a) 特例:观察者作为 𝐌≔𝐂 学习 函数 = 𝐂𝐃† → ෡𝓕𝐂 函数学习 = 𝐌𝐃†𝐌𝐂† → 𝐂𝒔𝒊−𝝋ෝ𝒂𝒊𝒆෡𝓕𝐂∙

在观察者 𝐌≠𝐂 眼中 在观察者 𝐌≠𝐂 眼中 真实场景 相机 𝐂 学习函数 显示器 𝐃 手机屏幕

DSLR 𝐌

(b) 常见情况:观察者作为 𝐌≠𝐂 (i) 仅针对 𝐂 的相机-显示器投影 (ii) 针对 𝐌 进行相机零空间校正后

图 6:颜色直通中两个学习组件的有效性。(a) 当使用同型号的另一台相机作为数字观察者时:(i) 仅学习到的相机–显示器投影就足以实现直通,(ii) 无需对 M 进行观察者校准;(b) 当观察者与相机不同时(例如 DSLR):(i) 仅相机–显示器投影是不够的,(ii) 为目标观察者 M 添加相机零空间校正可实现一致的颜色复现。

4.2 相机零空间颜色校正 尽管学习到的投影器 𝐅𝐂(近似于 (𝐂𝐃)†)在相机测量空间中可靠地强制实现了颜色直通,但我们最终的目标是为目标观察者 𝐌 实现直通。因此,我们分析了相机对齐的投影器在何种条件下能迁移到其他观察者,以及在何时会失效。 我们的动机来自实证。考虑两部同型号的智能手机:一部作为相机,另一部作为观察者(图 6 (a))。当我们通过一部相同的手机(作为数字观察者)将真实场景与手机上显示的图像进行比较时,仅相机–显示器投影就能从手机视角复现匹配的颜色。然而,对于其他观看者来说,手机上显示图像的颜色在感知上仍可能与真实场景存在偏差。在实践中,我们经常观察到屏幕上有一层淡淡的有色“色罩”。为了明确这种差异,我们引入一台 DSLR 作为代理的 3 通道观察者(图 6 (b))。 为了消除这种“色罩”,我们引入了相机零空间颜色校正。我们使用单个观察者特定的校准系数来估计残留的色偏,并对其进行补偿,以实现针对 𝐌 的颜色直通。 首先,我们推导残留色偏的起源。为了推导清晰,我们暂时将 𝐅𝐂 视为线性的,并将校正应用于投影器的输入端而非输出端。原因是实际层面的:在真实系统中,𝐅𝐂 本质上是非线性的(见图 5),这使得在此映射之后的补偿更加纠缠且不稳定。相反,在投影器之前应用校正会产生更清晰且更稳健的调整。因此,我们在 𝐅𝐂 的输入处引入一个校正项 𝛿𝑖 ∈ℝ³,并将式 (2) 中的观察者特定解与式 (3) 中的相机特定解联系起来,得到:

\ma t hb f {F } _{ \ m at hb f { M }} \ ,\mathbf{C}\mathbf{s}_i\;=\;\mathbf{F}_{\mathbf{C}}\bigl(\mathbf{C}\mathbf{s}_i-\delta_i\bigr\quad\Rightarrow\quad\delta_i\;:=\;\mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i,\label(5)

第 10 页

10 R. Li et al.

其中 $P_M = D(MD)^\dagger M$ 是一个幂等投影矩阵,具有与 $P_C$ 相似的属性。公式 (5) 揭示了刻画校正项 $\delta_i$ 的两个关键情形:

(1) 当对于所有观察者 $M$,$\delta_i = 0$ 时。公式 (5) 成立的充分条件是:

$$ \mathrm{null}(\mathbf{C})\subseteq\mathrm{null}(\mathbf{M}),\label{6} $$

这表明任何对相机不可见的光谱成分对观察者也是不可见的。我们将此称为相机-显示器投影下的 Luther–Ives 条件。它在精神上与用于色彩捕获的经典 Luther–Ives 条件($M = T_C \Leftrightarrow \mathrm{null}(\mathbf{M}) = \mathrm{null}(\mathbf{C})$)密切相关,但扩展了其条件。我们在补充材料中提供了证明,并提出了一种硬件驱动的解决方案来强制 $\delta_i = 0$。然而,在常见设置中,公式 (6) 通常不成立。因此,我们寻求一种基于优化的学习方法来估计观察者特定的 $\delta_i$ 近似值,从而引出第二种情形。

(2) 当对于特定观察者 $M$,$\delta_i \neq 0$ 时。根据公式 (5),使用 $F_C$ 需要估计 $\delta_i$ 并将其从相机颜色 $C\mathbf{s}_i$ 中减去。为了显式分析 $\delta_i$,我们建议通过将 $\mathbf{s}_i$ 投影到投影矩阵 $P_C$ 上来对其进行分解:

$$ \mathbf{s}_i = \mathbf{r}_i + \mathbf{n}_i, \qquad \begin{aligned} \mathbf{r}_i &:= \mathbf{P}_{\mathrm{C}}\mathbf{s}_i \quad \in \mathrm{Range}(\mathbf{C}) \\ \mathbf{n}_i &:= \mathbf{s}_i – \mathbf{r}_i \quad \in \mathrm{Null}(\mathbf{C}), \end{aligned} \label{7} $$

从几何上看,公式 (7) 对应于沿 $\mathrm{null}(\mathbf{C})$ 方向将 $\mathbf{s}_i$ 斜投影到 $\mathrm{Range}(\mathbf{D})$ 上。一个关键后果是 $C(I-P_M)\mathbf{r}_i = 0$,证明见补充材料。因此,公式 (5) 中的校正项 $\delta_i$ 简化为 $C(I – P_M)\mathbf{n}_i$,这表明校正项完全起源于对相机 $C$ 而言的同色异谱黑(即不可见)空间,因为 $\mathbf{n}_i \in \mathrm{null}(\mathbf{C})$,从而 $C\mathbf{n}_i = 0$。

在实践中,唯一可用的测量值是相机颜色 $C\mathbf{s}_i \in \mathbb{R}^3$,然而所需的校正项 $\delta_i$ 取决于未观测到的分量 $\mathbf{n}_i$。一种天真的解决方案是将 $C\mathbf{s}_i$ 视为先验,并尝试重构 $\mathbf{n}_i \in \mathbb{R}^L$(甚至是完整光谱)。即使这种重构是可行的,仍存在第二个瓶颈:计算 $\delta_i$ 需要观察者相关的算子 $C(I – P_M) \in \mathbb{R}^{3 \times L}$,由于其具有 $L$ 维,因此难以校准。

为了使 $C(I-P_M)$ 可校准,我们利用经典观察结果,即自然反射率和辐射光谱表现出低本征维度 [58,63]。因此,我们假设相机零空间分量 $\mathbf{n}_i$ 也大致位于一个低维子空间中,并使用 PCA 基对其进行建模,我们得到:

$$ \mathbf{n}_i \approx \sum_{k=1}^{K} a_{i}^{(k)}\,\mathbf{e}^{(k)} \qquad K \ll L, \label{8} $$

其中 $K$ 是 PCA 基的数量。我们发现,在大型辐射集上,第一个主成分解释了约 93% 的方差(见补充材料),这促使我们采用实用的秩-1 近似,即 $K = 1$:$\mathbf{n}_i \approx \hat{a}_i \mathbf{e} \in \mathbb{R}^{1 \times L}$,因此公式 (5) 中的校正颜色 $\delta_i$ 变为:

$$ \delta_i = C(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\cdot\mathbf{n}_i \approx \varphi \cdot a_i \label{9} $$

第 11 页

颜色直通 11

估计的相机 第一主成分 模拟的 模拟相机- 高光谱图像 传感器灵敏度 的 𝐧𝒊 相机原始 RGB 零空间系数 𝐬𝒊∈ℝ𝑳 𝐂∈ℝ𝟑×𝑳 𝐞∈ℝ𝟏×𝑳 𝐂𝐬𝒊∈ℝ𝟑 𝒂𝒊∈ℝ𝟏

(a) 使用校准后的 𝐂 和光谱数据集估计 𝐞 (b) 利用 (a) 构建虚拟训练数据

CNN 零空间 𝐂𝐬𝒊 ො𝐬𝒊 ෝ𝐧𝒊 ෝ𝒂𝒊= ෝ𝐧𝒊/𝒆 投影 使用 𝐂

损失函数: 𝝀𝟏 ො𝐬𝒊−𝐬𝒊𝟏 + 𝝀𝟐 ෝ𝒂𝒊−𝒂𝒊𝟏 + 𝝀𝟑 𝛁ෝ𝒂𝒊−𝛁𝒂𝒊𝟏

(c) 使用 CNN 网络学习逐像素相机零空间系数

图 7: 从高光谱数据中学习相机零空间颜色系数 𝑎𝑖。

在此,所有三项均可估计。第一主成分 𝐞 可以预先从数据中计算得出;标量 𝑎𝑖 是像素 𝑖 处的相机零空间颜色系数,可以通过学习的预测器进行估计,而 𝜑 是一个仅与观察者 𝑀 和显示器 𝐷 相关的校准系数。这种参数化使得校准变得切实可行,因为 𝜑 ∈ℝ³ˣ¹ 仅包含 3 个未知变量。此外,在图 13 中,我们展示了 𝜑 在不同野外场景中几乎保持稳定。 具体而言,为了学习 𝑎𝑖 的预测器,我们按图 7 所示分三个阶段进行:(a) 我们遵循 [44] 中的稳健方法,通过 ColorChecker 校准程序估计相机光谱灵敏度 𝐂;利用校准后的 𝐂,我们从高光谱数据集(视为 𝐬𝑖)中计算相机零空间成分的 PCA 基,并保留主要成分作为 𝐞;(b) 我们将训练输入构建为模拟的相机原始测量值 𝐂𝐬𝑖,学习目标为 𝑎𝑖;(c) 我们通过最小化损失函数,利用高效的频谱重建网络 [19] 估计逐像素系数 ˆ𝑎𝑖:

_ \ a 1\left\lVert\hat{\mathbf{s}}_i-\mathbf{s}_i\right\rVert\lambda_2\left\lVert\hat{a}_i-a_i\right\rVert\lambda\left\lVert\nabla\hat{a}_i-\nablaa_i\right\rVert\Big\label(10) th cal { L} = \s um _ { i} \ B ig [\l a mbda m

其中 ∇ 表示应用于系数 𝑎𝑖 的全变分算子,鼓励空间平滑性。除了直接监督 ˆ𝑎𝑖 外,我们还保留了频谱重建损失 ∥ˆ𝐬𝑖 −𝐬𝑖∥₁。在表 1b 中,我们展示了频谱重建监督也能提高估计系数 ˆ𝑎𝑖 的准确性。 总之,结合式 (2) 中的观察者特定颜色直通校正、学习的相机-显示器投影器 b𝓕𝐂(式 (5))以及学习的相机零空间校正 b𝛿𝑖 = ˆ𝑎𝑖𝐞(式 (9)),我们的完整颜色直通模型为:

\ a thbf } _{ \ tex l o r}} b r { M}\wid bf{s}}^{*}_i}_{\text{displaycolor}}\mathbf{M}\mathbf{D}\;\cdot\underbrace{\widehat{\mathcal{F}}_{\mathbf{C}}}_{\textbf{learned}}\cdot\bigl(\underbrace{\mathbf{C}\mathbf{s}_i}_{\text{cameracolor}}\underbrace{\varphi}_{\textbf{calibrate}}\underbrace{(\hat{a}_i\mathbf{e})}_{\textbf{learned}}\bigr\label{eq_4.9} (11) rbracundee {\m mathbf{M}\{s}_i cenet {sco prox \ap\ under {\mathbface {\mathe ha t

第 12 页

12 R. Li et al.

(a) 学习到的相机-显示器投影器 FC 的评估 (b) 学习到的 ˆai 的评估

方法 参数量 (K) 运行时间 (ms) PSNR ↑ ∆Emean ↓ ∆Ep95 ↓ STRESS ↓ λ1 λ2 λ3 PSNR(ˆai, ai)↑ PSNR(ˆsi, si)↑ IA-3DLUT [79] 593.0 339.92 26.69 5.66 9.22 9.22 ✓ 28.27 14.94 NiLUT [25] 33.9 31.16 31.03 3.59 9.39 5.02 ✓ ✓ 29.42 32.69 CSRNet [39] 36.5 253.78 31.12 3.59 9.34 5.00 ✓ ✓ 29.00 31.49 Ours 30.8 41.30 32.13 3.34 8.81 4.69 ✓ ✓ ✓ 29.68 31.95

表 1: 评估相机-显示器投影器 FC 和相机零空间颜色系数 ˆai 的学习模型性能。我们报告了定量指标,包括 PSNR [35]、∆Emean [69]、∆E ∗95(第 95 百分位数)和 STRESS [31],以及在 NVIDIA RTX 4090 GPU 上测量的 2K 分辨率输入的运行时间。

在对两个预测器 bFC 和 ˆai 进行预训练后(见图 4 和图 7),我们对目标观察者执行一次性校准以估计 φ ∈R3×1。一旦校准完成,φ 在所有后续评估中保持固定。

5 结果

我们首先评估两个学习预测器的拟合质量,然后将完整的颜色直通模型与几种基线方法进行比较,最后通过消融实验验证我们的设计选择和方法的鲁棒性。额外实验报告在补充材料中。 所有实验均使用两部相同的智能手机(HUAWEI Pura 70 Pro 或 Xiaomi 17 Pro Max)进行:一部作为相机 C,另一部作为显示器 D;使用数码单反相机(Sony ILCE-7M4)作为数字观察者 M 以生成所有定量结果和图表。我们将手机屏幕设置为最大亮度以最大化可用的色域,并在手机的 Pro 模式下捕获线性 RAW 图像以最小化额外的机内处理。对于室内多光源测试,我们使用 HSI 模式下的 Ulanzi VL49RGB 灯,其专用的 RGB LED 提供光谱峰值照明。

5.1 两个学习组件的拟合质量

学习到的相机-显示器投影器 FC 的评估。我们使用 DIV2K 数据集 [5](由 [55] 去噪)训练 bFC,并执行重捕获协议以获得 800 对训练数据和 100 对测试数据。我们在表 1a 中报告评估结果,并将我们学习到的模型与现有的逐像素颜色迁移方法进行比较。

学习到的相机零空间颜色系数 ˆai 的评估。我们使用高光谱数据集(ARAD-1K [10]、CAVE [78] 和 ICVL [9])训练 ˆai,其中 L = 31 个光谱通道。总共,我们使用 1000 张图像进行训练,182 张进行测试。我们在表 1b 中报告不同损失配置下的评估结果。基于使 ˆai 达到最高准确性的设置,我们在所有后续实验中保留 λ1、λ2,并在公式 (10) 中采用 λ1, λ2, λ3 = (1, 0.01, 1)。

第 13 页

颜色直通 13

(a) 默认智能手机相机 (b) 使用学习到的白平衡进行校正 (a) (c) 本文方法 (d) 真实场景(地面真值)

图 8:分离视图比较。左侧三列显示通过手机显示屏观察到的图像,而最右侧一列直接观察真实场景。 与其他基线相比,我们的方法保留了更一致的颜色。

表 2:在未见过的、多样化的光照条件下,使用 24 个 ColorChecker 色块进行颜色直通定量比较。灰色数字表示亮度与本文方法对齐的结果;我们的方法仍取得了最佳性能。

方法 PSNR ↑ ∆Emean ↓ STRESS ↓

华为 小米 华为 小米 华为 小米

默认智能手机相机 13.78 (15.80) 14.61 (15.93) 14.62 (12.31) 13.49 (11.54) 26.23 (27.58) 25.07 (25.27) ColorChecker 校准 15.02 (15.23) 16.36 (16.85) 18.49 (18.40) 15.32 (15.09) 38.85 (38.56) 36.42 (36.04) 多光源自动白平衡 12.84 (12.95) 13.92 (14.41) 17.84 (17.37) 17.08 (16.26) 31.12 (30.48) 30.05 (29.66) 本文方法无相机零空间校正 27.32 27.84 6.49 5.97 17.27 16.39 本文方法 28.65 29.10 5.18 4.79 17.48 16.12

5.2 评估完整颜色直通模型

对比方法。我们将三种强大且实用的基线方法与我们的方法进行比较,这些基线涵盖了标准的相机端和 ICC 风格校正管线。(a) 默认智能手机相机:由智能手机的商业 ISP 生成的图像,包括其专有的白平衡、色调映射和颜色调整。这代表了一个高度优化的商业管线。(b) 多光源自动白平衡:一种最先进的学习白平衡方法 [2],应用于默认智能手机输出,以校正由空间变化光照引起的色偏。(c) ColorChecker 校准:使用 ColorChecker Passport [70] 进行的仪器校准基线。我们从 ColorChecker 测量中估计基于 ICC/配置文件的颜色校正,并在显示前在 Photoshop 中渲染校正后的图像,使其成为一个强大的校准基线,也是标准每场景颜色校正工作流的近似上限。

第 14 页

14 R. Li et al.

(a) 默认智能手机相机 (b) 使用色卡对 (a) 进行校准 (c) 本文方法

(i) 室内 光源

(ii) 室外 光源

(iii) 室内 + 室外 光源

图 9: 直接现场对比。每列显示悬浮在真实场景上方的智能手机屏幕及处理后的图像。我们的方法复现了更准确的色彩。

(a) 默认智能手机相机 (b) 色卡校准 (c) 多光源自动白平衡 (d) 本文方法

平均得分:1.90 / 2.07 平均得分:1.66 / 1.90 平均得分:2.06 / 1.84 平均得分:4.32 / 4.03

图 10: 关于亮度和色彩准确性的用户研究。参与者使用 5 点李克特量表对与参考图像的相似度进行评分(1 表示最不相似,5 表示最相似)。

客观评估。我们首先通过一次性网格搜索校准数字观察者(DSLR),以确定校准系数 $\phi \in \mathbb{R}^{3 \times 1}$,该搜索基于自然光照下的 24 个 ColorChecker 色块。$\phi$ 的每个条目在 $[0.025, 0.075]$ 范围内以步长 0.0125 进行搜索,并选择使误差最小化的 $\phi$。随后,我们在一系列多样化的光照条件下,使用相同的 ColorChecker 评估我们的方法及所有基线方法:包括从 2500 K 到 9000 K 的十个相关色温,以及五个随机采样的 RGB-LED 光源颜色。24 个色块上的定量结果汇总于表 2。此外,图 8 和图 9 展示了在多样化真实场景下的定性比较。

主观评估。我们进行了包含十名人类观察者的用户研究,以评估感知层面的 Color Pass-Through(颜色直通)效果。通过一次性网格搜索生成候选校准系数 $\phi \in \mathbb{R}^{3 \times 1}$,每位参与者在其中一个场景中选出最佳的 $\phi$。校准完成后,参与者通过在十个未见过的场景中评估每种方法的亮度准确性和色彩准确性,来衡量显示图像与真实场景的匹配程度,结果汇总于图 10。

第 15 页

颜色直通 15

5 35 (dB) 30 4 评分

3 PSNR 25 研究 20 DSLR 15 2 用户

10 0 1 2 3 4 5 6 7 8 9 1 场景索引 默认智能手机相机 (DSLR PSNR) ColorChecker 校准 (DSLR PSNR) 多光源自动白平衡 (DSLR PSNR) 本文方法 (DSLR PSNR) 默认智能手机相机 (用户研究) ColorChecker 校准 (用户研究) 多光源自动白平衡 (用户研究) 本文方法 (用户研究)

图 11:基于 DSLR 与人类受试者评估之间的偏好比较。

观察者特定校准系数 𝒂𝒊 𝝋 PSNR 输入 偏差

目标 训练集数量 场景索引

图 12:FC 的学习效率。 图 13:校准后 𝝋 的鲁棒性。 b

5.3 消融实验。

DSLR 观察者代理的有效性。我们使用 DSLR 相机作为定量评估的数字代理观察者。这并不假设 DSLR 与人类视觉完全相同;相反,它作为一个可控且可重复的三通道观察者,与人类的三锥体颜色响应相一致。如图 11 所示,基于 DSLR 的偏好趋势与人类受试者的判断在不同场景中保持一致,同时通常提供更严格的评估。

FC 的学习效率。我们在有限的训练数据下测试学习到的 [模型/参数]。我们逐步对训练集进行子采样,发现即使仅使用 100 张图像进行训练,结果仍能保持相似的颜色,如图 12 所示。

校准后 𝝋 的鲁棒性。为了评估校准后的向量 𝝋 对于同一观察者 M 在不同光源下是否保持稳定,我们通过扰动 𝝋 的每个条目 ±0.015 来进行用户研究,并询问参与者这些替代方案中是否有任何一个更匹配真实场景。我们在图 13 中可视化了三位代表性观察者在 10 个场景中的选择。对于大多数场景,观察者保持其原始 𝝋 而不进行切换,表明其具有跨光源的稳定性。

6 结论

我们提出了颜色直通(Color Pass-Through),这是一种应用于通过耦合相机-显示器对捕获的图像上的端到端学习校正。在优化两个预测器后,我们在推理时将它们结合,并为目标观察者执行一次性系数校准。这使得在不同场景和光源下实现颜色直通,这一点已通过评估指标和用户研究得到证实。

第 16 页

16 R. Li 等

致谢

本研究部分由香港研究资助局早期职业计划(ECS)资助,项目编号 24209224。

参考文献

1. Afifi, M., Barron, J.T., LeGendre, C., Tsai, Y.T., Bleibel, F.: Cross-camera convolu- tional color constancy. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 1981–1990 (2021) 2. Afifi, M., Brubaker, M.A., Brown, M.S.: Auto white-balance correction for mixed- illuminant scenes. In: IEEE Winter Conference on Applications of Computer Vision (WACV) (2022) 3. Afifi, M., Brubaker, M.A., Brown, M.S.: Auto white-balance correction for mixed- illuminant scenes. In: Proceedings of the IEEE/CVF Winter Conference on Appli- cations of Computer Vision. pp. 1210–1219 (2022) 4. Afifi, M., Zhao, L., Punnappurath, A., Abdelsalam, M.A., Zhang, R., Brown, M.S.: Time-aware auto white balance in mobile photography. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 5038–5047 (2025) 5. Agustsson, E., Timofte, R.: Ntire 2017 challenge on single image super-resolution: Dataset and study (July 2017) 6. Alsam, A., Lenz, R.: Calibrating color cameras using metameric blacks. Journal of the Optical Society of America A 24(1), 11–17 (2006) 7. Anzagira, L., Fossum, E.R.: Color filter array patterns for small-pixel image sensors with substantial cross talk. Journal of the Optical Society of America A 32(1), 28– 34 (2015). https://doi.org/10.1364/JOSAA.32.000028 8. Apple Inc.: Color correction based on perceptual criteria and ambient light chro- maticity (2023) 9. Arad, B., Ben-Shahar, O.: Sparse recovery of hyperspectral signal from natural rgb images. In: European conference on computer vision. pp. 19–34. Springer (2016) 10. Arad, B., Timofte, R., Yahel, R., Morag, N., Bernat, A., Cai, Y., Lin, J., Lin, Z., Wang, H., Zhang, Y., et al.: Ntire 2022 spectral recovery challenge and data set. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 863–881 (2022) 11. Bailenson, J.N., Beams, B., Brown, J., DeVeaux, C., Han, E., Queiroz, A.C., Ratan, R., Santoso, M., Srirangarajan, T., Tao, Y., et al.: Seeing the world through digital prisms: Psychological implications of passthrough video usage in mixed reality (2024) 12. Barron, J.T.: Convolutional color constancy. In: Proceedings of the IEEE Interna- tional Conference on Computer Vision. pp. 379–387 (2015) 13. Barron, J.T., Tsai, Y.T.: Fast fourier color constancy. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 886–894 (2017) 14. Beep6581: Dcamprof. https://github.com/Beep6581/dcamprof (2016), gitHub repository, accessed 2026-03-10 15. Bianco, S., Cusano, C., Schettini, R.: Color constancy using cnns. In: Proceedings of the IEEE conference on computer vision and pattern recognition workshops. pp. 81–89 (2015) 16. Brainard, D.H., Freeman, W.T.: Bayesian color constancy. Journal of the optical Society of America A 14(7), 1393–1411 (1997)

第 17 页

颜色直通 17

17. Brauers, J., Aach, T.: A color filter array based multispectral camera. In: 12. Workshop Farbbildverarbeitung. Ilmenau (October 5–6 2006) 18. Buchsbaum, G.: A spatial processor model for object colour perception. Journal of the Franklin institute 310(1), 1–26 (1980) 19. Cai, Y., Lin, J., Lin, Z., Wang, H., Zhang, Y., Pfister, H., Timofte, R., Van Gool, L.: Mst++: Multi-stage spectral-wise transformer for efficient spectral reconstruction. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 745–755 (2022) 20. Canham, T.D., Tedla, S., Murdoch, M.J., Brown, M.S.: Gain-mlp: Improving hdr gain map encoding via a lightweight mlp. arXiv preprint arXiv:2503.11883 (2025) 21. Chang, S.C., Zhong, J.Z.: Ambient light adaptive displays with paper-like appear- ance, https://patents.google.com/patent/US20190139512A1/en 22. Cheng, D., Price, B., Cohen, S., Brown, M.S.: Beyond white: Ground truth colors for color constancy correction. In: Proceedings of the IEEE International Confer- ence on Computer Vision. pp. 298–306 (2015) 23. Cho, Y.H., Im, J.H., Ha, Y.H.: Inverse characterization method of alternate gain- offset-gamma model for display devices. Journal of Imaging Science and Technology 50(2), 139–148 (2006) 24. Cogo, L., Buzzelli, M., Bianco, S., Vazquez-Corral, J., Schettini, R.: Leverag- ing multispectral sensors for color correction in mobile cameras. arXiv preprint arXiv:2512.08441 (2025) 25. Conde, M.V., Vazquez-Corral, J., Brown, M.S., Timofte, R.: Nilut: Conditional neural implicit 3d lookup tables for image enhancement. vol. 38, pp. 1371–1379 (2024) 26. De Souza, J., Tartz, R.: Visual perception and user satisfaction in video see-through head-mounted displays: a mixed-methods evaluation. Frontiers in Virtual Reality 5, 1368721 (2024) 27. Debevec, P.E., Malik, J.: Recovering high dynamic range radiance maps from photographs. In: Proceedings of SIGGRAPH 1997. pp. 369–378 (1997). https: //doi.org/10.1145/258734.258884 28. Fairchild, M.D.: Color appearance models. John Wiley & Sons (2013) 29. Finlayson, G.D., Trezzi, E.: Shades of gray and colour constancy. In: Color and imaging conference. vol. 12, pp. 37–41. Society of Imaging Science and Technology (2004) 30. Finlayson, G.D., Zakizadeh, R.: Reproduction angular error: An improved perfor- mance metric for illuminant estimation. perception 310(1), 1–26 (2014) 31. Finlayson, G.D., Zakizadeh, R.: Reproduction angular error: An improved per- formance metric for illuminant estimation. Journal of Electronic Imaging 23(3) (2014) 32. Gehler, P.V., Rother, C., Blake, A., Minka, T., Sharp, T.: Bayesian color constancy revisited. In: 2008 IEEE Conference on Computer Vision and Pattern Recognition. pp. 1–8. IEEE (2008) 33. Gharbi, M., Chen, J., Barron, J.T., Hasinoff, S.W., Durand, F.: Deep bilateral learning for real-time image enhancement. ACM Trans. Graphic. 36(4), 1–12 (2017) 34. Gijsenij, A., Gevers, T., Van De Weijer, J.: Computational color constancy: Survey and experiments. IEEE transactions on image processing 20(9), 2475–2489 (2011) 35. Gonzalez, R.C., Woods, R.E.: Digital Image Processing. Pearson, 3 edn. (2008) 36. Green, P.: Color management understanding and using icc profiles, 2010

第 18 页

18 R. Li 等

37. Grönquist, P., Tulyakov, S., Dai, D.: Beyond calibration: Physically informed learn- ing for raw-to-raw mapping. CoRR abs/2506.08650 (2025), https://arxiv.org/ abs/2506.08650 38. Hasinoff, S.W., Sharlet, D., Geiss, R., Adams, A., Barron, J.T., Kainz, F., Chen, J., Levoy, M.: Burst photography for high dynamic range and low-light imaging on mobile cameras. ACM Transactions on Graphics 35(6), 192:1–192:12 (2016). https://doi.org/10.1145/2980179.2980254 39. He, J., Liu, Y., Qiao, Y., Dong, C.: Conditional sequential modulation for efficient global image retouching. pp. 679–695. Springer (2020) 40. Hellwig, L., Fairchild, M.D.: Brightness, lightness, colorfulness, and chroma in ciecam02 and cam16. Color Research & Application 47(5), 1083–1095 (2022) 41. Hu, Y., Wang, B., Lin, S.: Fc4: Fully convolutional color constancy with confidence- weighted pooling. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 4085–4094 (2017) 42. International Color Consortium: Specification icc.1:2022 (profile version 4.4.0.0). Tech. rep., International Color Consortium, Reston, VA (2022), https://www. color.org/specification/ICC.1-2022-05.pdf 43. Jee, S., Song, K.S., Kang, M.G.: Sensitivity and resolution improvement in rgbw color filter array sensor. Sensors 18(5), 1647 (2018). https://doi.org/10.3390/ s18051647 44. Jiang, J., Liu, D., Gu, J., Süsstrunk, S.: What is the space of spectral sensitivity functions for digital color cameras? In: 2013 IEEE Workshop on Applications of Computer Vision (WACV). pp. 168–179. IEEE (2013) 45. Judd, D.B., MacAdam, D.L., Wyszecki, G., Budde, H., Condit, H., Henderson, S., Simonds, J.: Spectral distribution of typical daylight as a function of correlated color temperature. Journal of the Optical Society of America 54(8), 1031–1040 (1964) 46. Karaimer, H.C., Brown, M.S.: Improving color reproduction accuracy on cameras. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recog- nition. pp. 6440–6449 (2018) 47. Kim, D., Afifi, M., Kim, D., Brown, M.S., Kim, S.J.: Ccmnet: Leveraging calibrated color correction matrices for cross-camera color constancy. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 6198–6208 (2025) 48. Kim, D., Kim, J., Nam, S., Lee, D., Lee, Y., Kang, N., Lee, H.E., Yoo, B., Han, J.J., Kim, S.J.: Large scale multi-illuminant (lsmi) dataset for developing white balance algorithm under mixed illumination. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 2410–2419 (2021) 49. Kim, D., Kim, J., Yu, J., Kim, S.J.: Attentive illumination decomposition model for multi-illuminant white balancing. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 25512–25521 (2024) 50. Kim, W., Cho, N.I.: Image-adaptive 3d lookup tables for real-time image enhance- ment with bilateral grids. In: European Conference on Computer Vision. pp. 91– 108. Springer (2024) 51. Kim, W., Lee, K., Cho, N.I.: Lightweight and fast real-time image enhancement via decomposition of the spatial-aware lookup tables. arXiv preprint arXiv:2508.16121 (2025) 52. Koskinen, S., Acar, E., Kämäräinen, J.K.: Single pixel spectral color constancy: S. koskinen et al. International Journal of Computer Vision 132(2), 287–299 (2024) 53. Le, H.M., Price, B., Cohen, S., Brown, M.S.: Gamutmlp: a lightweight mlp for color loss recovery. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 18268–18277 (2023)

第 19 页

颜色直通 19

54. Li, J., Chen, C., Hu, X., Song, F., Yan, Y., Xiong, Z.: Multi-spectral image color reproduction. In: 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). pp. 8400–8409. IEEE (2025) 55. Li, R., Wang, Y., Chen, S., Zhang, F., Gu, J., Xue, T.: Dualdn: Dual-domain denoising via differentiable isp. In: European Conference on Computer Vision. pp. 160–177. Springer (2024) 56. Liu, G., et al.: A super-resolution imaging system based on sub-pixel camera shift. In: Proceedings of SPIE. vol. 10817. SPIE (2018). https://doi.org/10.1117/12. 2502377 57. Lou, J., Zhao, X., Shi, K., Gu, S.: Learning pixel-adaptive multi-layer perceptrons for real-time image enhancement. pp. 14095–14105 (2025) 58. Maloney, L.T.: Evaluation of linear models of surface spectral reflectance with small numbers of parameters. Journal of the Optical Society of America A 3(10), 1673–1683 (1986) 59. Moroney, N., Fairchild, M., Hunt, R., Li, C.: The ciecam02 color appearance model (2002) 60. Morovič, P., Finlayson, G.D.: Metamer-set-based approach to estimating surface reflectance from camera rgb. Journal of the Optical Society of America A 23(8), 1814–1822 (2006) 61. Nyström, D.: Colorimetric and Multispectral Image Acquisition. Licentiate thesis, Linköping University (2006) 62. Oh, P., Lee, S., Kang, M.G.: Colorization-based rgb-white color interpolation using color filter array with randomly sampled pattern. Sensors 17(7), 1523 (2017). https://doi.org/10.3390/s17071523 63. Parkkinen, J.P., Hallikainen, J., Jaaskelainen, T.: Characteristic spectra of munsell colors. Journal of the Optical society of America A 6(2), 318–322 (1989) 64. Perevozchikov, G., Mehta, N., Afifi, M., Timofte, R.: Rawformer: Unpaired raw- to-raw translation for learnable camera isps. In: Computer Vision – ECCV 2024. Lecture Notes in Computer Science, vol. 15094, pp. 231–248. Springer (2024). https://doi.org/10.1007/978-3-031-72764-1_14 65. Prasad, D.K.: Strategies for resolving camera metamers using 3+1 channel. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). pp. 46–54 (2016) 66. Qian, Y., Chen, S.C., Hsiang, E.L., Akimoto, H., Lin, C.L., Wu, S.T.: Enhancing a display’s sunlight readability with tone mapping. Photonics 11(6), 578 (2024) 67. Reinhard, E., Stark, M., Shirley, P., Ferwerda, J.: Photographic tone reproduction for digital images. ACM Transactions on Graphics 21(3), 267–276 (2002). https: //doi.org/10.1145/566654.566575 68. Serrano-Lozano, D., Arora, A., Herranz, L., Derpanis, K.G., Brown, M.S., Vazquez- Corral, J.: Revisiting image fusion for multi-illuminant white-balance correction. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 8275–8284 (2025) 69. Sharma, G., Wu, W., Dalal, E.N.: The ciede2000 color-difference formula: Imple- mentation notes, supplementary test data, and mathematical observations. Color Research & Application 30(1), 21–30 (2005) 70. Sunoj, S., Igathinathane, C., et al.: Color calibration of digital images for agri- culture and other applications. Computers and Electronics in Agriculture 155, 306–318 (2018) 71. Teed, Z., Deng, J.: Raft: Recurrent all-pairs field transforms for optical flow. In: European conference on computer vision. pp. 402–419. Springer (2020)

第 20 页

20 R. Li 等

72. Van De Weijer, J., Gevers, T., Gijsenij, A.: 基于边缘的颜色恒常性。IEEE 图像处理汇刊 16(9), 2207–2214 (2007) 73. Viénot, F., Brettel, H.: 维里斯特讲座:超越锥体视觉的同色异谱黑视觉特性。美国光学学会杂志 A 31(4), A38–A46 (2013) 74. Wang, J., Ma, S., Bayer, K., Zhang, Y., Wang, P., Zhou, B., Nayar, S., Krishnan, G.: 具有屏下摄像头的透视对齐 AR 镜面。ACM 图形学汇刊 43(6), 1–11 (2024) 75. Wang, R., Zhang, Q., Fu, C.W., Shen, X., Zheng, W.S., Jia, J.: 使用深度光照估计进行欠曝光照片增强。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 6849–6857 页 (2019) 76. Wu, J., 等:具有改进通道交互建模的 OLED 显示器颜色表征模型。颜色研究与应用 (2023) 77. Xie, D., Qiao, C., Liang, L., Wang, Z., Li, T., Liu, Q., Li, C., Wang, G., Yang, Y.: 通过无监督原始到原始映射泛化 ISP 模型。在:第 32 届 ACM 国际多媒体会议论文集。第 3809–3817 页。MM ’24,ACM 计算协会 (2024)。https://doi.org/10.1145/3664647.3681666 78. Yasuma, F., Mitsunaga, T., Iso, D., Nayar, S.K.: 广义混合像素相机:捕获后对分辨率、动态范围和光谱的控制。IEEE 图像处理汇刊 19(9), 2241–2253 (2010) 79. Zeng, H., Cai, J., Li, L., Cao, Z., Zhang, L.: 学习图像自适应 3D 查找表以实现高性能实时照片增强 44(4), 2058–2073 (2020) 80. Zhao, H., Mainster, M.A.: 色散对人工晶状体眼光学性能的影响。英国眼科杂志 91(9), 1225–1229 (2007)

第 21 页

颜色直通 21

补充材料

在本补充文档中,我们提供了五个部分,旨在扩展主论文中提出的颜色直通(Color Pass-Through)方法。

– A节:我们详细描述模型,包括完整的实现和关键组件设计。 – B节:我们提供详细的数学推导。我们首先在线性情况下推导完整模型,然后将相机-显示器投影仪扩展到非线性设置,并结合相机零空间(camera-null)校正的低秩近似,从而得出最终公式。 – C节:我们提供额外的实验,包括评估平均池化(AvgPool)增强的有效性,并比较学习 \protectC 的各种基线方法。 – D节:我们讨论颜色直通(Color Pass-Through)的扩展应用,包括其与手机相机处理的兼容性,以产生细节更丰富、噪声更低的结果,以及其向高动态范围场景的扩展,以减轻高光区域的过曝问题。 – E节:我们讨论当前版本的局限性,并概述未来改进的潜在方向。

A 模型细节

A.1 完整模型实现

我们提出的颜色直通(Color Pass-Through)框架包含三个阶段:预训练阶段、校准阶段和推理阶段,如图14所示。

– 估计与预训练阶段。此阶段包含两个步骤。(i) 我们首先使用 [44] 从色卡(ColorChecker)图像中估计相机灵敏度函数 C,然后利用估计出的 C 从高光谱数据中推导出相机零空间基的第一个主成分 e。(ii) 我们独立预训练两个预测网络。第一个是学习到的相机-显示器投影仪(camera–display projector) bFC(·) : R3 →R3,用于耦合相机 C 和显示器 D,从而实现通用的直通效果。在 M = C 的特殊情况下,它能产生准确的结果;而当 M̸ = C 时,则会残留颜色差异。第二个预测器学习相机零空间颜色系数 bai ∈R,它从原始图像中估计同色异谱黑(metameric-black)分量,并为特定观察者 M 提供相机零空间颜色校正的基础。 – 校准阶段。我们将两个预训练的预测器结合起来,并使用手机的 Pro 模式拍摄任意场景的原始图像。随后,我们执行基于三维网格的校准程序,以估计校准系数 φ ∈R3×1。该系数仅计算一次,然后针对目标观察者(无论是人类观察者还是数字观察者)固定不变。 – 推理阶段。最后,我们将两个预训练的预测器与校准后的系数 φ 结合,进行验证和评估。

第 22 页

22 R. Li 等

相机光谱灵敏度 CNN 𝐂𝒔𝒊 全模型(b) 𝐂𝒔𝒊−𝝋̂𝒂𝒊𝐞෡𝓕𝐂∙ 𝐂𝒔𝒒 ̂𝒂𝒊 𝐞 估计阶段: 原始 图像 第一主成分 相机 𝐂 显示器 𝐃 第一主成分 分量 𝐞 观察者 𝝋 场景辐射度 𝐬𝒊 显示辐射度 𝐬𝒊∗ 校准

点 𝑖 𝑖 点 Avg MLP Avg 相机显示器 P.E.投影器 显示器 位置编码 场景 𝝋̂𝒂𝒊𝐞 编码 ̂𝓕𝐂∙ ̂𝓕𝐂 预训练阶段: 𝐬𝒊 𝐬𝒊∗ 𝐂𝒔𝒊−𝝋̂𝒂𝒊𝐞 ̂𝓕𝐂 校正相机-空域 图像 相机-空域 颜色 结果 图像 特定 观察者 𝐌 系数̂𝒂𝒊

(a) 估计与预训练阶段 (b) 校准阶段 (c) 推理阶段

图 14: 颜色直通(Color Pass-Through)的三个阶段。(a) 在估计与预训练阶段,我们首先估计相机光谱灵敏度 $\mathbf{C}$ 并由此推导出第一主成分 $\mathbf{e}$,随后分别训练这两个预测器。(b) 在校准阶段,使用两个预训练预测器执行一次全模型以估计校准系数 $\phi$。(c) 在推理阶段,我们评估给定观察者 $\mathbf{M}$ 下场景颜色 $\mathbf{M}\mathbf{s}_i$ 是否与显示颜色 $\mathbf{M}\mathbf{s}^*_i$ 一致。

A.2 估计与预训练

估计相机光谱灵敏度 $\mathbf{C}$。我们首先估计 $\mathbf{C}$,以便推导下一节中描述的第一主成分 $\mathbf{e}$。遵循 Jiang 等人 [44] 的方法,我们使用低维 PCA 基对可见光范围(400–720 nm)内的相机光谱灵敏度函数进行建模。令 $\mathbf{C} = [\mathbf{C}_R; \mathbf{C}_G; \mathbf{C}_B] \in \mathbb{R}^{3 \times L}$,其中 $\mathbf{C}_k$ 表示通道 $k \in \{R, G, B\}$ 在 $L$ 个波长处采样的光谱灵敏度。对于具有已知光谱反射率 $R_j(\lambda)$(我们采用自 [14])的 ColorChecker 色块 $j$,在光照光谱 $L(\lambda)$ 下,记录的响应由下式给出:

$$ I_{j,k} = \int \mathbf{C}_k(\lambda) L(\lambda) R_j(\lambda) d\lambda $$

或者,以离散形式表示为:

$$ I_{j,k} \approx \Delta \lambda \sum \mathbf{C}_k(\lambda) L(\lambda) R_j(\lambda) $$

与 [44] 类似,我们对每个通道的光谱灵敏度进行归一化,并将其表示为从测量的相机灵敏度中学习到的 PCA 子空间中的形式。具体而言,通道 $k$ 的归一化灵敏度写为:

$$ \mathbf{c}_{k,n} = \boldsymbol{\sigma}_k \mathbf{E}_k $$

其中 $\boldsymbol{\sigma}_k \in \mathbb{R}^{1 \times 2}$ 表示 PCA 系数,$\mathbf{E}_k \in \mathbb{R}^{2 \times L}$ 包含该通道的前两个主成分。完整灵敏度则由下式给出:

$$ \mathbf{c}_k = g_k \mathbf{c}_{k,n} = g_k \boldsymbol{\sigma}_k \mathbf{E}_k $$

其中 $g_k$ 是依赖于通道的增益。Jiang 等人 [44] 表明,前两个主成分解释了超过 97% 的方差;因此,每个 RGB 通道使用二维模型就足够了。

第 23 页

颜色直通 23

比例 零空间主成分分析方差比例 各数据集前3个零空间成分的方差比例 比例 PC1 = 前3个 70 (i) 捕获 92.76% 使用 Pura 拟合 数据集 平均 华为 方差 色卡色块 𝑰𝒋 主成分索引 数据集索引 比例 零空间主成分分析方差比例 各数据集前3个零空间成分的方差比例 估计的 𝐂– 华为 Pura 70 Pro 估计的 𝐂– 小米 17 Promax PC1 = 前3个 93.89% (ii) 拟合 Promax17 使用 结果 小米 方差

主成分索引 数据集索引 (a) 使用色卡色块估计相机灵敏度 (b) 相机零空间主成分的估计结果

图 15: 相机灵敏度和零空间成分的估计结果。(a) 捕获设置和估计的相机灵敏度。(b) 在整个数据集上估计的相机零空间的主成分分析方差比例(左),以及每个样本的前3个成分的方差比例(右),PC1 表示第一个主成分。

当光源未知但假设为日光时,光源光谱使用 CIE 日光基 [45] 进行建模:

L( \l a mbda , t)=\bar {L } (\lambda )+M_1(t)V_1(\lambda)+M_2(t)V_2(\lambda

其中 \bar {L}(\lambda) 是平均日光光谱,V_1(\lambda) 和 V_2(\lambda) 是特征日光基向量,M_1(t) 和 M_2(t) 由相关色温 (CCT) t 确定。在此模型下,日光参数 t 和主成分分析系数 \sigma_k 被迭代优化,以最小化测量的平均 ColorChecker 色块图像与恢复的灵敏度预测响应之间的前向模型误差。 在我们的实现中,我们在日光照明下捕获 15 张 ColorChecker 图像并平均估计结果,如图 15 (a) 所示。

估计第一个主成分 e。令 C \in \mathbb{R}^{L \times 3} 表示上一节中估计的相机灵敏度,已与高光谱采样网格对齐,其中 L = 31 个光谱波段。然后我们估计相机零空间成分,特别关注第一个主成分 e。具体而言,我们首先为零空间 null(C^\top) 计算一个标准正交基 N \in \mathbb{R}^{L \times d},其中 d = L – \text{rank}(C) = 28。对于光谱 s \in \mathbb{R}^L,其相机不可见(同色异谱黑)分量 [6,60,73] 由正交投影给出:

\mathbf{s}_{\mathrm{null}}=\mathbf{N}\mathbf{N}^{\top}\mathbf{s}

然后我们将 s_{\mathrm{null}} 表示为零空间坐标:

\mathbf{z}=\mathbf{s}^{\top}\mathbf{N}\in\mathbb{R}^{d},

并在此降维空间中执行主成分分析。具体而言,我们估计 z 在所选高光谱拟合集上的协方差,包括 ARAD-1K [10]、CAVE [78] 和 ICVL [9],并计算其特征分解。主要的特征向量随后定义零空间中变化的主方向。

第 24 页

24 R. Li et al.

a d b -0.025 c Origin 𝝋

0

e 0.025 h f -0.025 (a) (b) -0.025 g 0 0 0.025 0.025 (a) (b) Sampling of 𝝋 [-0.025, -0.025, -0.025] [-0.025, -0.025, 0.025]

(c) (d) (e)

(c) (d) (e)

[-0.025, 0.025, 0.025] [-0.025, 0.025, -0.025] [0.025, -0.025, -0.025] (f) (g) (h)

(b) Calibration images showed on the display

Compute MSE on Human ColorChecker patches Observer

Overall tone, color Digital (g) (f) (h) details, brightness, Real scene Observer [0.025, -0.025, 0.025] [0.025, 0.025, 0.025] [0.025, 0.025, -0.025] contrast, … (a) Examples of 3D-grid calibration and result images (c) Compare images in (b) with real scene to calibrate 𝝋

Fig. 16: Observer-Specific 3D Palette Calibration. (a) A one-time calibration is performed in an arbitrary scene by sampling \varphiin a 3D-grid space. (b) The sampled results are showed on the display. (c) The observer selects the one with \varphithat best matches the real scene, which is then fixed for all subsequent experiments.

Across 1,182 hyperspectral images (6.02 × 108 pixels in total), as shown in Fig. 15 (b), we observe that the null-space distribution is highly concentrated along the first principal direction. The first principal component explains over 90% of the total null-space variance, while the first three components explain over 98% cumulatively. In addition, reconstruction using the top three components preserves nearly 99% of the total energy. These results indicate that, although the null space is theoretically 28-dimensional, its effective dimensionality is close to one for our data. Therefore, in the following, we use only the first principal basis vector, denoted by e, to parameterize the null-space component.

A.3 Observer-Specific Calibration via a 3D-grid

After estimation and pretraining, we combine the two predictors and run the full Color Pass-Through model once to calibrate the coefficient \ v arphi\in{R}^{3\times1}, as illustrated in Fig. 14(b). As shown in the derivation of Eq. (53), under the low- rank approximation, \varphiis independent of the scene radiance \protect\mathbf{s}_ i. Moreover, Fig. 12 in the main paper shows that \varphiremains nearly stable across diverse real-world scenes. Therefore, we calibrate \varphionly once for each observer using an arbitrary scene and keep it fixed throughout all subsequent experiments. We adopt a 3D-grid calibration for \varphi. Specifically, we first generate result images under different \varphi(eight examples shown in Fig. 16(a)), and then render them on the display (Fig. 16(b)). The observer then selects the value of \varphithat provides the best match (Fig. 16(c)). For a human observer, the selection is based on both the overall tone and fine-grained color details. For a digital observer (DSLR), we determine \varphiby minimizing MSE over the ColorChecker patches.

第 25 页

颜色直通 25

第 2.1 节 – 全模型的线性版本推导 第 2.2 节 – 相机-显示器投影器的非线性扩展 𝐌𝐬𝒊≡𝐌𝐬𝒊∗≡𝐌𝐃𝐅𝐌𝐂𝐬𝒊 非线性 分析 观察者特定 颜色 直通 条件 ෡𝓕𝐂: ℝ𝟑→ℝ𝟑 𝐌𝐬𝒊≈𝐌ො𝐬𝒊 ∗= 𝐌𝓓෡𝓕𝐂𝐂𝐬𝒊−෡𝜹𝒊 [Eq. (2) 在 正文中]

𝐅𝐌= 𝐌𝐃†𝐌𝐂† 𝐅𝐂= 𝐂𝐃† 第 2.3 节 – 相机零空间校正的低秩近似 观察者特定校正 相机-显示器投影器 Luther-Ives扩展条件 硬件驱动解决方案 𝜹𝒊= 𝟎 𝐧𝐮𝐥𝐥(𝐂) ⊆𝐧𝐮𝐥𝐥(𝐌) 𝜹𝒊= 𝐂𝐈−𝐏𝐌𝐬𝒊 相机零空间校正项 低秩 数据驱动解决方案 𝜹𝒊= 𝐂𝐈−𝐏𝐌𝐧𝒊 𝜹𝒊= 𝝋∙𝒂𝒊𝐞 𝐌𝐬𝒊≈𝐌ො𝐬𝒊 ∗= 𝐌𝐃෠𝐅𝐂𝐂𝐬𝒊−෡𝜹𝒊 𝟑 𝐋 𝐋 𝟑 𝟏 𝟏 全颜色直通模型 估计值 [正文中 Eq. (11) 的线性版本] 校准 估计 校准

图 17: 第 B 节详细数学证明的示意图。

B 详细数学证明

我们在图 17 中提供了推导的示意图流程图,以及关键条件。建议读者在本节中参考该图。

B.1 线性情况下全模型解释的回顾

在本节中,我们首先推导公式 (5),然后展示正文中公式 (11) 的全模型线性形式。我们的目标是表明,观察者感知映射 \protectM} 可以被解释为相机-显示器投影器 \protectC} 加上输入空间中的校正项 \d e lta\in{R}^{3}。 从正文中的公式 (2) 开始,观察者保持条件为:

\ m athb f {M}\mat hbf{s}_i\;\equiv\;\mathbf{M}\mathbf{s}_i^{*}\;\equiv\;\mathbf{M}\mathbf{D}\mathbf{F}_{\mathbfM}\mathbf{C}\mathbf{s}_i,\quad\foralli,\label{eq:supp_1} (12)

由此得出: \ mathbf {F}_{\mathbfM}(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{C}^{\dagger\label{eq:supp_fm} (13)

在可识别信号子空间上,两边同时乘以 \protect\mathbf{C}\mathbf{s}_ i,并利用标准伪逆性质 \mat h bf{C}^{\dagger}\mathbf{C}\mathbf{s}_i=\mathbf{s}_i,我们得到:

\ma t hbf {F}_{\mathbfM}\mathbf{C}\mathbf{s}_i(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{s}_i,\label{eq:supp_fmcs} (14)

接下来,定义观察者诱导的光谱投影算子:

\m athbf {P}_{\mathbfM}:=\mathbf{D}(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M},\label{eq:supp_pm} (15)

根据构造, \ma t hbf {C}\mathbf{P}_{\mathbfM}\mathbf{s}_i\mathbf{C}\mathbf{D}(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{s}_i,\label{eq:supp_cpms} (16)

应用相机-显示器投影器:

\ mathbf{F}_{\mathbfC}(\mathbf{C}\mathbf{D})^{\dagger\label{eq:supp_fc} (17)

到两边得到:

\math b f {F}_{\mathbf C}\mathbf{C}\mathbf{P}_{\mathbfM}\mathbf{s}_i(\mathbf{C}\mathbf{D})^{\dagger}\mathbf{C}\mathbf{D}(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{s}_i,\label{eq:supp_fc_cpms} (18)

第 26 页

26 R. Li et al.

再次利用伪逆恒等式 $(\mathbf{C}\mathbf{D})^{\dagger}\mathbf{C}\mathbf{D}=\mathbf{I}$ 在相应的显示-代码子空间上,我们得到: $$ \mathbf{F}_{\mathbf{C}}\mathbf{C}\mathbf{P}_{\mathbf{M}}\mathbf{s}_i = (\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}\mathbf{s}_i, \label{eq:supp_fc_pm_result} \quad (19) $$

结合公式 (14) 和 (19) 可得:

$$ \mathbf{F}_{\mathbf{M}}\mathbf{C}\mathbf{s}_i = \mathbf{F}_{\mathbf{C}}\mathbf{C}\mathbf{P}_{\mathbf{M}}\mathbf{s}_i, \label{eq:supp_bridge} \quad (20) $$

最后,定义残差项:

$$ \delta_i := \mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i, \label{eq:supp_delta} \quad (21) $$

则: $$ \mathbf{C}\mathbf{P}_{\mathbf{M}}\mathbf{s}_i = \mathbf{C}\mathbf{s}_i – \delta_i, \label{eq:supp_cpms_delta} \quad (22) $$

将公式 (22) 代入公式 (20),我们得到:

$$ \mathbf{F}_{\mathbf{M}}\mathbf{C}\mathbf{s}_i = \mathbf{F}_{\mathbf{C}}\bigl(\mathbf{C}\mathbf{s}_i – \delta_i\bigr), \quad \delta_i := \mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i, \label{eq:supp_full_interpretation} \quad (23) $$

这正是主论文中公式 (5) 的内容。 将公式 (23) 与全模型解释公式 (12) 结合,得到主论文中使用的完整颜色直通模型(线性版本):

$$ \widehat{\mathbf{s}}_i^{*} = \underbrace{\mathbf{M}\mathbf{D}}_{\text{display}} \cdot \underbrace{\widehat{\mathbf{F}}_{\mathbf{C}}}_{\textbf{learned}} \cdot \Bigl( \underbrace{\mathbf{C}\mathbf{s}_i}_{\text{camera}} – \underbrace{\widehat{\delta_i}}_{\textbf{learned}} \Bigr) \label{eq:supp_full_model_final} \quad (24) $$

这正是主论文中公式 (11) 的线性版本。 该推导提供了对完整线性模型的直观解释:我们首先通过减去残差颜色项 $\delta_i$ 来校正相机颜色 $\mathbf{C}\mathbf{s}_i$,然后应用相机-显示器投影器 $\mathbf{F}_{\mathbf{C}}$。生成的信号在显示器 $\mathbf{D}$ 上渲染,并被观察者 $\mathbf{M}$ 观测时,产生显示颜色 $\mathbf{M}\widehat{\mathbf{s}}_i^{*}$,该颜色与场景颜色 $\mathbf{M}\mathbf{s}_i$ 非常匹配。

B.2 相机-显示器投影器的非线性扩展

上述推导是在线性公式下进行的,其中相机-显示器投影器表示为 $\mathbf{F}_{\mathbf{C}\mathbf{D}}$。然而,在实践中,有效显示器 $\mathbf{D}$ 并非严格线性,因为存在伽马校正、色调映射和其他设备相关的非线性处理。因此,我们将相机-显示器投影器 $\mathbf{F}_{\mathbf{C}\mathbf{D}}$ 推广为非线性算子 $\mathcal{F}_{\mathbf{C}\mathbf{D}}$,并表明公式 (24) 中的全模型在相同的组合形式下仍然有效。

(1) 非线性相机-显示器前向模型。我们不再用线性矩阵 $\mathbf{D}$ 对显示器进行建模,而是引入一个非线性显示器发射算子: $$ \mathcal{D}: \mathbb{R}^{3} \rightarrow \mathbb{R}^{L}, \label{eq:supp_nonlinear_display} \quad (25) $$ 它将数字 RGB 信号 $\sigma \in \mathbb{R}^{3}$ 映射为其发射的光谱。相应的有效相机-显示器前向过程表示为: $$ \mathcal{T}_{\mathbf{C}\mathbf{D}}(\sigma) := \mathbf{C}\,\mathcal{D}(\sigma), \quad \mathcal{T}_{\mathbf{C}\mathbf{D}}: \mathbb{R}^{3} \rightarrow \mathbb{R}^{3}. \label{eq:supp_nonlinear_forward} \quad (26) $$

该算子取代了线性映射 $\mathbf{C}\mathbf{D}$。

第 27 页

颜色直通 27

(2) 非线性相机-显示器投影器。我们现在将非线性相机-显示器投影器定义为一种学习算子:

\ ma t hcal{F}_{\mathbfC}:\mathbb{R}^{3}\rightarrow\mathbb{R}^{3},\label{eq:supp_nonlinear_fc_def} (27)

该算子被要求在目标相机-颜色域上作为有效前向过程的右逆,即,

\ m athcal {T }_ { \mathbf{C}\mathbf{D}}\bigl(\mathcal{F}_{\mathbfC}(\mathbf{c})\bigr\mathbf\qquad\forall\mathbf{c}\in\Omega_{\mathbfC},\label{eq:supp_nonlinear_right_inverse} (28)

其中 \O m egaC}\subseteq{R}^{3} 表示可实现相机颜色的集合。等价地,

\ mathbf {C}\,\mathcal{D}\bigl(\mathcal{F}_{\mathbfC}(\mathbf{c})\bigr\mathbf\label{eq:supp_nonlinear_right_inverse_expanded} (29)

因此, \protectC} 将线性伪逆推广到了非线性情况。

(3) 非线性全模型解释。在上述线性推导中,观察者感知映射被解释为对校正后的相机颜色 \protect\mathbf{C}\mathbf{s}_i-\deltai 应用 \protectC}。这种解释并不依赖于输入校正的线性;它仅要求校正后的信号位于相机-显示器投影器有效的定义域内。因此,一旦估计出 \textstyle{\delta}\ifdim\wd>\tw@em\mathaccent"055B{\delta\mathaccent"0362{\delta}\fii\@mathmeasure ,我们就可以定义非线性显示辐射度为:

\ h w id e at {\m a thb f {s}}_i^{*}:=\mathcal{D}\!\left\mathcal{F}_{\mathbfC}\bigl(\mathbf{C}\mathbf{s}_i-\widehat{\delta}_i\bigr\right\label{eq:supp_nonlinear_sstar} (30)

应用观察者 \protect\mathbf{M} 得到:

{\mathbf{s}}_i^{*}\mathbf{M}\,\mathcal{D}\!\left\mathcal{F}_{\mathbfC}\bigl(\mathbf{C}\mathbf{s}_i-\widehat{\delta}_i\bigr\right\label{eq:supp_nonlinear_observer} (31) \ma t h b f { M }\w i deh at

因此,完整的颜色直通模型与线性情况下的组合形式完全相同,只是相机-显示器投影器现在是非线性的:

\ M o { \ a thbf } _ { t ext r}} b rac } \widehat{\mathbf{s}}_i^{*}}_{\text{display\mathbf{M}\,\mathcal{D}\!\left\underbrace{\widehat{\mathcal{F}}_{\mathbfC}}_{\textbf{learned}}\Bigl\underbrace{\mathbf{C}\mathbf{s}_i}_{\text{camera\underbrace{\widehat{\delta}_i}_{\textbf{learned}}\Bigr\right\label{eq:supp_nonlinear_full_model} (32) rbracundee {\m mathbf{M}\{s}_i ene{sccol prox \ap\ under mathbfe {\

(4) 与线性形式的一致性。公式 (32) 是公式 (24) 的非线性对应形式。当显示发射是线性的,即 \ma t hcal{D}(\sigma)=\mathbf{D}\sigma,且 \wide h at {\mathcal{F}}_{\mathbfC}(\mathbf{c})=\widehat{\mathbf{F}}_{\mathbfC}\mathbfEq. (32) 简化回:

\ma t hb f {M } \ wid e hat {\mathbf{s}}_i^{*}\mathbf{M}\mathbf{D}\cdot\widehat{\mathbf{F}}_{\mathbfC}\cdot\bigl(\mathbf{C}\mathbf{s}_i-\widehat{\delta}_i\bigr(33)

这恰好是公式 (24)。

第 28 页

28 R. Li et al.

(5) 主论文中使用的实际形式。在实践中,我们学习的相机–显示器投影器实现为非线性逐像素网络。因此,主论文中使用的模型可以解释为公式 (32) 的实际实例化:我们首先通过减去学习的残差 $\delta_i$ 来校正相机颜色 $\mathbf{C}\mathbf{s}_i$,然后将校正后的相机颜色输入到学习的非线性相机–显示器投影器 $\mathbf{C}$ 中。经过显示器发射并由观察者 $\mathbf{M}$ 观察后,得到的显示器颜色 $\mathbf{M}\widehat{\mathbf{s}}_i^{*}$ 仍然是原始场景颜色 $\mathbf{M}\mathbf{s}_i$ 的近似值。因此,即使当 $\mathbf{C}$ 从线性伪逆推广为非线性学习算子时,全模型公式仍然有效。

B.3 相机零空间校正的低秩近似

在本节中,我们提供主论文中省略的关于主论文公式 (5) 中校正颜色项 $\delta_i$ 的推导:

$$ \delta_i := \mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i,\qquad\mathbf{P}_{\mathbf{M}}:=\mathbf{D}(\mathbf{M}\mathbf{D})^{\dagger}\mathbf{M}.\label{eq:supp_delta_def} \tag{34} $$

我们首先建立对应于主论文中讨论的第一种情形的 $\delta_i = \mathbf{0}$ 的充分条件,并提供一种硬件驱动的路径,以消除在 $\delta_i \approx 0$ 时估计 $\delta_i$ 的需要。然后,我们考虑一般情况 $\delta_i \neq \mathbf{0}$,并表明 $\delta_i$ 完全源于场景辐射度的相机零空间分量,因此必须通过学习获得。这一观察结果直接 motivating 了主论文公式 (9) 中使用的低秩近似。

(1) 零校正 $\delta_i = 0$ 的充分条件。根据主论文中的公式 (5),零校正意味着:

$$ \delta_i = \mathbf{0} \quad \Longleftrightarrow \quad \mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i=\mathbf{0}\label{eq:supp_zero_delta_start} \tag{35} $$

对于所有 $\mathbf{s}_i$ 成立的一个充分条件是:

$$ \bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}_i\in\mathrm{null}(\mathbf{C}),\qquad\forall i.\label{eq:supp_zero_delta_mid} \tag{36} $$

我们现在证明,当以下条件满足时,这一要求得到保证:

$$ \mathrm{null}(\mathbf{C})\subseteq\mathrm{null}(\mathbf{M}),\label{eq:supp_luther_ives_extended} \tag{37} $$

为了理解这一点,回想一下 $\mathbf{P}_{\mathbf{M}}=\mathbf{D}(\mathbf{M}\mathbf{D})^\dagger\mathbf{M}$ 是沿 $\mathrm{null}(\mathbf{M})$ 向 $\mathrm{range}(\mathbf{D})$ 的斜投影。因此,对于任意光谱 $\mathbf{s}$:

$$ \bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}\in\mathrm{null}(\mathbf{M}),\label{eq:supp_pm_nullm} \tag{38} $$

如果此外满足 $\mathrm{null}(\mathbf{C})\subseteq\mathrm{null}(\mathbf{M})$,那么所有对相机不可见的方向对观察者也是不可见的。在此条件下,只要残差分量 $(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{s}$ 位于 $\mathrm{null}(\mathbf{C})$ 中,它也会自动被 $\mathbf{M}$ 消除。因此,

$$ \mathbf{C}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}=\mathbf{0} \quad \Longrightarrow \quad \mathbf{M}\bigl(\mathbf{I}-\mathbf{P}_{\mathbf{M}}\bigr)\mathbf{s}=\mathbf{0}\label{eq:supp_zero_delta_logic} \tag{39} $$

第 29 页

颜色直通 29

并且观察者感知投影在相机空间中不引入任何残差校正。这证明了式 (37) 是 $\delta_i=\mathbf{0}$ 的充分条件。 等价地,使用相机-显示器投影矩阵 $\mathbf{F}$,我们有: $$(\mathbf{C}\mathbf{D})^\dagger \mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M} \;\Longleftarrow\; \mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M} \;\Longleftarrow\; (\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M} \in \mathrm{null}(\mathbf{C}), \label{eq:supp_zero_delta_chain}(40)$$

由于 $(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M}$ 由构造可知,该残差位于:

$$(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M} \in \mathrm{null}(\mathbf{C}) \cap \mathrm{null}(\mathbf{M}), \label{eq:supp_intersection} \quad (41)$$

这刻画了校正项 $\delta_i$ 消失的理想情况。

(2) 扩展的 Luther–Ives 条件。基于式 (41),我们得到了对于所有场景辐射度 $\mathbf{s}_i$ 均成立 $\delta_i=\mathbf{0}$ 的充分条件,即式 (37):

$$\mathrm{null}(\mathbf{C}) \subseteq \mathrm{null}(\mathbf{M}),$$

这是因为 $(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{M}$ 由构造可知。因此,如果相机零空间中的每个方向也包含在观察者零空间中,那么任何对相机不可见的残差分量对观察者而言也必然不可见。在以下特殊情况中: $$\mathbf{M} = \mathbf{K}\mathbf{C}, \qquad \mathbf{K} \in \mathbb{R}^{3\times3, \text{invertible}}, \label{eq:supp_mtc} \quad (42)$$

我们有 $$\mathrm{null}(\mathbf{C}) = \mathrm{null}(\mathbf{M}), \label{eq:supp_null_equal} \quad (43)$$

这恰好对应于经典 Luther–Ives 条件,最多相差一个可逆线性变换。在此条件下,观察者和相机共享相同的零空间,因此校正项恒为零。 我们将此称为基于相机-显示器投影的扩展 Luther–Ives 条件,因为它保证在我们的基于投影器的公式中校正项为零。

这一视角也为不同设备间的实际差异提供了直观解释。原则上,相机被设计为近似色度观察者。然而在实践中,由于制造限制,其光谱灵敏度可能与这一理想状态存在显著偏差。DSLR 相机在实践中可能比智能手机相机更接近满足式 (37),这可能部分解释了为什么尽管经过激进的后期处理,智能手机成像管线往往难以保留真实场景的感知“电影感”色彩。

更重要的是,式 (37) 暗示了一条通过硬件驱动来强制 $\delta_i = 0$ 的途径。增加相机通道数量会减小 $\mathrm{null}(\mathbf{C})$,从而使包含关系 $$\mathrm{null}(\mathbf{C}) \subseteq \mathrm{null}(\mathbf{M})$$ 更容易满足。这表明多通道捕获系统,例如 RGBW 或其他非拜耳四通道 CFA 设计(例如包含黄色的模式),以及更通用的多光谱传感器,可以通过设计减少甚至消除校正项 [7,17,43,61,62,65]。换句话说,增加传感通道提供了一种原则性的硬件级策略来改善颜色直通:随着相机零空间变小,在捕获过程中丢失的与观察者相关的光谱变化更少,且无需对 $\delta_i$ 进行校正,因为 $\delta_i \approx 0$。

第 30 页

30 R. Li et al.

(3) 分解为可显示分量和相机零空间分量。我们现在考虑一般情况,即对于特定观察者 $M$,$\delta_i \neq \mathbf{0}$。遵循主论文中的公式 (7),我们将场景辐射度分解为:

$\mathbf{s}_i = \mathbf{r}_i + \mathbf{n}_i, \qquad \left\{\begin{aligned}\mathbf{r}_i &:= \mathbf{P}_{\mathbf{C}}\mathbf{s}_i \in \mathrm{range}(\mathbf{D}), \\ \mathbf{n}_i &:= \mathbf{s}_i – \mathbf{r}_i \in \mathrm{null}(\mathbf{C}),\end{aligned}\right.\label{eq:supp_decompose}$

其中 $\mathbf{P}_{\mathbf{C}} := \mathbf{D}(\mathbf{C}\mathbf{D})^\dagger\mathbf{C},\label{eq:supp_pc}$ (45)

根据构造,$\mathbf{r}_i$ 是 $\mathbf{s}_i$ 的可显示分量,而 $\mathbf{n}_i$ 是相机不可见的同色异谱黑分量。 将 $\mathbf{s}_i = \mathbf{r}_i + \mathbf{n}_i$ 代入公式 (34) 得到:

$\delta_i = \mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{r}_i + \mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{n}_i,\label{eq:supp_delta_split}$ (46)

我们现在证明第一项消失。由于 $\mathbf{r}_i \in \mathrm{range}(\mathbf{D})$,存在某个 $\sigma \in \mathbb{R}^3$ 使得: $\mathbf{r}_i = \mathbf{D}\sigma_i,\label{eq:supp_r_in_D}$ (47)

那么

$\mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{r}_i = \mathbf{C}\mathbf{r}_i – \mathbf{C}\mathbf{P}_{\mathbf{M}}\mathbf{r}_i \notag = \mathbf{C}\mathbf{D}\sigma_i – \mathbf{C}\mathbf{D}(\mathbf{M}\mathbf{D})^\dagger\mathbf{M}\mathbf{D}\sigma_i,\label{eq:supp_r_term}$ (48)

因为 $(\mathbf{M}\mathbf{D})^\dagger(\mathbf{M}\mathbf{D})$ 在显示代码子空间上表现为恒等变换,所以我们有:

$\mathbf{P}_{\mathbf{M}}\mathbf{r}_i = \mathbf{r}_i,\label{eq:supp_pm_fix_r}$ (49)

因此: $\mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{r}_i = \mathbf{0}\label{eq:supp_r_vanish}$ (50)

因此,公式 (46) 简化为

$\delta_i = \mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}})\mathbf{n}_i,\label{eq:supp_delta_from_n}$ (51)

这证明了主文中的陈述:校正项完全源于相机零空间分量 $\mathbf{n}_i$,而不是源于可显示分量 $\mathbf{r}_i$。

(4) 为什么低秩近似是自然的。公式 (51) 表明,估计 $\delta_i$ 需要访问未观测到的光谱分量 $\mathbf{n}_i \in \mathbb{R}^L$,以及高维算子

$\mathbf{C}(\mathbf{I}-\mathbf{P}_{\mathbf{M}}) \in \mathbb{R}^{3 \times L}$.

直接恢复 $\mathbf{n}_i$ 或校准完整算子是不切实际的。因此,我们利用经典观察结果,即自然光谱通常可以由低维子空间很好地近似 [58,63]。相应地,我们假设(也

第 31 页

颜色直通 31

(由图 15 中的先前实验证据支持)相机零空间分量也可以用低秩基表示:

m \ a fi n_ \app r o x _{k=1}^{K}a_i^{(k)}\mathbfe^{(k)},\qquadK\llL,\label{eq:supp_n_pca} (52) thb

其中 \ifmmode\lbrace\else\textbracelefte^{(k)}\}_{k=1}^{K} 是张成相机零空间光谱主要变化模式的基向量。 将式 (52) 代入式 (51) 可得

\ del t a _i

b & = \ m ath f \math bf I C(

\

ath ) th bf\mn_i a

  • m bf_ P {\m a thbf M} \notag&\approx\mathbfC(\mathbfI-\mathbfP_{\mathbfM})_{k=1}^{K}a_i^{(k)}\mathbfe^{(k)}\notag_{k=1}^{K}a_i^{(k)}\underbrace{\mathbfC(\mathbfI-\mathbfP_{\mathbfM})\mathbfe^{(k)}}_{:=\;\varphi^{(k)}\in\mathbbR^3},\label{eq:supp_delta_pca_expand} (53)

因此,校正项也位于 \protectR^3 的低维子空间中,由相同的系数 a_i^{(k)} 参数化。以矩阵形式表示,即为

\ d elt a _ i \app r o x \math b f \Ph i \, \mathb f a _ i ,q \q uad\mathbf\Phi:=\bigl\varphi^{(1)},\ldots,\varphi^{(K)}\bigr]\in\mathbbR^{3\timesK},\quad\mathbfa_i:=\bigl[a_i^{(1)},\ldots,a_i^{(K)}\bigr]^\top\label{eq:supp_delta_lowrank_general} (54)

其中每一列定义为:

\v ar phi ^{(k)} : = \mathbfC(\mathbfI-\mathbfP_{\mathbfM})\mathbfe^{(k)}\in\mathbbR^{3},\label{eq:supp_phi_k} (55)

(5) 秩-1 近似。经验表明,如图 15 所示,第一主成分解释了相机零空间光谱的大部分方差。因此,在实际应用中我们设 K = 1。在这种情况下,系数向量 \protect\mathbfa_i 简化为标量 a_i^{(1)},校准矩阵 \protect\mathbf\Phi 简化为单个 3 \times 1 向量 \varphi^{(1)}。因此,式 (54) 简化为:

\ delta _i \approx\varphia_i^{(1)},\label{eq:supp_rank1_delta_compact} (56)

使用以下符号

a_ i := a _ i^ {(1)} , \ qqua d \m a thbf e :=\mathbf\qquad\varphi:=\varphi\mathbfC(\mathbfI-\mathbfP_{\mathbfM})\mathbf\label{eq:supp_rank1_notation} (57)

秩-1 近似可以写为:

\ del t a _i = \ mathbfC(\mathbfI-\mathbfP_{\mathbfM})\mathbfn_i\approx\varphi\cdot(a_i\mathbf\label{eq:supp_rank1_delta_final} (58)

这与正文中的式 (9) 一致。在这种解释下,\ v arphi\inR^{3\times1} 是一个可校准的秩-1 系数,而 a_ i\in\mathbb R 是依赖于场景的估计系数,可以通过学习预测器从数据中估计得出。

第 32 页

32 R. Li 等

去马赛克 𝐂𝐃𝝈𝒊 逐像素 −𝝈𝒊𝟏 网络

原始传感器 RGB 像素中仅有一个通道 未进行插值

(a) 直接将像素值 (R, G, B) 发送给逐像素网络会引入误差。

𝑮 平均池化 逐像素 𝑹, 𝑮, 𝑩 网络 𝑹, 𝑩 G 通道是 G 通道是 平均池化 无平均池化 不同的 几乎相同的

(c) 平均池化层使网络能够更 (b) 使用平均池化层增强绿色通道。 清晰地区分边缘像素。

普通输入 带平均池化的输入 放大补丁 真值 (d) 使用或不使用平均池化层训练的结果误差图和放大补丁。

图 18: 说明平均池化层在学习 \protectC} 方面的有效性。与普通输入 (a) 相比,使用平均池化层增强的输入 (b) 使逐像素模型能够区分由去马赛克引入的边缘像素 (c),从而产生较少彩色边缘伪影的结果 (d)。

(6) 解释。上述推导表明,残差校正完全由场景辐射的同色异谱黑(相机零空间)分量决定。一旦这个不可见分量由低秩基近似,相机空间中相应的校正也是低秩的。这将原始高维且不切实际的校正问题转化为估计少量系数 a_ i\in\mathbb R 以及一个紧凑的可校准算子 \ v arphi\inR^{3\times1},这直接启发了主论文中的模型设计。

C 额外实验

C.1 评估平均池化层在学习 FC 方面的有效性

我们进一步分析了第 4.1 节中引入的平均池化层,用于学习 C} 实现为逐像素的相机-显示器投影 \protectC}。尽管 \@mathmeasure 在实践中,输入相机 RGB 值并非严格逐像素局部,因为 去马赛克从相邻传感器样本重建每个 RGB 三元组。 因此,靠近边缘的像素通常包含混合颜色响应,并且

第 33 页

颜色直通 33

PSNR 18.848 / Δ E 12.011 PSNR 31.102 / Δ E 4.091 PSNR 31.778 / Δ E 3.718

PSNR 19.026 / Δ E 10.471 PSNR 33.171 / Δ E 2.269 PSNR 34.029/ Δ E 2.060

PSNR 22.540 / Δ E 7.894 PSNR 36.070 / Δ E 2.078 PSNR 36.655 / Δ E 1.791

BPAM CSRNet Ours Ground-truth (基于CNN) (基于MLP) (基于MLP)

图 19: \protectC} 的可视化拟合对比。与基于 CNN 的基线(BPAM [57])和基于 MLP 的基线(CSRNet [39])相比,我们提出的网络产生了更优的定量结果,并在相应的误差图中表现出更低的误差。

仅使用逐像素 RGB 输入很难将平滑区域中的像素区分开来。为了提供轻量级的空间线索,我们在将绿色通道输入 MLP 之前,对其执行 AvgPool 操作。这种局部聚合有助于模型识别受去马赛克插值影响的像素,特别是在边缘附近,同时保持了逐像素公式的简洁性。 如图 18 所示,与原始输入相比,经过 AvgPool 增强的输入使模型更容易识别边缘像素,并在最终输出中产生更少的彩色边缘伪影。经验表明,这种简单的设计持续提高了对 \protectC} 的学习效果。

C.2 学习 \protectC} 的不同基线对比

主论文中的表 1(a) 报告了使用不同基线拟合 \protectC} 的定量结果,而此处我们在图 19 中展示了相应的视觉对比。尽管基于 CNN 的方法 BPAM [57] 在颜色迁移任务中已被证明显著优于基于 MLP 的方法 CSRNet [39],但在拟合我们的相机-显示器投影仪 \protectC} 时,它并未超越 CSRNet。这一观察结果表明,\protectC} 本质上是一种具有最小空间相关性的逐像素颜色映射。此外,我们的方法仅对绿色通道使用位置编码和 AvgPool 层对 MLP 进行增强,实现了最佳的拟合性能且误差更低。

第 34 页

34 R. Li et al.

输入图像 条件图像

开启 HDR (多帧 融合)

过饱和、噪声大、细节丢失 高动态范围、高对比度

条件 Bilateral-Grid 下采样 条件 条件 条件 切片

输入 输入 输入 应用 引导 输入

(a) NiLUT, CSRNet (b) SVDLUT, SABLUT (c) HDRNet, DeepUPE (d) 本文方法 (Ours)

图 20: ISP 增强的 Color Pass-Through 对比。除了原始输入图像(左上角),我们使用 burst-fusion 图像作为条件(右上角)来增强 Color Pass-Through。我们比较了受 (a) NiLUT [25] 和 CSRNet [39]、(b) SVDLUT [51] 和 SABLUT [50]、(c) HDRNet [33] 和 DeepUPE [75] 启发的设计,以及 (d) 我们的设计。我们的方法产生了具有自然高光(第一行)、鲜艳色彩(第二行)、更丰富细节(第三行)和更低噪声(第四行)的结果。

D Color Pass-through 的进一步应用

D.1 利用手机相机处理进行增强

本文提出的 Color Pass-Through 模型目前仅支持单帧输入,且后处理相对简单。在此,我们讨论一种可能的扩展,将其与商业图像信号处理 (ISP) 管线集成。 现代智能手机通常内置 HDR [27]、burst fusion [38] 和色调映射 [67] 等成像功能,这些功能可改善动态范围、细节和对比度。受此启发,我们使用 HDR 融合图像作为条件,同时保持原始 raw 图像作为输入,如图 20 所示。在几种测试的设计中,图 20(d) 中的变体产生了最佳结果。

第 35 页

颜色直通 35

显示器 动态范围

压缩 映射 无曲线 场景 图像 动态范围 (示例) 恒等映射

人类 捕获的场景 视觉系统 带曲线

(a) 动态范围比较 (b) 类似色调映射的曲线 (c) 结果

图 21: 曲线增强颜色直通的比较。(a) 由于显示器的动态范围比真实场景更有限,学习到的映射可能在超出范围区域失效。(b) 为了缓解这个问题,我们在输入图像上应用类似色调映射的曲线,在低强度区域使用恒等映射,在高强度区域进行压缩。(c) 使用与不使用所提曲线的视觉比较。增强版本在强光照射区域(例如底部角落)产生了更一致的颜色变化。

D.2 扩展到高动态范围

所提出的颜色直通模型旨在严格对齐显示器亮度与真实世界场景的亮度,因为我们的目标是让显示器尽可能忠实地复现场景颜色。 然而,由于硬件限制,当前显示器的上限仍远远低于人类视觉感知的范围,特别是在包含强烈高光的场景中(见图 21(a))。在此,我们探索了一种简单的扩展方法,通过在原始输入中增加类似色调映射的曲线,以更好地保留高强度高光区域(见图 21(b))。如图 21(c) 所示,这种策略可以在一定程度上缓解过曝问题,尽管更有效的解决方案仍是未来研究的重要方向。

E 局限性

跨不同相机的泛化能力。我们的颜色直通框架是针对特定相机-显示器对设计的,例如 Vision Pro 通过其显示器复现由特定相机捕获的真实场景。因此,学习到的模型不能直接应用于由不同相机捕获的图像。解决这一局限性的一个可能方向是原始数据到原始数据的转换 [37,64,77],这有可能与我们完整的模型结合,以便在未来的工作中实现跨设备迁移。

有限的动态范围。如 D.2 节所述,与真实世界场景相比,当前显示器的动态范围有限。在极端光照条件下,例如直射阳光,忠实的颜色复现可能需要 HDR 捕获、特定的色调映射技术以及渲染,以避免明亮区域的裁剪或压缩。

发表评论