快速导读:Causal-AgentIR的核心区分在于引入自演化因果记忆图。它将修复经验结构化为图数据,支持多跳因果推理,实现知识的长期积累与更新。
图像修复领域正从单一任务模型向All-in-one框架及Agentic系统演进。然而,现有Agent系统普遍缺乏长期知识演化机制,难以在复杂、不可预测的真实世界退化场景中实现自适应修复。
Causal-AgentIR提出一种分层多Agent框架,核心创新在于引入自演化因果记忆图。该机制将修复经验结构化为图数据,通过可学习演化策略实现知识的长期积累与更新,从而提升工具协调与规划能力。
英文题目:Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents
论文出处:arXiv 每日论文精选 · arXiv:2607.21125
原始论文:PDF / 论文页面
对应视频标题:图像修复Agent如何进化?Causal-AgentIR用因果记忆解决长期适应难题|推荐指数:★★★★★
这篇论文解决什么问题?
传统图像修复模型针对特定退化类型设计,泛化能力有限。All-in-one模型虽能处理多种退化,但缺乏灵活性。近期Agentic系统利用LLM进行规划与工具调用,但多依赖静态工具描述或非结构化文本摘要。
这种静态知识表示导致Agent无法有效积累、验证和演化修复知识。在面对混合退化(如同时存在雨、雾、噪声)时,Agent难以进行上下文依赖的动作-效果建模,导致规划失误或修复效果不佳。
现有工作如MAIR、AgenticIR和IAMAgent虽引入了多Agent或自探索机制,但缺乏图结构记忆与自演化能力,限制了长期适应性与因果推理水平。
核心创新
方法概览
Causal-AgentIR的核心区分在于引入自演化因果记忆图。它将修复经验结构化为图数据,支持多跳因果推理,实现知识的长期积累与更新。
- Causal-AgentIR采用分层多Agent架构,包含规划器、退化分析、工具调用、因果记忆、批判与记忆策展Agent。各Agent协同工作,实现从退化识别到修复执行的全流程自动化。
- 核心模块为自演化因果记忆图,将修复经验存储为节点(退化、工具、动作、质量变化、成本、偏好)和边(经验因果关联)。该图结构支持多跳因果推理,帮助规划器推断有效工具序列。
- 记忆演化机制是可学习的,基于修复结果进行更新。操作包括添加、更新、合并、强化、忽略和丢弃。该机制确保记忆图随时间推移不断优化,保留高价值知识,剔除无效或过时信息。
- 规划器利用因果记忆图进行推理,结合退化分析结果,生成适应当前场景的修复计划。批判Agent评估修复效果,反馈给记忆策展Agent以触发记忆更新。
逐图理解论文
核心区分

图2展示了Causal-AgentIR的整体框架。注意各Agent的协作流程,特别是因果记忆图在规划与执行中的核心作用。该图清晰呈现了从退化分析到记忆更新的闭环。
最强结论

图3对比了不同修复方法的定性结果。第四列为特定任务模型结果,其余为All-in-one设置。观察Causal-AgentIR在细节保留与伪影抑制方面的优势。
意义与局限

图6呈现用户研究结果。对比Causal-AgentIR与ChatGPT 4o及其他Agent,关注适应性、可定制性、满意度和易用性维度的评分差异。
实验如何设计?
- 实验涵盖All-in-one设置、特定任务评估、真实世界零样本泛化及混合退化场景。数据集包括Test100、Snow100K、SOTS-Indoor、GoPro、CBSD68等。
- 对比基线包括IAMAgent、Defusion等先进方法。评估指标包括PSNR、SSIM、Rollback Rate (RR)、Success Rate (SR)和Preference Alignment Rate (PAR)。
- 消融研究验证了多Agent协作与自演化因果记忆组件的贡献。用户研究比较了Causal-AgentIR与ChatGPT 4o及其他Agent在适应性、可定制性、满意度和易用性方面的表现。
关键结果与论文证据
- 在All-in-one设置中,Causal-AgentIR平均PSNR达35.55 dB,优于IAMAgent (35.24 dB)和Defusion (33.58 dB) (Page 7)。
- 在特定任务中,Causal-AgentIR在去雨、去雪、去雾和去模糊任务上均取得最佳PSNR (Page 7)。
- 在真实世界基准测试中,Causal-AgentIR在RealRain-1k-L、RTTS和SIDD数据集上表现最佳,FADE和BRISQUE指标最低,NIMA最高 (Page 9)。
- Causal-AgentIR具有最低的Rollback Rate (0.12)、最高的Success Rate (0.92)和Preference Alignment Rate (0.90) (Page 10)。
- 消融研究表明,完整模型比基线提升0.73 dB PSNR,验证了各组件的有效性 (Page 11)。
- 用户研究显示Causal-AgentIR在适应性和满意度方面显著优于对比方法 (Page 12)。
阅读时需要注意
- 依赖冻结的修复工具库,性能提升源于规划而非模型参数更新。
- 记忆演化依赖准确的质量评估与反馈,在无参考真实场景中可能受噪声影响。
- 多Agent协调与图检索推理带来较大计算开销。
- “因果”关系为经验干预关系,非完整结构因果模型。
- 用户研究规模较小 (50人),且无参考指标与人类感知可能存在偏差。
关联工作
- MAIR引入真实世界退化先验,但缺乏图记忆与自更新机制。
- AgenticIR具备自探索能力,但缺乏多Agent结构与因果记忆。
- IAMAgent具有高工具扩展性,但缺乏图因果记忆与自演化机制。
- Defusion是SOTA All-in-one模型,但缺乏Agentic灵活性与自适应规划。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
1
Causal-AgentIR:用于自适应图像恢复智能体的自演化因果记忆
高虎,陈玉龙,马立庄†,IEEE 高级会员
摘要——图像恢复智能体最近作为一种灵活的范式出现,用于处理现实场景中多样且不可预测的退化。现有的智能体通常将恢复建模为使用工具的过程,其中智能体感知退化、搜索候选工具、执行恢复操作,并通过反思或回滚来修正计划。然而,它们的知识通常存储为静态工具描述、手动定义的退化先验或非结构化的文本摘要,这限制了长期经验中恢复知识的积累、验证、修订和遗忘。在本文中,我们提出了 Causal-AgentIR,这是一种具有自演化因果记忆的分层多智能体框架,用于集体图像恢复智能。Causal-AgentIR 不像孤立文本记录那样表示恢复经验,而是将退化模式、图像区域、恢复工具、动作、质量变化和用户偏好组织成结构化的因果记忆图。该图支持基于图的检索和多跳因果推理,使智能体能够推断特定的恢复操作或工具序列如何影响不同退化条件下的恢复质量。该框架进一步将多个智能体组织成一个协作系统,包括规划、退化分析、工具专长、因果记忆推理、结果批判和恢复。任务对齐的方法在多个任务上训练一个通用的恢复记忆策展网络 [6]–[11]。虽然这些方法增强了模型的迁移能力,但它们通常在推理时仍依赖于已知的退化设置,并且可能难以应对未知或特定领域的失真。全恢复(All-in-one Restoration)进一步寻求在单一统一框架内处理多种退化类型。代表性方法 [12]–[16] 使用退化嵌入、提示学习、指令条件、动态路由或视觉-语言先验来指导恢复过程。尽管提高了任务覆盖率,但这些方法仍然面临通用性与专业性之间的固有权衡:统一模型预计能适应多种退化,但在单个任务上可能不如专用模型有效。此外,作为在预定义退化类别上训练的静态模型,它们通常缺乏灵活性,无法将其恢复策略适应于未见过的退化组合、新出现的伪影或用户特定需求。
受大型语言模型 (LLMs) [17]–[19] 和多模态智能体 [20], [21] 近期进展的启发,代理式图像恢复已成为一个新的方向 [22]–[27]。恢复智能体不依赖单一的大型模型,而是将图像恢复制定为决策过程。它们可以分析输入图像,识别可能的退化,选择合适的恢复工具,执行操作,评估中间结果,并修正恢复计划。这种范式允许多个专用和通用的恢复模型在灵活的恢复工作流中进行协调,同时也提供了自然的
图 1. 现有图像恢复范式与提出的 Causal-AgentIR 框架之间的比较。
I. 引言
图像恢复旨在从退化的观测中恢复高质量图像,一直是低级视觉中的一个基本问题。在过去的几十年里,在特定任务的恢复方面取得了相当大的进展,包括图像去噪、去模糊、去雨、去雾和去雪及相关任务 [1]–[5]。在深度卷积网络、Transformer、扩散模型和状态空间模型的推动下,特定任务的方法在定义良好的基准上取得了强大的性能。然而,现实世界中的图像退化通常是多样、不可预测且空间非均匀的。这种变异性使得现实世界的恢复比具有预定义退化类型的传统特定任务设置更具挑战性。
为了提高跨退化场景的适应性,最近的研究探索了任务对齐和全恢复图像恢复。
高虎和马立庄隶属于上海交通大学计算机系,中国上海 200240(电子邮件:gao h@sjtu.edu.cn, lzma@sjtu.edu.cn)。 陈玉龙隶属于哈尔滨工业大学建筑与艺术学院,中国黑龙江(电子邮件:llong c@hit.edu.cn)
第 2 页
2
表 I 代表性图像恢复智能体与本文提出的 Causal-AgentIR 之间的对比。
方法 多智能体 图记忆 因果推理 自更新记忆 人类反馈 工具扩展性 MAIR [23] ✓ ✗ 基于先验 ✗ ✓ 高 AgenticIR [24] ✗ ✗ 弱 ✗ ✗ 中 HybridAgent [25] ✓ ✗ ✗ ✗ ✓ 中 IAMAgent [26] ✓ ✗ ✗ ✗ ✓ 高 Restore-R1 [27] ✗ ✗ ✗ ✗ 隐式 中 Causal-AgentIR ✓ ✓ ✓ ✓ ✓ 高
用于用户交互和个性化恢复的接口。智能体系统。 尽管它们具有灵活性,但现有的恢复智能体仍然严重依赖重复的工具搜索、反思和回滚,这可能会引入相当大的推理开销。它们的知识通常由静态工具描述、手动定义的退化先验、提示模板或非结构化文本摘要表示。此类表示可以支持短期规划,但随着新恢复经验的积累,它们难以验证、修订、整合或有选择地遗忘。更重要的是,它们很少编码上下文相关的动作效应,包括恢复操作或工具序列在不同退化组合、空间区域和用户要求下如何影响图像质量。例如,直接去雾可能会放大传感器噪声,而在去雾之前进行轻度去噪可能会产生更可靠的恢复轨迹。因此,现有的智能体仍然是有效的工具使用系统,但对长期恢复知识演化的支持有限。
为了解决这一局限性,我们提出了 Causal-AgentIR,这是一种具有自演化因果记忆的分层多智能体框架,用于自适应图像恢复,如图 1 所示。与将恢复经验存储为孤立文本记录不同,Causal-AgentIR 将退化、图像区域、恢复工具、动作、质量变化、计算成本和用户偏好组织到一个结构化记忆图中。该图表示从已执行的恢复操作中获得的经验和上下文相关的动作-结果关系。在推理过程中,检索相关子图以支持恢复规划、工具选择、区域处理和执行顺序确定。每次操作后,评估恢复结果和反馈以修订相应的记忆关系。通过规划器、退化智能体、工具智能体、因果记忆智能体、评论员和记忆管理员之间的分层协作,恢复经验可以不断被重用、验证、整合、强化或丢弃。
表 I 总结了代表性恢复智能体与 Causal-AgentIR 之间的主要区别。与主要关注工具调用、多智能体协调或轨迹级策略学习的现有系统不同,Causal-AgentIR 显式地对结构化恢复记忆及其持续演化进行建模。
我们的贡献总结如下: • 我们提出了 Causal-AgentIR,它将代理图像恢复表述为一个序列决策过程,在分层多智能体系统中联合集成恢复规划和执行后记忆演化。 • 我们引入了一种自演化因果记忆图,以及一种可学习的记忆演化机制。该图编码上下文相关的动作效应、执行顺序、质量变化、成本和用户偏好,同时支持结构化检索、多跳推理、证据整合和有选择地遗忘。 • 在特定任务、全恢复(all-in-one)、真实世界和混合退化基准上的大量实验证明了其有效性和通用性。
II. 相关工作 A. 图像恢复
图像恢复旨在从退化观测中恢复高质量图像,这是低层视觉中的一个基本问题。早期方法主要依赖手工设计的先验,如稀疏约束、低秩假设和物理退化模型 [28]–[30]。虽然可解释,但这些方法受限于手动设计的假设,并且通常难以推广到复杂的真实世界退化。最近的深度学习方法通过从大规模数据中学习退化感知表示,显著提高了恢复性能 [5], [6], [31]。ALGNet [2] 执行自适应的局部-全局特征提取以进行运动去模糊,XYScanNet [32] 使用交替扫描来捕捉长程空间依赖关系,EfDeRain+ [3] 将去雨公式化为预测滤波,PGH2Net [4] 将亮/暗通道先验与直方图均衡化集成以进行分层去雾。生成式恢复方法,如 UPID-EDM [33] 和 Diff-Unmix [34],进一步利用扩散先验和迭代去噪以提高感知质量。SFNet [8]、FSNet [6]、StarIR [10] 和 MHNet [7] 探索频域建模、线性注意力和分层特征表示以增强跨任务恢复。状态空间模型也被引入到恢复中。例如,MambaIRV2 [11]、ACL [9] 通过多维扫描和非因果状态建模改善空间表示,而相关研究调查了替代扫描或混合设计以更好地捕捉空间依赖关系。PromptIR [12] 和 CAPTNet [13] 引入退化感知提示来引导恢复,而 NDR [35] 学习神经退化表示以捕捉共享的退化特征。BaryIR [14] 通过分布对齐学习退化不变表示来提高泛化能力。最近,基于大模型的方法结合了视觉-语言
第 3 页
3
语言表示来提取退化感知线索,III. 方法 AutoDIR [15] 结合视觉-语言引导与潜在扩散先验,Defusion [36] 引入退化扩散以实现通用恢复。其他方法如 AdaIR [37] 和 Perceive-IR [38] 通过解耦退化与内容信息或识别细粒度退化严重程度,进一步提高了鲁棒性。 这些方法逐步将图像恢复从特定任务模型扩展至任务对齐和全合一框架。然而,它们的恢复知识主要编码在固定的模型参数中,推理过程通常由训练期间学到的表示决定。因此,它们无法显式重用新观察到的动作结果,也无法通过累积的执行经验调整恢复策略。在本工作中,现有的恢复网络被视为可调用的工具,而重点在于如何结构化、检索和重用恢复经验,以支持自适应的工具协调。
A. 概述 如图 2 所示,给定退化图像 $I_0$ 和用户指令 $P_u$,Causal-AgentIR 旨在通过分层多智能体协作生成恢复图像 $\hat{I}$。整体框架由三个耦合组件组成。首先,分层多智能体系统将复杂的恢复分解为退化分析、恢复规划、工具专长、因果记忆推理、结果批判和记忆策展。其次,自我演化的因果记忆图存储结构化的恢复经验,包括退化模式、图像区域、恢复工具、动作、质量变化、计算成本和用户偏好。第三,可学习的记忆演化机制根据质量变化和反馈决定新观察到的恢复经验是添加、更新、合并、强化、忽略还是丢弃。
B. 问题表述 B. 图像恢复智能体 最近大语言模型 [17]–[19] 和多模态大语言模型 [39]–[41] 的进展激发了智能体图像恢复的研究。恢复智能体不再将恢复视为直接的图像到图像映射,而是将其表述为多步决策过程,其中智能体感知退化、规划操作、调用工具、评估中间结果,并根据反馈修正计划。 几个代表性系统探索了这一方向。RestoreAgent [22] 使用视觉-语言模型生成恢复计划并调用相应工具。AgenticIR [24] 将人类图像处理抽象为感知、调度、执行、反思和重新调度,并引入自我探索以总结恢复经验。MAIR [23] 通过引入真实世界退化先验和两级多智能体系统进一步提高了效率,其中调度智能体生成全局计划,专家智能体处理特定退化。HybridAgent [25] 提出了快速、慢速和反馈智能体以适应不同的用户提示,并强调了由逐步单退化恢复引起的误差传播问题。Restore-R1 [27] 将工具选择表述为强化学习问题,并使用多模态感知反馈训练轻量级策略,减少了对迭代反思和回滚的需求。 现有的恢复智能体通过结合退化感知、工具选择、执行和基于反馈的重新规划来提高灵活性。然而,大多数现有系统侧重于选择适当的工具或纠正失败的恢复轨迹。它们保留的先验经验通常表示为静态先验、提示模板或文本摘要,没有显式建模上下文相关的动作效果、证据置信度或记忆巩固。Causal-AgentIR 通过结构化的恢复记忆图和记忆策展器解决了这一局限性,支持检索、推理、修订、强化、巩固和选择性遗忘。
令 $I_t$ 为第 $t$ 次恢复步骤后的图像状态。 在每一步,系统选择一个恢复动作 $a_t = (T_i, \theta_t, m_t), \quad (1)$ 其中 $T_i \in \mathcal{T}$ 是选定的恢复工具,$\theta_t$ 表示其参数配置,$m_t \in [0, 1]^{H_I \times W_I}$ 表示目标区域掩码。这里 $H_I$ 和 $W_I$ 分别表示图像的高度和宽度。对于全局恢复,$m_t = 1$。恢复后的图像通过下式获得: $I_{t+1} = m_t \odot T_i(I_t; \theta_t) + (1 – m_t) \odot I_t, \quad (2)$ 其中 $\odot$ 表示逐元素乘法。恢复轨迹表示为 $\tau = \{I_0, a_0, I_1, a_1, \dots, a_{L-1}, I_L\}, \quad (3)$ 其中 $L$ 是轨迹长度。目标是最大化累积恢复效用: $\max_{\pi} \mathbb{E}_{\tau \sim \pi} \sum_{t=0}^{L-1} R_t, \quad (4)$ 其中 $R_t$ 表示步骤 $t$ 的恢复奖励,定义见公式 (30)。 除了恢复动作外,Causal-AgentIR 显式建模记忆演化操作。在每一步,记忆策展器选择一个操作 $o_t \in \{\text{add, update, merge, reinforce, ignore, discard}\}. \quad (5)$ 联合决策策略表述为 $(a_t, o_t) \sim \pi(a, o | s_t, G), \quad (6)$ 其中 $s_t$ 表示当前恢复状态,$G$ 是因果记忆图。 为了避免当前观察与检索到的记忆之间的歧义,我们首先将预检索状态定义为 $x_t = [\phi(I_t), d_t, q_t, h_t], \quad (7)$
第 4 页
4
图 2. 提出的 Causal-AgentIR 框架概览。
其中 $\phi(I_t)$ 是当前图像的视觉表示,$d_t$ 表示退化状态,$q_t$ 表示质量状态,$h_t$ 表示执行历史。因果记忆代理根据 $x_t$ 和 $P_u$ 检索子图 $g_t$,最终决策状态定义为 $$s_t = [x_t, g_t]. \quad (8)$$
C. 分层多智能体系统
Causal-AgentIR 将复杂的修复任务分解为一组专门的智能体角色,包括规划器代理、退化代理、工具代理、因果记忆代理、评估代理和记忆策展人代理。这些智能体在退化分析、因果记忆检索、修复规划、工具执行、结果评估和记忆更新的闭环中协作。
规划器代理。规划器代理充当全局协调者。它接收用户指令、退化分析结果、检索到的因果记忆和评估反馈,然后将修复目标分解为可执行的子任务。具体而言,它决定修复是全局进行还是区域进行,是使用单个工具还是工具序列,以及使用全合一(all-in-one)或混合退化工具是否优于逐步修复。
退化代理。退化代理从输入图像中识别全局和局部退化。其输出包括退化类别、严重程度、空间区域和不确定性。
因果记忆代理。因果记忆代理从因果记忆图中检索相关子图并执行多跳因果推理。它估计在当前退化条件下,修复工具或工具序列可能如何影响修复质量。检索到的因果证据提供给规划器,帮助其避免有害操作并选择更可靠的修复顺序。
工具代理。工具代理负责执行特定领域的修复操作,包括去噪、去模糊、去雨、去雾和去雪。它们也可能包括全合一或混合退化修复工具。在规划器生成修复计划后,相应的工具代理执行所选操作。
评估代理。评估代理在每次执行操作后评估中间和最终的修复结果。其评估结合了保真度导向的指标,这些指标在真实世界场景中可用,包括无参考感知指标、伪影指示器、计算成本以及可选的用户或多模态反馈。
记忆策展人代理。记忆策展人根据观察到的修复结果更新因果记忆。它决定新生成的经验是否应作为新知识添加,用于更新现有因果关系,与相似记忆合并,作为可靠知识强化,作为无信息证据忽略,或作为不稳定或有害经验丢弃。
D. 自演化因果记忆图
Causal-AgentIR 的核心是一个自演化因果记忆图,它以结构化形式存储修复经验。该图定义为 $$G = (V, E), \quad (9)$$ 其中 $V$ 和 $E$ 分别表示节点集和边集。节点集定义为 $$V = \{V_d, V_r, V_T, V_a, V_q, V_c, V_u\}, \quad (10)$$ 其中 $V_d, V_r, V_T, V_a, V_q, V_c$ 和 $V_u$ 分别表示退化节点、区域节点、工具节点、动作节点、质量变化节点、成本节点和用户偏好节点。
每条边描述两个节点之间的经验因果或条件依赖关系: $$e_{ij} = (v_i, v_j, z_{ij}, w_{ij}, \gamma_{ij}), \quad (11)$$ 其中 $z_{ij}$ 表示上下文条件,$w_{ij}$ 表示对修复质量的估计影响,$\gamma_{ij}$ 表示置信度分数。在本文中,“因果”指的是由实际修复操作引起的经验干预关系,而非完全指定的结构因果模型。具体而言,在给定上下文下,应用动作并观察 resulting 质量变化为更新相应的因果关系提供了证据。例如,一条边可能编码在强噪声和雾霾下,先去噪再去雾可提高感知质量,或者先去模糊再去雨可能会放大雨痕并降低去雨效果。
给定预检索状态 $x_t$ 和用户指令 $P_u$,因果记忆代理构建查询表示: $$\psi_t = \Psi(x_t, P_u), \quad (12)$$
第 5 页
5
其中 $\psi_t$ 编码退化类别、严重程度、受影响区域、用户需求和执行历史。通过操作检索相关子图: $g_t = \text{Retrieve}(G, \psi_t)$. (13) 其中 $F_t$ 表示文本、多模态或用户反馈。给定 $\xi_t$ 和检索到的子图 $g_t$,策展人选择记忆操作: $o_t = \pi_m(\xi_t, g_t)$, (21) 其中 $o_t \in \{\text{add, update, merge, reinforce, ignore, discard}\}$. (22)
对于图中的每条边 $e$,其检索相关性计算为 $\text{Rel}(e|\psi_t) = \lambda_s \text{Sim}(\psi_t, z_e) + \lambda_\gamma \gamma_e + \lambda_w |w_e|$, (14) 其中 $\text{Sim}(\cdot)$ 衡量上下文相似度,$\gamma_e$ 是边置信度,$w_e$ 是估计的因果效应。项 $|w_e|$ 允许智能体检索既有有益也有有害的高影响关系,因为负面证据对于避免不可靠的恢复计划同样有用。
Add. 如果观察到的经验是新的且产生了显著的质量变化,则添加一个新的因果边: $e_{\text{new}} = (v_i, v_j, z_{\text{new}}, \Delta Q_t, \gamma_0)$, (23) 其中 $\gamma_0$ 是初始置信度分数。
Update. 如果经验与现有边 $e_{ij}$ 匹配,其因果效应通过以下公式更新: $w_{ij}^{t+1} = \alpha w_{ij}^t + (1 – \alpha) \Delta Q_t$, (24) 其中 $\alpha$ 是动量系数。
对于候选恢复计划 $\Pi_t = \{a_t, a_{t+1}, \dots, a_{t+H-1}\}$, (15) 规划 horizon 为 $H$,预期效用通过聚合检索子图中相关的因果路径来估计: $U(\Pi_t|s_t) = \sum_{P \in \Omega(\Pi_t, g_t)} \Gamma(P) – \lambda_C C(\Pi_t)$, (16) 其中 $\Omega(\Pi_t, g_t)$ 表示与 $\Pi_t$ 相关的因果路径集合,$C(\Pi_t)$ 表示计算成本,$\Gamma(P)$ 是路径级因果得分。对于路径 $P = \{e_1, e_2, \dots, e_J\}$,得分定义为 $\Gamma(P) = \left( \prod_{j=1}^J \gamma_{e_j} \right) \left( \sum_{j=1}^J w_{e_j} \right)$. (17)
Reinforce. 如果新观察结果与现有因果关系一致,则增加置信度分数: $\gamma_{ij}^{t+1} = \gamma_{ij}^t + \rho(1 – \gamma_{ij}^t)$, (25) 其中 $\rho$ 控制强化速率。
Merge. 如果两个记忆条目在相似上下文下描述相似的因果关系,则进行合并: $w_{\text{merge}} = \frac{\gamma_1 w_1 + \gamma_2 w_2}{\gamma_1 + \gamma_2}$, (26) $\gamma_{\text{merge}} = \max(\gamma_1, \gamma_2)$. (27)
Ignore. 如果观察到的经验质量变化可忽略或置信度低,则不用于更新图: $G_{t+1} = G_t, \quad \text{if } |\Delta Q_t| < \tau_Q \text{ or } \delta_t > \tau_\delta$, (28) 其中 $\tau_Q$ 和 $\tau_\delta$ 分别是质量变化和不确定性的阈值。
Discard. 如果记忆条目反复导致负面结果或与新的观察结果冲突,则将其削弱或移除: $e_{ij} \leftarrow \emptyset, \quad \text{if } \gamma_{ij} < \tau_\gamma \text{ and } w_{ij} < -\tau_w$. (29)
这种表述有利于由可靠且积极的因果证据支持的计划。与非结构化的文本摘要相比,因果记忆图允许智能体不仅推理应使用哪个工具,还推理在当前退化条件下,为何特定的操作或执行顺序可能有效。
E. 可学习的记忆演化机制
在执行动作 $a_t$ 后,评论家和记忆策展人智能体评估从 $I_t$ 到 $I_{t+1}$ 的转换并相应更新因果记忆。质量变化定义为 $\Delta Q_t = \Phi(Q(I_{t+1}), Q(I_t), P_u)$, (18) 其中 $Q(\cdot)$ 表示质量测量值,$\Phi(\cdot)$ 根据用户指令聚合它们。在实践中,质量变化计算为 $\Delta Q_t = \Delta Q_{\text{fid}_t} + \beta_1 \Delta Q_{\text{pert}} + \beta_2 \Delta Q_{\text{obj}_t} – \beta_3 \Delta Q_{\text{art}_t} – \beta_4 C_t + \beta_5 R_{\text{pref}_t}$, (19) 其中 $\Delta Q_{\text{fid}_t}$ 表示保真度提升,$\Delta Q_{\text{pert}}$ 表示感知提升,$\Delta Q_{\text{obj}_t}$ 表示客观质量提升,$\Delta Q_{\text{art}_t}$ 表示伪影增加,$C_t$ 表示计算成本,$R_{\text{pref}_t}$ 表示偏好对齐。在没有参考图像的真实场景中,保真度项被省略。
每次恢复转换被转换为经验元组: $\xi_t = (s_t, a_t, I_{t+1}, \Delta Q_t, P_u, F_t)$, (20) 记忆操作策略经过训练以提高长期恢复效用。其奖励定义为 $R_t = \Delta Q_t + \eta_1 R_{\text{mem}_t}$, (30) 其中 $R_{\text{mem}_t}$ 衡量更新的记忆是否改善了未来的规划。它通过以下公式估计: $R_{\text{mem}_t} = U(\Pi_{t+1}|G_{t+1}) – U(\Pi_{t+1}|G_t)$, (31) 其中 $G_t$ 和 $G_{t+1}$ 分别表示更新前后的记忆图。此处,$\Pi_{t+1}$ 表示从下一个图像状态生成的候选恢复计划。通过这种机制,Causal-AgentIR 并不简单地存储所有历史记录。相反,它选择性地保留可靠的因果知识,修正不稳定的关系,合并冗余经验,忽略无信息的转换,并遗忘错误的记忆。这使得智能体能够保持紧凑、可迁移且持续演化的恢复知识。
第 6 页
6
表 II 列出了共享工具库中使用的恢复工具。AgenticIR [24] 和 GPT-4o 采用的工具用于规划、退化识别和批评。表 II 报告了恢复工具库。所有工具在可用时均使用公开发布的检查点。否则,它们按照相应论文中报告的设置进行重新训练。在智能体训练期间,所有恢复工具的参数均被冻结。因此,Causal-AgentIR 取得的改进主要源于退化分析、工具选择、执行顺序、区域应用和基于记忆的规划,而非修改恢复网络本身。为了确保智能体方法之间的公平比较,所有智能体均被赋予访问相同恢复工具库的权限。
B. 全合一设置结果
表 III 报告了全合一 R+S+H+B+N 设置下恢复模型与恢复智能体之间的定量比较。总体而言,恢复智能体在大多数退化类型上持续优于基于模型的全合一方法。最佳的恢复方法 Defusion [36] 实现了 33.58 dB 的平均 PSNR。相比之下,即使在平均 PSNR 方面最弱的恢复智能体 MAIR [23] 也达到了 34.96 dB,在 PSNR 上超越了最佳恢复方法 1.38 dB。这一明显的性能差距表明,智能体恢复比直接应用单一统一的恢复模型更有效,特别是在需要在同一推理框架内处理多种退化类型时。
与恢复模型的比较。最近的多个全合一恢复模型通过学习多种退化类型的统一表示取得了具有竞争力的结果。其中,Defusion [36] 获得了最强的平均 PSNR,为 33.58 dB。相比之下,Causal-AgentIR 将平均 PSNR 从 33.58 dB 提升至 35.55 dB。这一改进表明,除了学习单一统一映射外,协调多个恢复工具并结合感知退化类型的规划和基于记忆的决策制定,可以更好地适应异质的恢复需求。
与现有恢复智能体的比较。与现有的恢复智能体相比,Causal-AgentIR 也取得了最佳的整体结果。最强的竞争智能体是 IAMAgent [26],其平均 PSNR 为 35.24 dB。Causal-AgentIR 进一步将平均 PSNR 提升至 35.55 dB,增益为 0.31 dB。这些结果表明,所提出的自我演化因果记忆为工具选择和执行顺序提供了比主要依赖工具搜索和轨迹级反思的传统智能体恢复管道更有效的指导。
针对不同退化类型的性能。Causal-AgentIR 在五项任务中的四项(包括去雨、去雪、去雾和去模糊)中取得了最佳 PSNR。在去噪方面,Causal-AgentIR 获得了 34.37 dB 的第二高 PSNR,略低于 IAMAgent,但仍高于其他智能体和基于模型的方法。
IV. 实验
在本节中,我们首先介绍实验设置,随后提供定性和定量比较结果。最后,进行消融研究以验证所提出方法的有效性。
A. 实验设置
我们在全合一和任务特定设置下评估我们的方法。
1) 数据集:任务特定设置。我们在图像去噪、去模糊、去雨、去雾和去雪上分别评估该框架。与明确提供退化类别的传统任务特定方法不同,除非另有说明,否则 Causal-AgentIR 仅接收退化图像和通用恢复指令。退化智能体首先估计退化条件,随后规划器从共享库中选择适当的恢复工具或工具序列。i) 图像去雨:我们在几个基准数据集上进行评估,包括 Rain100H [42]、Rain100L [42]、Test100 [43] 和 Test1200 [44]。ii) 图像去雪:我们利用 Snow100K [45]、SRRS [46] 和 CSD [47] 数据集。遵循 [6] 中的协议,我们随机采样 2,000 张图像进行评估。iii) 图像去雾:我们在 RESIDE [48] 的白天合成子集上评估 Causal-AgentIR。iv) 图像去模糊:我们在 GoPro 数据集 [49] 和 HIDE 数据集 [50] 上评估 Causal-AgentIR。v) 图像去噪:在 CBSD68 [51]、Urban100 [52] 和 Kodak24 [53] 上进行评估。生成加性高斯白噪声,σ ∈ 15, 25, 50。
全合一设置。我们在 Test100 [43] 上进行去雨评估,在 Snow100K [45] 上进行去雪评估,在 SOTS-Indoor [48] 上进行去雾评估,在 GoPro [49] 上进行去模糊评估,在 CBSD68 [51] 上进行去噪评估。
2) 评估指标:对于配对数据集,我们报告峰值信噪比 (PSNR)、结构相似性指数度量 (SSIM) 和学习感知图像块相似度 (LPIPS) [54]。对于没有参考图像的真实世界图像,我们报告盲/无参考图像空间质量评估器 (BRISQUE) [55]、雾感知密度评估器 (FADE) [56] 和神经图像评估 (NIMA) [57]。对于 PSNR、SSIM 和 NIMA,较高的值表示较好的性能,而较低的 LPIPS、FADE 和 BRISQUE 值更受青睐。在所有表格中,最佳和第二佳结果分别以粗体和下划线突出显示。
3) 训练细节:我们遵循与 MAIR [23] 相同的实现设置。具体而言,
第 7 页
7
表 III 全场景设置下,使用恢复模型与恢复智能体的定量结果。去噪结果报告的是噪声水平为 15 时的情况。
去雨 去雪 去雾 去模糊 去噪 平均 类型 方法 PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ Perceive-IR [38] 30.93 0.902 32.99 0.948 40.05 0.996 29.79 0.889 33.81 0.962 33.51 0.940 Defusion [36] 30.66 0.905 33.33 0.952 40.21 0.995 29.98 0.889 33.73 0.962 33.58 0.940 AllRestorer [67] 30.71 0.903 33.17 0.951 40.11 0.991 29.63 0.882 33.62 0.959 33.45 0.937 模型 BaryIR [14] 30.82 0.907 33.05 0.948 40.20 0.995 29.52 0.881 33.55 0.963 33.43 0.939 MAIR [23] 31.23 0.921 33.97 0.957 41.48 0.996 34.08 0.965 34.02 0.971 34.96 0.962 AgenticIR [24] 31.10 0.920 34.17 0.961 41.25 0.996 34.18 0.963 34.25 0.969 34.99 0.962 HybridAgent [25] 31.56 0.923 34.03 0.959 41.52 0.996 34.29 0.968 34.28 0.968 35.17 0.963 智能体 IAMAgent [26] 31.55 0.922 34.50 0.962 41.44 0.996 34.31 0.974 34.40 0.965 35.24 0.964 Restore-R1 [27] 31.48 0.920 34.46 0.962 41.39 0.997 34.15 0.968 34.17 0.968 35.13 0.963 Causal-AgentIR (Ours) 31.89 0.923 34.85 0.965 41.88 0.997 34.73 0.970 34.37 0.965 35.55 0.964
表 IV 特定任务设置下的图像去雨结果。
Test100 Test1200 Rain100H Rain100L 平均 方法 PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ EfDeRain+ [3] 31.10 0.911 33.12 0.925 34.57 0.957 39.03 0.972 34.46 0.941 MAIR [23] 31.23 0.921 33.28 0.927 34.40 0.955 39.99 0.984 34.73 0.947 AgenticIR [24] 31.10 0.920 33.31 0.928 34.52 0.956 39.71 0.980 34.66 0.946 HybridAgent [25] 31.56 0.923 33.39 0.926 34.28 0.956 39.72 0.981 34.74 0.947 IAMAgent [26] 31.55 0.922 33.43 0.925 34.55 0.951 39.41 0.979 34.74 0.944 Restore-R1 [27] 31.48 0.920 33.25 0.926 34.27 0.955 40.00 0.983 34.75 0.946 Causal-AgentIR (Ours) 31.89 0.923 33.52 0.929 34.53 0.954 40.08 0.985 35.01 0.948
场景,我们在五个具有代表性的图像恢复任务上进行了实验:图像去雨、图像去雪、图像去雾、图像去模糊和图像去噪。
1) 图像去雨:遵循先前工作 [7] 中的评估协议,我们在 YCbCr 颜色空间的 Y 通道上报告图像去雨的 PSNR 和 SSIM。表 IV 总结了特定任务设置下的定量结果。总体而言,Causal-AgentIR 在所有对比方法中取得了最佳平均性能,PSNR 为 35.01 dB。与最强的现有智能体 Restore-R1 [27] 相比,Causal-AgentIR 带来了 0.26 dB 的提升。与恢复模型相比,恢复智能体通常能取得更好的结果。例如,最强的基线 EfDeRain+ [3] 平均获得 34.46 dB PSNR 和 0.941 SSIM,而现有智能体将平均 PSNR 提升至 34.66–34.75 dB。Causal-AgentIR 进一步将平均 PSNR 提升至 35.01 dB,表明与直接应用单个恢复模型相比,基于智能体的恢复能更好地利用工具协调和感知退化的决策能力。在单个数据集上,Causal-AgentIR 在 Test100、Test1200 和 Rain100L 上取得了最佳 PSNR。在 Rain100H 上,EfDeRain+ 获得了最高 PSNR,而 Causal-AgentIR 仍具有高度竞争力,达到了 34.53 dB。
2) 图像去雪:表 V 报告了在三个基准数据集(包括 CSD、SRRS 和 Snow100K)上进行图像去雪的定量比较。总体而言,Causal-AgentIR 在所有数据集上取得了最佳或次佳性能,显示出在不同雪退化条件下的强大鲁棒性。在 CSD 数据集 [47] 上,StarIR [10] 获得了最高的 PSNR 和 SSIM。Causal-AgentIR 取得了非常接近的结果,排名第二,几乎追平了表现最好的基线。在 SRRS [46] 上,Causal-AgentIR 取得了 32.89 dB 的最佳 PSNR 和 0.98 的最佳 SSIM。与在 PSNR 方面最强的现有结果(由 StarIR 获得的 32.75 dB)相比,Causal-AgentIR 带来了 0.14 dB 的提升。在 Snow100K [45] 上,Causal-AgentIR 也取得了最佳性能。这些结果表明,Causal-AgentIR 在 SRRS 和 Snow100K 上提供了一致的提升,同时在 CSD 上保持了接近最佳的性能。
3) 图像去雾:表 VI 报告了在 SOTS [48] 基准上的定量比较。Causal-AgentIR 在 SOTS-Indoor 和 SOTS-Outdoor 上均取得了最佳性能。在 SOTS-Indoor 上,它获得了 41.88 dB PSNR,比最强的基线 PGH2Net [4] 在 PSNR 上高出 0.18 dB。在 SOTS-Outdoor 上,Causal-AgentIR 达到了 39.22
表 V 特定任务设置下的图像去雪结果。
CSD SRRS Snow100K 方法 PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PEUNet [61] 37.28 0.97 31.89 0.98 34.11 0.96 PW-FNet StarIR [10][60] 38.57- 0.99- 32.75 32.74 0.98 0.98 34.50 34.46 0.96 0.95 MAIR [23] 38.41 0.98 32.70 0.97 33.97 0.96 AgenticIR [24] 38.55 0.98 32.73 0.97 34.17 0.96 HybridAgent [25] 38.29 0.97 32.68 0.96 34.03 0.96 Restore-R1 [27] 38.38 0.98 32.66 0.97 34.50 0.96 IAMAgent [26] 38.49 0.97 32.74 0.98 34.46 0.96 Causal-AgentIR (Ours) 38.56 0.98 32.89 0.98 34.85 0.97
表 VI 特定任务设置下的图像去雾结果。
SOTS-Indoor SOTS-Outdoor 方法 PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ PGH2Net [4] 41.70 0.996 37.52 0.989 MAIR [23] 41.48 0.996 39.03 0.993 AgenticIR [24] 41.25 0.996 39.17 0.994 HybridAgent [25] 41.52 0.996 39.09 0.996 IAMAgent [26] 41.44 0.996 39.17 0.996 Restore-R1 [27] 41.39 0.997 39.11 0.995 Causal-AgentIR (Ours) 41.88 0.997 39.22 0.996
第 8 页
8
图 3. 不同复原方法的定性比较。第四列展示了相应任务特定模型的结果,其余列展示了在全能(all-in-one)设置下获得的结果。
表 VII 任务特定设置下的图像去模糊结果。 表 VIII 任务特定设置下的图像去噪结果。
GoPro HIDE CBSD68 Kodak24 Urban100 方法 PSNR ↑ SSIM ↑ PSNR ↑ SSIM ↑ SFNet方法[8] 34.0915 31.4925 28.0250 34.9315 32.4225 29.2550 34.1915 32.0125 29.0350 StarIR [10] 34.34 0.970 32.12 0.951 FSNet [6] 34.11 31.51 28.01 34.95 32.42 29.27 34.15 32.04 29.15 Perceive-IR [38] 34.38 31.74 28.53 34.84 32.50 29.16 34.86 32.55 29.42 MAIR [23] 34.08 0.965 32.06 0.950 VLU-Net [16] 34.35 31.72 28.46 – – – 34.92 32.71 29.61 AgenticIR [24] 34.18 0.963 32.12 0.949 MAIR [23] 34.02 31.69 28.51 34.91 32.45 29.22 34.87 32.70 29.49 HybridAgent [25] 34.29 0.968 32.04 0.950 HybridAgentAgenticIR [24][25] 34.2534.28 31.7131.66 28.5028.43 34.8934.93 32.4432.50 29.2529.23 34.8334.91 32.6832.68 29.4629.55 IAMAgent [26] 34.31 0.974 32.09 0.952 IAMAgent [26] 34.40 31.74 28.65 34.94 32.41 29.26 34.90 32.66 29.49 Restore-R1 [27] 34.15 0.968 32.11 0.951 Causal-AgentIR(Ours)Restore-R1 [27] 34.1734.37 31.7031.74 28.4428.72 34.8834.99 32.4732.52 29.2129.31 34.9034.98 32.6432.56 29.4729.61 Causal-AgentIR(Ours) 34.73 0.970 32.20 0.952
表 IX dB PSNR,超越了现有的复原智能体如 REAL-WORLD RESULTS. AgenticIR [24] 和 IAMAgent [26]。 方法 PSNR ↑ RealRain-1k-LSSIM ↑ LPIPS ↓ FADE ↓ BRISQUERTTS ↓ NIMA ↑ PSNR ↑SIDDSSIM ↑ 4) 图像去模糊:表 VII 报告了在 GoPro [49] 和 HIDE [50] 数据集上的定量比较。 Causal-AgentIR 在两个基准测试中均取得了最佳的 PSNR。在 GoPro 上,它获得了 34.73 dB 的 PSNR,比最强的竞争方法 StarIR [10] 高出 0.39 dB。在 HIDE 上,Causal-AgentIR 实现了 32.20 dB 的 PSNR,超过了 StarIR [10] 和 Agenti-cIR [24] 取得的 32.12 dB 的第二高 PSNR。 5) 图像去噪:表 VIII 报告了在 CBSD68、Kodak24 和 Urban100 上,高斯噪声水平 σ = 15, 25, 50 下的定量去噪结果。总体而言,Causal-AgentIR 在大多数设置中实现了具有竞争力或最佳的性能,证明了其在不同噪声水平下稳定的去噪能力。在 CBSD68 上,Causal-AgentIR 在 σ = 50 时取得了最佳结果,为 28.72 dB,并在 σ = 25 时以 31.74 dB 的成绩并列最佳。在 σ = 15 时,它达到了 34.37 dB,接近 IAMAgent [26] 的最佳结果。在 Kodak24 上,Causal-AgentIR 在所有三个噪声水平下均取得了最佳 PSNR,分别达到 34.99 dB、32.52 dB 和 29.31 dB。在 Urban100 上,该数据集包含丰富的重复结构和高频细节,
第 9 页
9
Causal-AgentIR 在 $\sigma = 15$ 和 $\sigma = 50$ 时获得最佳 PSNR。定量结果见表 X,定性比较如图 4 所示。总体而言,在大多数退化设置下,恢复智能体明显优于恢复模型。
D. 定性比较
图 3 展示了不同退化场景下的定性比较。第四列显示了相应任务特定模型产生的恢复结果,而其他对比方法均在 all-in-one(全合一)设置下进行评估。与现有的 all-in-one 恢复模型和恢复智能体相比,Causal-AgentIR 产生了视觉上更干净的结果,并恢复了更细微的图像细节。具体而言,现有的 all-in-one 方法在一定程度上可以去除主导性退化,但往往存在残留伪影、纹理过度平滑或局部退化区域恢复不完整的问题。虽然任务特定模型在其对应的退化类型上表现强劲,但当输入包含其他退化时,其适用性受到限制。相比之下,Causal-AgentIR 自适应地分析退化条件,检索相关的因果记忆,并通过多智能体协作选择适当的恢复操作。因此,它在更好地保留结构边缘、局部纹理和自然图像外观的同时,更有效地抑制了退化伪影。这些定性结果与定量比较一致,并进一步证明 Causal-AgentIR 不仅提高了数值恢复精度,还提高了不同恢复场景下的感知视觉质量。
基于模型的方法,如 FDTANet [31]、Ref-IRT [72]、Perceive-IR [38] 和 DSwinIR [71],直接学习不同退化组合的统一映射。尽管它们在几个单一或相对简单的退化案例中取得了具有竞争力的结果,但在多种退化共存时,其性能变得不太稳定。相比之下,基于智能体的方法在大多数混合退化设置中始终获得更高的 PSNR 和 SSIM,显示出退化感知工具协调和自适应恢复规划的优势。在现有的智能体中,MAIR [23]、AgenticIR [24]、HybridAgent [25]、IAMAgent [26] 和 Restore-R1 [27] 均比恢复模型有了显著改进。Causal-AgentIR 进一步实现了最佳 PSNR。Causal-AgentIR 的优势在复合退化场景中尤为明显。对于 H+R+N,它将最佳恢复模型结果的 30.22 dB 提高到 31.66 dB,增益为 1.44 dB。这些增益表明,静态恢复模型难以处理相互作用的退化,而智能体方法可以根据退化组成更好地调整恢复策略。
图 4 进一步展示了混合退化下的定性比较。恢复模型往往无法同时抑制雾、雨和噪声,导致残留伪影、过度平滑或颜色失真。现有的智能体通过基于工具的恢复缓解了这些问题。Causal-AgentIR 产生了更干净的结果,具有更锐利的结构和更自然的颜色恢复,这得益于因果记忆引导的规划。
E. 泛化能力
1) 真实场景中的零样本泛化:我们进一步评估了不同方法在统一 R+S+H+B+N 设置下在真实世界基准(包括 RealRain-1k-L [68]、RTTS [69] 和 SIDD [70])上的零样本泛化能力。表 IX 总结了定量结果。在 RealRain-1k-L 上,Causal-AgentIR 在所有三项指标上均实现了最佳性能。与最强的竞争方法 HybridAgent [25] 相比,Causal-AgentIR 将 PSNR 提高了 0.13 dB。它还将 MAIR [23] 实现的 LPIPS 从 0.335 降低到 0.332,表明在真实世界雨退化下的感知恢复质量更好。在 RTTS 上,Causal-AgentIR 也获得了最佳结果,实现了最低的 FADE 分数 1.145,最低的 BRISQUE 分数 23.178,以及最高的 NIMA 分数 4.892。这些结果表明,Causal-AgentIR 在保持更自然的图像统计量和感知质量的同时,提高了去雾效果。在 SIDD 上,Causal-AgentIR 也实现了最佳性能。总体而言,Causal-AgentIR 在真实世界雨、雾和噪声基准上实现了最佳或极具竞争力的性能,证明了对未见过的真实世界退化具有强大的零样本泛化能力。这种改进可归因于退化感知工具协调和因果记忆引导的规划,这使得智能体能够根据复杂的真实世界退化条件调整恢复决策。
F. 智能体效率与偏好对齐
除了恢复精度外,有效的恢复智能体还应做出可靠的决策,减少不必要的修正,并更好地与用户偏好对齐。因此,我们使用三项额外指标评估不同的智能体方法:回滚率(Rollback Rate, RR)、恢复成功率(SR)和偏好对齐率(Preference Alignment Rate, PAR)。
回滚率。我们报告回滚率(RR),其中较低的值表示较少无效或有害的恢复操作:
$$ RR = \frac{N_{rollback}}{N_{execution}}, \quad (32) $$
其中 $N_{rollback}$ 是智能体明确撤销的恢复操作数量,$N_{execution}$ 是执行的操作总数。
恢复成功率。我们进一步报告恢复成功率(SR),用于衡量恢复后的输出是否在未引入严重伪影的情况下改进了输入:
$$ SR = \frac{1}{N} \sum_{i=1}^{N} \mathbb{I} [ Q(I_{out}^i) > Q(I_{in}^i) \land A(I_{out}^i) = 0 ], \quad (33) $$
其中 $Q(\cdot)$ 表示复合恢复质量分数,$A(\cdot)$ 是严重伪影检测器,$\mathbb{I}[\cdot]$ 是指示函数。
2) 混合退化的泛化:为了进一步评估不同方法在复杂真实世界条件下的鲁棒性,我们在混合退化场景下进行了实验,其中雾、雨和噪声单独或组合出现。定量结果
第 10 页
10
表 X 不同模型在各种退化类型组合上的定量结果。
方法 H + R + N H + R H + N R + N H R N Perceive-IR [38] 30.22/0.894 31.55/0.945 28.32/0.871 30.52/0.849 31.90/0.980 38.95/0.983 31.88/0.923 DSwinIR [71] 30.09/0.899 31.07/0.960 28.45/0.873 31.29/0.915 31.77/0.973 39.09/0.982 32.22/0.923 MAIR [23] 31.25/0.912 31.56/0.973 31.33/0.907 32.07/0.919 39.43/0.993 40.17/0.992 32.76/0.935 AgenticIR [24] 31.31/0.912 31.62/0.971 31.44/0.910 32.15/0.921 39.43/0.991 40.06/0.991 32.83/0.937 HybridAgent [25] 31.22/0.912 31.88/0.976 31.52/0.911 32.31/0.922 39.39/0.993 39.99/0.990 32.54/0.933 IAMAgent [26] 31.52/0.926 31.70/0.975 31.09/0.905 31.98/0.920 39.21/0.990 40.11/0.992 32.58/0.933 Restore-R1 [27] 31.20/0.910 31.73/0.976 31.27/0.910 32.22/0.918 39.08/0.991 39.96/0.989 32.81/0.929 Causal-AgentIR(Ours) 31.66/0.927 32.03/0.976 31.80/0.912 32.49/0.920 39.55/0.991 40.22/0.993 33.01/0.942
图 4. 各种退化组合下的多退化图像恢复结果。
偏好对齐。对于偏好条件恢复,参与者比较在“保留自然细节”、“偏好更强的伪影去除”和“避免过度增强”等指令下生成的匿名输出。偏好对齐率定义为:
PAR = Nagree / Ntotal, (34)
其中 Nagree 是系统输出与参与者偏好一致的比较次数。每次比较由至少 50 名独立参与者进行评估。
表 XI 将 Causal-AgentIR 与现有的恢复代理进行了比较。Causal-AgentIR 实现了最低的 RR 以及最高的 SR 和 PAR。降低的 RR 表明,所提出的因果记忆有助于规划器在执行前避免不可靠的恢复操作,从而减少反思和回滚。提高的 SR 表明 Causal-AgentIR 更一致地产生成功的恢复结果。此外,更高的 PAR 表明自我进化记忆和人类反馈使代理能够更好地将恢复行为与用户偏好对齐。
表 XI 代理效率与偏好对齐的比较。
方法 RR ↓ SR ↑ PAR ↑ AgenticIR [24] 0.32 0.84 0.88 MAIR [23] 0.36 0.90 0.80 HybridAgent [25] 0.38 0.88 0.82 IAMAgent [26] 0.32 0.90 0.86 Restore-R1 [27] 0.28 0.88 0.86 Causal-AgentIR 0.12 0.92 0.90
G. 消融实验 我们进行消融实验以评估多代理协作和自我进化因果记忆的贡献。如表 XII 所示,没有这两个组件的基线实现了 34.82 dB PSNR,回滚率 (RR) 为 0.38,成功率 (SR) 为 0.82,以及偏好对齐
第 11 页
11
表 XII Causal-AgentIR 各个组件的消融研究。
方法 多智能体 自演化因果记忆 RR ↓ SR ↑ PAR ↑ PSNR ↑ (a) 0.38 0.82 0.76 34.82 (b) ✔ 0.36 0.88 0.82 35.08 (c) ✔ 0.22 0.86 0.86 35.22 (d) ✔ ✔ 0.12 0.92 0.90 35.55
图 6. 遵循 IAMAgent [26] 设置的用户研究结果。(a) Causal-AgentIR 与 ChatGPT 4o 及一种全栈式复原方法进行比较。(b) 和 (c) 代表性复原智能体与其增强记忆变体进行比较。
在第一种情况下,输入图像包含更复杂的真实世界退化,包括雨线、雾气和轻微噪声。退化智能体首先识别退化组成,并观察到能见度较低,尤其是在远处的道路区域。随后,记忆智能体检索因果证据,表明在去雾之前进行弱去噪可以提高能见度,且去雨在去雾后更有效,因为雨线变得更加明显。基于此证据,规划智能体选择一个三步轨迹:弱去噪、去雾和区域去雨。工具智能体通过选择 FSNet [6] 进行去噪,PGH2Net [4] 进行去雾,以及 EfDeRain+ [3] 进行区域去雨来实例化该计划。执行后,批评智能体确认可见度和结构得到改善,且残留雨水减少。由于进一步复原的预期效用较低,过程终止。
引入多智能体机制将 PSNR 提升至 35.08 dB,增益为 0.26 dB。它还将 SR 从 0.82 提升至 0.88,将 PAR 从 0.76 提升至 0.82,表明协作退化分析、规划、工具执行和批评提高了复原可靠性和用户偏好对齐。当仅使用自演化因果记忆时,PSNR 进一步增加至 35.22 dB,增益为 0.40 dB。同时,RR 从 0.38 降至 0.22,PAR 提升至 0.86,表明结构化记忆检索和因果推理有助于避免无效操作并指导更可靠的复原规划。通过联合结合多智能体协作和自演化因果记忆,Causal-AgentIR 实现了最佳整体性能,PSNR 为 35.55 dB,RR 为 0.12,SR 为 0.92,PAR 为 0.90。与基线相比,它使 PSNR 提高了 0.73 dB,RR 降低了 0.26,SR 和 PAR 分别提高了 0.10 和 0.14。这些结果表明,这两个组件是互补的,多智能体协作改进了任务分解和执行,而因果记忆提供了可重用的知识以实现更稳定且符合偏好的规划。
记忆智能体进一步强化了去噪与后续去雾之间的关系,并添加了一个新的因果关系,表明在 H+R+N 条件下,去雾后的区域去雨是有效的。
第二种情况展示了人类反馈的细化。用户首先要求 Causal-AgentIR 复原一张雨雾图像,同时保持自然外观。初始复原后,用户观察到场景变得更清晰,但天空过度增强。Causal-AgentIR 随后减弱去雾强度并调整对比度,以产生更自然的结果。当用户进一步要求提高远处车辆的能见度时,Causal-AgentIR 选择性地增强特定区域,同时保持整体外观。在用户确认结果令人满意后,最终输出被保存,用户偏好被记录以供未来复原使用。此案例表明,Causal-AgentIR 可以在交互过程中融入人类反馈,并将复原行为与用户特定偏好对齐。
I. 用户研究
遵循 IAMAgent [26] 的实验设置,我们进行了一项小规模用户研究,以评估 Causal-AgentIR 的交互复原能力。具体而言,邀请了来自不同背景的 50 名参与者,使用与 IAMAgent 相同的四个维度来评估所比较的系统,包括适应性、可定制性、满意度和易用性。评估遵循与 IAMAgent 相同的协议。满意度基于复原结果以盲测方式评估,而适应性、可定制性和易用性则通过非盲交互进行评估。
第 12 页
12
因为这些维度依赖于用户与系统响应及可控性的直接经验 [7] H. Gao, Y. Zhang, J. Yang, and D. Dang, “Mixed hierarchy network for with system responses and controllability. image restoration,” Pattern Recognition, vol. 161, p. 111313, 2025. [8] Y. Cui, Y. Tao, Z. Bing, W. Ren, X. Gao, X. Cao, K. Huang, and 图 6 报告了用户偏好结果。如图 A. Knoll, “Selective frequency network for image restoration,” in ICLR, Figure 6(a), Causal-AgentIR is preferred over ChatGPT 4o and 2023. the all-in-one method across all four dimensions. It achieves [9] Y. Gu, Y. Meng, J. Ji, and X. Sun, “Acl: Activating capability of linear attention for image restoration,” in Proceedings of the Computer Vision the highest preference ratios in adaptability, customizability, and Pattern Recognition Conference, 2025, pp. 17 913–17 923. satisfaction, and user-friendliness, indicating that users con- [10] Y. Cui, S. W. Zamir, M.-H. Yang, A. Knoll, F. S. Khan, and S. Khan, sider Causal-AgentIR more capable of adapting to different “Starir: Convolutional image restoration with spatial-frequency fusion,” IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. degradation conditions, following user instructions, and pro- 1–18, 2026. ducing satisfactory restoration results. We further evaluate the [11] H. Guo, Y. Guo, Y. Zha, Y. Zhang, W. Li, T. Dai, S.-T. Xia, and Y. Li, effect of memory by comparing several representative restora- “Mambairv2: Attentive state space restoration,” in Proceedings of the Computer Vision and Pattern Recognition Conference, 2025, pp. 28 124– tion agents with their memory-enhanced variants. As shown in 28 133. Figure 6(b) and (c), introducing memory consistently improves [12] V. Potlapalli, S. W. Zamir, S. Khan, and F. S. Khan, “Promptir: user preference for AgenticIR and MAIR. The improvement is Prompting for all-in-one blind image restoration,” Advances in Neural Information Processing Systems (NeurIPS), 2023. especially clear in adaptability and satisfaction, suggesting that [13] H. Gao, J. Yang, Y. Zhang, N. Wang, J. Yang, and D. Dang, “Prompt- memory helps restoration agents make more reliable decisions based ingredient-oriented all-in-one image restoration,” IEEE Transac- under diverse image conditions. Compared with static or tions on Circuits and Systems for Video Technology, vol. 34, no. 10, pp. purely interaction-driven agents, memory-enhanced agents can [14] X. Tang, X. He, J. Xu, X. Gu, and J. Sun, “Learning continuous wasser- better reuse previous restoration experience and provide more stein barycenter space for generalized all-in-one image restoration,” stable responses to user requirements. IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. 1–16, 2026. [15] Y. Jiang, Z. Zhang, T. Xue, and J. Gu, “Autodir: Automatic all-in-one V. CONCLUSION image restoration with latent diffusion,” in Computer Vision – ECCV 2024: 18th European Conference, Milan, Italy, September 29–October In this paper, we proposed Causal-AgentIR, a hierarchi- 4, 2024, Proceedings, Part XL, 2024, p. 340–359. cal multi-agent framework with self-evolving causal memory [16] H. Zeng, X. Wang, Y. Chen, J. Su, and J. Liu, “Vision-language gradient descent-driven all-in-one deep unfolding networks,” in Proceedings of for image restoration. Unlike existing restoration agents that the IEEE/CVF Conference on Computer Vision and Pattern Recognition mainly rely on static tool descriptions, predefined priors, or (CVPR), June 2025, pp. 7524–7533. trajectory-level reflection, Causal-AgentIR organizes restora- [17] T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell et al., “Language mod- tion experience as a structured causal memory graph con- els are few-shot learners,” Advances in neural information processing necting degradations, regions, tools, actions, quality changes, systems, vol. 33, pp. 1877–1901, 2020. costs, and user preferences. This design enables graph-based [18] B. Roziere, J. Gehring, F. Gloeckle, S. Sootla, I. Gat, X. E. Tan, Y. Adi, J. Liu, R. Sauvestre, T. Remez et al., “Code llama: Open foundation retrieval, multi-hop causal reasoning, and memory-guided models for code,” arXiv preprint arXiv:2308.12950, 2023. planning, allowing the agent to infer effective restoration [19] H. Touvron, L. Martin, K. Stone, P. Albert, A. Almahairi, Y. Babaei, N. Bashlykov, S. Batra, P. Bhargava, S. Bhosale et al., “Llamaoperations and execution orders under different degradation 2: Open foundation and fine-tuned chat models,” arXiv preprint conditions. A learnable memory evolution mechanism was arXiv:2307.09288, 2023. further introduced to add, update, merge, reinforce, ignore, [20] J. Xie, Z. Chen, R. Zhang, and G. Li, “Large multimodal agents: a survey,” Visual Intelligence, vol. 3, no. 1, p. 24, 2025.or discard experience according to observed outcomes and [21] J. Yang, R. Tan, Q. Wu, R. Zheng, B. Peng, Y. Liang, Y. Gu, M. Cai, feedback. Extensive experiments demonstrate the effectiveness S. Ye, J. Jang et al., “Magma: A foundation model for multimodal ai and generality of Causal-AgentIR. agents,” in Proceedings of the computer vision and pattern recognition conference, 2025, pp. 14 203–14 214. [22] H. Chen, W. Li, J. Gu, J. Ren, S. Chen, T. Ye, R. Pei, K. Zhou, REFERENCES F. Song, and L. Zhu, “Restoreagent: autonomous image restoration agent via multimodal large language models,” in Proceedings of the 38th [1] Q. Ma, J. Jiang, X. Zhou, P. Liang, X. Liu, and J. Ma, “Pixel2pixel: International Conference on Neural Information Processing Systems, A pixelwise approach for zero-shot single image denoising,” IEEE 2024. Transactions on Pattern Analysis and Machine Intelligence, vol. 47, [23] X. Jiang, G. Li, B. Chen, and J. Zhang, “Multi-agent image restoration,” no. 6, pp. 4614–4629, 2025. International Journal of Computer Vision, vol. 134, no. 5, p. 205, 2026. [2] H. Gao, B. Ma, Y. Zhang, J. Yang, J. Yang, and D. Dang, “Learning [24] K. Zhu, J. Gu, Z. You, Y. Qiao, and C. Dong, “An intelligent agen- enriched features via selective state spaces model for efficient image tic system for complex image restoration problems,” in International deblurring,” in Proceedings of the 32nd ACM International Conference Conference on Learning Representations, vol. 2025, 2025, pp. 57 985– on Multimedia, 2024, pp. 710–718. 58 013. [3] Q. Guo, H. Qi, J. Sun, F. Juefei-Xu, L. Ma, D. Lin, W. Feng, [25] B. Li, X. Li, Y. Lu, and Z. Chen, “Hybrid agents for image restoration,” and S. Wang, “Efficientderain+: Learning uncertainty-aware filtering in Proceedings of the IEEE/CVF Conference on Computer Vision and via rainmix augmentation for high-efficiency deraining,” International Pattern Recognition, 2026, pp. 22 636–22 647. Journal of Computer Vision, vol. 133, no. 4, pp. 2111–2135, 2025. [26] Y. Wei, Y. Zhang, H. Zheng, J. Ren, X. Xu, Z. Shi, Z. Zhang, and [4] X. Su, S. Li, Y. Cui, M. Cao, Y. Zhang, Z. Chen, Z. Wu, Z. Wang, M. Wang, “Iamagent: Towards an interactive and adaptive multi-agent Y. Zhang, and X. Yuan, “Prior-guided hierarchical harmonization net- system for image restoration,” IEEE Transactions on Image Processing, work for efficient image dehazing,” in Proceedings of the AAAI Confer- 2026. ence on Artificial Intelligence, vol. 39, no. 7, 2025, pp. 7042–7050. [27] J. Lu, Y. Wu, Z. Zhao, H. Wang, F. Jimenez, A. Majeedi, and Y. Fu, [5] H. Gao, J. Yang, Y. Zhang, J. Yang, B. Ma, and D. Dang, “Learn- “Restore-r1: Efficient image restoration agents via reinforcement learn- ing optimal combination patterns for lightweight stereo image super- ing with multimodal llm perceptual feedback,” in Proceedings of the resolution,” in Proceedings of the 32nd ACM International Conference IEEE/CVF Conference on Computer Vision and Pattern Recognition, on Multimedia, 2024, pp. 5566–5574. 2026, pp. 8629–8639.
[6] Y. Cui, W. Ren, X. Cao, 和 A. Knoll,“基于频率选择的图像恢复”,TPAMI,第 1–16 页,2023 年。 [28] K. He, J. Sun, 和 X. Tang,“基于暗通道先验的单幅图像去雾”,TPAMI,2011 年。
第 13 页
13
[29] J. Rong, H. Huang 和 J. Li,“非均匀相机抖动去模糊中的惯性测量单元辅助精确模糊核估计”,《IEEE 图像处理汇刊》,第 33 卷,第 3823–3838 页,2024 年。 [30] H. Feng, L. Wang, Y. Huang, Y. Wang, L. Zhu 和 H. Huang,“从暗帧中学习物理信息噪声模型用于低光原始图像去噪”,《IEEE 模式分析与机器智能汇刊》,第 48 卷,第 4 期,第 3952–3969 页,2026 年。 [31] H. Gao, B. Ma, Y. Zhang, J. Yang, J. Yang 和 D. Dang,“用于恢复具有复合退化图像的频率域任务自适应网络”,《模式识别》,第 158 卷,第 111057 页,2025 年。 [32] H. Liu, C. Liu, J. Xu, P. Jiang 和 M. Lu,“Xyscannet:一种用于感知图像去模糊的可解释状态空间模型”,《计算机视觉与模式识别会议论文集 (CVPR)》,2025 年,第 779–789 页。 [33] Y. Wen, T. Gao 和 T. Chen,“具有能量感知扩散模型的无配对照片级真实图像去雨”,《第 32 届 ACM 国际多媒体会议论文集》,2024 年,第 360–369 页。 [34] H. Zeng, J. Cao, K. Zhang, Y. Chen, H. Luong 和 W. Philips,“用于自监督高光谱图像去噪的混合扩散模型”,《2024 年 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)》,2024 年,第 27 820–27 830 页。 [35] M. Yao, R. Xu, Y. Guan, J. Huang 和 Z. Xiong,“用于全合一图像恢复的神经退化表示学习”,《IEEE 图像处理汇刊》,第 33 卷,第 5408–5423 页,2024 年。 [36] W. Luo, H. Qin, Z. Chen, L. Wang, D. Zheng, Y. Li, Y. Liu, B. Li 和 W. Hu,“视觉指导的退化扩散用于全合一图像恢复”,《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》,2025 年 6 月,第 12 764–12 777 页。 [37] Y. Cui, S. W. Zamir, S. Khan, A. Knoll, M. Shah 和 F. S. Khan,“AdaIR:通过频率挖掘和调制进行自适应全合一图像恢复”,《第十三届表示学习国际会议》,2025 年。 [38] X. Zhang, J. Ma, G. Wang, Q. Zhang, H. Zhang 和 L. Zhang,“Perceive-ir:学习更好地感知退化以实现全合一图像恢复”,《IEEE 图像处理汇刊》,第 1–1 页,2025 年。 [39] J. Li, D. Li, S. Savarese 和 S. Hoi,“Blip-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练”,《国际机器学习会议论文集》,2023 年,第 19 730–19 742 页。 [40] H. Liu, C. Li, Q. Wu 和 Y. J. Lee,“视觉指令微调”,《神经信息处理系统进展》,第 36 卷,第 34 892–34 916 页,2023 年。 [41] A. Singh, A. Fry, A. Perelman, A. Tart, A. Ganesh, A. El-Kishky, A. McLaughlin, A. Low, A. Ostrow, A. Ananthram 等人,“OpenAI GPT-5 系统卡片”,arXiv 预印本 arXiv:2601.03267,2025 年。 [42] W. Yang, R. T. Tan, J. Feng, J. Liu, Z. Guo 和 S. Yan,“从单张图像中进行深度联合雨检测与去除”,CVPR,第 1685–1694 页,2016 年。 [43] H. Zhang, V. A. Sindagi 和 V. M. Patel,“使用条件生成对抗网络进行图像去雨”,TCSVT,第 30 卷,第 3943–3956 页,2017 年。 [44] H. Zhang 和 V. M. Patel,“使用多流密集网络进行密度感知的单图像去雨”,CVPR,第 695–704 页,2018 年。 [45] Y.-F. Liu, D.-W. Jaw, S.-C. Huang 和 J.-N. Hwang,“Desnownet:用于除雪的上下文感知深度网络”,《IEEE 图像处理汇刊》,第 27 卷,第 6 期,第 3064–3073 页,2018 年。 [46] W.-T. Chen, H.-Y. Fang, J.-J. Ding, C.-C. Tsai 和 S.-Y. Kuo,“Jstasr:基于修改的部分卷积和眩光效应去除的联合尺寸和透明度感知除雪算法”,《计算机视觉–ECCV 2020:第 16 届欧洲会议,英国格拉斯哥,2020 年 8 月 23–28 日,论文集,第 21 部分》,Springer,2020 年,第 754–770 页。 [47] W.-T. Chen, H.-Y. Fang, C.-L. Hsieh, C.-C. Tsai, I. Chen, J.-J. Ding, S.-Y. Kuo 等人,“All snow removed:单图像除雪算法”, [48] J. Rong, H. Huang 和 J. Li,“非均匀相机抖动去模糊中的惯性测量单元辅助精确模糊核估计算法及生态统计测量”,《第八届 IEEE 国际计算机视觉会议论文集。ICCV 2001》,第 2 卷,第 2 卷,2001 年,第 416–423 页。 [52] J.-B. Huang, A. Singh 和 N. Ahuja,“来自变换自示例的单图像超分辨率”,《2015 年 IEEE 计算机视觉与模式识别会议 (CVPR)》,2015 年,第 5197–5206 页。 [53] R. Franzen,“Kodak 无损真彩色图像套件”,来源:http://r0k.us/graphics/kodak,第 4 卷,第 2 号,第 9 页,1999 年。 [54] R. Zhang, P. Isola, A. A. Efros, E. Shechtman 和 O. Wang,“深度特征作为感知度量的不合理有效性”,《IEEE 计算机视觉与模式识别会议论文集》,2018 年,第 586–595 页。 [55] A. Mittal, A. K. Moorthy 和 A. C. Bovik,“盲/无参考图像空间质量评估器”,《第四十五届信号、系统和计算机阿斯洛马尔会议记录 (ASILOMAR)》,IEEE,2011 年,第 723–727 页。 [56] L. K. Choi, J. You 和 A. C. Bovik,“感知雾密度的无参考预测及感知图像去雾”,《IEEE 图像处理汇刊》,第 24 卷,第 11 期,第 3888–3901 页,2015 年。 [57] H. Talebi 和 P. Milanfar,“Nima:神经图像评估”,《IEEE 图像处理汇刊》,第 27 卷,第 8 期,第 3998–4011 页,2018 年。 [58] C. Wang, J. Pan, L. Wang 和 W. Wang,“用于有效图像恢复的块内和块间解析器提示变压器”,《AAAI 人工智能会议论文集》,第 39 卷,第 7 期,2025 年,第 7609–7618 页。 [59] S. Chen, T. Ye, Y. Liu, T. Liao, J. Jiang, E. Chen 和 P. Chen,“Msp-former:用于单图像去雪的尺度投影变压器”,《ICASSP 2023 – 2023 年 IEEE 声学、语音和信号处理国际会议 (ICASSP)》,2023 年,第 1–5 页。 [60] X. Jiang, N. Gao, H. Dou, X. Zhang, X. Zhong, Y. Deng 和 H. Li,“全局建模至关重要:一种快速、轻量且有效的图像恢复基线”,《IEEE 图像处理汇刊》,第 35 卷,第 2740–2754 页,2026 年。 [61] X. Guo, X. Wang, X. Fu 和 Z.-J. Zha,“具有雪形状先验的深度展开网络用于图像去雪”,《IEEE 电路与系统视频技术汇刊》,第 35 卷,第 5 期,第 4740–4752 页,2025 年。 [62] Z. Chen, Z. He 和 Z.-M. Lu,“Dea-net:基于细节增强卷积和内容引导注意力的单图像去雾”,《IEEE 图像处理汇刊》,2024 年。 [63] H. Gao, B. Ma, Y. Zhang, J. Yang, J. Yang, X. Wang 和 D. Dang,“强调关键特征以实现高效图像恢复”,《模式识别》,第 113575 页,2026 年。 [64] Y. Li, H. An, T. Zhang, X. Chen, B. Jiang 和 J. Pan,“Omni-deblurring:捕捉全范围上下文用于图像去模糊”,《IEEE 电路与系统视频技术汇刊》,第 1–1 页,2025 年。 [65] D. Chen, S. Zhou, J. Pan, J. Shi, L. Qu 和 J. Yang,“一种用于通过运动矢量分解进行图像去模糊的偏振辅助变压器”,《计算机视觉与模式识别会议论文集 (CVPR)》,2025 年 6 月,第 28 061–28 070 页。 [66] S. W. Zamir, A. Arora, S. Khan, M. Hayat, F. S. Khan 和 M.-H. Yang,“Restormer:用于高分辨率图像恢复的高效变压器”,CVPR,2022 年。 [67] J. Mao, Y. Yang, X. Yin, L. Shao 和 H. Tang,“全合一变压器用于恶劣天气退化下的图像恢复”,《IEEE 模式分析与机器智能汇刊》,第 48 卷,第 6 期,第 6628–6641 页,2026 年。 [68] W. Li, Q. Zhang, J. Zhang, Z. Huang, X. Tian 和 D. Tao,“迈向真实世界单图像去雨:新基准及超越”,arXiv 预印本 arXiv:2206.05514,2022 年。 [69] B. Li, W. Ren, D. Fu, D. Tao, D. Feng, W. Zeng 和 Z. Wang,“单图像去雾及超越的基准测试”,《IEEE 图像处理汇刊》,第 28 卷,第 1 期,第 492–505 页,2018 年。 [70] A. Abdelhamed, S. Lin 和 M. S. Brown,“高质量去噪
算法,使用分层双树复小波表示和智能手机相机数据集,”在 IEEE 会议论文集 矛盾通道丢失,”在 IEEE/CVF 国际计算机视觉会议上,2021 年,第 4196–4205 页。[71] G. Wu, J. Jiang, K. Jiang, X. Liu 和 L. Nie,“Dswinir:重新思考 [48] B. Li, W. Ren, D. Fu, D. Tao, D. Feng, W. Zeng 和 Z. Wang, “单图像去雾及 beyond 的基准测试,”TIP,第 28 卷,第 1 期,模式识别与机器智能汇刊,第 48 卷,第 4 期,第 4350– 第 492–505 页,2018 年。4366 页,2026 年。 [49] S. Nah, T. H. Kim 和 K. M. Lee,“用于动态场景去模糊的深度多尺度卷积 [72] Y. Zhang, Q. Yang, D. M. Chandler 和 X. Mou,“基于参考的 神经网络,”CVPR,第 257–265 页,多阶段渐进式恢复用于多退化图像,”IEEE 2016 年。图像处理汇刊,第 33 卷,第 4982–4997 页,2024 年。 [50] Z. Shen, W. Wang, X. Lu, J. Shen, H. Ling, T. Xu 和 L. Shao,“人类 感知运动去模糊,”2019 IEEE/CVF 国际计算机视觉会议 计算机视觉 (ICCV),第 5571–5580 页,2019 年。 [51] D. Martin, C. Fowlkes, D. Tal 和 J. Malik,“人类 分割自然图像数据库及其在评估分割中的应用