文档MLLM的关系型隐私泄露:当视觉证据消失,模型靠记忆联合泄密

快速导读:本文揭示文档MLLM在视觉证据缺失时会依赖记忆的字段关联联合泄露多个敏感字段,并提出动态关系解耦遗忘框架DRUF及基准DocPrivacyBench来缓解该风险。

文档多模态大模型(Document MLLM)在护照、身份证等结构化文档的关键信息抽取(KIE)任务中表现优异,但这类文档的敏感字段天然高度相关:姓名、证件号、出生日期等字段共同标识同一个体。本文揭示了一个此前被忽视的风险:当输入图像缺乏有效视觉证据时,模型会转而依赖训练中记忆的字段关联,联合生成同一身份的多项敏感信息,作者称之为关系型隐私泄露(Relational Privacy Leakage)。

与以往只关注单字段泄露的工作不同,本文的核心论点是:真正的危险不在于模型泄露某一个字段,而在于它能在没有视觉依据的情况下,凭借参数记忆中的关联结构,一次性还原出一个人的多项敏感信息。为此,作者提出动态关系解耦遗忘框架DRUF,并构建了专用评估基准DocPrivacyBench。

英文题目:Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.12911

原始论文:PDF / 论文页面

这篇论文解决什么问题?

文档MLLM的KIE能力建立在海量真实文档的训练之上,这意味着模型参数中不可避免地编码了大量身份信息及其关联。当输入图像清晰完整时,模型可以基于视觉证据进行预测,泄露风险相对可控;但当图像被噪声破坏、关键区域缺失、或输入完全空白时,模型的行为会发生根本转变——它不再依赖视觉,而是转向参数记忆。

作者通过实验证实了这一直觉:在IDNet数据集上,即使输入是无关的Other Photos或训练相似的人脸图像,模型仍能以较高准确率输出训练集中的敏感字段。更关键的是,泄露不是孤立的单字段行为,而是成对出现的联合泄露——模型同时输出姓名和证件号,且两者属于同一训练身份。

现有遗忘方法(如GA、SCRUB、DPO等)大多针对样本级或字段级遗忘,没有考虑字段对之间的关联结构。SCRUB虽然通过师生框架保留了部分KIE能力,但其遗忘目标仍然是单个字段或样本,无法有效切断字段之间的关联记忆。这正是本文要填补的研究空白。

核心创新

  • 首次识别文档MLLM在弱视觉证据下依赖记忆字段关联联合泄露相关敏感字段的关系型隐私风险
  • 提出DRUF框架,包含动态遗忘集更新机制和RDU关系解耦遗忘目标,直接惩罚敏感字段对的联合生成
  • 提出DocPrivacyBench基准,在Image-Driven和Prompt-Driven两种设置下系统评估关系型隐私泄露
  • RDU以字段对为遗忘单元,通过KL耦合乘积目标实现关系级遗忘,避免样本级或字段级遗忘的不足

方法概览

DRUF包含Retain分支和Forget分支。Retain分支用正常样本和冻结教师模型通过师生对齐保留KIE能力;Forget分支用无有效视觉证据的探针样本探测当前模型泄露的敏感字段对,动态更新遗忘集,并通过RDU目标在空白图像输入上抑制字段对的联合生成。总损失为L=Lretain+λLforget,其中Lforget=-KaKb,Ka、Kb为两个敏感span的KL散度偏移。

  • DRUF框架包含两个并行分支:Retain分支和Forget分支。Retain分支使用正常文档样本,通过冻结教师模型与学生模型之间的师生对齐,保留原有的KIE能力,防止遗忘过程损害正常任务效用。
  • Forget分支的核心是动态遗忘集机制:每轮训练前,用无有效视觉证据的探针样本探测当前模型的泄露行为,识别出模型仍然会联合生成的敏感字段对,将其加入遗忘集。这种动态更新确保遗忘目标始终对准模型当前的泄露弱点,而非静态预设。
  • 关系解耦遗忘目标RDU是DRUF的关键创新。对于遗忘集中的每个敏感字段对,RDU在空白图像输入上计算两个敏感span的KL散度偏移,并将其乘积作为对级遗忘信号。总损失为L=Lretain+λLforget,其中Lforget=-KaKb,Ka和Kb分别是两个敏感字段的KL偏移。
  • 这种KL耦合乘积的设计意味着:只有当两个字段同时被模型生成时,遗忘信号才会强烈激活;如果模型只泄露其中一个字段,惩罚会显著减弱。这实现了关系级的精确遗忘,避免了样本级遗忘的过度损害和字段级遗忘的关联残留。
  • DocPrivacyBench基准包含两种评估设置:Image-Driven设置使用文档相关图像(包括正常图像、噪声图像、无关照片和人脸图像)作为输入;Prompt-Driven设置使用空白图像配合精心设计的文本查询,包括NIQP(无隐私线索的自然疑问式查询)、SIEP(提供部分敏感字段的结构化指令)和ECAP(实体条件关联查询)。
  • 泄露判定采用token级相似度和top-2-of-3字段匹配,在多个相似度阈值(0.8/0.9/1.0)下评估模型是否复现了训练集中的身份信息。这种多阈值设计避免了单一阈值带来的判定偏差。

逐图理解论文

一个具体的失败案例

一个具体的失败案例
Table 3: Leakage evaluation on Other Photos and Face inputs. Privacy leakage persists under both irrelevant and training- similar visual conditions.

想象一下:你给模型看一张完全无关的照片,或者干脆一张空白图,然后问它某个人的姓名。它不仅能答出姓名,还能顺带吐出这个人的证件号、出生日期——而且这些字段在训练数据里确实属于同一个人。这不是幻觉,而是模型在参数里记住了字段之间的关联。实验显示,即使输入是无关照片,模型仍能以极高准确率复现训练集中的敏感字段对。

研究空白:从单字段到关系级

研究空白:从单字段到关系级
Figure 1: Unlike prior work[20] on single-field leakage, we show that relational privacy leakage in document MLLMs occurs when models jointly reveal correlated sensitive fields under abnormal or weak-evidence inputs.

图1对比了单字段泄露与关系型隐私泄露的区别。注意观察右侧的关系型泄露示例:模型在没有视觉证据的情况下同时输出多个相关敏感字段,这正是本文要解决的核心问题。

DRUF的核心机制

DRUF的核心机制
Figure 2: Overview of DRUF. The Retain branch uses normal document samples and a frozen teacher model to preserve the student model’s original key information extraction (KIE) capability through teacher–student alignment. In the Forget branch, probing samples are used to evaluate current privacy leakage and dynamically update the forget set. The selected samples are paired with blank-image inputs, while the Relational Decoupling Unlearning (RDU) objective suppresses the joint generation of correlated sensitive fields. Both branches are jointly optimized to reduce relation-level privacy leakage while preserving normal KIE utility.

图2展示了DRUF的整体架构。重点关注Forget分支中的动态遗忘集更新机制和RDU目标:探针样本先探测当前泄露行为,再据此更新遗忘集,形成闭环。

验证与效果

验证与效果
Table 2: Unlearning performance on privacy-related tasks un- der the Prompt-Driven and Image-Driven settings, together with utility preservation on the normal KIE task. Acc and LC denote leakage accuracy and leakage completeness, respec- tively. Our method substantially reduces leakage under both attack settings while preserving strong KIE performance, achieving a better balance between privacy protection and task utility than competing methods.

表2是本文最关键的实验结果。对比DRUF与SCRUB、DPO等基线在泄露准确率和KIE效用上的表现,DRUF在泄露抑制上大幅领先,同时保持了可接受的KIE性能。

实验如何设计?

  • 在DocXPand-25k、IDNet、IDNet(with noise)三个数据集上评估LLaVA-1.5-hf、Xgen-Phi3、Idefics2三个文档MLLM的隐私泄露行为,覆盖不同模型架构和数据分布。
  • 将DRUF与六种遗忘方法对比:GA、GA+KL、SCRUB、DPO、FTF、DP,在Prompt-Driven和Image-Driven两种设置下同时评估泄露抑制效果和KIE效用保留。
  • 消融研究包括:动态遗忘集与静态遗忘集的对比、不同耦合机制(乘积、加法、最大值等)的对比、Other Photos和Face输入下的泄露评估。
  • 分析不同提示策略(NIQP、SIEP、ECAP)对泄露的影响,以及测试集大小和λ参数对隐私-效用权衡的影响。

关键结果与论文证据

  • LLaVA-1.5-hf在DocXPand-25k上Image-Driven设置下Acc@1.0达0.835,Prompt-Driven下为0.644,表明泄露在两种设置下都显著存在(第7页,Table 1)。
  • DRUF在Prompt-Driven下将泄露准确率降至0.000,Image-Driven下降至0.001,同时KIE LC保持0.808,实现了隐私与效用的良好平衡(第8页,Table 2)。
  • DRUF相比最强基线SCRUB在Image-Driven下泄露准确率降低4.8个百分点(0.049→0.001),且泄露字段对数量从基线的62降至5,远低于SCRUB的34、DPO的78和FTF的90(第8页,Table 2)。
  • Other Photos输入下泄露率@1.0达0.955,Face输入下为0.825,证明泄露不依赖有效视觉证据,模型确实在依赖记忆(第8页,Table 3)。
  • NIQP在DocXPand-25k上对LLaVA-1.5-hf的Acc@1.0达0.953,高于SIEP的0.284和ECAP的0.818,说明泄露并非由提示中的隐私线索直接驱动,而是模型内部的关联记忆在起作用(第11页,Table 4)。
  • 动态遗忘集相比静态遗忘集在泄露抑制上表现更好,验证了动态探测机制的必要性(第14页,Table 5)。
  • 训练过程对比显示,DRUF在抑制泄露的同时保持了比SCRUB更稳定的KIE能力,而GA类方法在遗忘过程中严重损害了正常任务效用(第13页,Figure 7)。

阅读时需要注意

  • 实验仅在三个文档MLLM(LLaVA-1.5-hf、Xgen-Phi3、Idefics2)上验证,模型覆盖范围有限,结论的泛化性有待进一步检验。
  • 隐私字段定义限于family name、given name、document number等少数字段,未覆盖地址、电话号码等其他敏感信息类型。
  • DRUF的KIE LC(0.808)相比基线(0.852)仍有约4个百分点的效用下降,隐私保护与任务效用之间的权衡尚未完全解决。
  • 动态遗忘集依赖多轮探测,计算开销高于静态遗忘集方法,在实际部署中可能面临效率挑战。

关联工作

  • PrIeD-KIE首次揭示了文档KIE任务存在隐私泄露风险,但缺乏针对性防护方法和微调指南,本文在其基础上进一步识别了关系型泄露这一更隐蔽的风险形式。
  • MM-Privacy将多模态隐私风险总结为Disclosure Risks和Retention Risks,为本文的风险分类提供了理论框架。
  • VL-MIA通过成员推断攻击展示了视觉语言模型保留可利用的训练记忆,为本文的记忆依赖假设提供了间接支持。
  • SCRUB作为师生框架遗忘方法的代表,是本文的最强基线,但其遗忘目标停留在样本级,未针对字段对级的联合泄露进行设计。

发表评论