快速导读:提出HierDoc框架,将长文档证据获取建模为从页面到区域的连续结构化集合预测,通过阶段式GRPO优化页面和区域策略,在多个长文档VQA基准上取得领先性能。
长文档视觉问答面临一个核心挑战:证据往往稀疏地分布在数十甚至上百个页面中,模型需要同时判断哪些页面包含相关信息,以及这些页面中的哪些区域真正回答了问题。现有方法通常将页面检索和区域定位视为两个独立甚至割裂的步骤——页面检索器负责召回候选页,下游的答案模型或OCR智能体再在页内寻找证据。这种分离导致一个致命问题:页面检索的失误无法在下游被纠正,而区域定位的优化信号也无法反馈给上游的页面选择。
HierDoc针对这一断层提出了一个统一的层级证据路由框架。它的核心思想是将证据获取形式化为一个连续的、从页面到区域的结构化集合预测过程:先由可训练的页面策略从固定窗口中选出证据页面集合,再由可训练的区域策略从这些页面的语义区域中选出相关区域子集,最终答案模型同时接收选中的整页、区域裁剪图和OCR文本进行推理。页面策略和区域策略均通过阶段式GRPO独立训练,使用粒度特定的集合奖励——页面级侧重召回以避免不可逆的证据遗漏,区域级侧重精确率以精简输入。这种设计使得两级路由可以各自专注于自己的优化目标,同时又通过层级结构自然地衔接在一起。
英文题目:HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
论文出处:arXiv 每日论文精选 · arXiv:2607.29638
原始论文:PDF / 论文页面
这篇论文解决什么问题?
多页文档VQA的难点在于证据的稀疏性和跨页分布。以MMLongBench-Doc为例,一个典型问题可能需要从一篇26页的论文中找到某个特定消融实验的数值,或者从一份43页的报告中汇总两个不同页面的统计数据。传统的页面检索方法如ColPali以整页图像为检索单元,虽然能高效召回相关页面,但无法进一步定位页内的具体证据区域。而DocR1虽然通过Evidence Page-Guided GRPO使页面选择变得可学习,却仍然停留在页面粒度,没有延伸到区域级的选择。
另一类方法如AgenticOCR和Doc-V*试图通过智能体循环来解决细粒度定位:模型交替进行页面获取、区域缩放和OCR操作,逐步逼近答案。但这种设计将页面选择与答案推理耦合在一起,页面获取的决策受到下游推理状态的影响,难以独立评估和优化页面选择的质量。更重要的是,这些方法都没有将页面选择和区域选择作为两个可以分别训练的证据策略来看待,导致无法针对不同粒度设计专门的优化目标。
DocLens和RegionRAG虽然触及了区域级的选择,但前者没有学习查询条件的区域子集选择,后者则完全脱离了上游的页面检索。HierDoc的独特之处在于,它明确地将页面路由和区域路由定义为两个连续的、可独立优化的结构化集合预测任务,并通过层级结构将它们连接成一个完整的证据获取流水线。
核心创新
- 提出层级证据路由框架,将页面和区域获取形式化为连续的、答案无关的结构化集合预测。
- 设计阶段式GRPO训练策略,为页面和区域策略分别定义粒度特定的集合奖励(召回率、F1、精确率等)。
- 构建基于解析器原生语义区域ID的离散动作空间,将空间监督映射为离散区域决策。
- 在答案生成中融合整页上下文、区域裁剪图和OCR文本,实现全局布局与局部证据的互补。
方法概览
HierDoc包含三个阶段:(1) 页面路由:页面策略从固定窗口中选择证据页面集合;(2) 区域路由:MinerU2.5-Pro将选中页面解析为语义区域,区域策略从中选择相关区域子集;(3) 答案生成:答案模型同时接收选中整页、区域裁剪图和OCR文本,生成最终答案。页面和区域策略均采用阶段式GRPO,使用粒度特定的结构化集合奖励进行独立优化,并通过有界反思(bounded reflection)精简证据集。
- 页面路由阶段:页面策略基于问题文本和固定大小的页面窗口,输出一个证据页面集合。窗口机制限制了动作空间的大小,使策略可以在可控范围内学习选择。页面策略通过GRPO训练,奖励函数以召回率为核心(λrecall=0.15),辅以F1(λpf1=0.45)和精确率(λprec=0.40),这种设计优先保证证据页面不被遗漏,因为页面级的遗漏在下游无法恢复。
- 区域路由阶段:选中的页面首先由MinerU2.5-Pro解析为带类型的语义区域——每个区域包含类别标签、边界框坐标和OCR文本或表格元数据。区域策略的离散动作空间直接建立在解析器原生的语义区域ID上,每个区域对应一个独立的动作。这种设计将空间监督自然地映射为离散决策,避免了额外的区域提议步骤。
- 区域策略同样通过GRPO训练,但奖励函数的设计与页面策略不同:区域级奖励以精确率为核心(λprec=0.50),配合F1(λpf1=0.30)和召回率(λrecall=0.20)。这是因为区域路由发生在已选页面内部,即使遗漏了部分区域,整页图像仍然会传递给答案模型作为上下文补充,因此可以更激进地追求精确率以精简输入。
- 有界反思(bounded reflection):在训练和推理中,页面和区域策略都会应用一个启发式后处理步骤——如果选中的页面或区域数量超过预设上限,则按策略输出的置信度排序并截断。这一步骤在训练中作为环境的一部分参与奖励计算,在推理中则直接精简证据集。
- 答案生成阶段:答案模型同时接收三类输入——选中的整页图像(提供全局布局和上下文)、选中的区域裁剪图(提供局部证据的高分辨率视图)、以及区域的OCR文本(提供可直接读取的文字信息)。这种多模态证据组合使模型既能理解文档的整体结构,又能精确读取局部细节。
- 阶段式训练策略:页面策略和区域策略分别独立训练,而非端到端联合优化。页面策略训练时使用固定的区域选择(全选或随机),区域策略训练时使用已训练好的页面策略的输出。这种解耦设计使得每个策略可以专注于自己的粒度目标,同时避免了联合训练中奖励信号分配的问题。
逐图理解论文
失败案例与直觉

想象一个典型场景:你问一篇几十页的论文里某个消融实验的具体数值。传统方法可能先召回三五个候选页面,但答案模型面对整页的图表和文字,仍然可能读错行、看错表,甚至完全忽略真正的证据区域。更糟的是,如果页面检索一开始就漏掉了关键页,下游无论多努力都无法挽回。这个不可逆的错误传播,正是现有方法的致命弱点。
核心区分与研究空白

HierDoc推理流程总览。从文档页面窗口开始,页面策略选出证据页面,经MinerU2.5-Pro解析为语义区域后,区域策略筛选相关区域,最终答案模型融合整页、区域裁剪图和文本进行推理。火焰标记表示可训练的选择器。
方法贡献与验证

选择器训练和有界反思的增量消融。从无训练的页面选择开始,逐步添加页面GRPO、有界反思、区域GRPO和区域有界反思,每一步都带来QA性能的累积提升。
实验如何设计?
- 在五个长文档VQA基准上评估端到端问答性能:MMLongBench-Doc(多领域长文档)、LongDocURL(多模态理解)、SlideVQA(幻灯片问答)、PaperTab和FetaTab(表格导向的学术论文和维基百科子集)。
- 页面级证据检索评估:将HierDoc的页面策略与Doc-V*等方法的页面选择质量进行对比,指标包括Page F1和平均选择页面数。
- 增量消融研究:在MMLongBench-Doc上逐步添加选择器GRPO训练和有界反思,观察对页面路由、区域路由和下游QA的影响。
- 证据组合消融:对比仅整页、整页+OCR、整页+区域裁剪图、整页+区域裁剪图+OCR等不同证据组合方式对答案质量的影响,同时对比学习到的区域选择与随机区域选择的差异。
- 奖励函数消融:分别消融页面策略奖励中召回率与F1的平衡权重,以及区域策略训练中同文档负样本页面的作用。
关键结果与论文证据
- 端到端性能:Qwen3-VL-8B版本的HierDoc在MMLongBench-Doc上达到53.62%准确率,LongDocURL上65.80%,SlideVQA上F1 76.45%,在多个基准上取得领先或竞争性结果(Table 1, p.5)。
- 页面检索质量:页面策略在MMLongBench-Doc上Page F1达68.9%,平均仅选择2.2页;在SlideVQA上Page F1达82.3%,平均仅1.5页,表明策略能以极少的页面实现高召回(Table 2, p.6)。
- 区域路由增益:在页面路由基础上加入训练后的区域路由和有界反思,MMLongBench-Doc上QA准确率提升5.51%,F1提升4.82%,证明区域级选择对下游QA有实质性贡献(Table 3, p.6)。
- 证据组合价值:选中区域裁剪图+OCR相比仅整页,准确率/F1提升5.51%/4.82%;学习到的区域选择相比随机选择,准确率/F1提升3.18%/4.46%,说明区域选择策略确实学到了有意义的证据偏好(Figure 2, p.7)。
- 召回优先的页面奖励设计是合理的:消融实验显示,降低页面奖励中的召回权重会导致下游QA性能下降,验证了页面级遗漏不可逆的假设(Table 7, p.12)。
- 同文档负样本的作用有限:在区域策略训练中加入同文档负样本页面仅带来+0.44%准确率的微小增益,说明跨页负样本的区分难度较低,实际部署时可权衡数据准备成本(Table 8, p.11)。
- 定性案例展示了层级路由的有效性:在DETR论文的26页中,页面策略精准定位到包含消融实验的第13页,区域策略进一步选中了损失函数说明和消融表格两个区域,答案模型正确输出57.3(Figure 3, p.12)。跨页组合案例中,页面策略从43页报告中选出两页,区域策略分别定位到两页中的具体数据行,答案模型成功汇总计算(Figure 4, p.12)。
阅读时需要注意
- 层级设计引入不可逆的错误传播:区域策略仅作用于已选页面,页面路由遗漏的证据无法在下游恢复。尽管页面奖励设计优先保证召回,但在极端稀疏或噪声场景下仍可能出现遗漏。
- 区域路由依赖MinerU2.5-Pro进行候选区域解析,布局解析错误、OCR噪声和启发式框对齐可能限制动作空间的质量,进而影响区域策略的学习和推理。
- 路由策略采用集合级目标独立优化,而非端到端答案反馈,证据选择指标的提升不一定等比转化为答案质量的提升,存在优化目标与最终目标之间的代理偏差。
- 当前框架假设页面窗口大小固定,对于页面数极多(如数百页)的文档,窗口机制可能需要调整或引入更粗粒度的预筛选。
关联工作
- ColPali(视觉文档检索):以整页图像为检索单元,使用视觉语言模型进行稠密检索,但未涉及细粒度区域选择。HierDoc可以看作在其基础上的层级扩展。
- DocR1(Evidence Page-Guided GRPO):首次将GRPO引入文档证据选择,使页面选择变得可学习。HierDoc继承了这一思路,并将其推广到区域粒度,同时设计了粒度特定的奖励函数。
- Doc-V*(智能体文档QA):交替进行检索、页面获取和回答,页面选择与答案推理耦合。HierDoc将页面选择解耦为独立的策略,使其可以单独评估和优化。
- AgenticOCR(查询驱动OCR):学习查询驱动的缩放与OCR操作,但页面获取作为上游输入未与区域选择联合优化。HierDoc的区域路由可以看作对这一思路的离散化和结构化改进。