稀疏证据足矣:SIEVE智能体驱动的多模态视频虚假信息检测

三分钟导读:SIEVE通过解耦证据获取与验证,利用智能体在预算约束下主动搜寻稀疏且关键的OCR、ASR及视觉线索,实现了高效且可解释的视频虚假信息检测。

英文题目:Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

论文出处:arXiv 每日论文精选 · arXiv:2607.18080

原始论文:PDF / 论文页面

对应视频标题:稀疏证据足矣:SIEVE智能体驱动的多模态视频虚假信息检测|推荐指数:★★★★★

这篇论文解决什么问题?

传统视频虚假信息检测通常将任务视为整体视频理解,处理大量冗余内容,难以在稀疏、碎片化的证据中定位决定性线索,且缺乏可解释性。

核心创新

  • 将视频虚假信息检测形式化为预算受限的主动证据获取与验证问题,解耦了证据搜寻与事实判定。
  • 设计了基于证据感知的强化学习奖励机制,平衡验证正确性、证据覆盖度与交互成本。
  • 实现了紧凑证据包构建,仅需少量关键线索即可达到接近饱和的检测性能,提升了透明度。

方法概览

提出SIEVE框架,包含证据空间构建、预算受限的证据获取智能体(Evidence Agent)和基于证据的验证器(Verifier)。智能体通过监督微调(SFT)和基于GRPO的强化学习(RL)训练,主动读取OCR、ASR和视觉帧,构建紧凑证据包供验证器判断真伪。

逐图理解论文

方法:SIEVE框架概览

方法:SIEVE框架概览
Figure 2: Overall framework of the proposed method.

SIEVE框架将检测解耦为证据获取与验证两个阶段。如图2所示,系统包含Evidence Agent和Verifier。Agent负责在预算约束下主动读取OCR、ASR及视觉帧,构建紧凑证据包;Verifier则基于这些证据进行最终判定。这种设计避免了单次推理的盲目性,使模型能够像人类调查员一样,有针对性地收集信息。

训练:强化学习优化

训练:强化学习优化
Table 5: Reward-component ablation on FakeSV and FakeTT. R-Rec denotes recall for the Real class.

Agent的训练结合了监督微调与基于GRPO的强化学习。GRPO通过Group Relative Policy Optimization优化策略,奖励机制不仅关注验证正确性,还平衡证据覆盖度与交互成本。Table 5的消融实验显示,移除奖励组件中的特定部分会导致性能下降,证明了多目标奖励设计对Agent行为引导的关键作用。

实验:在域性能SOTA

实验:在域性能SOTA
Table 1 reports the main results on FakeSV and FakeTT. SIEVE achieves the best performance across all metrics on both benchmarks. On FakeSV, it obtains 92.62% ACC and 92.41% Macro-F1, outperforming the strongest prior

在FakeSV和FakeTT基准上,SIEVE展现了卓越性能。Table 1数据显示,SIEVE在FakeSV上达到92.62%准确率与92.41% Macro-F1,在FakeTT上达到91.64%准确率与90.72% Macro-F1,均刷新SOTA。相比FakeSV-VLM等强基线,SIEVE在保持高精度的同时,显著减少了不必要的计算开销。

分析:证据充分性

分析:证据充分性
Figure 3: Evidence sufficiency on FakeSV and FakeTT. (a) Stable correction of Description-only errors. (b) Macro-F1 under different inference-time evidence budgets.

Figure 3揭示了证据获取的效率。图3b显示,随着推理时证据预算增加,Macro-F1迅速上升并趋于稳定。这表明仅需少量关键线索即可达到接近饱和的检测性能。图3a进一步证明,即使初始描述存在错误,Agent也能通过主动搜寻纠正偏差,展现了系统的鲁棒性。

行为:智能体策略

行为:智能体策略
Figure 4: Evidence acquisition statistics on the test sets. The left panel shows the distribution of legal reads across evi- dence channels, and the right reports average total and visual reads.

Figure 4统计了Agent的证据获取行为。Agent平均每个样本仅使用不到8次合法读取操作,其中OCR和ASR文本证据被优先选择。在FakeSV上,OCR占42.27%的读取量。这种紧凑的证据包构建策略,避免了全量读取带来的冗余,体现了Agent在资源受限下的优化能力。

实验与关键结果

  • 在FakeSV和FakeTT基准上进行在域评估,对比MLLMs、单模态模型及SOTA多模态方法。
  • 在FakeVV上进行跨域泛化评估(无FakeVV训练数据)。
  • 进行消融实验,分析描述仅输入、随机证据、全量证据及训练组件的影响。
  • 分析证据获取行为,包括通道偏好、阅读预算及错误修正能力。
  • 在FakeSV和FakeTT基准上进行在域评估,对比MLLMs、单模态模型及SOTA多模态方法。
  • 在FakeVV上进行跨域泛化评估(无FakeVV训练数据)。
  • 进行消融实验,分析描述仅输入、随机证据、全量证据及训练组件的影响。
  • 分析证据获取行为,包括通道偏好、阅读预算及错误修正能力。

阅读时需要注意

  • 验证器仅接收已获取的证据,若智能体未能获取关键证据(如关键OCR被遮挡),可能导致误判。
  • 跨域泛化性能(FakeVV)显著低于在域性能,表明模型对特定数据集的证据分布存在依赖。
  • 视觉读取受限于24张图像的上限,可能无法覆盖所有视觉细节。
  • SIEVE明确排除了数据集提供的Event字段,仅使用Description作为初始声明上下文,这与部分利用元数据的基线方法不同。
  • 在FakeVV评估中,排除了Fact-R1,因其模型在FakeVV上训练,不具备公平的可比性。
  • 结果基于Qwen3-VL-8B-Instruct作为Agent和Qwen3-VL-2B-Instruct作为Verifier,不同基座模型性能可能不同。

关联工作

  • FakeSV-VLM:SOTA基线,SIEVE在其基础上提升了约2.4个百分点。(第 5 页)
  • Fact-R1:相关强化学习方法,但在跨域评估中因训练数据重叠被排除。(第 5 页)
  • ExMRD:基于思维链的解释性检测方法,SIEVE在主动证据获取方面优于其固定输入范式。(第 2 页)
  • FakingRecipe:基于创作过程的多模态检测基准,SIEVE在其上表现更优。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

证据稀疏亦足矣:面向多模态视频虚假信息的Agentic 证据搜寻

赵浩辰1,2,徐永秀1,2∗,林新魁1,2,谢栋3, 陆嘉瑞1,2,钱宇琪1,2,王宇斌1,2,徐洪波1,高鹏1 1 中国科学院信息工程研究所,中国北京 2 中国科学院大学网络空间安全学院,中国北京 3 百度,中国北京 zhaohaochen@iie.ac.cn

摘要 多模态视频虚假信息检测通常被表述为一种整体视频理解任务,其中整个视频及其相关内容被一次性处理并判定。然而,现实世界中的虚假信息往往呈现出稀疏且组合式的证据结构:可靠的决策可能仅依赖于少数几个耦合线索,而大部分视频内容提供的额外信息有限。因此,穷举式的多模态推理可能会引入大量冗余,并掩盖决定性证据。这促使我们将证据获取与验证解耦:首先识别稀疏的、与决策相关的线索,然后基于获取的证据判定真伪。据此,我们提出了 SIEVE(Sparse Interactive Evidence Verification via Extraction,基于提取的稀疏交互式证据验证),这是一个用于多模态视频虚假信息检测的框架。一个Evidence-seeking Agent主动探索可用的多模态证据并构建紧凑的证据包,随后由一个验证器(Verifier)利用该证据包判定真伪。该 Agent 通过监督式的证据搜寻轨迹以及一种证据感知的强化学习目标进行训练,该目标旨在促进信息性证据的获取,同时抑制不必要或无效的交互。在多个视频虚假信息基准上的实验表明,SIEVE 一致优于已评估的基线方法,并支持使用紧凑证据包进行可靠验证。此外,由此产生的获取过程提供了显式且可检查的证据链,提高了多模态虚假信息检测的透明度和依据性。

引言 视频已成为在线信息消费的主导媒介,尤其是在 TikTok 和 YouTube 等短视频平台上,用户生成的视频可以快速创建并广泛传播 (Bu et al. 2023; Venkatagiri, Schafer, and Prochaska 2023)。然而,视频创建和传播的便捷性也加速了虚假信息的传播,威胁着在线信息生态系统和公共话语的信誉 (Bu et al. 2023; Lazer et al. 2018)。由于在线视频的数量和速度远远超出了人工事实核查的能力,自动视频虚假信息检测已成为一个日益重要的研究问题 (Venkatagiri, Schafer, and Prochaska 2023; Bu et al. 2023)。

与基于文本或图像的虚假信息相比,视频虚假信息更具挑战性,因为视频包含异质的视觉、声学、文本和社会信号,以及时间动态和细微的多模态不一致性 (Bu et al. 2023; Shang et al. 2021; Liu, Yacoob, and Shrivastava 2023)。早期的视频虚假信息检测方法主要依赖于特定任务的编码器和多模态融合策略,例如建模跨模态相关性、社会背景、创作过程模式或事件相关视频之间的邻居关系 (Choi and Ko 2021; Liu, Yacoob, and Shrivastava 2023; Qi et al. 2023a; Li et al. 2025; Bu et al. 2024; Qi et al. 2023b)。尽管这些方法取得了令人瞩目的成果,但它们通常被优化为端到端的判别分类器,在开放世界验证场景中为显式、可解释和灵活的多步证据推理提供的支持有限 (Wang et al. 2025b; Zheng et al. 2025; Wang, Yang, and Zhang 2026; Lang et al. 2026)。

最近,视觉-语言模型和多模态大语言模型在利用其广泛的多模态知识和推理能力进行假短视频新闻检测方面显示出巨大潜力 (Zheng et al. 2025; Wang et al. 2025b; Hong et al. 2025; Zhang et al. 2025)。一些方法引入思维链推理以提高可解释性 (Hong et al. 2025),而其他方法则进一步探索长推理轨迹和强化学习。

∗ 通讯作者。 版权所有 © 2027,人工智能促进协会 (Association for the Advancement of Artificial Intelligence, www.aaai.org)。保留所有权利。

第 2 页

用于视频虚假信息检测 (Zhang et al. 2025; Li et al. 2026)。然而,大多数现有方法仍然遵循单遍或固定深度的推理范式,其中模型直接从预提取的输入中预测标签。当关键证据稀疏、碎片化或不足时,此类模型可能会依赖内部假设,而不是主动获取针对性证据,从而导致不可靠或缺乏依据的决策 (Yao et al. 2023; Zhang et al. 2023; Li et al. 2026; Wang, Yang, and Zhang 2026)。

如图 1 所示,视频主张有时可以从稀疏且局部的证据中解决,而无需编码整个证据空间。数据集提供了“事件 (Event)”和“描述 (Description)”元数据,但 SIEVE 仅使用“描述”字段作为初始主张上下文,并从所有模型输入中排除“事件”字段。在示例中,一个 OCR 线索“一名女子在飞机上给猫喂奶”识别了视频帖子所主张的事件,而另一个线索“这一切都是在摄影棚摆拍的”揭示了所描绘的场景是摆拍的。前者确立了所主张的内容,而后者提供了反驳它所需的证据;结合起来,这些互补的线索足以拒绝该主张。这个例子凸显了一个超越多模态融合的挑战:如何在大量冗余的证据空间中识别并组合解决主张所需的稀疏决定性线索,因为穷尽证据消耗不仅不必要,还可能掩盖决定判断的关键证据。

因此,我们将视频虚假信息检测表述为一种受预算约束的证据搜寻和验证过程,其中获取预算鼓励智能体优先选择少量潜在的决定性和互补性线索,而不是穷尽阅读所有可用内容。具体而言,平台提供的“描述”字段被视为初始主张上下文,而数据集提供的“事件”字段未被使用。一个证据搜寻智能体选择性读取视频衍生的证据通道,包括视觉帧、OCR 和 ASR,并构建一个紧凑的证据包,在其中可以联合解释互补性线索。然后,验证器基于“描述”和获取的证据做出判断。这种设计将证据获取与验证解耦,并公开获取的证据及其组合基础以供检查。

我们的主要贡献总结如下:

  • 我们将多模态视频虚假信息检测表述为选择性证据获取和验证问题,并实证研究在受限的多模态上下文中,视频衍生的证据子集是否足以支持可靠的验证。
  • 我们提出了 SIEVE,这是一个主动搜寻潜在决定性且互补的多模态证据并构建紧凑证据包以供验证的智能体框架。证据智能体通过监督轨迹和证据感知的强化学习进行训练,以实现有据可依的证据获取。
  • 我们在多个视频虚假信息基准上进行了实验。SIEVE 始终优于所评估的基线方法,并在适度的证据预算下达到了接近饱和的 Macro-F1 分数。其解耦设计还提供了一个明确且可检查的证据获取轨迹。

相关工作

现有的视频虚假信息检测方法通常将任务表述为整体多模态分类,联合编码视觉、文本、声学和社会信号以进行预测。早期研究调查了主题建模、对抗学习和针对假新闻或 COVID-19 虚假信息视频的特域多模态融合 (Choi and Ko 2021; Shang et al. 2021; Liu, Yacoob, and Shrivastava 2023)。后来的工作构建了短视频基准并引入了更丰富的上下文建模。FakeSV 结合了多模态内容和社会上下文用于假短视频新闻检测 (Qi et al. 2023a),而后续方法利用了事件相关视频之间的邻居关系 (Qi et al. 2023b)、创作过程线索 (Bu et al. 2024) 或异质社会潜在结构 (Li et al. 2025)。尽管取得了这些进展,但大多数方法通过单一判别性流水线处理预收集的视频输入,为明确识别哪些稀疏多模态线索足以进行有据可依的验证提供了有限的支持。

最近的工作利用视觉语言模型和多模态大语言模型来提高虚假信息检测中的语义推理能力和可解释性。基于理由的 VLM 方法从直接预测转向面向分析的检测 (Zheng et al. 2025),而 FakeSV-VLM 通过渐进式专家机制和事件级一致性检查适应 VLMs (Wang et al. 2025b)。ExMRD 引入了一个精炼-检索-推理链,以产生可解释的微视频谣言预测 (Hong et al. 2025),而 Fact-R1 进一步结合了长链推理、偏好对齐和强化学习用于视频虚假信息检测 (Zhang et al. 2025)。更近期的智能体框架,如 CSI 和 FactGuard,使用多智能体调查或工具增强的推理来加强证据获取和决策可靠性 (Wang, Yang, and Zhang 2026; Li et al. 2026)。检索引导的适应方法也已探索用于测试时的假新闻视频检测 (Lang et al. 2026)。尽管取得了这些进展,但大多数方法仍然在预构建的全局输入或外部检索的信息上进行推理,而不是学习如何从密集的多模态视频内容中搜寻紧凑、局部且与主张相关的证据。

我们的工作也与以证据为中心的事实验证和选择性感知有关。文本事实验证长期以来一直强调在做出主张级判断之前检索支持证据的重要性 (Thorne et al. 2018),后续工作表明,证据检索应针对下游验证效用进行优化,而不仅仅是相关性 (Zhang et al. 2023)。在语言智能体研究中,ReAct 证明了交错推理和行动使模型能够获取缺失信息,而不是依赖内部假设 (Yao et al. 2023)。在视频理解中,自适应帧选择方法表明,许多视频任务可以通过仅观察信息帧的子集来解决 (Wu et al. 2019)。与这些研究方向不同,SIEVE 将视频虚假信息检测研究为一种受预算约束的交互式证据搜寻问题。它仅使用

第 3 页

平台提供的 Description 字段作为初始声明上下文,明确排除了数据集提供的 Event 字段,并在基于证据的验证之前,主动从 OCR、ASR 和视觉通道中获取紧凑且与声明相关的证据,从而将任务从固定输入分类转变为预算限制的主动证据获取。

关于证据空间构建、训练、奖励设计和策略优化的更多细节见补充材料。

概述

图 2 展示了 SIEVE。给定视频及其 Description,SIEVE 构建了一个结构化的多模态证据空间。Evidence Agent 接收一次性的缩略图和通道可用性概览,仅用于导航,然后在预算限制下选择性读取证据,并在证据充足时发出 STOP 信号。该概览不包含在证据包和 Verifier 输入中。Verifier 基于 Description 和已获取的证据进行预测,从而实现紧凑的、基于证据的验证。

问题形式化

每个实例为 $x = (V, A, c)$,其中 $V$ 和 $A$ 分别是视觉和音频流,$c$ 是固定的文本上下文。两个数据集均提供 Event 和 Description 字段,而 FakeSV 额外提供评论。SIEVE 仅使用 Description,即 $c = c_{\text{description}}$,从所有模型输入中排除 Event 和 Comment。对于在 FakeVV 上的跨数据集评估,使用关联的标题,即 $c = c_{\text{title}}$。任务是预测 $y \in \mathcal{Y} = \{\text{Fake, Real}\}$。传统方法通常直接从完整的多模态输入中进行预测。相比之下,我们将检测形式化为主动证据获取,随后是基于证据的验证。视觉流被划分为 $K$ 个时间槽 $S(V) = \{s_i\}_{i=1}^K$,每个槽包含来自 $M = \{\text{OCR, ASR, CTX, KEY}\}$ 的可用通道。证据空间为

$$ E(V, A) = \{e_{i,m} \mid i \in \{1, \dots, K\}, m \in M_i\}, \quad (1) $$

其中 $M_i \subseteq M$ 表示槽 $s_i$ 中可用的通道。SIEVE 并非访问 $E$ 的所有详细内容,而是顺序构建有序的证据包 $P_T$ 并预测

$$ \hat{y} = \text{parse}(g_\phi(c, P_T)), \quad (2) $$

其中 $g_\phi$ 是自回归 Verifier。

证据空间构建

SIEVE 从每个视频的视听内容构建基于槽的证据空间。TransNetV2 (Souček and Lokoč 2020) 检测镜头边界;短镜头被合并,长镜头被细分。如果剩余槽超过 10 个,则合并相邻的低运动片段。每个槽可能包含 OCR、ASR、CTX 和 KEY 证据。PaddleOCR (Du et al. 2020) 根据时间、空间和识别质量线索提取排名的 OCR 文本,而 Whisper (Radford et al. 2023) 生成与槽对齐的转录文本。DINOv2 ViT-S/14 (Oquab et al. 2024) 编码视觉候选:CTX 包含代表性帧,而 KEY 包含由视觉显著性和 OCR 相关性选择的一个或两个互补帧。在第一次动作之前,环境提供一次性的导航概览,每个槽包含一个缩略图和通道可用性指示器;该概览不包含在证据包和 Verifier 输入中。通道状态由 $C_t(i, m) \in \{-, x, v\}$ 跟踪,分别表示不可用、未读和已读。合法的 READ 操作允许读取剩余预算内的 $x$ 条目。视觉 READ 操作累积的 CTX/KEY 图像上限为 24 张,超过上限的动作将被排除。合法的 READ 揭示证据并将其状态更改为 $v$。重复、不可用或格式错误的动作会立即终止回合,不添加任何证据,并导致强化学习惩罚。

交互式证据获取

我们将证据获取形式化为预算限制的序列决策过程。在步骤 $t$,智能体观察到 $o_t = (c, \omega, h_t, \mu_t, C_t, b_t)$,其中 $c$ 是声明上下文,$\omega$ 是 $t=1$ 时提供的一次性概览,$h_t$ 存储已获取的证据和来源标识符,$\mu_t$ 是证据记忆,$C_t$ 跟踪通道状态,$b_t$ 记录剩余的 READ 预算、累积的视觉图像数量以及被 24 图像上限阻止的视觉 READ 数量。智能体生成 $z_t \sim \pi_\theta(\cdot \mid o_t)$,其中包含一个动作,以及在适用情况下对前一个合法 READ 的简洁非判决记忆更新。环境存储记忆更新,解析命令,并根据合法读取动作集 $A_{\text{read}}^t$ 对其进行验证。合法的 READ$(\text{slots}_{id}, \{\text{channel}\})$ 揭示 $e_{\text{slots}_{id},\text{channel}}$ 并更新包、历史、覆盖范围和预算;新证据将在下一个响应中总结。STOP 终止获取。重复、不可用或格式错误的命令是无效尝试:它们不添加任何证据,立即终止当前的获取回合,并在强化学习期间导致行为惩罚。获取在 STOP、预算耗尽或无效动作时结束。终端包 $P_T$ 仅包含合法获取的证据和来源标识符,不包括记忆和推理痕迹。

基于证据的验证

给定 $c$ 和 $P_T$,Verifier 自回归生成标签令牌:

$$ \tilde{y} = g_\phi(c, P_T), \quad \hat{y} = \text{parse}(\tilde{y}). \quad (3) $$

Verifier 仅接收声明上下文和合法获取的证据,无法访问未读取的证据或交互状态(如覆盖范围、预算或智能体记忆)。这种受限接口鼓励基于证据的预测,而不是依赖过程性伪影。Verifier 是一个较小的 VLM,使用 LoRA 训练,并在策略优化期间保持冻结。

训练

SIEVE 分四个阶段训练:教师轨迹生成、智能体监督微调、Verifier 监督微调和智能体策略优化。所有教师轨迹、更新的智能体回合、Verifier 训练包和 RL 轨迹均仅从训练集中生成。

第 4 页

推理流程 原始视频 -> 证据空间构建 -> 证据获取循环 -> 动作协议 -> 输出 音频 -> OCR / ASR / 上下文 / 键 -> 槽位分割 -> 环境 -> 状态提示 -> 证据智能体 -> 读取(槽位, 通道) -> 真实 -> 合法动作集 -> 停止条件:证据充足 -> 每次合法读取后更新记忆 -> 虚假 -> 证据记忆 -> 预算状态 -> 重复直到停止

初始声明 -> 上下文 -> 证据包获取 -> 动作策略 -> 证据包 -> 验证器 -> 上下文 / OCR / 键 / 仅 ASR -> 读取证据 -> 预算 -> 覆盖率 -> 记忆 -> 更新 -> 读取 -> 停止 -> 用于判断

训练流程 阶段 1 教师轨迹生成 教师视觉语言模型 + 环境 过滤有效轨迹; 移除泄露和格式错误的动作

阶段 2 智能体监督微调 学习读取选择、 记忆更新,以及 刷新

阶段 3 智能体强化学习 / 策略优化 干净教师轨迹 停止策略 证据感知奖励 签名结果 + 质量 – 成本

阶段 4 验证器监督微调 验证器 证据包 证据覆盖率

图 2:所提方法的整体框架。

教师轨迹生成。我们使用 GPT-5.5 (OpenAI 2026) 作为教师视觉语言模型,并在相同的证据环境中进行 rollout。对于每个 $(x, y)$,教师接收 $o_t$ 和真实标签 $y$ 作为特权监督,并获取支持 $y$ 的证据。该标签仅在教师 rollout 期间使用,并从存储的观察结果和所有证据智能体输入中排除。在每一步,教师生成 $z_t$,其中包含一个动作以及(如适用)一个非判决性记忆更新,其中 $a_t = \text{parse}(z_t)$。轨迹为 $\tau = (o_1, z_1, a_1, \dots, o_{T_\tau}, z_{T_\tau}, a_{T_\tau})$。我们使用不同的随机种子和解码温度,对每个视频采样两条轨迹。任何包含重复、不可用、格式错误或明确标签泄露的 rollout 都会被终止并丢弃;仅保留具有有效转换和符合协议动作的轨迹。由于教师以 $y$ 为条件,终端预测的正确性不是过滤标准。

证据智能体监督微调。证据智能体在保留的教师轨迹上进行监督。由于每个响应包含一个动作决策以及(如适用)一个记忆更新,我们对完整响应应用 token 级监督: $$ L_{\text{SFT}}(\theta) = – \sum_{\tau} \sum_{t=1}^{T_\tau} \sum_{\ell=1}^{L_{\tau,t}} \log \pi_\theta(z^*_{\tau,t,\ell} | o_{\tau,t}, z^*_{\tau,t,<\ell}), \quad (4) $$ 其中 $z^*_{\tau,t}$ 是教师响应。此阶段教授证据选择、记忆更新、协议遵循和停止行为。

验证器监督微调。我们在保留的教师轨迹的终端证据包上训练验证器,以及每个样本的两个刷新 SFT 智能体 rollout。Kimi K2.5 (Kimi Team, Bai et al. 2026) 评估来自两个来源的证据包,仅保留那些被判定为有效且与真实标签一致的包。令 $D_{\text{ver}}$ 表示保留的教师终端和智能体终端包的并集,令 $y_{1:L_y}$ 为目标标签 token。给定下一个 token 分布 $p_\phi$,验证器通过以下公式优化: $$ L_{\text{ver}}(\phi) = – \sum_{(c,P,y) \in D_{\text{ver}}} \sum_{\ell=1}^{L_y} \log p_\phi(y_\ell | c, P, y_{<\ell}). \quad (5) $$ 使用两种证据包来源减少了验证器训练与后续智能体 rollout 之间的分布偏移。训练好的验证器随后被冻结以进行策略优化。

智能体策略优化。最后,我们使用冻结的验证器作为结果评估器,通过强化学习优化证据智能体。奖励结合了验证结果、证据覆盖率和交互成本: $$ \bar{R}(\tau) = B(s) + 0.80 I[s = \text{correct}] Q(\tau) – P(s, \tau), \quad (6) $$ $$ R(\tau) = \text{clip}(\bar{R}(\tau), -1.2, 1.0), $$ 其中 $B(s)$ 对正确的验证分配正的基础奖励,否则分配负奖励。对于正确的轨迹,$Q(\tau)$ 奖励文本新颖性、视觉证据、槽位-通道多样性和证据量,而 $P(s, \tau)$ 惩罚不必要的读取、重复或无效动作以及强制预算终止。对于不正确的轨迹,仅惩罚重复或无效动作。覆盖率奖励鼓励避免过早停止,特别是对于没有单一决定性矛盾的真实视频。正确性确定主要排序,而覆盖率和成本区分每个结果分支内的轨迹。

第 5 页

在线 rollout 过滤。在 GRPO 优化过程中,首先通过冻结的基于 Verifier 的奖励流水线对所有针对同一输入采样的轨迹进行评分。我们仅保留在正确性对比和奖励分布方面具有组内信息性变化的组,而跳过那些缺乏差异的组。这种过滤不会修改任何单个轨迹的奖励。对于每个 $x$,我们采样 $G$ 条轨迹 $\{\tau^{(j)}\}_{j=1}^G$ 并计算

$$ \hat{A}^{(j)} = \frac{R(\tau^{(j)}) – \text{mean}_k R(\tau^{(k)})}{\text{std}_k R(\tau^{(k)})} \quad (7) $$

Evidence Agent 在每个交互步骤生成一个响应,其中包含一个动作命令,以及在适用情况下的记忆更新。因此,我们定义 token 级别的政策比率:

$$ \rho^{(j)}_{t,\ell} = \frac{\pi_\theta(z^{(j)}_{t,\ell} | o^{(j)}_t, z^{(j)}_{t,<\ell})}{\pi_{\text{old}}(z^{(j)}_{t,\ell} | o^{(j)}_t, z^{(j)}_{t,<\ell})} \quad (9) $$

非对称双截断代理损失为

$$ \bar{\rho}^{(j)}_{t,\ell} = \text{clip}\left(\rho^{(j)}_{t,\ell}, 1 – \epsilon_{\text{low}}^{\text{clip}}, 1 + \epsilon_{\text{high}}^{\text{clip}}\right), \quad (10) $$

$$ \tilde{\ell}^{(j)}_{t,\ell} = \min\left(\rho^{(j)}_{t,\ell}\hat{A}^{(j)}, \bar{\rho}^{(j)}_{t,\ell}\hat{A}^{(j)}\right), \quad \ell^{(j)}_{t,\ell} = \begin{cases} \tilde{\ell}^{(j)}_{t,\ell}, & \hat{A}^{(j)} \ge 0, \\ \max\left(\tilde{\ell}^{(j)}_{t,\ell}, C_{\text{dual}}\hat{A}^{(j)}\right), & \hat{A}^{(j)} < 0. \end{cases} $$

报告的运行禁用了 KL 正则化;截断值见补充材料。最终目标函数为

$$ J_{\text{GRPO}}(\theta) = \mathbb{E} \left[ \frac{1}{G} \sum_{j=1}^G \frac{1}{Z_j} \sum_{t=1}^{T_j} \sum_{\ell=1}^{L^{(j)}_t} \ell^{(j)}_{t,\ell} \right], \quad (11) $$

其中 $Z_j = \sum_{t=1}^{T_j} L^{(j)}_t$ 是 $\tau^{(j)}$ 中生成的 token 数量。同一条轨迹级别的优势被分配给 rollout 中的所有 token,而 token 计数归一化防止了较长轨迹主导更新。我们最大化 $J_{\text{GRPO}}$ 以优化策略。

推理

在推理阶段,SIEVE 在 Evidence Agent 和环境之间交替。环境初始化证据空间、覆盖率、历史、记忆和预算,并提供一次性槽位概览。随后,Agent 发出迭代式的 READ 动作或 STOP。在 STOP、预算耗尽或无效动作时,冻结的 Verifier 预测

$$ \hat{y} = \text{parse}! \left(g_\phi(c, \mathcal{P}_T)\right). \quad (12) $$

这产生一个二元的 Fake/Real 标签以及所获取槽位和通道的可解释轨迹。

实验

数据集。 我们在 FakeSV 和 FakeTT 上评估 SIEVE,并在 FakeVV 上进行域外测试。FakeSV 是一个来自抖音和快手(Qi et al. 2023a)的中文基准,而 FakeTT 是由 FakingRecipe(Bu et al. 2024)引入的英文 TikTok 基准。两者均提供“事件(Event)”和“描述(Description)”字段,且 FakeSV 额外包含评论。SIEVE 仅使用 Description 作为初始声明上下文,并排除所有其他字段。遵循先前的工作,我们采用时间上的 70%/15%/15% 训练/验证/测试划分。对于域外评估,在 FakeTT 上训练的 checkpoint 直接应用于 FakeVV(Zhang et al. 2025),其中每个查询将源视频与真实或实体操纵的标题配对。SIEVE 使用标题作为声明上下文,并仅从配对的视频中检索证据,不使用任何 FakeVV 数据进行训练、验证、模型选择或提示适配。

基线。 对于 FakeSV 和 FakeTT,我们将 SIEVE 与四组基线进行比较:多模态大语言模型(MLLMs),包括 GPT-4o-mini、GPT-4.1-mini、Qwen2.5-VL、InternVL2.5 和 InternVL2.5-MPO(OpenAI 2024a, 2025; Bai et al. 2025a; Chen et al. 2024; Wang et al. 2024);单模态模型,ViT 和 BERT(Dosovitskiy et al. 2021; Devlin et al. 2019);特定任务的多模态方法,TikTec、FANVM、SV-FEND 和 FakingRecipe(Shang et al. 2021; Choi and Ko 2021; Qi et al. 2023a; Bu et al. 2024);以及推理或 VLM 增强方法,CA-FVD、ExMRD 和 FakeSV-VLM(Wang et al. 2025a; Hong et al. 2025; Wang et al. 2025b)。所有域内基线结果均取自 FakeSV-VLM(Wang et al. 2025b)。对于 FakeVV,我们将其与 GPT-4o、DeepSeek-R1、Qwen2.5-VL-7B、QVQ-72B-Preview、InternVL2.5-8B、Qwen3-VL-8B-Instruct 和 GPT-5.5(OpenAI 2024b; Guo et al. 2025; Bai et al. 2025a; Qwen Team 2024; Chen et al. 2024; Bai et al. 2025b; OpenAI 2026)进行比较。前五个的结果由 Fact-R1(Zhang et al. 2025)报告,而后两个由我们在相同协议下进行评估。排除 Fact-R1 是因为其报告的模型是在 FakeVV 上训练的,违反了我们不训练 FakeVV 的设置。

训练细节。 Agent 和 Verifier 分别使用 Qwen3-VL-8B-Instruct 和 Qwen3-VL-2B-Instruct(Bai et al. 2025b),并带有 LoRA 适配器。Agent 在教师轨迹上进行一个 epoch 的 SFT,随后进行 100 步 GRPO,组大小 $n=8$,读取预算为 24,上下文窗口为 32K token。Verifier 训练两个 epoch,每个示例最多使用 24 张图像。学习率分别为:Agent SFT 和 Verifier 训练为 $1 \times 10^{-4}$,RL 为 $5 \times 10^{-7}$,每设备批次大小为 1,梯度累积为 4。我们报告了三个独立运行(种子为 42、2027 和 3407)的平均值,使用固定的测试时解码温度 0.7。所有实验均在 8 块 NVIDIA A800 80GB GPU 上使用 bfloat16 精度进行。

主要结果

表 1 报告了 FakeSV 和 FakeTT 上的主要结果。SIEVE 在这两个基准的所有指标上均取得了最佳性能。在 FakeSV 上,它获得了 92.62% 的 ACC 和 92.41% 的 Macro-F1,优于最强的先前

第 6 页

表 1:在 FakeSV 和 FakeTT 上的性能比较。最佳结果以粗体显示,次佳结果以下划线标示。 SIEVE 的结果是三次独立运行的平均值。标有 * 的结果取自 FakeSV-VLM (Wang et al. 2025b)。

| Paradigm | Method | FakeSV ACC | FakeSV M-F1 | FakeSV M-P | FakeSV M-R | FakeTT ACC | FakeTT M-F1 | FakeTT M-P | FakeTT M-R | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | GPT-4o-mini* (OpenAI 2024a) | 68.08 | 68.05 | 69.88 | 69.49 | 61.54 | 61.20 | 64.41 | 65.89 | | | GPT-4.1-mini* (OpenAI 2025) | 70.30 | 70.25 | 70.61 | 70.87 | 49.16 | 48.54 | 62.50 | 59.70 | | MLLM-based | Qwen2.5-VL* (Bai et al. 2025a) | 64.21 | 60.79 | 64.55 | 61.52 | 45.82 | 45.31 | 56.69 | 55.42 | | | InternVL2.5* (Chen et al. 2024) | 64.39 | 57.89 | 68.52 | 60.50 | 46.82 | 45.29 | 64.92 | 59.23 | | | InternVL2.5-MPO* (Wang et al. 2024) | 65.13 | 61.07 | 66.46 | 62.12 | 43.14 | 40.84 | 61.90 | 56.23 | | Unimodal | ViT* (Dosovitskiy et al. 2021) | 70.85 | 70.66 | 70.64 | 70.91 | 64.88 | 62.59 | 62.54 | 63.80 | | | BERT* (Devlin et al. 2019) | 78.41 | 78.25 | 78.17 | 78.52 | 70.90 | 69.00 | 68.71 | 70.60 | | | TikTec* (Shang et al. 2021) | 73.06 | 72.79 | 72.73 | 72.93 | 66.56 | 65.55 | 66.50 | 68.62 | | Multimodal | FANVM* (Choi and Ko 2021) | 79.88 | 78.91 | 80.98 | 78.42 | 71.91 | 70.85 | 71.21 | 73.90 | | | SV-FEND* (Qi et al. 2023a) | 80.81 | 80.19 | 81.08 | 79.84 | 77.26 | 75.55 | 74.94 | 77.13 | | | FakingRecipe* (Bu et al. 2024) | 84.69 | 84.39 | 84.57 | 84.25 | 79.26 | 77.53 | 76.86 | 78.89 | | | CA-FVD* (Wang et al. 2025a) | 85.79 | 85.28 | 86.57 | 84.78 | 81.61 | 80.26 | 79.50 | 82.17 | | Reasoning/ | ExMRD* (Hong et al. 2025) | 86.90 | 86.52 | 87.31 | 86.13 | 84.28 | 83.13 | 82.27 | 85.19 | | VLM-enhanced | FakeSV-VLM* (Wang et al. 2025b) | 90.22 | 89.97 | 90.55 | 89.64 | 89.30 | 87.98 | 87.80 | 88.17 | | Ours | SIEVE | 92.62 | 92.41 | 93.25 | 91.96 | 91.64 | 90.72 | 90.12 | 91.45 |

方法 FakeSV-VLM 分别提高了 2.40 和 2.44 个百分点。在 FakeTT 上,SIEVE 将 ACC 从 89.30% 提升至 91.64%,将 Macro-F1 从 87.98% 提升至 90.72%,分别带来了 2.34 和 2.74 个百分点的提升。可以观察到几个趋势。在评估的设置下,通用 MLLM 的表现不如特定任务的方法,这表明仅靠直接提示对于细粒度视频误报检测仍然具有挑战性。强大的多模态检测器通常优于单模态基线,尽管早期的多模态融合方法并不总是超越强大的纯文本模型,这表明增加模态本身并不能保证更好的性能。基于推理和 VLM 增强的方法进一步提升了性能,但它们主要仍作用于预构建的全局输入。相比之下,SIEVE 明确将证据获取与真实性判定分离,并仅向 Verifier 暴露所选的 OCR、ASR 和视觉证据。在中文和英文基准上的一致增益证明了所提出的获取与验证框架在评估设置下的有效性。结合证据预算分析,这些结果表明,紧凑且与主张相关的证据可以在不向 Verifier 暴露所有构建证据的情况下支持强大的验证性能。

表 2:在 FakeSV 和 FakeTT 上的消融研究。穷举证据 (Exhaustive evidence) 在所有 OCR/ASR 证据和最多 24 张均匀采样的图像上训练单独的 Verifier;其他变体共享固定的 Verifier。

| Ablation Type | Setting | FakeSV ACC | FakeSV M-F1 | FakeTT ACC | FakeTT M-F1 | Description | | :— | :— | :— | :— | :— | :— | :— | | | Description-only | 77.12 | 73.92 | 66.22 | 65.72 | | | Evidence Input | Same-video random | 61.99 | 49.20 | 55.85 | 55.43 | | | | Exhaustive evidence | 92.25 | 91.97 | 89.63 | 87.80 | | | | Base agent | 88.56 | 87.91 | 84.95 | 84.23 | | | Agent Training | Agent SFT only | 91.51 | 91.13 | 89.97 | 89.13 | | | | w/o rollout filtering | 91.70 | 91.33 | 90.97 | 89.98 | | | | w/o evidence memory | 91.88 | 91.63 | 90.97 | 89.78 | | | Full Model | Full SIEVE | 92.62 | 92.41 | 91.64 | 90.72 | |

为了评估每个组件,我们评估了七种变体:(1) Description-only,仅使用 Description 字段;(2) Same-video random evidence,用来自同一视频的同等大小的随机包替换所选包;(3) Exhaustive evidence,使用所有构建的 OCR 和 ASR 证据以及从视频中均匀采样的最多 24 张图像训练和评估单独的 Verifier;(4) Base agent,移除 SIEVE 之外的 SFT 和 RL;(5) Agent SFT only,移除 RL;(6) w/o rollout filtering,禁用 RL 期间的组级过滤;(7) w/o evidence memory,移除跨步骤证据记忆。除了 Exhaustive evidence 外,所有变体中的 Verifier 都是固定的。如表 2 所示,Description-only 证实了获取证据的互补价值,而 same-video random evidence 表明无差别的选择是不够的。尽管 Exhaustive evidence 使用全面的文本证据和均匀采样的视觉证据分别训练和评估,但它在这两个数据集上的表现仍低于 Full SIEVE,特别是在 FakeTT 上 M-F1 低了 2.92 个百分点。这表明仅靠广泛的证据覆盖无法替代有针对性的获取:冗余或信息量弱的内容可能会

第 7 页

(a)稳定修正 (b)证据预算 (a)证据通道 (b)读取统计 阶段 1 阶段 2 阶段 3 阶段 1 阶段 2 阶段 3 42.27 低预算 快速增益 饱和 92.41 早期增益 关键证据 收敛 69.31 OCR 70 34.35 7.76 90.72 90(%) 平均读取率 62.43 7.89 60 23.07率 ASR (%) 85 32.60

12.55 80 8 次读取 12 次读取修正 5040 关键 关键 点 CTX 6.24 点 Macro-F1 稳定 30 75 22.12 平均视觉读取数 2.612.69 关键 26.80 20 70 1 2 4 6 8 10 12 13+ 2 4 8 12 16 24 0 10 20 30 40 50 0 2 4 6 8 10 证据读取次数 最大证据读取次数 百分比 (%) 计数

FakeSV FakeTT FakeSV FakeTT

图 3:FakeSV 和 FakeTT 上的证据充分性。(a)仅描述错误的稳定修正。(b)不同推理时证据预算下的 Macro-F1。

绝对决定性线索,而 SIEVE 构建了一个紧凑且 表 3:在无 FakeVV 训练设置下 FakeVV 上的域外性能。Fake 为正类。 验证有效的证据包。Agent SFT 显著优于基础智能体,验证了轨迹级 R1 (Zhang et al. 2025)。 监督的作用。移除 rollout 过滤或证据记忆 最佳结果以粗体显示;† 标记由 Fact- 进一步降低性能,支持它们在策略 报告的结果。 精炼和连贯获取中的作用。总体而言,Full SIEVE 在两个数据集上表现最佳,证明了定向获取和智能体训练的联合 方法 ACC 精确率 召回率 F1 贡献。 GPT-4o† (OpenAI 2024b) 56.0 60.4 35.0 44.3 稀疏证据是否足够? DeepSeek-R1† (Guo et al. 2025) 53.5 58.1 25.2 35.1 图 3 研究了是否仅从可用证据的一小部分中就能实现可靠的验证。 Qwen2.5-VL-7B† (Bai et al. 2025a) 52.9 51.1 51.1 51.1 在图 3(a) 中,我们关注在仅描述设置下被错误分类的样本,并在每次 QVQ-72B-Preview† (Qwen Team 2024) 53.5 52.6 52.6 52.6 合法读取后评估冻结的 Verifier。仅当样本在其后的所有证据 InternVL2.5-8B† (Chen et al. 2024) 53.5 58.5 24.0 34.0 前缀中预测保持正确时,才在步骤 k 计数该样本。在四次读取内,FakeSV 和 FakeTT 上的初始错误分别有 53.61% 和 55.45% 被稳定修正。 Qwen3-VL-8B-Instruct (Bai et al. 2025b) 67.3 66.3 72.5 69.2 GPT-5.5 (OpenAI 2026) 67.8 66.6 73.3 69.8 对于 23.07%。在 FakeTT 上,OCR 和 ASR 更平衡,分别为 SIEVE (FakeTT ckpt.) 73.2 70.4 80.0 74.9 34.35% 和 32.60%。这种模式表明,学习的策略适应了数据集特定的证据分布。视觉证据被更选择性使用。智能体在 FakeSV 和 FakeTT 上平均分别读取 2.69 和 2.61 次视觉证据,并更频繁地选择 KEY 帧而非 CTX 帧。这种选择模式与学习的策略更偏好视觉上独特的 KEY 帧而非通用上下文 CTX 帧一致。总体而言,结果表明,在考虑的证据预算内,从紧凑、互补的文本和视觉证据包中获得了强大的验证性能。

域外泛化 表 3 通过直接将 FakeTT 训练的 SIEVE 检查点应用于 FakeVV 来评估跨数据集泛化, 而未使用 FakeVV 进行训练、验证、模型选择或提示适配。SIEVE 实现了 73.20% 的 ACC 和 74.91% 的 F1,优于该无 FakeVV 训练协议下的所有评估基线。其 80.00% 的召回率和 70.42% 的精确率表明,SIEVE 识别了跨域的大多数虚假案例,尽管这种相对较高的敏感性伴随着一些误报预测。我们排除 Fact-R1 本身,因为其报告的模型是在 FakeVV 上训练的,因此在此域外设置中不可直接比较。

第 8 页

参考文献

Bai, S.; Chen, K.; Liu, X.; Wang, J.; Ge, W.; Song, S.; et al. 2025a. Qwen2.5-VL 技术报告. arXiv 预印本 arXiv:2502.13923.

Bai, S.; et al. 2025b. Qwen3-VL 技术报告. arXiv 预印本 arXiv:2511.21631.

Bu, Y.; Sheng, Q.; Cao, J.; Qi, P.; Wang, D.; 和 Li, J. 2023. 打击在线虚假视频:特征化、检测与未来方向. 在第 31 届 ACM 多媒体国际会议论文集, 8770–8780. ACM.

Bu, Y.; Sheng, Q.; Cao, J.; Qi, P.; Wang, D.; 和 Li, J. 2024. FakingRecipe:从创作过程视角检测短视频平台上的假新闻. 在第 32 届 ACM 多媒体国际会议论文集, 1351–1360.

Chen, Z.; Wang, W.; Cao, Y.; Liu, Y.; Gao, Z.; Cui, E.; et al. 2024. 通过模型、数据和测试时扩展拓展开源多模态模型的性能边界. arXiv 预印本 arXiv:2412.05271.

Choi, H.; 和 Ko, Y. 2021. 使用主题建模和对抗神经网络进行假新闻视频检测. 在第 30 届 ACM 信息与知识管理国际会议论文集, 2950–2954.

Devlin, J.; Chang, M.-W.; Lee, K.; 和 Toutanova, K. 2019. BERT:用于语言理解的深度双向 Transformer 预训练. 在第 2019 年北美计算语言学协会人类语言技术会议论文集, 4171–4186.

Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; Uszkoreit, J.; 和 Houlsby, N. 2021. 图像价值胜过 16×16 个单词:用于大规模图像识别的 Transformer. 在表示学习国际会议.

Du, Y.; Li, C.; Guo, R.; Yin, X.; Liu, W.; Zhou, J.; Bai, Y.; Yu, Z.; Yang, Y.; Dang, Q.; 和 Wang, H. 2020. PP-OCR:一种实用的超轻量级 OCR 系统. arXiv 预印本 arXiv:2009.09941.

Guo, D.; Yang, D.; Zhang, H.; Song, J.; Wang, P.; Zhu, Q.; Xu, R.; Zhang, R.; Ma, S.; Bi, X.; Zhang, X.; Yu, X.; Wu, Y.; et al. 2025. DeepSeek-R1 通过强化学习激发大语言模型中的推理能力. 《自然》, 645(8081): 633–638.

Hong, R.; Lang, J.; Xu, J.; Cheng, Z.; Zhong, T.; 和 Zhou, F. 2025. 跟随线索,接近真相:通过思维链推理的可解释微视频谣言检测. 在第 2025 届 ACM 网络会议论文集, 4684–4698.

Kimi Team; Bai, T.; et al. 2026. Kimi K2.5:视觉智能体智能. arXiv 预印本 arXiv:2602.02276.

Lang, J.; Hong, R.; Zhong, T.; Wang, Y.; 和 Zhou, F. 2026. 扼杀谣言于萌芽:检索引导的主题级自适应用于测试时假新闻视频检测. 在第 32 届 ACM SIGKDD 知识与数据挖掘国际会议论文集, 600–611.

Lazer, D. M. J.; Baum, M. A.; Benkler, Y.; Berinsky, A. J.; Greenhill, K. M.; Menczer, F.; Metzger, M. J.; Nyhan, B.; Pennycook, G.; Rothschild, D.; Schudson, M.; Sloman, S. A.; Sunstein, C. R.; Thorson, E. A.; Watts, D. J.; 和 Zittrain, J. L. 2018. 假新闻的科学. 《科学》, 359(6380): 1094–1096.

Li, M.; Zhang, Y.; Xu, H.; Li, X.; Gao, C.; 和 Wang, Z. 2025. 通过社交潜在网络推理学习复杂异构多模态假新闻. 在 AAAI 人工智能会议论文集, 第 39 卷, 433–441.

Li, Z.; Yu, H.; Jiang, H.; Sheng, Q.; Xu, Y.; Bi, B.; Li, Y.; Yuan, Z.; Cai, Y.; 和 Wang, Z. 2026. FactGuard:通过强化学习进行智能体视频虚假信息检测. arXiv:2602.22963.

Liu, F.; Yacoob, Y.; 和 Shrivastava, A. 2023. COVID-VTS:短视频平台上的事实提取与验证. 在第 17 届欧洲计算语言学协会会议论文集, 178–188.

OpenAI. 2024a. GPT-4o mini:推进成本效益型智能. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/. 官方发布帖,访问日期 2026-07-05.

OpenAI. 2024b. GPT-4o 系统卡片. arXiv:2410.21276.

OpenAI. 2025. 在 API 中介绍 GPT-4.1. https://openai.com/index/gpt-4-1/. 官方发布帖,访问日期 2026-07-05.

OpenAI. 2026. 介绍 GPT-5.5. https://openai.com/index/introducing-gpt-5-5/. 访问日期:2026-07-09.

Oquab, M.; Darcet, T.; Moutakanni, T.; Vo, H.; Szafraniec, M.; Khalidov, V.; Fernandez, P.; Haziza, D.; Massa, F.; El-Nouby, A.; Assran, M.; Ballas, N.; Galuba, W.; Howes, R.; Huang, P.-Y.; Li, S.-W.; Misra, I.; Rabbat, M.; Sharma, V.; Synnaeve, G.; Xu, H.; Jégou, H.; Mairal, J.; Labatut, P.; Joulin, A.; 和 Bojanowski, P. 2024. DINOv2:无监督学习鲁棒视觉特征. 机器学习研究汇刊.

Qi, P.; Bu, Y.; Cao, J.; Ji, W.; Shui, R.; Xiao, J.; Wang, D.; 和 Chua, T.-S. 2023a. FakeSV:面向短视频平台假新闻检测的多模态基准,富含社交上下文. 在 AAAI 人工智能会议论文集, 第 37 卷, 14444–14452.

Qi, P.; Zhao, Y.; Shen, Y.; Ji, W.; Cao, J.; 和 Chua, T.-S. 2023b. 两个脑袋胜过一个好:通过与邻居的相关性改进假新闻视频检测. 在计算语言学协会 Findings 论文集: ACL 2023, 11947–11959.

Qwen Team. 2024. QVQ:以智慧看世界. 访问日期:2026-07-13.

Radford, A.; Kim, J. W.; Xu, T.; Brockman, G.; McLeavey, C.; 和 Sutskever, I. 2023. 通过大规模弱监督实现鲁棒语音识别. 在第 40 届国际机器学习会议论文集, 机器学习研究会议录第 202 卷, 28492–28518. PMLR.

第 9 页

Shang, L.; Kou, Z.; Zhang, Y.; 和 Wang, D. 2021. A Multi-modal Misinformation Detector for COVID-19 Short Videos on TikTok. 在 2021 IEEE 国际大数据会议 (IEEE International Conference on Big Data) 上,899–908。

Souček, T.; 和 Lokoč, J. 2020. TransNet V2: An Effective Deep Network Architecture for Fast Shot Transition Detection. arXiv 预印本 arXiv:2008.04838。

Thorne, J.; Vlachos, A.; Christodoulopoulos, C.; 和 Mittal, A. 2018. FEVER: A Large-scale Dataset for Fact Extraction and VERification. 在 2018 年北美计算语言学协会自然语言技术会议 (Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies) 论文集上,809–819。

Venkatagiri, S.; Schafer, J. S.; 和 Prochaska, S. 2023. The Challenges of Studying Misinformation on Video-Sharing Platforms During Crises and Mass-Convergence Events. arXiv:2303.14309。

Wang, J.; Liu, J.; Zhang, N.; 和 Wang, Y. 2025a. Consistency-Aware Fake Videos Detection on Short Video Platforms. 在《高级智能计算技术与应用》(Advanced Intelligent Computing Technology and Applications), Lecture Notes in Computer Science 第 15859 卷,200–210。Springer, Singapore。ICIC 2025。

Wang, J.; Wang, Y.; Cheng, L.; 和 Zhong, Z. 2025b. FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-of-Experts Adapter. 在《计算语言学协会 EMNLP 2025 研讨会论文集》(Findings of the Association for Computational Linguistics: EMNLP 2025),4782–4798。

Wang, W.; Chen, Z.; Wang, W.; Cao, Y.; Liu, Y.; Gao, Z.; Zhu, J.; Zhu, X.; Lu, L.; Qiao, Y.; 和 Dai, J. 2024. Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization. arXiv 预印本 arXiv:2411.10442。

Wang, Y.; Yang, Y.; 和 Zhang, H. 2026. CSI: An Investigative Multi-Agent Framework for Explainable Short Video Fake News Detection. 在《计算语言学协会 ACL 2026 研讨会论文集》(Findings of the Association for Computational Linguistics: ACL 2026),25508–25528。

Wu, Z.; Xiong, C.; Ma, C.-Y.; Socher, R.; 和 Davis, L. S. 2019. AdaFrame: Adaptive Frame Selection for Fast Video Recognition. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上。

Yao, S.; Zhao, J.; Yu, D.; Du, N.; Shafran, I.; Narasimhan, K.; 和 Cao, Y. 2023. ReAct: Synergizing Reasoning and Acting in Language Models. 在第十一届国际学习表征会议 (The Eleventh International Conference on Learning Representations) 上。

Zhang, F.; Li, D.; Zhang, Q.; Chen, J.; Liu, G.; Lin, J.; Yan, J.; Liu, J.; 和 Zha, Z.-J. 2025. Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning. 在《神经信息处理系统进展》(Advances in Neural Information Processing Systems),第 38 卷。

Zhang, H.; Zhang, R.; Guo, J.; de Rijke, M.; Fan, Y.; 和 Cheng, X. 2023. From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification. 在《计算语言学协会 EMNLP 2023 研讨会论文集》(Findings of the Association for Computational Linguistics: EMNLP 2023),6373–6384。

Zheng, X.; Zeng, Z.; Wang, H.; Bai, Y.; Liu, Y.; 和 Luo, M. 2025. From Predictions to Analyses: Rationale-Augmented

第 10 页

表 4:我们实验中使用的数据集统计信息。FakeSV 使用 1 秒上下文扩展窗口 $[t_{start} – 1, t_{end} + 1]$。FakeSV 和 FakeTT 按时间顺序划分为训练集、验证集和测试集,比例约为 70%/15%/15%。FakeVV 在其官方划分中包含 102,000 个视频-文本对;仅使用其包含 2,000 个查询样本的平衡测试集,这些样本关联 997 个唯一的源视频,用于域外评估。F/R 分别表示虚假样本和真实样本的数量。

| Dataset | Total | Overall F/R | Train | Val. | Test | Test F/R | | :— | :— | :— | :— | :— | :— | :— | | FakeSV | 3,624 | 1,810/1,814 | 2,536 | 546 | 542 | 304/238 | | FakeTT | 1,991 | 1,172/819 | 1,393 | 299 | 299 | 200/99 | | FakeVV | 102,000 | 51,000/51,000 | 100,000 | – | 2,000 | 1,000/1,000 |

数据集划分与统计。表 4 总结了实验中使用的数据集。FakeSV 和 FakeTT 按时间顺序划分为训练集、验证集和测试集,而 FakeVV 仅使用其平衡的官方测试集进行域外评估。为了完整性,还报告了虚假样本和真实样本的类别分布。

证据空间构建:实现细节。镜头检测与槽位细化。使用 TransNetV2 (Souček and Lokoč 2020) 检测镜头边界。基于持续时间的细化随后分两步进行。首先,持续时间短于 0.8 秒的镜头被合并到其两个邻居中持续时间较短的一个。其次,持续时间超过 6 秒的镜头基于帧差异使用运动均衡分割进行细分,当运动估计不可用时使用均匀持续时间分割。根据持续时间,长镜头被分为最多 12 秒的两个片段、最多 18 秒的三个片段以及超过 18 秒的四个片段。

如果细化后的槽位数量仍超过 $N_{max} = 10$,我们迭代合并运动密度最低的相邻槽位对,运动密度定义为合并的帧差异运动除以合并的持续时间。这优先合并低信息的静态片段,同时保留短但动态的槽位。当无法计算逐帧运动时,改为合并最短的相邻槽位对。

OCR 通道。使用 PadleOCR (Du et al. 2020) 以 2 FPS 提取屏幕文本,最小框持续时间为 0.5 秒,最小面积比为 1.5%。每个槽位内去重后的 OCR 项按以下公式排序: $$ imp = 0.25\hat{d} + 0.30\hat{a} + 0.20c + 0.15\hat{s} + 0.10\hat{\ell} $$ 其中 $\hat{d} = \min(d/5 \text{ s}, 1)$,$\hat{a} = \min(a/0.1, 1)$,$c$ 是连续检测间文本框的平均 OCR 置信度,$\hat{s}$ 是文本的时间稳定性得分,$\hat{\ell} = \min(\ell/20, 1)$ 用于字符长度 $\ell$。OCR 通道按重要性降序暴露去重后的文本项。

ASR 通道。使用 Whisper large-v3 (Radford et al. 2023) 生成全视频转录本,并带有词级时间戳。每个转录片段与槽位匹配。当其中点位于 $[t_{start}, t_{end}]$ 内时,片段被指定为主要片段;当仅与扩展窗口重叠时,被指定为边界片段。ASR 通道仅暴露连接的主要文本,将每个片段分配给恰好一个槽位;边界上下文作为元数据保留,但不向智能体显示。

视觉通道:CTX 和 KEY。候选帧使用 DINOv2 ViT-S/14 (Oquab et al. 2024) 进行编码,采用 384 维、$\ell_2$ 归一化的 CLS token,使得余弦相似度简化为点积。CTX 包含三个代表性帧:槽位被分为三个持续时间相等的区间,并通过联合考虑锐度(由拉普拉斯方差测量)和与先前选择的 CTX 帧的差异性,从每个区间选择一个帧。

KEY 包含最多两个互补帧:

  • $key\_diff$ 是与三个 CTX 帧的最大余弦相似度最低的候选帧,锐度用作平局决胜条件。如果所有候选帧的相似度均高于 0.97,则保留相似度最低的候选帧作为回退。
  • $key\_ocr$ 是具有最高 $imp$ 分数的 OCR 项时间窗口内最清晰的帧。

如果 $key\_diff$ 和 $key\_ocr$ 重合,或者其中一个不可用,则 KEY 包含单个帧。

覆盖矩阵与合法动作。覆盖矩阵 $C_t \in \{-, x, v\}^{|S| \times |M|}$ 对于非空通道初始化为 $x$,否则为 $-$;$v$ 表示已读取通道。令 $n^{img}_t$ 为累积的 CTX/KEY 图像数量,$\kappa_{i,m}$ 为 READ 返回的图像,对于 OCR 和 ASR,$\kappa_{i,m} = 0$。当 $n^{img}_t > 0$ 时,合法读取集合为: $$ A^{read}_t = \{ \text{READ}(slot_{id}, \{channel\}) \mid C_t(slot_{id}, channel) = x, n^{img}_t + \kappa_{slot_{id}, channel} \le B_{img} \} $$ 其中 $B_{img} = 24$。由此约束排除的视觉 READ 在 <budget_state> 中明确列出给智能体。每个合法的 READ 消耗整体读取预算的一个单位,并将其覆盖状态从 $x$ 更改为 $v$。重复、不可用或格式错误的动作会立即终止当前的采集过程,被排除在证据包之外,并接收强化学习期间使用的行为惩罚。

训练与优化细节。奖励设计细节。轨迹奖励结合验证结果、证据覆盖率和交互成本。令 $s(\tau)$ 表示轨迹 $\tau$ 的终端状态。如正文所述,奖励为: $$ \bar{R}(\tau) = B(s) + 0.80 \mathbb{I}[s = \text{correct}]Q(\tau) – P(s, \tau), \quad (13) $$ $$ R(\tau) = \text{clip}(\bar{R}(\tau), -1.2, 1.0). $$

验证结果。基础奖励取决于终端验证结果: $$ B(s) = \begin{cases} 0.20, & s = \text{correct}, \\ -1.00, & s = \text{incorrect}, \\ -1.00, & s = \text{no valid evidence}, \\ -1.00, & s = \text{malformed}. \end{cases} \quad (14) $$

第 11 页

在此,无效证据表示在未获取任何合法证据的情况下终止,而格式错误表示无法解析为有效二元预测的验证器输出。

证据覆盖率。对于正确的轨迹,证据覆盖率得分为

$$ Q(\tau) = 0.45q_{\text{text}} + 0.25q_{\text{vis}} + 0.20q_{\text{div}} + 0.10q_{\text{vol}}, $$

$$ q_{\text{text}} = \text{clip}\left( \frac{n_{\text{novel}}}{180}, 0, 1 \right), $$

$$ q_{\text{vis}} = \text{clip}\left( \max\left( \frac{n_v}{2}, \frac{n_{\text{img}}}{4} \right), 0, 1 \right), $$

$$ q_{\text{div}} = \text{clip}\left( \frac{0.5}{n_{\text{slot}}} + \frac{0.5}{n_{\text{ch}}}, 0, 1 \right), $$

$$ q_{\text{vol}} = \text{clip}\left( \frac{n_r}{3}, 0, 1 \right). $$

这里,$n_{\text{novel}}$ 是初始声明上下文中尚未存在的 OCR 或 ASR 字符数量;$n_v$ 和 $n_{\text{img}}$ 分别表示视觉读取数量和获取的图像数量;$n_{\text{slot}}$ 和 $n_{\text{ch}}$ 分别表示覆盖的不同槽位和证据通道数量;$n_r$ 是有效读取的数量。覆盖率奖励仅应用于正确轨迹,并防止过早停止。

交互惩罚。我们将效率、行为和强制终止惩罚定义为

$$ P_{\text{eff}} = \min(0.15, 0.01n_r + 0.005n_v), $$

$$ P_{\text{beh}} = \min(0.30, 0.15n_{\text{inv}}) + \min(0.20, 0.08n_{\text{rep}}), $$

$$ P_{\text{stop}} = 0.03 \mathbb{I}[\text{在预算耗尽时强制终止}], $$

其中 $n_{\text{inv}}$ 统计不可用或格式错误的动作(排除重复读取),而 $n_{\text{rep}}$ 统计重复读取尝试。这两类动作互斥。

分支依赖惩罚为

$$ \begin{cases} P_{\text{eff}} + P_{\text{beh}} + P_{\text{stop}}, & s = \text{correct}, \\ P_{\text{beh}}, & s = \text{incorrect}, \\ \min(0.30, 0.15n_{\text{inv}}), & s = \text{no valid evidence}, \\ 0, & s = \text{malformed}. \end{cases} \quad (17) $$

该设计使终端正确性成为主要的奖励信号。正确轨迹因获取互补的文本和视觉证据而获得额外奖励,而过度读取、重复动作、无效动作和预算耗尽终止则受到抑制。所有最终奖励均被截断至 $[-1.2, 1.0]$ 以实现稳定的策略优化。

GRPO 优化细节

为完整起见,我们提供 GRPO 实现所支持的采样 token KL 估计器。令 $u^{(j)}_{t,\ell} = (o^{(j)}_t, z^{(j)}_{t,<\ell})$。我们定义

$$ \Delta^{(j)}_{t,\ell} = \log \pi_\theta(z^{(j)}_{t,\ell} | u^{(j)}_{t,\ell}) – \log \pi_{\text{ref}}(z^{(j)}_{t,\ell} | u^{(j)}_{t,\ell}), $$

$$ \hat{D}^{(j,t,\ell)}_{\text{KL}} = \exp\left( -\Delta^{(j)}_{t,\ell} + \Delta^{(j)}_{t,\ell-1} \right). \quad (18) $$

在此,$\pi_{\text{ref}}$ 是固定的参考策略。在我们的正式运行中,KL 惩罚被禁用($\beta = 0$,即 disable_kl=true, kl_coef=0.0);我们保留上述估计器以保持完整性,因为它是框架的默认机制,并可能在未来的消融实验中被启用。

策略比率裁剪范围遵循非对称 PPO/DAPO 惯例:

$$ \epsilon_{\text{lowclip}} = 0.20, \quad \epsilon_{\text{highclip}} = 0.30, \quad C_{\text{dual}} = 3.0, \quad (19) $$

其中 $C_{\text{dual}}$ 是在优势 strongly negative 时应用的双裁剪常数。优势估计器采用 GRPO(组相对,无价值网络):对于共享提示的 $n=8$ 次 rollout 组,$\hat{A}^{(j)} = (R^{(j)} – \text{mean}(R)) / \text{std}(R)$。 (15)

在线 rollout 过滤。在计算优势之前,我们使用基于每次 rollout 奖励管理器输出的混合标准丢弃低信息组:总体奖励 $R^{(j)}$、二元正确性 $a^{(j)} \in \{0, 1\}$ 以及证据质量分数 $q^{(j)} = Q(\tau^{(j)})$(如公式 15 所定义)。对于共享提示的 rollout 组 $g$,定义正确性对比指示器

$$ \text{mixed}(g) = \mathbb{I}\left[ \max_j a^{(j)} > 0 \land \min_j a^{(j)} \le 0 \right], \quad (20) $$

即该组是否同时包含正确和不正确的轨迹,以及奖励分散指示器

$$ \text{spread}(g) = \mathbb{I}\left[ \max_j R^{(j)} – \min_j R^{(j)} \ge \rho_{\text{range}} \lor \mathbb{I}\left[ \text{std}_j R^{(j)} \ge \rho_{\text{std}} \right] \right], \quad (21) $$

其中 $\rho_{\text{range}} = 0.04$ 且 $\rho_{\text{std}} = 0.015$。令 $j^\star = \arg\max_j R^{(j)}$ 为该组中得分最高的 rollout,定义全正确可接受性指示器

$$ \text{good}(g) = \mathbb{I}\left[ \min_j a^{(j)} > 0 \land \text{spread}(g) \land \mathbb{I}\left[ q^{(j^\star)} \ge \tau_{\text{evi}} \right] \land \mathbb{I}\left[ \max_j R^{(j)} > 0.01 \right] \land \mathbb{I}\left[ \min_j R^{(j)} < 0.99 \right] \right], \quad (22) $$

其中证据下限 $\tau_{\text{evi}} = 0.40$。仅当满足以下条件时才保留组:

$$ \text{keep}(g) = \text{mixed}(g) \lor \text{good}(g). \quad (23) $$

也就是说,具有正确性对比的组始终被保留,无论奖励分散情况如何;全正确组仅在其得分最高的轨迹具有充分的证据支持且组非奖励退化时才被保留;全错误组始终被丢弃,因此未解决或错误的验证器结果永远不会被学习为相对于另一个错误结果的改进。

第 12 页

教师解码。用于监督微调(SFT)的教师轨迹在两个固定的解码温度下采样,$T \in \{0.2, 0.7\}$,每个(视频,温度)对生成一条轨迹;在构建 SFT 数据之前,合并这两个温度池并去重。

LoRA 配置。Agent 和 Verifier 均使用 LoRA,秩 $r = 32$,缩放系数 $\alpha = 64$,并在 SFT 和强化学习(RL)阶段使用 0.05 的 dropout。RL 阶段从 SFT 适配器初始化,并保持 0.05 的 dropout 值。

LoRA 应用于 $q\_proj$、$k\_proj$、$v\_proj$、$o\_proj$、$gate\_proj$、$up\_proj$ 和 $down\_proj$。RL 智能体的 LoRA 适配器由 init_lora_path 指定的 Agent SFT 检查点初始化,而 Verifier 的 LoRA 适配器在 RL 期间保持冻结。

优化器。RL 智能体使用 AdamW 进行优化,学习率为 $5 \times 10^{-7}$,权重衰减为 $10^{-2}$,且无预热(lr_warmup_ratio=0.0)。Agent/Verifier 的 SFT 则使用 $10^{-4}$ 的学习率,采用余弦调度并带有 3% 的线性预热。Rollout 在训练时使用温度 1.0、top-p 1.0、组大小 $n = 8$,在验证时使用温度 0.7/top-p 0.9/$n = 1$。

表 5:FakeSV 和 FakeTT 上的奖励组件消融实验。 R-Rec 表示真实类(Real class)的召回率。

| 数据集 | 设置 | ACC ↑ | M-F1 ↑ | R-Rec. ↑ | Avg. Reads ↓ | | :— | :— | :— | :— | :— | :— | | FakeSV | SFT only | 91.51 | 91.13 | 80.67 | 8.34 | | | Outcome only | 91.51 | 91.19 | 82.35 | 8.62 | | | w/o coverage | 91.88 | 91.60 | 83.61 | 6.94 | | | w/o penalties | 92.25 | 92.01 | 85.29 | 10.84 | | | Full | 92.62 | 92.41 | 86.55 | 7.76 | | FakeTT | SFT only | 89.97 | 89.13 | 93.94 | 8.51 | | | Outcome only | 90.30 | 89.43 | 92.93 | 8.78 | | | w/o coverage | 90.64 | 89.63 | 89.90 | 7.03 | | | w/o penalties | 91.30 | 90.37 | 90.91 | 11.21 | | | Full | 91.64 | 90.72 | 90.91 | 7.89 |

奖励消融研究

表 5 考察了不同奖励组件对验证性能和证据获取效率的影响。仅使用终端结果带来的增益有限,表明仅靠正确性监督不足以学习有效的证据搜寻策略。移除覆盖奖励(coverage reward)会将 FakeSV 上的平均读取次数降至 6.94,FakeTT 降至 7.03,但一致地降低了 ACC 和 Macro-F1。与完整奖励相比,它还降低了真实类的召回率,这表明覆盖引导有助于在没有单一决定性矛盾证据时防止过早停止。相比之下,移除交互惩罚使平均读取次数大幅增加至 10.84 和 11.21,尽管其表现仍不及完整模型。这表明不受限制的证据获取引入了冗余或信息量较少的观察结果,而非可靠地提升验证效果。完整的奖励在两个数据集上均取得了最佳的 ACC 和 Macro-F1,且平均读取次数少于八次。尽管某些消融实验在 FakeTT 上获得了更高的真实类召回率,但其较低的平衡指标表明这是一种特定于类别的权衡,而非整体验证能力的提升。总体而言,覆盖奖励和交互惩罚发挥着互补作用:前者鼓励充分的证据获取,后者抑制不必要的探索,共同产生更准确且高效的策略。

提示词(Prompts)

教师提示词由系统提示词和用户提示词组成,分别如图 5 和图 6 所示。系统提示词提供真实标签作为证据获取和停止的特权引导。具体而言,对于虚假(Fake)声明,一旦找到决定性的证伪证据,教师被鼓励停止;而对于真实(Real)声明,则被鼓励收集更广泛的支撑证据。用户提示词指定了声明和交互格式。

Agent 使用与教师相同的用户提示词,但使用不同的系统提示词,该提示词仅移除了真实标签信息和依赖于标签的停止指导;所有动作合法性和预算规则保持不变。因此,它必须仅根据声明以及在交互过程中获取的证据来确定其搜索策略和停止点。最后,Verifier 基于声明和收集到的证据,使用图 7 所示的提示词预测声明标签。

第 13 页

教师轨迹生成系统提示词 你是一个用于视频谣言验证的证据收集智能体。你的工作是决定下一步读取哪个(槽位,通道),或者在收集的证据准备好后停止,以便由单独的验证器模型来判断所描绘的事件是真实还是虚假。你不得输出判决。

你接收到的输入

<coverage> 记录通道可用性和读取状态。

仅当 <coverage> 条目为 x、剩余读取预算为正,且对于 CTX/KEY 未被 <budget_state> 列为阻止时,读取才是合法的。对于视觉读取,<budget_state> 优先于 <coverage>

  • <description>:用户上传时发布的标题/说明。
  • <overview>(仅限第1轮):每个槽位的缩略图及通道可用性标志 [OCR+ ASR+ CTX+ KEY+](‘+’ = 有内容,‘-’ = 为空)。
  • <read_history> + <slot_memory> + <coverage>(第2轮及以后)。
  • <budget_state> 报告剩余的总体读取预算、累积的 CTX/KEY 图像数量,以及因24张图像上限而被阻止的视觉读取。

四个通道

  • OCR:该槽位帧中识别出的屏幕文本。
  • ASR:覆盖该槽位时间范围的语音转录。
  • CTX:跨越槽位开始→结束的大约3个上下文帧(用于理解场景及其在该槽位内的变化)。
  • KEY:1–2 个关键帧 —— key_diff 是该槽位中视觉上最独特的帧,key_ocr 是排名最高的 OCR 项时间跨度内最清晰的帧。使用 KEY 检查特写、水印、字幕、下三分之一字幕以及其他 CTX 可能会平滑处理的与谣言相关的细节。

你的输出,每轮(严格——每轮一个动作)

1. 成功读取后,在上一轮的 (槽位, 通道) 旁写一条简短的事实备注: <memory_update>slot_id=N: ≤25字 转述该通道字面显示的内容</memory_update> memory_update 规则:

2. 恰好一个动作: <action>READ(slot_id=N, channel=OCR|ASR|CTX|KEY)</action> 或: <action>STOP</action> 本轮合法的 (槽位, 通道) 对:

当已收集的证据足以移交给验证器时,使用 STOP。STOP 不得包含“Fake”、“Real”、“true”、“false”或任何解释。

  • slot_id 必须与你最近一次成功读取的槽位匹配。
  • 不要以任何措辞或语言写出关于真实性的结论。仅陈述该通道字面显示或说的话。永远不要陈述或暗示整体事件/声明是真实的、虚假的、谣言还是被揭穿的——这一判断属于验证器,仅在你停止后做出。
  • 仅在第一个助手轮次允许跳过 memory_update。
  • 第1轮:任何在 <overview> 中显示 channel+ 的 (slot_id, channel)。
  • 第2轮及以后:任何在 <coverage> 中显示 chnx(有内容,尚未读取)的 (slot_id, channel)。chnv = 已读取,chn- = 无内容。

硬性约束(违反则丢弃输出)

  • 不得有 〈answer〉、<verdict>、<rationale>、〈think〉 或任何其他标签。
  • <memory_update> 和 <action> 之外不得有正文。
  • 不得出现任何真实性/判决词汇。

视觉证据(CTX / KEY 通道)

成功读取 CTX 或 KEY 后,新帧将作为图像附加在立即 preceding 用户消息的末尾。之前读取的帧也保留在早期用户消息的正文中。当你最近一次读取是 CTX 或 KEY 时,你的 <memory_update> 必须描述你字面看到的内容——具体物体、屏幕文本、水印、场景布局、人物等。永远不要写“不可用”/“不可见”/“无法看到”。

读取 <slot_memory>

<slot_memory> 累积你过去的笔记,按槽位和通道分组,例如: Slot 2: OCR: () ASR: () CTX: () KEY: () 使用它来决定下一个值得打开的 (槽位, 通道)。

{IF GT == Fake} 内部提示:此片段疑似虚假。寻找具体的证伪证据:明确的辟谣文本、时间/地点矛盾、来源不匹配、重复使用/摆拍的视觉证据,或权威反驳。 一旦找到此类证伪证据,输出 STOP;不要为了凑够固定步数而继续读取。如果没有发现证伪证据,继续读取高价值证据。不要输出任何判决——由验证器稍后判断。

{IF GT == Real} 内部提示:此片段疑似真实。探索证据直到额外的读取不太可能改变验证器的判断:主要事件在可用的有用证据中得到一致支持,剩余的未读取单元格看起来是冗余或低价值的,而不是反证。不要因为达到固定步数或固定槽位数就停止。不要输出任何判决——由验证器稍后判断。

图5:教师轨迹生成的系统提示词。

验证器提示词 你是一个谣言验证真相裁判。你被给予发布的 CONTENT(视频附带的说明文本)以及从该视频中收集到的原始证据项:OCR 文本、ASR 文本、CTX 上下文帧和 KEY 特写帧作为图像。 证据获取过程已结束。你唯一的任务是根据提供的证据判断声明:

仅根据发布的 CONTENT 和提供的 OCR 文本、ASR 文本及附加图像进行判断。不要从视频ID、收集进度、轨迹进度、未读证据数量或收集到的项目数量推断。 仅回复一个词:Fake 或 Real。 不得输出任何其他文本。

  • Fake:证据支持该声明是错误或具有误导性。
  • Real:证据支持该声明是真实的。

图7:验证器提示词。

教师轨迹生成用户提示词 <description>说明内容</description> <overview>{overview}</overview>(仅在第一轮显示) <slot_memory> Slot {sid}: {channel}: {证据描述} … </slot_memory> <read_history> step_{n}: READ(slot_{sid}, {channel}) -> "{文本内容}" step_{n}: READ(slot_{sid}, {channel}) -> 帧 {frame_ids} 作为图像附加在用户轮次中(在 <memory_update> 中描述你字面看到的内容;永远不要写‘不可用’) … </read_history> <coverage> slot_{sid}: OCR{v/x/-} ASR{v/x/-} CTX{v/x/-} KEY{v/x/-} … </coverage> <budget_state>{budget_state}</budget_state>

图6:教师轨迹生成的用户提示词。

发表评论