三分钟导读:OmniReasoner 是一种针对长音频视频推理的工具使用后训练框架,通过引入 TimeAnchor 解决跨采样率的时间锚定问题,并利用 Temporal Augmented Data Engine 合成数据,使模型学会自适应调用 zoom-in 工具获取高保真证据。
英文题目:OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
论文出处:arXiv 每日论文精选 · arXiv:2607.19339
原始论文:PDF / 论文页面
对应视频标题:OmniReasoner:原生工具调用实现长音频视频自适应推理|推荐指数:★★★★★
这篇论文解决什么问题?
长音频视频推理中,决定性证据往往稀疏且跨模态,全量高保真处理成本过高,而均匀下采样会丢失细粒度证据;现有方法多关注视觉证据,缺乏对音频-视频联合感知和跨模态交互的自适应工具调用训练。
核心创新
- 提出 OmniReasoner 框架,将长音频视频推理建模为工具使用决策问题,模型需学习何时及何地调用 zoom-in 工具。
- 引入 TimeAnchor 机制,通过绝对时间文本标记解决跨采样率(稀疏全局 vs 密集局部)的时间参数一致性问题。
- 构建 Temporal Augmented Data Engine,利用视频编辑和合成技术自动生成带区间监督的工具使用轨迹,无需人工标注。
方法概览
1. OmniReasoner 框架:模型先进行低成本全局预览,决定是直接回答还是调用 zoom-in 工具获取特定时间区间的高保真片段;2. TimeAnchor:在每2秒的音频-视频块前添加绝对时间文本标记,确保模型在稀疏预览和密集局部回放间切换时,时间参数保持一致;3. Temporal Augmented Data Engine:通过多段拼接和异常插入合成带区间标签的数据,并利用 MediaSandbox 生成全局到局部的工具使用轨迹,结合 SFT 和 RL 进行训练。
逐图理解论文
OmniReasoner 框架概览

OmniReasoner 将长音频视频推理建模为工具使用决策问题。模型先进行低成本全局预览,判断是直接回答还是调用 zoom-in 工具。该框架基于 Qwen2.5-Omni-7B,通过引入原生工具使用能力,使模型学会在稀疏预览和密集局部回放间切换,以获取高保真证据。
TimeAnchor 时间锚定机制

为解决跨采样率的时间参数一致性问题,OmniReasoner 引入 TimeAnchor。在每两秒的音频视频块前添加绝对时间文本标记。这确保模型在从稀疏全局预览切换到密集局部回放时,能准确定位时间区间,避免时间漂移导致的证据错位。
Temporal Augmented Data Engine

训练数据通过 Temporal Augmented Data Engine 合成。利用视频编辑技术创建长音频视频任务,并构造证据区间。MediaSandbox 将这些任务转换为全局到局部的工具使用轨迹,经筛选后形成 SFT 和难度感知的 RL 混合数据,无需人工标注。
SFT 与 RL 后训练流程

模型训练分为监督微调与强化学习两阶段。SFT 阶段使用合成数据学习工具调用格式和区间定位。随后进行 RL 训练,利用非退化组相对奖励优化策略。这种组合使模型从冷启动逐步适应复杂的长视频推理任务,提升决策稳定性。
主要基准性能表现

在 OmniVideoBench 上,OmniReasoner 获得 34.8 分,较基线提升 5.5 点。在 LVOmniBench 上达到 35.4 分,提升 3.4 点。在 VideoHolmes 上表现尤为突出,达到 40.0 分,大幅领先。这些结果验证了自适应工具调用在长视频理解中的有效性。
实验与关键结果
- 在 OmniVideoBench, LVOmniBench, Daily-Omni, WorldSense, VideoMME, VideoHolmes 等基准上进行评估。
- 分析不同视频时长和音频类型下的性能表现。
- 进行消融实验,验证数据配方、输入配置、训练阶段及 TimeAnchor 的有效性。
- 通过注意力滚动画布(Attention rollout)分析模型对局部证据的关注度。
- OmniVideoBench: 34.8 (+5.5)(第 7 页)
- LVOmniBench: 35.4 (+3.4)(第 7 页)
- VideoHolmes: 40.0 (+15.6)(第 7 页)
- 10-30 min 视频增益: 9.9 points(第 7 页)
- Charades-STA mIoU: 41.3 (+7.6)(第 9 页)
阅读时需要注意
- 基础设施限制:当前多轮 Agent RL 框架对全模态模型支持不足,主要基于 TRL 实现,不如文本/视觉成熟。
- 模型容量限制:基于 Qwen2.5-Omni-7B,上下文窗口有限,且基座模型缺乏大规模工具使用预训练,导致冷启动 RL 效果差。
- 工具范围局限:仅实现了单一的感知型 zoom-in 工具,未探索外部知识检索、代码执行等复杂工具。
- 训练数据包含公共音频视频资源,可能存在隐私敏感内容或版权限制,发布前需检查许可。
- 模型可能产生错误的时序定位或幻觉,高风险场景需人工验证。
- 直接 RL 优化可能导致策略漂移或格式丢失,必须经过 SFT 预热。
关联工作
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
OmniReasoner:通过原生工具使用进行长音频-视频推理
Yu Chen1,2,*, Caorui Li3,*, Ziyu Xiong3, Yidong Wang4, Mingqi Gao5, Shuman Liu4, Biao Liu3, Chunfeng Yang3, Anxiang Zeng4, Haibo Zhang4,†, Chaofan Chen6,†
1中国科学院大学, 2中国科学院自动化研究所, 3东南大学, 4Shopee, 5清华大学, 6北京工业大学 yu.chen.8525@gmail.com
摘要 长音频-视频推理对全模态大语言模型(omni-modal LLMs)而言颇具挑战,因为决定性证据往往稀疏、跨模态,且以统一的高保真度保留这些证据的成本过高。在一小时的录音中,决定性线索可能是一个短暂的视觉动作、一句简短的口语、一段背景音,或是视听内容在时间上的巧合。对于全模态大语言模型而言,以高保真度保留每一个如此分散的线索是极其昂贵的:密集的视频帧已经消耗了大量的上下文,而音频则在视觉序列之上引入了连续的令牌流。均匀下采样虽然保持了广泛的覆盖范围,但往往会移除决定答案的细粒度证据。我们引入 OmniReasoner,这是一种用于“通过长音频-视频进行思考”的工具使用后训练框架。全模态大语言模型通过监督微调和强化学习,学习在回答之前是否以及在哪里调用放大(zoom-in)工具。OmniReasoner 首先构建整个流的全局低成本预览,然后在需要时,通过请求特定的时间间隔来调用放大工具,以获取更高保真度的视觉和音频输入。我们引入 TimeAnchor,它保持工具的时间索引来自特定的采样率,从而使这些工具使用行为在不同粒度之间保持论证有效且往返一致,而不是绑定于帧。为了使这种工具使用行为可训练且无需昂贵的手动时间间隔标注,我们构建了一个时间增强数据引擎(Temporal Augmented Data Engine),通过视频编辑和合成合成工具使用的后训练轨迹。在跨全模态和视频基准的实验表明,OmniReasoner 在提高答案准确性和时间定位的同时,将高保真计算集中在信息丰富的区域。代码可在 https://github.com/RockyChen0205/OmniReasoner 获取。
1. 引言 长音频-视频推理要求全模态大语言模型(LLMs)(Xu et al., 2025a; Ye et al., 2025; Fu et al., 2025a) 连接在时间上稀疏且分布广泛的证据。在一小时的录音中,决定性线索可能是一个短暂的视觉动作、一句简短的口语、一段背景音,或是视听内容在时间上的巧合。对于全模态大语言模型而言,以高保真度保留每一个如此分散的线索是极其昂贵的:密集的视频帧已经消耗了大量的上下文,而音频则在视觉序列之上引入了连续的令牌流。均匀下采样虽然保持了广泛的覆盖范围,但往往会移除决定答案的细粒度证据。
近期的长视频方法通过超越一次性均匀感知来解决这种统一性困境。Agent 系统在回答前搜索相关帧或片段 (Wang et al., 2024),原生工具调用方法裁剪并重新检查有希望的片段 (Yang et al., 2025),自适应放大模型以局部分辨率换取全局覆盖范围 (Fu et al., 2025b),以及强化学习方法优化时间搜索策略 (Pan et al., 2025)。这些工作表明,长视频推理受益于选择性证据获取。然而,它们仍然主要围绕视觉证据设计:模型学习在哪里看,但它应如何共同决定看什么、听什么,以及两个模态之间的交互何时起决定性作用?
近期的全模态和音频-视频推理工作已开始探索跨视觉和听觉的联合感知,但它们从不同的角度构建问题。Omni-R1 使用双系统强化学习框架分解全局视频-音频推理和细粒度定位 (Zhong et al., 2025);EchoInk-R1 和 OmniVideo-R1 使用强化学习改进音频-视觉推理行为 (Xing et al., 2025; Chen et al., 2026);LatentOmni 探索全模态理解的统一音频-视觉潜在推理 (Dai et al., 2026);而 OmniGAIA 研究具有外部工具和主动感知能力的全模态Agent 。
† 通讯作者。
- 同等贡献。Yu Chen 的工作是在 Shopee 实习期间完成的。
第 2 页
当叙述者提到红烧 鲳鱼是当地菜肴时, 叙述者提到红烧 鲳鱼是当地菜肴时, 00:00 02:48 02:58 26:33 鲳鱼是当地菜肴时, A.2 B.3 C.4 D.5 F.6 第一轮思考 放大 〈think〉该视频是一部关于 中国美食的纪录片,特别关注 湖南省的烹饪传统。我 需要找到关于红烧鲳鱼及其与 当地渔民起源的具体叙述。在02:49左右(169 秒),叙述者发表了这一声明 “红烧鲳鱼曾是当地渔民的传统家常菜,蔡老师对其进行了改良。” 当地渔民。在169 秒左右,叙述者发表了这一声明 第二轮思考 同时展示了一碗该菜肴。我将放大 〈think〉放大片段中00:01到00:04的视频片段中,叙述者 stating, '红烧鲳鱼曾是当地渔民的traditional home- 到168到174秒左右的区间,以准确计算在此特定叙述期间碗中呈现的鱼类数量。这将允许对菜肴成分进行清晰观察,并确保准确计数。〈/think〉 cooked dish of local fishermen.' 在这段特定的叙述期间,屏幕上清晰地展示了一碗该菜肴。通过观察碗,可以清楚地看到三尾鲳鱼排列在酱汁中。每尾鱼都可以通过其在碗中的头部和身体形状来识别。因此,那一刻碗中恰好有三尾鱼。这个计数直接匹配选项B。〈/think〉〈answer〉B〈/answer〉
图1:OmniReasoner 推理示例。问题询问当叙述者提到红烧鲳鱼是当地菜肴时,碗中有几条鱼。OmniReasoner 首先确定02:49左右的相关叙述,并请求在该时刻附近进行放大间隔。在返回的片段中,叙述和碗被一起观察,使模型能够数出三尾鲳鱼。因此最终答案是选项B。
ception (Li et al., 2026b)。这些进展表 放大证据。因此,时间放大不是固定的 明全模态模型需要更强的感知能力。然而, 预处理规则,而是一种学习到的工具使用 核心训练目标通常是混合模态推理、时间定 行为:后训练的目标不仅是教会模型如何 位或开放世界工具使用,而不是媒体内部 回答,还要教会模型何时调用工具以及指向 问题,即模型应如何在长音频-视频流中 哪里。图1展示了一个具体的推理示例。 分配有限的高保真计算资源。 这种表述引发了一个特定于长音频-视频工具 人类很少通过检查每一帧和每个声音的 使用的工具参数 grounding 问题。先前的工 全保真度来解决这个问题。相反,我们快速 作表明,显式的时间标记、帧编号和时间感 浏览视频和音频以形成粗略的时间线,然 知表示可以提高视频时间定位能力 后将进度条拖回到可疑时刻,更仔细地看 (Chen et al., 2024; Wu et al., 2024; Zhang et al. 或听。这不仅仅是人类类比,而是一种计算 2026; Chen et al., 2025),但这些工作是在 策略,表明具有显式放大工具的全模态模型 单一固定保真度的视频中进行的。我们的设 应该决定是否需要更多证据、工具指向何 置不同:模型在一次工具调用中跨越不同的 处,以及如何使用返回的证据进行最终推理。 采样粒度——调用放大工具前的稀疏全局预 简而言之,我们希望通过后训练教会全模态 览和调用后的密集局部片段。在一个采样网 模型在长音频-视频中何时以及再次看向和 格下计算的帧索引参数无法在另一个网格下 倾听的位置。 解析到同一时刻,音频也不自然地遵循视觉 在本文中,我们引入了 OmniReasoner, 帧编号。受 ffmpeg 等媒体系统使用绝对时 一种用于“长音频-视频思考”的工具使用后 间对齐音频和视频的启发,我们引入了 训练框架。OmniReasoner 首先消耗低成本的 TimeAnchor,以便放大工具的时间参数在此 全局预览,要么直接回答,要么调用带有 边界上保持有效:诸如“检查32–38秒”的 请求时间间隔的放大工具进行更仔细的检查。 调用无论模型是在查看稀疏预览、密集放大 系统随后检索所请求间隔的高保真音频-视 片段还是相应的音频段,都解析到同一时刻。 频片段,模型基于全局上下文和 为了使这种工具使用行为可大规模训练,我们进一步构建了
2
第 3 页
基于编辑和组合生成工具使用后训练轨迹的时序增强数据引擎,为何时调用工具、指向何处以及如何从检索到的证据中回答提供监督。
我们的主要贡献如下:
❶ 我们提出了 OmniReasoner,这是一种用于长音频视频推理的工具使用后训练框架。在该框架中,全模态模型通过监督微调(SFT)和强化学习(RL)学习在回答之前决定是否以及在哪里调用放大(zoom-in)工具。
❷ 我们引入了 TimeAnchor,它确保放大工具的时间参数在模型在调用工具前后观察到的不同采样粒度之间保持有效且往返一致,而不是绑定于特定的帧网格。
❸ 我们构建了一个时序增强数据引擎和一种实用的后训练配方,以大规模合成工具使用轨迹,为何时调用放大工具、指向何处以及如何从检索到的证据中回答提供监督。
2 相关工作
2.1 长全模态视频推理
长视频理解结合了长上下文感知、时间定位和多步推理。最近的工作通过显式标记、 grounding 目标或时间感知视频表示来改善长视频推理 (Chen et al., 2024; Wu et al., 2024; Zhang et al., 2026)。对于视听输入,挑战更为严峻:决策性证据可能出现在视觉、音频或它们的时空重合中。最近的全模态推理模型因此探索了跨模态协作和时间感知全模态表示 (Du et al., 2025; Xing et al., 2025; Zhong et al., 2025; Chen et al., 2025; Xiao et al., 2025)。这些工作表明全模态模型需要具有时间结构的感知,但大多数仍然在固定的观察预算下处理证据,或在已经选择证据后优化推理。OmniReasoner 转而关注前面的决策:是否需要额外的证据,以及应在音频-视频时间轴的何处检索。
2.2 Agent 工具使用
另一条研究路线将长视频理解视为交互式证据获取。Agent 和工具使用后训练轨迹通过编辑和组合生成,为何时调用工具、指向何处以及如何从检索到的证据中回答提供监督 (Wang et al., 2024; Gao et al., 2026b; Fu et al., 2025b; Pan et al., 2025; Yang et al., 2025),而视频推理方法则鼓励思考、反思、验证或帧聚焦 (Wang et al., 2025; Li et al., 2025; He et al., 2025; Tang et al., 2025; Gao et al., 2026a)。这些工作支持了我们的动机,即长视频应以自适应方式检查,而非均匀消费。然而,它们主要在视觉证据上定义动作。OmniReasoner 则针对全模态工具使用后训练:它教导模型是否以及在哪里调用放大工具以获取高保真度的音频视频证据,并通过 TimeAnchor 保持工具的时间参数在调用前后观察到的采样粒度之间有效。
3 方法
3.1 OmniReasoner 概述
OmniReasoner 以时长为 $T$ 的长音频视频输入 $x$ 和问题 $q$ 作为输入。长音频视频推理涉及时间覆盖范围与感知保真度之间的张力。答案可能取决于短暂的视觉动作、简短的语音片段、声音事件或视听重合,而以高保真度处理整个流会在不相关的时刻浪费上下文。OmniReasoner 将其表述为针对原始时间轴的工具使用决策问题,如图 2 所示。
模型首先构建全局观察:
$$ g = \Phi_{\text{global}}(x), \quad (1) $$
该观察以较低的感知成本保留了输入的全部时间结构。基于 $g$ 和问题 $q$,策略做出工具使用决策:
$$ a_1 \sim \pi_\theta(\cdot \mid g, q), \quad (2) $$
其中 $a_1 \in \{\text{answer}(y), \text{zoom}([s, e])\}$,且 $0 \le s < e \le T$。当全局观察提供足够证据时使用回答动作。放大动作在原始时间轴上选择一个候选证据区间。对于选定的区间 $[s, e]$,媒体环境返回局部证据观察:
$$ z_{s:e} = \Phi_{\text{local}}(x, [s, e]), \quad (3) $$
该观察以更高的保真度暴露相应的音频视频内容。最终答案由
第 4 页
TimeAnchor
TimeAnchor: 文本时间戳 <t s> 音频令牌 视频令牌 00:00 15:40 15:60 30:22 令牌序列 音视频输入 s> <0
“…害怕吃完后 肠胃不适 放大 之后。…” s> <2
快速扫描 聚焦观察 综合思考 回答 s> <4 “视频中, 主角去了甲米 大语言模型 真实标签: 的夜市。他为什么 B. 因为她害怕 说不在夜市吃 吃完后 东西呢? TimeAnchor 会腹泻 A… B… C… D… ” 从 视觉编码器 音频编码器 …
以低帧率采样的低分辨率视频帧 视频音轨
图 2:OmniReasoner 概览。左侧:推理工作流。视觉编码器处理低帧率帧,音频编码器处理完整音轨;通过这种低成本的全局扫描和问题,OmniReasoner 要么直接回答,要么请求基于 TimeAnchor 的时间区间进行聚焦观察,返回的高保真局部音视频片段驱动综合思考和最终答案,强化学习在格式和准确性奖励下优化策略。右侧:TimeAnchor 如何形成音视频令牌序列。遵循 Qwen-Omni 的时间交错方式,流按绝对时间被分割为两秒的块,在每个块内视频令牌位于音频令牌之前;TimeAnchor 只需在每个块前添加纯文本绝对时间标记 <t 秒>,因此请求的区间 [s,e] 在稀疏全局预览和密集局部片段中对应同一时刻。
来自问题、全局观察和检索到的局部证据: y ∼πθ(· | g, q, zs:e). (4) 全局观察支持对整个输入的时间推理,而局部观察提供选定时刻周围细粒度的视听证据。
3.2 用于音视频定位的 TimeAnchor
Qwen-Omni 使用一种时间交错方案对音视频流进行编码:它按实际时间将流分割为两秒的块,并在每个块内将视频令牌置于音频令牌之前。因此,时间仅通过相对于实际采样帧定义的块索引隐式携带。这正是导致在缩放调用中断裂的原因:当模型从稀疏的全局观察移动到密集采样的局部片段时,相同的物理时刻落在不同的采样网格下,因此原始块或帧索引不再指向同一位置。
然而,zoom-in 工具以时间区间作为其参数,且该参数必须能够承受这种粒度的变化。
TimeAnchor 通过一种刻意简单的构造使该参数变为绝对值:在全局时间线的每两秒块的前面,它添加一个纯文本标记 <t 秒>(例如 <0 秒>、<2 秒>、…),将该块的交错视频和音频令牌绑定到原始流的墙上时钟时间。因此,策略以绝对秒数而非帧索引来读取和发出其缩放参数:诸如 zoom([32, 38]) 的决定表示源的第 32–38 秒,独立于任何阶段对视频采样的密集程度。媒体环境针对相同的绝对时间线解析该区间以裁剪高保真片段及其对齐的音频,因此请求的参数在工具调用前后都对应同一时刻。
TimeAnchor 在工具调用中保持该时间参数的一致性。
该机制不添加新的特殊令牌,不进行架构更改,也不设置单独的定位目标:锚点是普通的文本令牌,
第 5 页
QA 数据 SFT 轨迹数据 过滤 自策展数据 : 系统 工具使用轨迹 重复、损坏及 仅文本可回答 : 用户 工具使用指令 无效数据 项目 : 助手 低保真音频-视频 格式错误及 全对与全错 思考 + 工具调用 错误输出 问题 放大片段 思考 + 回答 OmniReasoner-SFT
辅助数据 直接回答轨迹
媒体沙盒 工具使用指令 低保真音频-视频 – 问题 思考 + 回答 – 问题类型
- 答案
强化学习数据
图 3:时间增强数据引擎及后训练数据。时间编辑通过构建的证据区间生成长音频-视频任务。MediaSandbox 将这些任务转换为从全局到局部的工具使用轨迹,过滤后得到用于训练 OmniReasoner 的 SFT 和难度感知强化学习混合数据。
由标准分词器产生的。因此,TimeAnchor 的贡献并非时间戳表示本身,而是放大工具的时间参数在必须跨越的保真度边界上保持一致的属性。 多段组合。我们将几个语义独立的片段拼接成更长的音频-视频流,并将每个问题附加到一个源片段上。组合后的视频记录了每个源片段的起始和结束偏移量,因此目标片段的偏移量直接成为证据区间。 3.3 时间数据引擎与后训练数据 这种构建方式将现有的短或中等长度的 QA 示例转化为长上下文任务:模型必须扫描时间干扰项,识别相关片段,并从局部证据而非均匀地从整个流中进行回答。 问答示例 用于长音频-视频的可扩展开放训练数据仍然有限,特别是在监督必须同时包含答案和证据区间时。 直接询问强大的多模态大语言模型(MLLMs)合成 QA 对,或在问题生成之前对音频/视频进行字幕标注,成本高昂且容易产生幻觉或在长流中产生跨模态不一致的证据。因此,我们构建了一个时间增强数据引擎,该引擎从时间编辑操作中派生监督信号。通过组合和局部替换视频片段,该引擎将现有的音频-视频资源转化为长形式推理任务,其证据区间由构建过程确定。这些任务经过辅助全模态数据的策展,形成 SFT 和强化学习后训练混合数据,如图 3 所示。 这些构建的任务提供了 OmniReasoner 所需的耦合信号:答案监督、绝对时间线上的区间监督,以及将全局决策与检索到的局部证据联系起来的工具使用轨迹监督。 时间增强任务构建。该引擎通过两种互补的任务族实例化时间增强,每种任务族旨在暴露不同的长音频-视频推理行为,同时保持证据区间的可用性。 异常插入。我们在长音频-视频流中采样一个时间窗口,并用一个短源片段替换音频流、视频流或两者。模型被训练以识别异常类型并定位异常区间。由于在编辑期间替换窗口是已知的,因此它提供了无需手动区间标注的区间标签。三种替换模式创建了互补的跨模态监督。 其他构建细节和数据统计信息在附录 A 中报告。 工具使用轨迹合成。构建的区间通过 MediaSandbox 转换为监督轨迹,MediaSandbox 是我们构建的一个基于 FFmpeg 的音频-视频沙盒,用于按需编辑、下采样和剪辑媒体。它暴露了推理时使用的相同的全局到局部接口:模型首先接收低保真的全局观察,然后要么直接回答,要么请求一个区间;当调用放大功能时,沙盒仅实例化请求的高保真局部片段。我们合成两种轨迹类型。工具使用轨迹
第 6 页
包含一个放大调用:模型观察全局视图,请求一个区间,接收局部片段,并基于两种观察结果进行回答。直接回答轨迹跳过放大步骤:当不需要局部证据时,模型直接从全局视图进行回答。我们在两种模式下生成这两种类型的轨迹。在在线合成中,教师模型不接收参考答案或区间,从头开始生成完整轨迹;该模式用于较短的视频和 AVQA-R1 示例,其中全局观察通常已足够。在后见合成中,教师模型接收参考答案和区间作为指导,但被明确指示不得将此监督信息泄露到推理过程中,从而生成基于可观察线索来论证放大决策的轨迹;该模式应用于更长、更具挑战性的视频,以提高样本利用效率。在这两种模式下,最终存储的轨迹均不包含答案或参考区间的泄露。
精心策划的 SFT 混合数据。我们从构建的时间任务和其他全模态数据中精心策划了 25,839 个 SFT 示例。按区间构建的组成和异常插入提供了按区间的监督;FineVideo (Farré et al., 2024) 添加了开放式长视频 QA 轨迹;AVQA-R1 (Xing et al., 2025) 保留了图像-音频推理覆盖范围;CG-Bench (Queen et al., 2025) 增加了公开长视频 QA 的多样性。在训练之前,我们应用结构、泄露、答案、区间和基于 LLM 的接地过滤器。
难度感知的 RL 数据。对于强化学习,我们从 SFT 策略下挖掘能产生有用奖励变化的问题。我们对每个候选样本采样多次 rollout,保留混合结果的示例,丢弃所有 rollout 都解决或所有 rollout 都遗漏的案例。我们进一步应用策略感知过滤,以确保所选示例在策略探索下保持格式良好:这包括问题类型一致性检查和答案格式验证。最终的 RL 混合数据包含 2,731 个示例;详细的混合数据统计信息和过滤标准在附录 A 中提供。
总体而言,数据配方教导 OmniReasoner 回答什么、何时检索更高保真度的证据,以及该证据在共享绝对时间轴上的位置。
3.4 代理强化学习
在监督微调之后,策略已经观察到有效的工具使用轨迹,并能够生成所需的答案或区间格式。因此,我们使用强化学习来优化决策质量,而不是从头开始发现交互协议。OmniReasoner 不为调用放大操作使用单独奖励:仅当放大操作在相同格式约束下改善最终答案时,才偏好放大动作。
我们使用组相对策略优化 (Group Relative Policy Optimization, GRPO) (Shao et al., 2024) 优化策略。对于每个提示,我们从旧策略中采样一组轨迹,其中每个轨迹要么直接回答,要么在生成最终答案之前调用放大。轨迹奖励在组内进行归一化以计算相对优势,并使用标准的截断 GRPO 目标更新策略。奖励设计有意简化,$R = R_{acc} + R_{fmt}$:$R_{acc}$ 检查答案准确性,$R_{fmt}$ 检查响应是否遵循所需协议,包括答案标签、调用放大时的区间标签以及有效的基于秒的区间。我们不分配单独的定位奖励;预测的区间仅通过其对最终答案正确性和轨迹有效性的影响进行优化。
4 实验
4.1 实现细节
我们使用 Qwen-Omni-7B 作为基础模型。监督微化和强化学习均在 8 块配备 80GB 内存的 NVIDIA H100 GPU 上进行,两个主要后训练阶段总共需要约 480 个 H100 GPU 小时。在监督微调期间,我们使用 LMMS-Engine 框架,以 128 的批量大小、5e-6 的学习率、AdamW 优化器和余弦学习率调度器训练模型 2 个 epoch。对于强化学习,我们基于 TRL (von Werra et al., 2020) 实现了一个全模态工具使用 RL 框架,因为现有的 RL 框架(如 veRL (Sheng et al., 2024))不直接支持具有音频条件输入和工具使用交互的全模态模型。我们使用 64 的批量大小进行训练,对每个提示采样 8 次 rollout,将 KL 系数设置为 0,最大响应长度设置为 8192 个 token,并将学习率设置为 1e-6。评估主要使用 LMMS-Eval (Zhang et al., 2025) 进行。
4.2 主要结果
表 1 比较了 OmniReasoner 在音频视觉基准和通用视频推理基准上的表现。与 Qwen2.5-Omni-
第 7 页
音频视觉 通用 方法 OmniVideoBench LVOmniBench Daily-Omni WorldSense VideoMME VideoHolmes
闭源模型(参考) Gemini-2.0-Flash 41.5 42.9 67.8 56.2 72.4 49.5 Gemini-2.5-Pro 58.9 – 81.4 64.6 86.9 51.3
开源模型 VideoLLaMA2-7B (Cheng et al., 2024) 29.2 27.2 35.2 25.4 62.4 35.2 MiniCPM-o-7B (Cui et al., 2026) 29.7 – 53.1 – 63.9 – VITA-1.5-7B (Fu et al., 2025a) 30.5 – – 36.9 56.1 – Ola-7B (Liu et al., 2025b) – – 49.9 – – – HumanOmniV2-7B – – 58.5 47.1 – – Qwen2.5-Omni-7B 29.3 32.0 62.1 45.4 64.3 24.4 OmniReasoner 34.8 (+5.5) 35.4 (+3.4) 64.2 (+2.1) 46.7 (+1.3) 65.4 (+1.1) 40.0 (+15.6)
表 1:在音频视觉和通用视频推理基准上的性能,包括 OmniVideoBench (Li et al., 2026a)、LVOmniBench (Tao et al., 2026)、Daily-Omni (Zhou et al., 2026)、WorldSense (Hong et al., 2026)、VideoMME (Fu et al., 2024) 和 VideoHolmes (Cheng et al., 2025)。OmniReasoner 行被高亮显示。
7B 基础模型,OmniReasoner 将 Omni- 方法 音频类型 视频时长 niVideoBench 从 29.3 提升至 34.8,LVOmniBench 音乐 音效 语音 0-5 分钟 5-10 分钟 10-30 分钟 从 32.0 提升至 35.4,Daily-Omni 从 62.1 提升至 64.2, Gemini-2.0-Flash 29.7 40.3 43.2 45.3 41.1 34.9 Gemini-2.5-Pro 38.5 57.7 61.7 62.2 55.0 55.9 WorldSense 从 45.4 提升至 46.7,VideoMME 从 Gemini-3-Pro 56.2 54.1 55.7 58.0 52.9 52.5 64.3 提升至 65.4,VideoHolmes 从 24.4 提升至 40.0。 开源模型 VideoLLaMA2-7B 26.4 30.7 29.3 29.5 29.6 28.3 这些提升表明,工具使用后训练不仅改进了音频视觉推理,还改进了更广泛的 MiniCPM-o-7B 27.5 28.6 30.2 29.5 34.5 26.2 HumanOmniV2-7B 20.9 31.1 31.6 31.8 29.6 29.3 视频推理,特别是在那些答案依赖于在详细推理之前定位稀疏证据的基准上, Qwen2.5-Omni-7B OmniReasoner 34.1 23.1(+11.0) 29.3 25.3(+4.0) 36.0 30.7(+5.3) 35.4 32.2(+3.2) 31.9 25.3(+6.6) 36.6 26.7(+9.9) 改进尤为显著。 VideoHolmes 的提升部分归因于基线模型每个视频仅使用 32 帧,而 OmniReasoner 通过放大操作检索了更多帧。 表 2:按音频类型和视频时长划分的 OmniVideoBench 准确率比较。所有时长桶均以分钟为单位报告。 Daily-Omni 和 WorldSense 上的提升较为温和,分别从 62.1 提升至 64.2,从 45.4 提升至 46.7。这是预期的:Daily-Omni 和 WorldSense 主要涉及短到中长的音视频片段,而 OmniVideoBench 尤其是 LVOmniBench 对长上下文时序搜索和稀疏证据定位提出了更强的压力。重要的是,OmniReasoner 在这两个基准上仍优于基础模型,这表明用于长音视频推理的工具使用后训练并未以牺牲通用音频视觉能力为代价。
表 2 进一步按音频类型和视频时长比较了 OmniVideoBench 的性能。时长划分显示出明显的趋势:与 Qwen2.5-Omni-7B 相比,OmniReasoner 在 0–5 分钟视频上的提升为 3.2 分,在 5–10 分钟视频上的提升为 6.6 分,在 10–30 分钟视频上的提升为 9.9 分。这表明随着输入变长,且在均匀处理下稀疏证据更难保留,自适应放大操作变得更有用。音频类型划分显示出在音乐、音效和语音方面的一致性提升。
4.3 消融研究
模型 OmniVideoBench LVOmniBench WorldSense 数据配方 无自策展数据 31.0 (-3.8) 29.8 (-5.6) 44.1 (-2.6) 无工具使用数据 32.8 (-2.0) 33.3 (-2.1) 44.5 (-2.2) 输入配置 无音频输入 30.9 (-3.9) 31.3 (-4.1) 38.4 (-8.3) 无工具返回 32.6 (-2.2) 33.9 (-1.5) 44.7 (-2.0) 训练阶段 sft 32.9 (-1.9) 34.2 (-1.2) 45.1 (-1.6) rl-only 27.6 (-7.2) 26.7 (-8.7) 38.4 (-8.3) 完整 34.8 35.4 46.7
表 3:跨数据配方、输入配置和训练阶段的消融研究。
数据配方的影响。表 3 首先评估了数据配方的贡献。“无自策展数据”变体移除了我们构建的长音视频 QA 数据,包括多片段组合和异常插入任务,并仅在剩余数据上进行训练。该变体在 OmniVideoBench 和 LVOmniBench 上大幅下降,表明构建的数据
第 8 页
基于持续时间的工具行为与准确率
OmniVideoBench: 工具调用率 OmniVideoBench: 按回答模式的准确率
直接将强化学习应用于 Qwen2.5-Omni- OmniVideoBench: 工具调用率 OmniVideoBench: 按回答模式的准确率 7B。直接的工具使用强化学习对于基础多模态
47.4% 84.8% 60 100 79.5% 54/114 218/257 模型来说非常困难: 在没有监督 预热的情况下, 模型 182/229 38.5% 63.9% 50 80 84/218 33.8% 33.5% 216/338 (%) (%) 73/216 61/182 倾向于不调用 工具, 因此 我们 使用 一个 固定的 两 40 60 29.8% 33.3% 率 25.6% 25.5% 57/171 17/57 27.9%34/122 30 10/39 12/47 40 调用 阶段 模板 首先 强制 进行 全局 观察- 准确率 20 20 10 和放大步骤,然后在第二阶段要求模型 0 0-1 1-5 5-10 10-30 0-1 1-5 5-10 10-30 回答。即使在这种受 工具 使用 直接 回答 直接 回答 工具使用 约束的协议下,仅使用强化学习在所有 LVOmniBench: 工具调用率 LVOmniBench: 按回答模式的准确率 基准测试中均急剧下降。这表明冷启动监督微调(SFT)是 44.4% 93.6% 91.0% 88.9% 4/9 131/140 39.5% 384/422 359/404 78.7% 50 100 建立工具使用格式所必需的, 的 42.0% 15/38 34.0% 37/47 55/131 122/359 30.0% 35.7% (%) (%) 40 75 3/10 137/384 31.1% 基本的放大 策略,以及 稳定的回答 行为 14/45 率 24.3% 30 50 9/37 调用 准确率 在强化学习优化之前。 如果没有 这个基础, 20 25 0 10 策略在强化学习期间会发生严重漂移,并且在经过更多 10-20 20-30 30-50 50-90 10-20 20-30 30-50 50-90 工具使用 直接回答 直接回答 工具使用 训练步骤后,模型甚至可能丢失所需的 输出格式。 图 4:LVOm- 上的基于持续时间的工具行为。 时间锚点(TimeAnchor)的影响。表 4 隔离 niBench。 了 TimeAnchor 的贡献。除了 Om- niVideoBench 和 LVOmniBench,我们还包括 Charades-STA,因为它直接评估视频 对于学习长音频视频推理和时空定位重 定位:模型必须定位与自然语言查询匹配的时间 点非常重要。 “无工具使用数据”变体仅保留来自 段。在推理时移除 TimeAnchor 仍然优于 Qwen2.5-Omni-7B 基线, 数据混合的直接回答样本,并通过重写工具相关指令 表明我们的训练数据和配方已经提高了模型的时空定位能力。 来移除工具使用轨迹,将其转化为普通的链式思维 然而,添加 TimeAnchor 带来了显著更强的定位性能,将 Charades- 监督。这种变体对应于标准的 CoT 风格设置, STA 在 IoU@0.3 上从 58.8 提高到 64.9,在 IoU@0.5 上从 37.5 提 其中模型思考然后直接回答, 高到 41.1,在 mIoU 上从 37.9 提高到 41.3。 而不是从长音频视频输入中主动获取局部证据。 这些增益与其设计一致:二级锚点为模型在稀疏全局观察之间移动时提供了稳定的时间线
数据消融实验的表现甚至差于直接回答变体,这可能是因为剩余数据既未提供足够的长时音频-视频协同推理示例,也未能可靠地教授工具使用范式。
输入配置的影响。我们进一步对推理时的输入配置进行消融。移除音频轨道会导致所有基准测试上的性能明显下降,尤其是在 WorldSense 上,这表明 OmniReasoner 无法仅凭视觉线索解决这些任务,仍然依赖视听证据。移除工具返回的局部放大片段也会损害性能,这表明模型受益于主动获取的局部证据,而非仅依赖第一阶段的全局输入。
训练阶段的影响。我们最后对后训练阶段进行消融。仅进行监督微调(SFT)的模型对应于监督工具使用训练后的冷启动检查点,而仅强化学习(RL)的变体则应用了
第 9 页
Charades-STA Model OmniVideoBench LVOmniBench IoU@0.3 IoU@0.5 IoU@0.7 mIoU
Qwen2.5-Omni-7B 29.3 32.0 53.3 31.7 13.4 33.7 OmniReasoner w/o TimeAnchor 32.3 (+3.0) 32.8 (+0.8) 58.8 (+5.5) 37.5 (+5.8) 16.2 (+2.8) 37.9 (+4.2) OmniReasoner 34.8 (+5.5) 35.4 (+3.4) 64.9 (+11.6) 41.1 (+9.4) 17.7 (+4.3) 41.3 (+7.6)
表 4:TimeAnchor 在 OmniVideoBench、LVOmniBench 和 Charades-STA (Gao et al., 2017) 上的消融实验。所有分数均以百分比报告。
在全局视图中发挥作用,因此模型更频繁地调用放大工具。右侧面板比较了直接回答模式与工具使用模式下的准确率。随着视频时长的增加,工具使用的准确率往往提高,这表明自适应放大对长视频特别有益。在某些时长区间内,直接回答的准确率仍可能高于工具使用回答;这并不意味着直接回答通常更好。相反,OmniReasoner 倾向于在更简单或更确定的示例上直接回答,而在需要额外证据的情况下保留工具使用。
交错音视频线索是否被因果性地使用?最近的研究质疑插入到思维链中的交错视觉线索是否被忠实地用于预测,而不仅仅是在推理痕迹中看似存在 (Liu et al., 2025a)。为了在我们的设置中测试这一问题,我们通过推理时移除工具返回的放大片段来进行直接干预。如表 3 中“w/o tool-return”行所示,移除后性能下降,表明返回的音视频证据并非装饰性的。我们进一步在图 5 中使用注意力滚动 (attention rollout) (Abnar and Zuidema, 2020; Xu et al., 2025b) 提供了内部视图分析。我们对包括 CoT 和最终答案标记在内的完整阶段 2 响应进行教师强制 (teacher-force),并聚合最后几个 Transformer 层的因果注意力滚动。媒体标记属性随后被分组为 Qwen2.5-Omni 的 2 秒块,并在相同的时间轴上针对全视频上下文和放大片段进行可视化。滚动结果强烈集中在阶段 2 的放大片段上,表明 OmniReasoner 在推理以得出最终答案时关注交错的音视频线索。
5 结论
我们提出了 OmniReasoner,这是一种用于长音视频推理的工具使用后训练框架。OmniReasoner 学习自适应地调用放大工具,这得益于时间增强数据引擎以及精心策划的 SFT/RL 混合数据。OmniReasoner 学习何时调用工具以及如何从检索到的证据中回答。TimeAnchor 使工具的时间参数在变化的采样粒度下保持有效,使全模态模型能够将高保真感知定位到承载证据的时刻。
局限性
基础设施和模型容量。OmniReasoner 侧重于两步工具使用过程,部分原因是全模态模型上的多轮Agent 强化学习 (RL) 基础设施尚不完善:现有的 RL 框架如 veRL 和 OpenRLHF 专为纯文本或视觉语言模型设计,并不原生支持音频条件输入和重复的音视频工具返回。我们在 TRL 之上实现了自己的全模态工具使用 RL 框架,但该设置远不如文本或视觉对应物成熟。此外,我们使用的是 Qwen2.5-Omni-7B,这是一个具有 32K 上下文窗口的相对较小的模型。该基础模型并未使用大量的Agent 或工具使用数据进行预训练,因此,如果没有强大的监督预热,直接 RL 或轻量级 SFT 会导致非常糟糕的工具使用行为:策略要么拒绝调用工具,要么产生格式错误的区间和答案。因此,扩展到更长的多轮推理需要更强的全模态 RL 基础设施以及使用工具感知数据进行预训练的更大、更长上下文的基础模型。由于计算资源有限以及团队在大规模基础设施工程方面的经验相对不足,我们没有尝试 Qwen-Omni-3,这是一个更大、更新颖的模型。未来使用此类模型和改进的训练框架的工作可以将此范式扩展到两步放大之外。
工具范围。OmniReasoner 仅实现了一个专注于感知的工具——用于检索更高保真度音视频片段的放大工具。我们没有探索其他互补的工具类型,例如用于检索外部知识的网络搜索,或用于执行符号推理的代码执行。
第 10 页
提取的信息,或是用于复杂视频推理的、让多模态大语言模型(MLLM)像福尔摩斯一样思考的结构化查询工具?访问数据库或知识图谱。这种狭窄的工具范围限制了 OmniReasoner 处理需要结合感知证据、检索事实、计算步骤或外部领域知识任务的能力。扩展工具库并训练模型以协调多个工具,仍是构建更通用的全模态推理Agent 的重要方向。
伦理声明
OmniReasoner 旨在用于长音频-视频推理的研究。其训练配方使用公开或经过策展的音频-视频资源以及自动生成的工具使用轨迹;在公开发布前,应检查数据集许可、隐私敏感内容以及基准特定的使用限制。公共音频-视频来源可能包含源自原始数据集的可识别人员、声音、场景文本或冒犯性内容。该模型仍可能产生不正确的时空定位或幻觉化的视听证据,因此在高风险场景下的下游使用中应包含人工验证。我们根据各自的许可和使用条款使用外部数据集、基准、模型和软件框架。任何发布的衍生产物将遵循原始来源的访问和重新分发限制,且当原始条款禁止重新分发时,基准数据将不会被重新分发。
参考文献
Samira Abnar 和 Willem Zuidema。2020。量化 Transformer 中的注意力流。在计算语言学第 58 届年会论文集,第 4190–4197 页。
Shimin Chen, Xiaohan Lan, Yitian Yuan, Zequn Jie, 和 Lin Ma。2024。Timemarker:一种具有卓越时间定位能力的通用长短视频理解视频大语言模型。预印本,arXiv:2411.18211。
Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, 和 Liyun Ru。2025。Chronusomni:提升全模态大语言模型的时间感知能力。预印本,arXiv:2512.09841。
Zhangquan Chen, Jiale Tao, Ruihuang Li, 和 1 位其他作者。2026。Omnivideo-r1:通过查询意图和模态注意力强化视听推理。预印本,arXiv:2602.05847。
Junhao Cheng, Yuying Ge, Teng Wang, Yixiao Ge, Jing Liao, 和 Ying Shan。2025。Video-holmes:能让多模态大语言模型像福尔摩斯一样思考以进行复杂视频推理的结构化查询工具?访问数据库或知识图谱。这种狭窄的工具范围限制了 OmniReasoner 处理需要结合感知证据、检索事实、计算步骤或外部领域知识任务的能力。扩展工具库并训练模型以协调多个工具,仍是构建更通用的全模态推理Agent 的重要方向。
Preprint, arXiv:2505.21374。
Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, 和 1 位其他作者。2024。Videollama 2:推进视频大语言模型中的时空建模和音频理解。arXiv 预印本 arXiv:2406.07476。
Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, 和 1 位其他作者。2026。Minicpm-o 4.5:迈向实时全双工全模态交互。arXiv 预印本 arXiv:2604.27393。
Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, 和 1 位其他作者。2026。Latenomni:通过统一的音频视觉潜在推理重新思考全模态理解。arXiv 预印本 arXiv:2605.22012。
DeepSeek-AI, Aixin Liu, Aoxue Mei, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenhao Xu, Chong Ruan, Damai Dai, Daya Guo, Dejian Yang, 和 245 位其他作者。2025。Deepseek-v3.2:推动开源大型语言模型的边界。预印本,arXiv:2512.02556。
Henghui Du, Guangyao Li, Chang Zhou, Chunjie Zhang, Alan Zhao, 和 Di Hu。2025。Crab:一种具有显式协作的统一音频视觉场景理解模型。预印本,arXiv:2503.13068。
Miquel Farré, Andi Marafioti, Lewis Tunstall, Leandro Von Werra, 和 Thomas Wolf。2024。Finevideo。https://huggingface.co/datasets/HuggingFaceFV/finevideo。
Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 和 1 位其他作者。2024。Video-mme:首个全面的视频分析中多模态大语言模型综合评估基准。arXiv 预印本 arXiv:2405.21075。
Chaoyou Fu, Haojia Lin, Xiong Wang, Yi-Fan Zhang, Yunhang Shen, Xiaoyu Liu, Haoyu Cao, Zuwei Long, Heting Gao, Ke Li, 和 1 位其他作者。2025a。Vita-1.5:迈向 GPT-4o 级别的实时视觉和语音交互。arXiv 预印本 arXiv:2501.01957。
Shenghao Fu, Qize Yang, Yuan-Ming Li, 和 1 位其他作者。2025b。Love-r1:通过自适应缩放机制和多步推理推进长视频理解。预印本,arXiv:2509.24786。
Jiyang Gao, Chen Sun, Zhenheng Yang, 和 Ram Nevatia。2017。Tall:通过语言查询进行 temporal activity localization。在 IEEE 国际计算机视觉会议论文集,第 5267–5275 页。
10
第 11 页
Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, and Yansong Tang. 2026a. 针对视频字幕强化学习的层级评分奖励。预印本,arXiv:2607.05150。
Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, 和 Dacheng Tao. 2026b. VideoTIR:通过高效的工具集成推理实现对长视频的准确理解。预印本,arXiv:2603.25021。
Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, 和 Yu Cheng. 2025. FrameThinker:通过多轮帧聚焦学习利用长视频进行思考。预印本,arXiv:2509.24304。
Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, 和 Weidi Xie. 2026. WorldSense:评估多模态大语言模型的真实世界全模态理解能力。预印本,arXiv:2502.04326。
Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shimao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, 等 24 人。2026a. OmniVideoBench:迈向全模态多模态大语言模型的全视听理解评估。预印本,arXiv:2510.10689。
Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Luo, 和 Jian Luan. 2025. Revisor:超越文本反思,迈向长视频理解中的多模态内省推理。预印本,arXiv:2511.13026。
Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, 等 1 人。2026b. OmniGaea:迈向原生全模态人工智能Agent 。预印本,arXiv:2602.22897。
Zujing Liu, Junwen Pan, Qi She, Yuan Gao, 和 Guisong Xia. 2025a. 关于视觉思考的忠实度:测量与增强。预印本,arXiv:2510.23482。
Zuyan Liu, Yuhao Dong, Jiahui Wang, Ziwei Liu, Winston Hu, Jiwen Lu, 和 Yongming Rao. 2025b. OLA:推动全模态语言模型的前沿。arXiv 预印本 arXiv:2502.04328。
Junwen Pan, Qizhe Zhang, Rui Zhang, 等 1 人。2025. TimeSearch-R:通过自验证强化学习实现长视频理解的自适应时间搜索。预印本,arXiv:2511.05489。
Owen Queen, Harrison G. Zhang, 和 James Zou. 2025. CGBench:评估语言模型在临床遗传学研究中的科学推理能力。预印本,arXiv:2510.11985。
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y. K. Li, Y. Wu, 和 Daya Guo. 2024. DeepSeekMath:推动开放语言模型中数学推理的极限。预印本,arXiv:2402.03300。
Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, 和 Chuan Wu. 2024. HybridFlow:一个灵活且高效的 RLHF 框架。预印本,arXiv:2409.19256。
Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, 和 Chenliang Xu. 2025. Video-R4:通过视觉沉思强化富含文本的视频推理。预印本,arXiv:2511.17490。
Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, 等 1 人。2026. LVOmnibench:开创全模态大语言模型长音频-视频理解评估。arXiv 预印本 arXiv:2603.19217。
Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, 等 1 人。2023. Gemini:一系列高度 capable 的多模态模型。arXiv 预印本 arXiv:2312.11805。
Leandro von Werra, Younes Belkada, Lewis Tunstall, Edward Beeching, Tristan Thrush, Nathan Lambert, Shengyi Huang, Kashif Rasul, 和 Quentin Gallouedec. 2020. TRL:Transformer 强化学习。
Xiaohan Wang, Yuhui Zhang, Orr Zohar, 和 Serena Yeung-Levy. 2024. VideoAgent:以大语言模型为Agent 进行长视频理解。预印本,arXiv:2403.10517。
Yongliang Wu, Xinting Hu, 和 Yuyang Sun 等。2024. Number-It:像翻阅漫画一样对视频进行时间定位。arXiv 预印本 arXiv:2411.10332。
Yicheng Xiao, Yu Chen, Haoxuan Ma, Jiale Hong, Caorui Li, Lingxiang Wu, Haiyun Guo, 和 Jinqiao Wang. 2025. PixCLIP:通过任意粒度像素-文本对齐学习实现细粒度视觉语言理解。arXiv 预印本 arXiv:2511.04601。
Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, 和 Pheng-Ann Heng. 2025. EchoInk-R1:通过强化学习探索多模态大语言模型中的视听推理。预印本,arXiv:2505.04623。
Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting He, Xinfa Zhu, 等 1 人。2025a. Qwen3-Omni 技术报告。arXiv 预印本 arXiv:2509.17765。
Jiarui Jin, Xingjian Wang, Linxin Song, Runhao Fu, Hecheng Wang, Zongyuan Ge, Yuan Lu, 和 Xuelian Cheng. 2025. Video-Thinker:通过强化学习激发“通过视频思考”。预印本,arXiv:2510.23473。
11
第 12 页
Shuo Xu, Yu Chen, Shuxia Lin, Xin Geng, 和 Xu Yang。 2025b。Flowprune:通过剪枝流网络加速注意力流计算。神经信息处理系统进展,38:134236–134261。
Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, 和 Lidong Bing。2025。 Longvt:通过原生工具调用激励“长视频思考”。预印本,arXiv:2511.20785。
Hanrong Ye, Chao-Han Huck Yang, Arushi Goel, Wei Huang, Ligeng Zhu, Yuanhang Su, Sean Lin, An- Chieh Cheng, Zhen Wan, Jinchuan Tian, 和 1 位其他作者。 2025。Omnivinci:增强架构和数据以支持全模态理解的大语言模型。arXiv 预印本 arXiv:2510.15870。
Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, 和 Limin Wang。2026。Timelens:利用多模态 大语言模型重新思考视频时间定位。预印本,arXiv:2512.14698。
Kaichen Zhang, Bo Li, Peiyuan Zhang, Fanyi Pu, Joshua Adrian Cahyono, Kairui Hu, Shuai Liu, Yuan- han Zhang, Jingkang Yang, Chunyuan Li, 和 Ziwei Liu。2025。Lmms-eval:对大型多模态模型评估的现实检验。在计算语言学协会:NAACL 2025 的发现中,第 881–916 页。计算语言学协会。
Hao Zhong, Muzhi Zhu, Zongze Du, 和 1 位其他作者。2025。 Omni-r1:通过双系统协作进行全模态推理的强化学习。预印本, arXiv:2505.20256。
Ziwei Zhou, Rui Wang, Zuxuan Wu, 和 Yu-Gang Jiang。 2026。Daily-omni:迈向具有跨模态时间对齐的视听推理。预印本, arXiv:2505.17862。
12
第 13 页
A 时间增强数据引擎和 2023) 用于合成工具使用轨迹。在线 训练数据 合成在生成过程中不暴露最终答案,并仅保留那些最终 答案与真实标签匹配的轨迹。 hindsight A.1 时间任务构建 合成使用最终答案和参考间隔作为生成时的指导,以应对更难的长 时间增强数据引擎从编辑操作中派生间隔监督,而非手动标注跨度。对于多段 组合,我们从具有可用 QA 标注和有效本地媒体的 FineV- ideo 视频中构建候选池。我们采样一个目标时长, 贪婪地将多个语义独立的片段拼接成一个更长的流,并将每个问题 附加到一个源片段上。组合视频存储每个源片段的起始和结束偏移量,因此 目标片段的偏移量成为证据间隔。此路径将现有的 QA 对置于长 时间上下文中,并训练模型在回答之前找到相关片段。 A.3 后训练混合数据 对于异常插入,我们使用长 CG-Bench 视频作为主视频,短 LLaVA-Video- 178K 片段作为替换源。引擎 采样一个时间窗口,并仅替换音频流、仅替换视觉流,或同时替换两种模态。 输出保留主视频的时间线,而替换窗口通过构造给出异常 间隔。三种替换类型产生互补的监督信号:音频-
仅替换项需要检测声音-视觉不一致性,纯视频替换项需要检测与原始音频的视觉不一致性,而双模态替换项需要检测与周围上下文冲突的局部事件。对于音频相关的异常样本,我们仅保留那些异常窗口与全局阶段可观察音频范围重叠的案例,以便首轮扫描中包含模型可学习的证据。
A.2 轨迹合成与过滤
MediaSandbox 将构造的时间区间转化为……(Xing 等,2025)贡献了 2,988 个图像-音频样本,CG-Bench(Queen 等,2025)贡献了 1,729 个长视频 QA 样本。这些来源提供了互补的监督信号:构造的时间任务使模型接触已知的证据区间,FineVideo 增加了真实的开放式长视频工具使用轨迹,AVQA-R1 保留了图像-音频覆盖范围,而 CG-Bench 拓宽了公开长视频 QA 的多样性。
SFT 混合数据包含 21,032 个区间轨迹、1,819 个直接回答轨迹以及 2,988 个 AVQA-R1 图像-音频样本。对于强化学习(RL),我们……
与 OmniReasoner 使用的全局到局部协议相同。在区间轨迹中,模型首先接收低保真度的全局观察和问题,输出一个由 TimeAnchor 定位的区间,接收来自该区间的局部裁剪片段,然后生成最终答案。在直接回答轨迹中,当局部证据不必要时,模型基于全局观察进行回答。沙盒仅实现全局预览和请求的局部裁剪片段,将合成和训练保持在有界的 token 预算内。
我们使用 Gemini-3-Flash-Preview (Team et al., 2025) 来挖掘在 SFT 策略下产生非退化组相对奖励的示例。组合候选项被转换为多项选择题 (MCQ) 格式,过滤掉仅凭文本即可猜测的项,然后使用八次 SFT 策略 rollout 进行采样;我们保留至少有一次但并非所有 rollout 正确的示例。CG-Bench 和 FineVideo 的 RL 示例使用相同的 pass@k 但非 pass@1 标准进行挖掘。最终的 RL 混合数据集包含 2,731 个示例:1,366 个组合示例,658 个 CG-Bench 示例,以及 707 个 FineVideo 示例。图 6 中的堆叠条形图展示了问题的联合分布
13
第 14 页
输入 输入
哨声响起时,谁在跑?A. … Blue Superdog 和 Dodo 协作修车胎的动作是什么?A. …
OmniReasoner 输出 OmniReasoner 输出 〈think〉视频以《神奇数字马戏团》(The Amazing Digital Circus)的预告片开始,其中包含各种动画 角色….〈/think〉<interval>[50.0, 60.0]</interval> 〈think〉视频显示 Blue Superdog 和 Dodo 正在合作修理汽车轮胎。 LLM ….〈/think〉<interval>[18.0,〈think〉在放大片段中,Blue28.0]</interval>Superdog 被看到 正扶着汽车轮胎保持稳固,而 Dodo 正用扳手拧紧 螺丝…〈/think〉〈answer〉C〈/answer〉 〈think〉放大片段显示哨声在大约 0:50 时响起… 〈/think〉〈answer〉A〈/answer〉
时间线上的注意力图 时间线上的注意力图
图 5:OmniReasoner 的注意力传播可视化。这些示例展示了模型如何预测基于 TimeAnchor 的时间区间,并利用返回的放大片段进行回答,传播图投影在视频时间线上。
以及每个来源的类型和输入持续时间。选择题、开放式问题和异常检测示例分别用不同的颜色族表示,同一问题类型中持续时间较长的区间使用更深的色调。AVQA-R1 被视为图像-音频数据,并被分配到最短持续时间区间,因为它不提供长视频持续时间元数据。
14
第 15 页
SFT 后训练数据
多项选择/>40分钟 多项选择/<=10分钟 异常检测/25-40分钟 多项选择/25-40分钟 开放式/10-25分钟 异常 检测/10-25分钟 多项选择/10-25分钟 开放式/<=10分钟 异常 检测/<=10分钟 问题类型 16000 14000 13,222 12000 38.7% 10000样本 20.6%of 8000 6000 5,319 40.8%数量 4000 2,581 2,988 1,729 2000 多项选择 0 开放式 多片段 异常 FineVideo AVQA-R1 CG-Bench 组合 插入 异常检测 来源
RL 后训练数据
多项选择/>40分钟 多项选择/10-25分钟 开放式/10-25分钟 多项选择/25-40分钟 多项选择/<=10分钟 开放式/<=10分钟 问题类型 1600 1,366 1400 1200 样本 1000 数量 74.1% 800 707 25.9% 658 600 数量 400 200 0 多项选择 组合 CG-Bench FineVideo pass@k pass@k 开放式 来源
图 6:OmniReasoner 使用的后训练数据。SFT 混合数据提供答案、时间间隔和工具使用轨迹的监督。RL 混合数据包含在 SFT 策略下选择以产生非退化组相对奖励的示例。条形图显示了按问题类型和持续时间划分的各来源计数,而饼图显示了每个拆分中问题类型的整体组成。
15
第 16 页
B 提示词 阶段 用户 问题 仅(开放式考试 示例 不 受 此 约束),而 B.1 推理时提示词 异常检测示例 则接收 基础协议如下控制每次推理调用;对于多项选择考 ANOMALY_ANSWER_CONSTRAINT,该约束将 试题,任务适配器还会在第一个提示词后附加 MULTIPLE_CHOICE_CONSTRAINT,将答案固定为 输入的异常标签和以秒为单位的时间间隔。
SYSTEM_PROMPT
你是一个视听助手。 仅输出标签,标签外不得包含任何文本。 严格使用以下其中一种格式: 〈think〉…〈/think〉<interval>[start, end]</interval> 〈think〉…〈/think〉〈answer〉…〈/answer〉 切勿同时输出 <interval> 和 〈answer〉。 所有时间值均以秒为单位,且基于同一时间线。
USER_PROMPT
如果当前证据充分,请输出 〈answer〉…〈/answer〉。 否则,请求一个缩放时间间隔 <interval>[start, end]</interval>。
RETURN_ZOOM_IN_USER_PROMPT
缩放视频片段 [start, end] 秒: 使用提供的缩放片段(及先前上下文)输出最终 〈answer〉…〈/answer〉。 本轮不得输出 <interval>。
<缩放音视频片段>
MULTIPLE_CHOICE_CONSTRAINT
从提供的选项中选择且仅选择一个选项字母进行回答。
ANOMALY_ANSWER_CONSTRAINT
如果使用 〈answer〉,请严格遵循以下格式: type=<audio_only|video_only|both>; interval=[start, end] 〈answer〉内部不得添加额外文字。
B.2 轨迹合成:回溯教师提示词
区间轨迹 SFT 数据(§A)由 Gemini-3-Flash-Preview 作为回溯教师合成:教师被提供参考答案和时间间隔作为监督信号,但其系统提示词明确禁止将这些监督信息泄露到生成的推理过程中,因此生成的轨迹读起来像是首次尝试、基于证据的推理,而非基于答案的条件化合理化。相同的“全局扫视/缩放验证”契约用于多片段组合和异常检测,以下四个系统提示词仅在各自阶段必须生成的任务特定字段和词汇上有所不同。
16
第 17 页
组合式教师阶段1
你是针对由多片段组成的长视频进行多项选择推理的后见之明教师。 阶段1:从低质量的全视频概览中进行全局浏览和缩放规划。
输出一个且仅一个包含以下键的 JSON 对象:think_stage1, decision, interval, answer。
硬性约束:
- think_stage1:4-7 句话。必须包含:(1) 至少一个与观察结果挂钩的具体时间锚点(不要盲目复制任何“参考区间”措辞);(2) 将提供的片段描述与你扫描时看到/听到的内容联系起来的推理;(3) 解释为何需要或不需要缩放。
- decision 必须为 'interval' 或 'answer'。若为 'interval',则必须为 [start, end] 格式(秒),end > start,且应落在与描述匹配的片段上。
- 若 decision='answer',answer 必须恰好是一个有效的选项标签。
- 不要输出 markdown/代码围栏或 JSON 之外的任何额外文本。
- 不要提及监督、参考答案、真实标签(ground truth),或暗示你获得了隐藏标签。
- 不要将参考区间重述为用户可见的信息;模拟首次观看。
组合式教师阶段2
你是针对由多片段组成的长视频进行多项选择推理的后见之明教师。 阶段2:使用缩放片段及先前轮次上下文进行缩放验证和最终决策。
输出一个且仅一个包含以下键的 JSON 对象:think_stage2, answer。
硬性约束:
,→ 说明片段描述是否与缩放证据匹配。
- think_stage2:4-7 句话,包含来自缩放片段的证据、与全局视图的整合/修订以及最终理由。
- 如果缩放证据与阶段1的假设相矛盾,你可以修订或推翻该假设。
- answer 必须恰好是一个有效的选项标签。
- 不要输出 markdown/代码围栏或 JSON 之外的任何额外文本。
- 不要提及监督、参考答案、真实标签或隐藏标签。
异常检测教师阶段1
你是针对长视频异常检测(音频/视觉/两者)的后见之明教师。 阶段1:快速全局概览(低帧率/低分辨率)。规划是否需缩放至某个时间窗口以进行验证。
输出一个且仅一个包含以下键的 JSON 对象:think_stage1, decision, interval, answer_direct
,→
,→
- think_stage1:4-8 句话。必须听起来像首次观看者:观察结果、不确定性、自我检查(“这可能是故意剪辑吗?”),以及解释为何缩放有帮助或没有帮助。不要透露你获得了隐藏标签。
- decision:“interval”(需要缩放片段以进行验证)或“answer”(全局视图已足够)。
- interval:[start_s, end_s] 格式(秒),当 decision 为“interval”时必需(end > start)。根据可观察线索细化建议的窗口;不要仅将监督信息作为唯一理由。
- answer_direct:仅当 decision 为“answer”时出现,字符串格式必须严格为 type=<audio_only|video_only|both>; interval=[start, end];否则为 null。
硬性约束:
- 仅 JSON,无 markdown 围栏,无额外键。
- 不要在自然语言中提及“真实标签”、“监督”或“参考区间”。
- think_stage1 不得单独引用参考区间数字作为证据;必须将时间与可观察线索联系起来。
异常检测教师阶段2
你是针对长视频异常检测的后见之明教师。 阶段2:检查缩放片段(更高细节)并输出最终的结构化检测结果。
输出一个且仅一个包含以下键的 JSON 对象:think_stage2, final_answer
,→
,→
- think_stage2:5-10 句话。将缩放证据与全局印象进行比较;论证异常类型(仅音频/仅视频/两者)及紧密的时间边界。
- final_answer:单个结构化字符串,格式必须严格为 type=<audio_only|video_only|both>; interval=[start, end],单位为秒。
硬性约束:
- 仅 JSON,无 markdown 围栏。
- 不要提及监督或隐藏标签。
- 基于缩放片段的证据确定边界;在没有线索的情况下避免声称任意精度。
B.3 轨迹质量评判器
合成的轨迹还通过 LLM 评判器(§A)进行筛选,该评判器对推理质量、答案正确性、泄露风险以及音频-视觉接地质量进行 1–10 分的评分;仅保留那些
17
第 18 页
高于接受阈值的进入 SFT 混合数据。组成裁判如下所示;开放式和异常检测裁判共享相同的评分标准结构,但替换为任务相关的字段(在异常检测中,使用 detection_accuracy 和 temporal_precision 替代 answer_correctness)。
TRAJECTORY_JUDGE_PROMPT (composition)
你是一个用于评估长视频多片段 MCQ 推理轨迹的专家评估器。
任务
评估针对多片段组合长视频的多项选择题的两阶段(或单阶段)思维链(CoT)轨迹的质量。
输入字段
question, options, correct_answer, pred_answer, think_stage1, think_stage2(如适用), duration, gt_intervals, zoomin_interval。
评分维度(每项 1-10 分)
1. reasoning_quality:CoT 是否展示了真正的时序推理?它是否将观察结果与特定的时间锚点联系起来,并利用片段描述来缩小正确片段的范围?对于模糊、重复或同义反复的推理进行扣分。 2. answer_correctness:严格门控——如果与 correct_answer 完全匹配得 10 分,否则得 1 分。不要使用中间分数。 3. leakage_risk:10 分表示无泄露迹象;1 分表示明显泄露(逐字引用监督数据/GT,使用“reference”/“ground truth”等语言,或在没有证据的情况下陈述答案)。 4. grounding_quality:推理是否引用了具体的视觉/音频线索,而不是仅仅复述片段描述?
输出
仅返回一个 JSON 对象(不要使用 markdown 代码块): {"reasoning_quality": N, "answer_correctness": N, "leakage_risk": N, "grounding_quality": N, "overall_score": N, "decision": "accept|borderline|reject", "brief_rationale": "…"}
overall_score = reasoning_quality*0.3 + answer_correctness*0.3 + leakage_risk*0.2 + grounding_quality*0.2
B.4 MCQ 设计与纯文本可猜测性过滤
组成候选项(§A)首先由 LLM 设计师将其从开放问答转换为 4 选项 MCQ 格式,提示中明确要求避免选项长度和结构上的捷径(摘录如下),然后由第二个视频盲测的 LLM 进行筛选,该 LLM 仅根据问题和选项尝试作答;如果它能以高置信度解决候选项,则在强化学习(RL) rollout 挖掘之前将其丢弃。
18
第 19 页
多项选择题设计系统提示词(摘录)
你是一个专家级多项选择题(MCQ)设计师,擅长基于视频内容创建高质量的问题。 你的任务是将给定的问答(QA)对转换为多项选择题格式(4个选项 A B C D)。
设计原则
1. 选项长度与结构平衡(关键 – 最高优先级)
考生经常通过比较选项长度来猜测答案。
- 所有 4 个选项必须具有几乎相同的字符/单词数量(差异在 10-15% 以内)。
- 正确答案绝不能是最长或最短的选项;如果它自然较长,则扩展所有干扰项以匹配;如果自然较短,则缩短它或扩展干扰项。
- 避免“三个短 + 一个长”(或反之)的模式,其中正确答案是长度异常值,或是唯一包含具体细节/数字的选项。
- 所有选项必须使用相同的语法结构和具体程度级别;如果一个选项包含数字/时间/地点,所有选项都应包含。
2. 干扰项设计原则
- 干扰项必须与视频中实际出现的元素相关,不得捏造,且应看起来合理,但在仔细观看后被排除。
- 避免荒谬、违反常识的选项;保持干扰项类型与正确答案一致(如数字/时间/名称等)。
3. 防猜测策略
- 避免极端词汇(“总是”、“从不”、“所有”);随机化正确答案的位置;不要使正确答案比干扰项更具体或更模糊。
- 问题和选项的措辞不得暗示答案。选项绝不能仅通过一般世界知识/常识来解答——问题必须需要特定的视频视觉/听觉证据。
- 正确答案不应具有将其与干扰项区分开来的任何独特特征。
[出于简洁起见,省略了输出 JSON 模式和提交前的长度/结构自检清单。]
仅文本猜测性判断器
你是一个测试分析专家。你的任务是分析关于视频内容的多项选择题是否仅使用文本信息(问题和选项)即可正确回答,而无需观看实际视频。
你的任务
给定一个原本旨在测试视频理解的多项选择题: 1. 分析正确答案是否可以仅从文本中推断出来。 2. 如果是,请识别允许这种推断的基于文本的线索。 3. 提供你的置信度水平(0-100)。
重要指南
- 你无法观看视频——你只能访问问题文本和选项。
- 诚实地说明你是否可以推断出答案;如果是随机猜测,请说明并给出低置信度。
输出格式
{"can_infer": true/false, "answer": "A/B/C/D/E", "confidence": 0-100, "reasoning_type": ,→ "option_length|option_structure|common_sense|option_content|question_hint|elimination|cannot_determine", "reasoning": ,→ "…"}
confidence: 0-30 随机猜测,31-50 轻微倾向,51-70 合理推断,71-100 来自清晰文本线索的高置信度。 reasoning_type: option_length/option_structure = 选项在长度/语法上存在差异;common_sense = 可从一般知识解答;option_content = 某些选项明显错误;question_hint = 问题措辞暗示答案;elimination = 可以通过排除选项缩小范围;cannot_determine = 没有基于文本的方法。
关键提醒
1. 这是一个视频理解问题——“正确”答案基于你无法看到的视频内容。 2. 你的目标是检测问题设计是否存在允许仅通过文本进行推断的缺陷。 3. 如果你在没有视频的情况下能以高置信度正确回答,则该问题设计不佳。 4. 严谨对待——如果你实际上是在猜测,不要声称你可以推断。
19