三分钟导读:本文提出AV-Flamingo,一个完全开源的音视频大语言模型,通过引入大规模音视频技能数据集、三阶段课程学习以及时间戳锚定的链式思维推理框架,实现了对长视频和复杂真实世界音视频流的联合理解与推理。
英文题目:Nemotron-Labs-Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
论文出处:arXiv 每日论文精选 · arXiv:2607.16107
原始论文:PDF / 论文页面
对应视频标题:Nemotron AV-Flamingo:开源长视频音视频联合推理模型解析|推荐指数:★★★★★
这篇论文解决什么问题?
现有音视频大语言模型(AV-LLMs)主要关注短视频,缺乏对长视频和复杂真实世界音视频流的联合理解能力;公开的高质量音视频配对数据稀缺,且现有模型在长上下文推理和跨模态对齐方面存在不足。
核心创新
- Audio-Visual-Skills (AV-Skills):包含约700万标注实例的大规模音视频技能数据集,涵盖短/长视频,专注于时间、组合和跨模态推理。
- Temporal Audio-Visual Interleaved Chain-of-Thought (TAVIT):一种推理框架,将中间推理步骤显式锚定到音视频流的时间戳上,提高时间对齐和可解释性。
- 三阶段课程学习:从短上下文感知逐步过渡到长视野多事件推理,有效平衡了基础能力保留与复杂技能习得。
- 完全开源:开放模型权重、训练代码、推理代码及数据集,填补了高性能开源音视频模型的空白。
方法概览
AV-Flamingo基于OmniVinci初始化,采用三阶段训练:1) 预训练:在AV-Skills-Short和单模态数据上训练,建立基础感知;2) 中训练:引入AV-Skills-Long,扩展上下文至15分钟,强化长程推理;3) 后训练:使用AV-Think数据集进行基于GRPO的强化学习,引入TAVIT推理框架。架构上采用SigLip视觉编码器、AF-Whisper音频编码器,并通过交叉模态交错和受限旋转时间嵌入(CRTE)进行对齐。
逐图理解论文
方法概述

本文提出AV-Flamingo,基于OmniVinci初始化,采用三阶段训练策略。首先使用AV-Skills-Short和单模态数据进行预训练,建立基础感知;随后引入AV-Skills-Long扩展上下文至十五分钟,强化长程推理;最后使用AV-Think数据集进行基于GRPO的强化学习,引入TAVIT推理框架。
数据集创新

核心创新之一是Audio-Visual-Skills数据集,包含约七百万标注实例,涵盖短长视频,专注于时间、组合和跨模态推理。该数据集通过大规模合成与筛选,提供了丰富的长上下文训练信号,解决了高质量音视频配对数据稀缺的问题,为模型提供了坚实的感知基础。
推理框架TAVIT

为提升长视频推理的可解释性,作者提出Temporal Audio-Visual Interleaved Chain-of-Thought框架。该框架将中间推理步骤显式锚定到音视频流的时间戳上,使模型能够展示其如何结合特定时刻的视觉与听觉证据得出结论,从而增强时间对齐能力。
课程学习策略

训练采用三阶段课程学习,从短上下文感知逐步过渡到长视野多事件推理。消融实验表明,AV-Skills-Short在预训练阶段至关重要,而AV-Skills-Long在中训练阶段显著提升了长视频理解能力。这种渐进式策略有效平衡了基础能力保留与复杂技能习得。
基准测试结果

在十五个以上基准上进行评估。在MMOU基准上,AVF-Think达到百分之六十点二准确率,优于OmniVinci的百分之四十六点八,但略低于Gemini-2.5 Pro的百分之六十四点二。在WorldSense上,AVF-Think达到百分之五十点六,优于OmniVinci和Qwen2.5-Omni。
实验与关键结果
- 在15个以上的音视频、全模态、音频和视觉基准上进行评估,包括WorldSense, DailyOmni, MMOU, Video-MME, MMAU等。
- 与闭源模型(如Gemini 2.5 Pro, GPT-4o)和开源模型(如Qwen2.5-Omni, OmniVinci)进行对比。
- 进行消融实验,验证AV-Skills-Short和AV-Skills-Long在不同训练阶段的作用。
- 在MMOU基准上,AVF-Think达到60.2%准确率,优于OmniVinci (46.8%)和Gemini-2.5 Pro (64.2%注:原文表1显示Gemini-2.5 Pro为64.2,但文本描述称AVF在长视频上具有竞争力,此处需仔细核对,表1中Gemini-2.5 Pro为64.2,AVF-Think为60.2,AVF-Instruct为56.9。文本第10页称AVF是long and complex audio-visual understanding的best-in-class,可能指特定子任务或综合表现,但数值上Gemini更高。需如实记录。修正:表1中Gemini-2.5 Pro MMOU为64.2,AVF-Think为60.2。文本第10页称AVF在MMOU上表现优异,但未直接说超越Gemini-2.5 Pro。需准确引用。(第 9 页)
- 在WorldSense基准上,AVF-Think达到51.6%准确率,优于OmniVinci (48.2%)和Qwen2.5-Omni (45.4%)。(第 9 页)
- 在Video-MME基准上,AVF-Instruct在无字幕情况下达到70.7%准确率,优于NVILA (64.2%)和OmniVinci (67.3%)。(第 9 页)
- 在LibriSpeech test-clean上,AVF-Instruct的WER为1.64,优于Phi-4-mm (1.67)和Qwen2.5-Omni (3.4)。(第 9 页)
- 在MMAU基准上,AVF-Instruct平均得分为73.49,优于Audio Flamingo 3 (72.42)和OmniVinci (71.60)。(第 9 页)
阅读时需要注意
- AV-Skills数据集基于公开数据集和互联网视频,可能存在来源偏差或与先前训练数据重叠。
- 在非常长且高度密集的视频中进行推理仍然具有挑战性,特别是当证据稀疏或时间分散时。
- 现有基准不能完全捕捉开放世界部署中的真实情况。
- 部分基准测试中,闭源模型(如Gemini 2.5 Pro)在某些指标上仍优于AV-Flamingo,需结合具体任务场景评估。
- 数据集包含已撤回的Aidatatang语料,仅用于透明度说明,不作为发布的一部分。
关联工作
- OmniVinci:基础模型,AV-Flamingo从其预训练检查点初始化。(第 4 页)
- Audio Flamingo 3:音频编码器AF-Whisper的来源,以及部分训练数据和架构设计的参考。(第 4 页)
- Qwen2.5-Omni:基线模型,用于对比全模态理解能力。(第 10 页)
- Gemini 2.5 Pro:闭源SOTA模型,用于对比音视频推理能力。(第 10 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
2026-7-20
Nemotron-Labs-Audio-Visual Flamingo: 面向长视频和复杂视频的开放音视频智能 系统
Sreyan Ghosh1,2,∗ Arushi Goel1,∗ Kaousheik Jayakumar2 Lasha Koroshinadze2 Nishit Anand2 Siddharth Gururani1 Hanrong Ye1 Pritam Biswas1 Yuanhang Su1 Ehsan Hosseini-Asl1 Sang-gil Lee1 Zhifeng Kong1 Jaehyeon Kim1 Sungwon Kim1 Karan Sapra1 S Sakshi2 Ramani Duraiswami2 Dinesh Manocha2 Andrew Tao1 Mohammad Shoeybi1 Bryan Catanzaro1 Ming-Yu Liu1 Wei Ping1
1美国 NVIDIA 2美国马里兰大学
代码 模型 项目页面 数据集 演示
摘要。我们提出了 Nemotron-Labs-Audio-Visual Flamingo (AV-Flamingo),这是一个完全开源的音视频大语言模型(AV-LLM),旨在对音频、图像和长视频进行联合理解与推理。与主要关注短视频片段的前代 AV-LLM 不同,AV-Flamingo 专为理解和推理长而复杂的真实世界(音视频)视频而设计。为此,我们做出了三项关键贡献:(i) Audio-Visual-Skills,一个大规模的真实世界视频集合,包含约 700 万个带标题和问答的训练实例,旨在强调时序、组合和跨模态的音视频推理;(ii) 一种新颖的三阶段课程学习方法,逐步训练模型从短程感知发展到长程多事件推理;以及 (iii) Temporal Audio-Visual Interleaved Chain-of-Thought(TAVIT),一种推理框架,它将中间推理步骤显式地锚定在长音视频流的特定时间戳上,从而改善时序对齐性和可解释性。在 15 多个 AV、全模态、音频和视觉基准测试上的广泛实验表明,AV-Flamingo 以显著优势优于规模相似的开源模型,并且在许多情况下与规模大得多的开源权重模型和闭源模型保持高度竞争力,甚至超越它们,特别是在长而复杂的真实世界音视频理解和推理任务上。除了基准测试表现外,AV-Flamingo 还展现出强大的现实世界实用性,并能很好地迁移到未见过的任务中,突显了其鲁棒性和泛化能力。
1. 引言
视频占全球互联网流量的 82%,用户平均每天花费超过 2.5 小时观看在线视频 (Kumar, 2026)。这些视频通常很长、多样化且信息丰富,将复杂的视觉内容、图形、语音、声音和音乐以连续流的形式结合在一起。这与人类似乎感知世界的方式非常相似:作为一个持续的音视频序列。然而,尽管大型语言模型(LLMs)在许多现实世界任务中取得了显著进展,但它们以人类般的方式理解和推理视频的能力仍然相对未被充分探索。在此之后,除非另有说明,我们使用“视频”一词来指代音视频序列。 Figure 1: Comparison of AVF with current SOTA model 大多数视频理解模型仍然无法处理各种基准测试上的当前 SOTA 模型。
∗项目负责人。排序通过抛硬币决定。 © 2026 NVIDIA. All rights reserved.
第 2 页
与视觉联合处理音频(Zhang et al., 2023, 2025; Zhu et al., 2025)。然而,音频——包括语音、声音和音乐——是一种基础模态,甚至被描述为“观影体验的50%”(Lucas, 1992)。
最近的音视频和全模态大语言模型展现了前景(Xu et al., 2025a; Team, 2026b),但大多数主要关注短视频理解(Chowdhury et al., 2024)。相比之下,人类消费的许多视频内容是中长形式的,如电影、电视、讲座和纪录片。
长形式音视频理解的一个核心挑战是缺乏合适的数据:公开可用的资源通常仅为音频或视频,或集中于带有字幕和问题解答(QA)标注的短视频。此外,当前模型在联合音视频感知方面仍存在显著弱点(Gong et al., 2024; Zhou et al., 2026; Goel et al., 2026; Chowdhury et al., 2025; Fu et al., 2025a),我们将其归因于架构限制以及大规模高质量配对音视频数据的稀缺(Seth et al., 2025; Selvakumar et al., 2025)。最近的机制分析部分地将此归因于视觉偏差,即深层网络优先处理视觉并抑制潜在的音频表示(Selvakumar et al., 2026)。在实践中,许多现有的全模态模型是分别针对音频和视频理解进行训练的,预计仅以隐式方式获得跨模态推理能力。最后,最强的音视频理解模型要么是闭源的(Team et al., 2024),要么仅开放权重(Xu et al., 2025b; Team, 2026b),其训练数据、代码和方法论均未公开。这限制了开放进展以及对这些系统构建方式的理解。
主要贡献。在本工作中,我们提出了 Nemotron-Labs-Audio-Visual Flamingo (AV-Flamingo 或 AVF),这是一个完全开放的 multimodal large language model,用于对长且复杂的真实世界视频进行联合音视频理解。AV-Flamingo 是迈向扩展开放音视频智能的第一步,超越了学术基准,通过利用互联网规模的音视频数据和针对推理的有目标后训练来实现。为此,AV-Flamingo 围绕三个技术组件构建。首先,我们引入了 Audio-Visual-Skills (AV-Skills),这是一个用于联合音视频理解和推理的大规模数据集。与严重依赖单模态数据并希望隐式学习跨模态推理的先前全模态模型不同,AV-Skills 是明确为跨模态学习而策划的。它包含从不同来源收集的视频,并配有旨在测试和训练音视频推理能力的字幕和 QA 标注,总计约 700 万条字幕和 QA 训练实例,包括约 480 万对 QA 对,涵盖短视频和长视频。其次,我们提出了 Temporal Audio-Visual Interleaved Chain-of-Thought (TAVIT),这是一种推理框架,将中间推理步骤明确地锚定在长音视频流的时间戳上。第三,我们开发了一种新颖的三阶段训练课程,包括具有不同数据混合的预训练、中训练和后训练。AV-Flamingo 在超过 15 个音视频、全模态、音频和视觉基准测试中优于大小相似或更大的模型。总之,我们的主要贡献如下:
1. 我们引入了 Nemotron-Labs-Audio-Visual Flamingo,这是一个完全开放的前沿 AVLLM,用于对长且复杂的真实世界视频进行联合音视频理解和推理。
2. 我们提出了一种可扩展的下一代 AV-LLM 配方,包括互联网规模的音视频数据策划、有针对性的能力扩展以及针对长视频的时间锚定推理。
3. 我们开源了模型、训练和推理代码,以及相关技术,以支持开放音视频大语言模型的未来研究。
4. AV-Flamingo 在 15 多个基准测试中优于大小相似的 AV 和全模态 LLM,并且在某些情况下甚至超越了更大规模的开放权重和闭源模型,保持极高的竞争力。此外,它在长且复杂的真实世界视频上表现出显著更强的鲁棒性。
2. 相关工作
音视频大语言模型。多模态 LLM 的最新进展产生了越来越强大的视觉语言模型,从 Flamingo (Alayrac et al., 2022)、BLIP-2 (Li
2
第 3 页
et al., 2023),以及 LLaVA(Liu et al., 2023b),到近期系统如 InternVL 2.5(Chen et al., 2024d)、Qwen3-VL(Bai et al., 2025)、VideoLLaMA 3(Zhang et al., 2025)和 Qwen3.5(Team, 2026a)。与此同时,LTU(Gong et al., 2023b)、SALMONN(Tang et al., 2023)、Qwen2-Audio(Chu et al., 2024)和 Audio Flamingo 3(Goel et al., 2025)等音频-语言模型在语音、声音和音乐理解方面取得了进展。然而,将音频和视觉流整合到单一模型中在定性上更加困难,需要跨模态对齐、时间同步以及处理多样化的输入组合。早期的 AV-LLM 如 Video-LLaMA(Zhang et al., 2023)为每种模态使用独立的 Q-Formers;Video-LLaMA 2(Cheng et al., 2024)通过时空卷积连接器改进了这一点;video-SALMONN(Sun et al., 2024; Tang et al., 2025)提出了多分辨率因果 Q-Formers;Dolphin(Guo et al., 2025)引入了多尺度适配器;TriSense(Li et al., 2025d)提出了基于查询的自适应模态重加权。在全模态前沿,GPT-4o(Hurst et al., 2024)和 Gemini 1.5 Pro(Team et al., 2024)等专有系统设立了高基准,而开源模型迅速缩小了差距:Qwen2.5-Omni(Xu et al., 2025a)引入了 thinker-talker 架构,Qwen3-Omni(Xu et al., 2025b)和 Qwen3.5-Omni(Team, 2026b)进一步扩展了这一架构,Phi-4-Multimodal(Abouelenin et al., 2025)展示了用于紧凑全模态模型的 Mixture-of-LoRAs,OmniVinci(Ye et al., 2025)引入了共享的全模态对齐以及一个包含 2400 万样本的合成管道。然而,大多数这些系统侧重于短至中等的视频片段,而非长篇幅、具有时间基础(temporally grounded)的音视频推理。此外,许多系统仍是闭源或仅开放权重,阻碍了可复现性——AV-Flamingo 正是为了解决这一差距。
长视频理解与时间推理。理解长视频仍然是多模态 AI 的核心开放挑战之一,因为大多数当前的视频 LLM 仍局限于短于一分钟的片段。近期在长视频理解方面的进展主要集中在纯视觉设置上,通常不包含音频(Li et al., 2024b; Cheng et al., 2024),许多方法依赖上下文缩减来处理长视频,这可能会损害现实场景中的性能(Zhang et al., 2024a; Qian et al., 2024; Li et al., 2025c)。近期的全模态模型是一个显著的例外,其中一些开始支持长音频-视觉序列 Team (2026b); Deshmukh et al. (2026)。然而,Video-MME(Fu et al., 2025a)和 MMOU(Goel et al., 2026)等基准测试显示,随着视频时长的增加,性能出现系统性下降——MMOU 显示最佳专有模型在长音频-视觉推理上的准确率仅为 64.2%,而开源模型则停滞在 46.8%。另一方面,时间链式思维推理(temporal chain-of-thought reasoning)作为一个有前景的方向应运而生:Temporal CoT(Arnab et al., 2025)逐步缩小长视频问答的注意力范围,Open-o3-Video(Meng et al., 2025)将时空证据整合到推理链中,UniTime(Liu et al., 2024)将时间戳令牌与视频令牌交错,Audio Flamingo 3(Goel et al., 2025)引入了针对音频事件的按需思考(on-demand thinking)。在音频领域,R1-AQA(Li et al., 2025a)和 Step-Audio-R1(Tian et al., 2025)展示了 CoT 的收益,尽管主要是在短音频上。然而,没有任何先前工作将中间推理步骤同时锚定在音频和视觉流的时间戳上,我们提出通过 AV-Think 来填补这一空白。
数据策展。高质量数据仍然是构建多模态基础模型的主要瓶颈,包括音频(Panayotov et al., 2015; Gemmeke et al., 2017; Galvez et al., 2021)、视频(Miech et al., 2019; Bain et al., 2022; Chen et al., 2024b),尤其是长视频理解方面。这一挑战在音频-视觉模型中更为显著(Liu et al., 2025b),因为高质量的联合音频-视觉监督数据在公开领域很少见(Geng et al., 2025)。大多数现有资源要么是单模态的,要么是音频-视觉的,但主要局限于短视频和以识别为导向的任务。例如,许多当前的音频-视觉 LLM 主要基于短格式音频-视觉数据进行训练(Sun et al., 2024; Cheng et al., 2024; Xu et al., 2025a; Fu et al., 2025b),而 OmniVinci 等模型则严重依赖独立的单模态音频和视频语料库。为了填补这一空白,我们引入了 Audio-Visual-Skills,这是一个大规模数据集,旨在支持长篇幅、真实世界视频中的时间、组合和跨模态推理,涵盖 13 个技能类别。
第 4 页
图 2:AV-Flamingo 的训练与架构。上部:以 OmniVinci 为起点,AV-Flamingo 分三个阶段进行训练:在 AV-Skills 短上下文数据上进行预训练,在 AV-Skills 长上下文数据上进行中期训练,以及在链式思维数据上进行后训练,从而生成 AVF-Instruct 和 AVF-Think。下部:AV-Flamingo 接受图像、视频、音频和文本输入。视觉和音频流通过独立的编码器和适配器进行编码,压缩为音视频嵌入,进行时间分组,并使用旋转时间嵌入(Rotary Time Embedding)与提示文本令牌对齐,随后由大语言模型(LLM)进行处理。
3. 方法论
3.1 架构
在本节中,我们讨论如图 2 所示的 Audio-Visual Flamingo 架构。AVF 是一种音视频大语言模型(AVLM),旨在对视觉和听觉输入(两者或其中之一)进行联合推理,同时通过语音合成支持基于语音的交互。该架构与 OmniVinci 类似,由五个关键组件组成:i) SigLip 视觉编码器,从视觉输入(例如图像、视频帧)中提取丰富的空间特征;ii) AF-Whisper(借用于 Audio Flamingo 系列),一种具有滑动窗口特征提取机制的音频编码器,用于处理长音频;iii) 跨模态交错和时间对齐模块,沿时间轴融合视频和音频表示;iv) 纯文本大语言模型,作为核心推理骨干;v) 流式文本转语音(TTS)模块,实现实时语音输出。下文将详细讨论每个组件。
SigLip 视觉编码器。为了编码视觉输入,我们采用 SigLip (Zhai et al., 2023) 视觉编码器,
4
第 5 页
从而从图像或视频帧中生成密集的特征表示 $V$。给定原始输入,我们首先从预训练的 SigLip 模型中提取特征图。这些特征图随后通过“空间-尺度-然后压缩”动态 S2 模块(Dynamic S2 module),遵循 Liu 等人 (2025a) 和 Ye 等人 (2025) 的设计原则。动态 S2 模块首先以多种空间尺度对输入图像进行编码,然后将多尺度表示压缩为紧凑的 token 序列。这种多尺度策略使 AVF 能够编码更高分辨率的图像和包含更多帧的更长视频,同时保留细粒度的空间和时序细节——关键在于,这不会导致 LLM 消耗的 token 总数成比例增加。因此,我们获得单个图像(或视频的每一帧)的特征表示,记为 $h_v = f_v(V)$,其中 $h_v \in \mathbb{R}^{HW \times d_v}$,$H$ 和 $W$ 是压缩后的视觉特征图的空间高度和宽度,$d_v$ 是视觉编码器的隐藏维度。
AF-Whisper 音频编码器。遵循 Audio Flamingo 3、Next 和 Music Flamingo,我们采用来自 AF-Next (Goel 等人, 2025; Ghosh 等人, 2025a) 的基于 Whisper 的 AF-Whisper 音频编码器。对于每个音频输入 $A$,我们首先将其重采样为 16 kHz 单声道,以标准化不同音频源的采样率。然后,使用 25 ms 的窗口大小和 10 ms 的步长,将重采样后的原始波形转换为 128 通道的对数梅尔频谱图,生成适合下游编码器的时频表示。该梅尔频谱图由编码器处理 (Goel 等人, 2025; Ye 等人, 2025),该编码器应用滑动窗口机制来处理任意长度的音频:频谱图被分割为不重叠的 30 秒块,每个块被独立编码,然后沿时间轴连接。这产生了音频特征,记为 $h_a = f_a(A)$,其中 $h_a \in \mathbb{R}^{N \times d_a}$,$N$ 是 30 秒音频块的总数,$d_a$ 是 Whisper 编码器的隐藏维度。滑动窗口设计使 AVF 能够处理长格式音频(例如完整长度的播客剧集或电影原声带),而无需截断或过度消耗内存。
视觉和音频适配器。对于每种模态,我们设有投影层,具体而言,音频使用 2 层 MLP,记为 $A(\cdot)$,视觉使用 2 层 MLP,记为 $V(\cdot)$。这些投影将编码器输出映射到 LLM 的嵌入空间:投影后的音频嵌入为 $a = A(h_a)$,投影后的图像/视频嵌入为 $v = V(h_v)$。
视觉和音频的跨模态对齐。多模态架构中的一个核心挑战是在将 token 输入 LLM 之前融合视觉和音频 token。遵循 OmniVinci (Ye 等人, 2025),我们通过时间交错在两种模态之间强制执行跨模态对齐。投影后的视频和音频 token 序列首先沿时间维度划分为多个同步块,然后根据它们的时间戳进行交错,使得来自给定时间窗口的视觉 token 与来自同一窗口的音频 token 相邻放置。这种交错排列允许 LLM 的自注意力机制自然地关注共现的视觉和听觉事件。最后,在将这些交错的 token 嵌入注入 LLM 之前,我们通过受限旋转时间嵌入(Constrained Rotary Time Embeddings, CRTE)(Goel 等人, 2024; Ye 等人, 2025) 为其增强周期性时序信息。这使用正弦旋转变换编码绝对时间位置,使模型即使在交错后也能区分多模态事件的顺序和相对时间。
大型语言模型(LLM)。AVF 的核心推理组件是一个大型语言模型,它处理交错的 multimodal token 序列并生成文本响应。遵循 OmniVinci (Ye 等人, 2025),我们采用 Qwen2.5-7B (Team., 2025) 作为基础 LLM,它包含 70 亿参数、36 个隐藏层和每层 16 个注意力头。LLM 接收时间对齐的交错视觉-音频嵌入作为输入前缀 token,随后是任何基于文本的指令或查询,并自回归地生成文本响应。为了处理第 3.3 节中讨论的长达 15 分钟的长视频的训练长上下文问题,我们使用混合序列并行 (Fang 和 Zhao, 2024) 以及完全分片数据并行 (Rasley 等人, 2020)。这种方法通过将多模态序列维度跨 GPU 分割来减少内存使用,使用 Ulysses (Jacobs 等人, 2023) 进行节点内通信,使用 Ring-Attention (Liu 等人, 2023a) 进行节点间通信。可选地,为了支持语音到语音交互,类似于 Audio Flamingo 3 (Goel 等人, 2025) 和 OmniVinci (Ye 等人, 2025),音视频 Flamingo 模型(AV-Flamingo)集成了一个流式 TTS 模块。更多细节,我们参考 Goel 等人 (2025)。
流式 TTS。为了支持语音到语音交互,类似于 Audio Flamingo 3 (Goel 等人, 2025) 和
5
第 6 页
OmniVinci (Ye 等人, 2025),Audio-Visual Flamingo 整合了一个流式文本转语音(TTS)模块。该模块实现为一个仅解码器的 Transformer,其根据来自大语言模型(LLM)的输入子词文本 token 和先前生成的音频 token,预测下一个音频 token。更多细节,请参阅 Goel 等人 (2025)。
3.2 训练数据
数据仍然是构建开放基础全模态和音视频模型中最关键却最少公开讨论的组成部分之一 (Ye 等人, 2025)。尽管近期的努力改善了纯音频(Galvez 等人, 2021; Ghosh 等人, 2026)和纯图像/视频数据集(Schuhmann 等人, 2022; Zhang 等人, 2024b)的可用性,但用于联合音视频学习的可比资源仍然有限,特别是对于需要整合理解声音与视觉以及跨模态推理的任务而言。现有的音视频问答(QA)数据集通常源自以识别任务为核心的基础基准,如自动语音识别(AVSR)、事件分类或音视频定位(Chen 等人, 2020; Tian 等人, 2018),不足以训练具有强大专家级推理能力的模型 (Goel 等人, 2026)。
在 AVF 中,我们特别强调通过大规模、高质量的音视频 QA 数据来发展推理和问题解决能力。受 Audio Flamingo 系列的启发,除了现有的单模态图像/音频/视频数据集(主要借用于 OmniVinci,并有一些补充,详细统计见表 2)外,我们引入了音视频技能数据集(AV-Skills),这是一个包含来自现有数据集和开放互联网的真实视频的大规模数据集,视频时长多样,并配有高质量的字幕和 QA 标注。与严重依赖单模态监督的先前数据混合不同,AV-Skills 专门针对联合跨模态音视频理解进行策划,重点在于教授模型超越识别的复杂技能,包括对时间跨度长、组合式以及真实世界长视频的推理。
作为数据策划的第一步,我们确定了实现强大真实世界音视频理解所需的关键技能。为此,我们在 WorldSense 和 MMOU 等具有挑战性的基准上评估了前沿的全模态和音视频模型,包括 Qwen-Omni 系列、Gemini 和 VideoLLaMA,并分析其输出以识别系统性的能力差距。特别是,我们将基准 QA 对转换为开放式形式,因为多项选择题设置可能允许模型利用选项偏差或排除启发式方法。我们的分析揭示了核心技能(如计数和时间理解)方面的差距,以及由于对多样化视频类型训练接触有限而导致的分布弱点。例如,现有开放模型中使用的数据大多以博客风格的说话人视频为主,对环境声音、背景音乐和复杂真实世界音视频场景的覆盖相对有限。
为了解决这些局限性,我们策划了两个大规模训练集:AV-Skills-Short,由不超过 60 秒的视频组成;以及 AV-Skills-Long,由 60 秒至 15 分钟之间的视频组成。这些数据集源自两个来源:公开可用的数据集和从开放互联网收集的原始视频,随后我们对其进行合成标注。对于公开数据集,我们主要使用 YouTube-8M (Abu-El-Haija 等人, 2016)、HD-VILA (Xue 等人, 2022)、InternVid (Wang 等人, 2024b) 和 VidChapters (Yang 等人, 2023) 用于短格式数据,以及 HarmonySet (Zhou 等人, 2025)、LSMDC (Rohrbach 等人, 2016)、MMTrail (Chi 等人, 2024)、MovieClips (Bose 等人, 2022) 和 MiraData (Ju 等人, 2024) 用于长格式数据。其余数据从开放互联网收集,强调类别多样性 (Goel 等人, 2026),涵盖播客、城市游览、采访、体育等领域(图 4)。我们最终的 AV-Skills-Short 数据集包含 10 万小时的视频和 380 万个训练实例,包括 100 万条字幕和 280 万个 QA 对(详细统计见表 2)。长视频训练数据包含约 14 万小时的视频和 320 万个训练实例,包括 120 万条字幕和 200 万个 QA 对。对于 AV-Skills-Short,我们关注以下技能(示例见附录 B):(i) 关系推理涉及理解视频中实体(包括人物、物体、角色及其相对配置)之间的关系、交互或区别。(ii) 情绪变化侧重于追踪人物或角色情绪状态随时间的演变,包括初始情绪、最终情绪以及两者之间的过渡。(iii) 时间推理捕捉视频的时间结构,包括事件顺序、目标事件之前或之后发生的事情,以及动作随时间的展开方式。(iv) 空间感知
第 7 页
图 3:Audio-Visual-Skills 中问题类型的示例。更多示例见图 5 和表 3,详细信息见附录 B。
需要感知视觉场景中的空间属性,例如人或物体的方向、朝向、相对位置、对齐方式和放置位置。(v) 因果推理旨在通过将观察到的结果与其根本原因联系起来,推断事件、行为、动作或结果发生的原因。(vi) 幻觉检测评估问题是否基于视频中实际存在的信息,要求模型拒绝错误的前提或缺乏支持的声明。(vii) 音频计数测试计算视频中特定声音、口语、乐器或其他音频事件发生次数的能力。(viii) 视频计数测量计算视频中特定物体、实体、动作或视觉事件出现次数的能力。
对于 AV-Skills-Long,我们关注以下技能(示例见图 3 和表 2):(i) 大海捞针推理:回答关于长视频中特定但重要的时刻,或仍需要更广泛的音视频上下文才能正确识别的局部事件的问题。(ii) 时间推理:a) 时间指代:识别目标事件之前或之后立即发生的事情。b) 时间顺序:确定多个音视频事件的正确顺序。c) 时间属性:推理场景动态(如强度、节奏或氛围)如何随时间演变。(iii) 子场景理解:基于其前后发生的事件,理解和描述长视频中有意义的中间部分。(iv) 整体推理:通过整合分布在视频大部分内容中的音视频证据,推断高层目标、动机或结果。(v) 计数:计算整个视频中特定音视频事件、交互或重复模式出现的次数。(vi) 音视频指代:将一种模态中的事件与其在另一种模态中的对应事件联系起来,例如识别与声音相关的视觉场景,或识别与视觉事件相关的声音。(vii) 主题级推理:通过综合整个时间线上的证据,识别视频的主要活动、目标或整体主题。(viii) 详细描述:生成对整个视频的全面音视频描述,捕捉关键动作、场景变化、声音和口语内容,且不冗余。(ix) 事件序列推理:确定视频时间线上关键音视频事件的相对顺序。(x) 音视频事件对齐:识别与视觉时刻完全吻合的声音,或与目标音频提示完全同步的视觉事件。(xi) 推理:关于隐含意图、原因或结果得出结论
7
第 8 页
通过结合未直接陈述的多个音视频线索。(xii) 比较推理:识别同一视频中两个音视频事件、场景或演示之间的重要差异或相似之处。(xiii) 情境理解:通过对视觉细节、声音和语音进行联合推理,推断更广泛的情境设置、背景上下文或场景条件。
AV-Think。最后,我们引入时间音视频交错链式思维(Temporal Audio-Visual Interleaved Chain-of-Thought, TAVIT),这是一种推理框架,教导模型将中间推理步骤锚定在相互依赖的音频和视频流的时间戳上(示例见图 3)。先前关于视频理解的链式思维(CoT)工作仍然有限,主要集中于纯视频设置或近期全模态模型中的浅层推理轨迹。现有方法通常只能带来适度的提升,有时甚至会导致性能下降(Team, 2026b),部分原因是当前的音频或音视频 CoT 数据主要局限于短视频片段,且推理是事后附加在简单问答对上的。
我们认为,显式推理在长而复杂的真实世界视频中最为有用,因为证据分布在多个重叠且时间分散的事件中。为了弥补这一空白,我们构建了 AV-Think,这是一个用于时间锚定音视频推理的问答推理三元组数据集。与先前工作不同,AV-Think 在带时间戳的推理步骤中明确交错音频和视觉证据,从而将推理准确性与时间锚定联系起来。
AV-Think 是从具有挑战性的长视频(包括预告片、电影回顾、悬疑故事和多方面对话)中精心策划的,并配有需要扩展时间推理的问题。我们将推理锚定在时间上,因为 (i) 带时间戳的思维有助于模型导航并对长音视频流进行推理,以及 (ii) 将中间推理锚定在时间事件上可以提高识别性能(Kumar et al., 2026)。为了构建该数据集,我们首先使用 TAC 风格流水线为每个视频生成带时间戳的标题,然后在这些标题上提示大型语言模型(LLM)以合成推理三元组(见图 20 中的提示)。AV-Think 包含约 24K 个训练样本,推理链平均长度为 635.7 个单词。
3.3 训练课程
我们设计了一个三阶段课程来训练 AVF。在每个阶段,我们采用不同的数据混合,旨在逐步增加上下文长度和任务复杂性。我们假设不同的能力在训练的不同阶段涌现:基础的听觉和视觉技能最好在早期通过单模态和短上下文数据获得,在此期间,模型还获得了弱音视频对齐。另一方面,强音视频对齐、长上下文理解以及更复杂的技能(如时间理解)需要后期使用长、真实世界、复杂数据进行专业化训练。我们在表 2 中提供了完整的数据混合比例,并在第 4 节中描述了训练技术,包括训练超参数。
预训练。此阶段包含两个旨在建立基础能力的阶段。在第 1 阶段:初始化阶段,我们从预训练的 OmniVinci (Ye et al., 2025) 检查点初始化 AVF,该检查点提供了已对齐的视觉、音频和语言表示的强大起点。在第 2 阶段:短上下文训练,我们在单模态数据集的混合数据上对模型进行全微调——涵盖纯音频和纯视觉任务,如分类、标题生成、自动语音识别(ASR)和图像/视频问答——以及我们新策划的 AV-Skills-Short 数据。单模态数据确保保留并加强从 OmniVinci 继承的模态特定能力,而 AV-Skills-Short 数据引入了 Audio-Visual Flamingo 独有的跨模态推理能力。此阶段的最大音视频时长限制为 5 分钟,重点放在高质量的中短长度示例上,因为技能特定的监督在这些示例中最可靠且可扩展。此阶段的总上下文长度限制为 16K 个令牌。
中期训练。基于预训练第 2 阶段后获得的能力,此阶段侧重于扩展 AVF 对更长音视频输入的理解。我们通过 AV-Skills-Long 数据扩展数据混合,该数据专注于长格式标题生成、需要精确时间锚定的时间感知注释以及长上下文问答数据集。为了保持平衡的训练分布,我们
8
第 9 页
表 1:AVF 模型变体在 Omni、Audio、Video 和 Speech Understanding 基准测试上的性能对比(WER ↓ 和 ACC ↑)。我们高亮显示了闭源、开放权重和开源模型。
| 任务 | 数据集 | 模型 | 指标 | 结果 | | :— | :— | :— | :— | :— | | | | Qwen2.5-Omni | | 45.4 | | | | OmniVinci | | 48.2 | | | WorldSense | ACC ↑ | | | | | | AVF-Instruct | | 50.3 | | | | AVF-Think | | 51.6 | | | | OmniVinci | | 66.5 | | Omni | DailyOmni | AVF-Instruct | ACC ↑ | 72.4 | | Understanding | | AVF-Think | | 73.9 | | | | Gemini-1.5 Pro | | 47.6 | | | OmniBench | AVF-Instruct | ACC ↑ | 48.5 | | | | AVF-Think | | 50.6 | | | | Gemini-2.5 Pro | | 64.2 | | | | Minicpm-o 4.5 | | 46.8 | | MMOU | | ACC ↑ | | | | | | AVF-Instruct | | 56.9 | | | | AVF-Think | | 60.2 | | | | Gemini-2.0 Flash | | 83.3 \| 63.3 | | | AVHBench | AVF-Instruct | ACC ↑ | 77.0 \| 81.1 | A->V Hall. \| V->A Hall. | | | | AVF-Think | | 79.0 \| 85.9 | | | | OmniVinci | | 58.4 | | MMAR | | AVF-Instruct | ACC ↑ | 60.1 | | | | Gemini 1.5 Pro | | 60.7 | | MMSU | | ACC ↑ | | | | Audio | | AVF-Instruct | | 61.5 | | Understanding | | Audio Flamingo 3 | | 75.83 \| 74.47 \| 66.97 \| 72.42 | | | MMAU-v05.15.25 (test) | | | | | | | OmniVinci | ACC ↑ | 73.57 \| 73.07 \| 68.17 \| 71.60 | | | Sound \| Music \| Speech \| Avg | | | | | | | AVF-Instruct | | 77.97 \| 73.17 \| 69.33 \| 73.49 | | | | Gemini 2.5 Pro | | 82.0 | | CMM Hallucination | | ACC ↑ | | | | | | AVF-Instruct | | 86.7 | | | NVILA | | 64.2 \| – | | | Video-MME | OmniVinci | ACC ↑ | 67.3 \| 68.6 | w/o subtitles \| w/ subtitles | | Video | | AVF-Instruct | | 70.7 \| 71.2 | | Understanding | OmniVinci | | 62.0 | | | LongVideoBench | NVILA | ACC ↑ | 58.7 | | | | | AVF-Instruct | | 60.1 | | | OmniVinci | | 70.6 | | | MVHBench | | ACC ↑ | | | | | | AVF-Instruct | | 71.7 | | LibriSpeech (en) | Phi-4-mm \| Qwen2.5-O | | 1.67 \| 3.4 | | | | test-clean \| test-other | WER ↓ | | | | | | AVF-Instruct | | 1.64 \| 3.5 | | | Qwen2-A-Inst | | 3.0 | | | SPGISpeech (en) | | WER ↓ | | | | | | AVF-Instruct | | 2.8 | | Automatic Speech | | | | | | Recognition | Phi-4-mm | | 2.9 | TEDLIUM (en) WER ↓ | | | | AVF-Instruct | | 3.0 | | | Phi-4-mm | | 9.78 | | | GigaSpeech (en) | | WER ↓ | | | | | | AVF-Instruct | | 10.2 | | | Phi-4-mm | | 5.9 | | | VoxPopuli (en) | | WER ↓ | | | | | | AVF-Instruct | | 5.8 |
此外,还包括来自预训练阶段的 AV-Skills-Short 数据的下采样子集,确保在模型学习对扩展时间上下文进行推理的同时,保留先前获得的技能。此阶段的最大音频/视频持续时间增加到 15 分钟,总上下文长度扩展到 32K 个 token。由此产生的完全训练模型被称为 AVF-Instruct。
9
第 10 页
后训练。最后,我们在 AV-Think 数据集上对 AVF 进行基于时间定位的链式思维(CoT)训练。从 AVF-Instruct 出发,我们首先在 AV-Think 上执行监督微调(SFT),鼓励模型生成结构化的、逐步的推理依据,这些依据锚定于音频-视觉输入中的特定实例。随后,我们使用基于 GRPO 的强化学习(Shao et al., 2024)(更多细节见附录 E)对模型进行训练,以进一步增强模型的推理质量。此阶段获得的最终模型被称为 AVF-Think。
4. 实验
实验设置。我们在 512 块 NVIDIA H100 GPU 上对 Audio Visual Flamingo 进行预训练、长上下文训练和后训练。有关每个训练阶段的批量大小、学习率和优化器的更多细节见附录 C。
基线模型。我们将提出的模型与最近的 SOTA 开源和专有 MLLM(大型多模态语言模型,包括 Qwen2.5-O(mni) (Xu et al., 2025a)、Qwen3-O(mni) (Xu et al., 2025b)、OmniVinci (Ye et al., 2025)、Gemini (2.0 Flash, 1.5 Pro, 2.5 Flash 和 2.5 Pro) (Team et al., 2024; Team, 2025) 以及 GPT-4o (Hurst et al., 2024))进行评估。此外,针对音频和语音理解,我们还与专门的大型音频语言模型(LALMs)进行比较,例如 Audio Flamingo (Kong et al., 2024)、Audio Flamingo 2 (Ghosh et al., 2025b)、Audio Flamingo 3 (Goel et al., 2025)、Qwen-A(udio) (Chu et al., 2023)、Qwen2-A(udio) (Chu et al., 2024)、Qwen2-A(udio)-(Inst)ruct、R1-AQA Li et al. (2025a)、Pengi (Deshmukh et al., 2024)、Phi-4-mm (Abouelenin et al., 2025)、Baichun Audio (Li et al., 2025b)、Step-Audio-Chat (Tian et al., 2025)、LTU (Gong et al., 2023b)、LTU-AS (Gong et al., 2023a)、SALMONN (Tang et al., 2023) 和 AudioGPT (Huang et al., 2023)。同样,针对视频理解,我们与专门的视觉语言模型(VLMs)进行比较,例如 VILA (Lin et al., 2024)、LongVILA (Chen et al., 2024c)、NVILA (Liu et al., 2025a)、InternVL (Chen et al., 2024e)、Qwen2-VL (Wang et al., 2024a)、LLaVA-OneVision (Li et al., 2024a) 和 Florence-VL (Chen et al., 2024a)。
评估数据集。我们在涵盖音频理解(MMAR (Ma et al., 2025)、MMSU (Wang et al., 2026)、MMAU (v05.15.25) (Sakshi et al., 2024))的多样化基准上评估我们的模型,这些基准涵盖声音、音乐和语音推理;视频理解(Video-MME (Fu et al., 2025a)、ActivityNetQA (Yu et al., 2019)、LongVideoBench (Wu et al., 2024)),捕捉视觉理解以及时间推理;全模态/多模态理解(WorldSense (Hong et al., 2026) 和 DailyOmni (Zhou et al., 2026)),评估跨音频和视频信号的联合推理;以及自动语音识别(ASR)(LibriSpeech (clean and other) (Panayotov et al., 2015)、SPGISpeech (O’Neill et al., 2021)、TEDLIUM (Hernandez et al., 2018)、GigaSpeech (Chen et al., 2021)、Common Voice 15),涵盖干净、嘈杂和多样化的真实世界语音条件。
5. 结果
音频理解与推理。尽管 AVF-Instruct 是作为联合音频-视觉模型训练的,但它展现出强大的向纯音频理解和推理的迁移能力。它在 MMAR 上优于 OmniVinci(60.1 对 58.4),并在 MMSU 上超过 Gemini 1.5 Pro(61.5 对 60.7)。在 MMAU 上,AVF-Instruct 取得了最佳的整体平均分(73.49),优于 AF3 和 OmniVinci,尤其在声音和语音理解方面取得了显著增益。对于 ASR,AVF 在 LibriSpeech test-clean(1.64 WER)、SPGISpeech(2.8)和 VoxPopuli(5.8)上取得了最佳结果,而在其他数据集上仍与最强基线模型保持接近。
视频与全模态理解。AVF-Instruct 在纯视频和全模态评估中也表现出一致的增益。在 Video-MME 上,它在无字幕(70.7)和有字幕(71.2)情况下均取得了最佳性能,优于 NVILA 和 OmniVinci。在 WorldSense 和 DailyOmni 上,AVF-Instruct 再次设定了最强结果,表明其在跨模态的联合感知和推理方面表现更佳。在 LongVideoBench 上,虽然 OmniVinci 仍然略强,但 AVF-Instruct 仍优于 NVILA,并在长视频理解方面保持竞争力,表明其能有效扩展至具有挑战性的长视频场景。
10
第 11 页
真实世界视频场景。MMOU 上的结果强调 AVF 是长时序和复杂音视频理解领域的最佳模型。更多定性示例见表 7 及我们的项目页面。消融实验:表 5 总结了紧凑的 AVF 训练配方。表 6 提供了附录中关于我们的 AV-Skills 课程学习的消融研究。
6. 结论、局限性与未来工作
我们提出了 AV-Flamingo,这是一个完全开源的 AV-LLM,用于对长时序和复杂的真实世界视频进行联合理解与推理。AV-Flamingo 结合了 AV-Skills(一个用于联合跨模态学习的大规模数据集)、一个从短上下文感知扩展到长时序推理的三阶段课程学习策略,以及 TAVIT(一种将中间思维锚定到音视频流时间戳的推理框架)。实验表明,该模型在多样化的基准测试中表现出色,尤其在长时序和复杂的真实世界视频上取得了显著增益。
AV-Flamingo 仍存在若干局限性。AV-Skills 构建于公开数据集和开放互联网视频之上,这可能引入来源偏差以及与先前训练数据的潜在重叠。此外,对非常长且高度密集的视频进行推理仍然具有挑战性,尤其是在证据稀疏或时间分散的情况下。最后,当前的基准测试未能完全捕捉开放式的真实世界部署场景。在未来的工作中,我们计划将 AV-Skills 扩展到更广泛的领域和更具挑战性的长格式场景,改进长上下文推理能力,并为开放音视频系统开发更真实的评估协议。
参考文献
Abdelrahman Abouelenin, Atabak Ashfaq, Adam Atkinson, Hany Awadalla, Nguyen Bach, Jianmin Bao, Alon Benhaim, Martin Cai, Vishrav Chaudhary, Congcong Chen, et al. Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras. arXiv preprint arXiv:2503.01743, 2025.
Sami Abu-El-Haija, Nisarg Kothari, Joonseok Lee, Paul Natsev, George Toderici, Balakrishnan Varadarajan, and Sudheendra Vijayanarasimhan. YouTube-8M: A large-scale video classification benchmark. arXiv preprint arXiv:1609.08675, 2016.
Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, et al. Flamingo: a visual language model for few-shot learning. Advances in neural information processing systems, 35:23716–23736, 2022.
Anurag Arnab, Ahmet Iscen, Mathilde Caron, Alireza Fathi, and Cordelia Schmid. Temporal chain of thought: Long-video understanding by thinking in frames. arXiv preprint arXiv:2507.02001, 2025.
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025.
Max Bain, Arsha Nagrani, Gül Varol, and Andrew Zisserman. Frozen in time: A joint video and image encoder for end-to-end retrieval, 2022. URL https://arxiv.org/abs/2104.00650.
Beijing DataTang Technology Co., Ltd. aidatatang_200zh: A free Chinese Mandarin speech corpus. https: //www.openslr.org/62/, 2018. OpenSLR resource 62.
Digbalay Bose, Rajat Hebbar, Krishna Somandepalli, Haoyang Zhang, Yin Cui, Kree Cole-McLaughlin, Huisheng Wang, and Shrikanth Narayanan. Movieclip: Visual scene recognition in movies, 2022. URL https://arxiv.org/abs/2210.11065.
Hui Bu, Jiayu Du, Xingyu Na, Bengu Wu, and Hao Zheng. Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline. In Oriental COCOSDA 2017, 2017.
11
第 12 页
Roldano Cattoni, Mattia Antonino Di Gangi, Luisa Bentivogli, Matteo Negri, 和 Marco Turchi。Must-c: 用于端到端语音翻译的多语言语料库。Computer speech & language, 66:101155, 2021.
Guoguo Chen, Shuzhou Chai, Guan-Bo Wang, Jiayu Du, Wei-Qiang Zhang, Chao Weng, Dan Su, Daniel Povey, Jan Trmal, Junbo Zhang, Mingjie Jin, Sanjeev Khudanpur, Shinji Watanabe, Shuaijiang Zhao, Wei Zou, Xiangang Li, Xuchen Yao, Yongqing Wang, Zhao You, 和 Zhiyong Yan。Gigaspeech: 一个不断演进的、包含10,000小时转录音频的多领域自动语音识别语料库。在 Interspeech 2021, 第 3670–3674 页。ISCA, 2021年8月。 doi: 10.21437/interspeech.2021-1965. URL http://dx.doi.org/10.21437/Interspeech.2021-1965.
Honglie Chen, Weidi Xie, Andrea Vedaldi, 和 Andrew Zisserman。Vggsound: 一个大规模音视频数据集。在 International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2020.
Jiuhai Chen, Jianwei Yang, Haiping Wu, Dianqi Li, Jianfeng Gao, Tianyi Zhou, 和 Bin Xiao。Florence-vl: 通过生成式视觉编码器和深度-广度融合增强视觉-语言模型, 2024a. URL https://arxiv.org/abs/2412.04424.
Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Ekaterina Deyneka, Hsiang wei Chao, Byung Eun Jeon, Yuwei Fang, Hsin-Ying Lee, Jian Ren, Ming-Hsuan Yang, 和 Sergey Tulyakov。Panda-70m: 使用多个跨模态教师为7000万个视频生成字幕, 2024b. URL https://arxiv.org/abs/2402.19479.
Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Ethan He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Linxi Fan, Yuke Zhu, Yao Lu, 和 Song Han。Longvila: 扩展长上下文视觉语言模型以处理长视频, 2024c. URL https://arxiv.org/abs/2408.10188.
Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, 等。通过模型、数据和测试时扩展扩展开源多模态模型的性能边界。arXiv 预印本 arXiv:2412.05271, 2024d.
Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, 和 Jifeng Dai。Internvl: 扩展视觉基础模型并针对通用视觉-语言任务进行对齐, 2024e. URL https://arxiv.org/abs/2312.14238.
Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, 等。Videollama 2: 推进视频大语言模型中的时空建模和音频理解。arXiv 预印本 arXiv:2406.07476, 2024.
Xiaowei Chi, Yatian Wang, Aosong Cheng, Pengjun Fang, Zeyue Tian, Yingqing He, Zhaoyang Liu, Xingqun Qi, Jiahao Pan, Rongyu Zhang, Mengfei Li, Ruibin Yuan, Yanbing Jiang, Wei Xue, Wenhan Luo, Qifeng Chen, Shanghang Zhang, Qifeng Liu, 和 Yike Guo。Mmtrail: 一个带有语言和音乐描述的多模态预告片视频数据集, 2024. URL https://arxiv.org/abs/2407.20962.
Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Jun Chen, Mohamed Elhoseiny, Ruohan Gao, 和 Dinesh Manocha。Meerkat: 用于时空定位的音视频大语言模型。在 European Conference on Computer Vision, 第 52–70 页。Springer, 2024.
Sanjoy Chowdhury, Hanan Gani, Nishit Anand, Sayan Nag, Ruohan Gao, Mohamed Elhoseiny, Salman Khan, 和 Dinesh Manocha。Aurelia: 音视频大语言模型中的测试时推理蒸馏。在 IEEE/CVF International Conference on Computer Vision (ICCV) 论文集, 第 22899–22910 页, 2025年10月.
Yunfei Chu, Jin Xu, Xiaohuan Zhou, Qian Yang, Shiliang Zhang, Zhijie Yan, Chang Zhou, 和 Jingren Zhou。Qwen-audio: 通过统一的大规模音频-语言模型推进通用音频理解, 2023. URL https://arxiv.org/abs/2311.07919.
Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, 等。Qwen2-audio 技术报告。arXiv 预印本 arXiv:2407.10759, 2024.
12
第 13 页
Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Da- nial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, 等人。Nemotron 3 nano omni:高效且开放的多模态智能。arXiv 预印本 arXiv:2604.24954,2026。
Soham Deshmukh, Benjamin Elizalde, Rita Singh, 和 Huaming Wang。Pengi:用于音频任务的音频语言模型,2024。URL https://arxiv.org/abs/2305.11834。
Jiarui Fang 和 Shangchun Zhao。Usp:一种用于长上下文生成式 AI 的统一序列并行方法。arXiv 预印本 arXiv:2405.07719,2024。
Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等人。Video-mme:首个针对视频分析中多模态大型语言模型的综合评估基准。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 24108–24118 页,2025a。
Chaoyou Fu, Haojia Lin, Zuwei Long, Yunhang Shen, Yuhang Dai, Meng Zhao, Yi-Fan Zhang, Shaoqi Dong, Yangze Li, Xiong Wang, Haoyu Cao, Di Yin, Long Ma, Xiawu Zheng, Rongrong Ji, Yunsheng Wu, Ran He, Caifeng Shan, 和 Xing Sun。Vita:迈向开源交互式全模态多模态大型语言模型,2025b。URL https://arxiv.org/abs/2408.05211。
Daniel Galvez, Greg Diamos, Juan Ciro, Juan Felipe Cerón, Keith Achorn, Anjali Gopi, David Kanter, Maximilian Lam, Mark Mazumder, 和 Vijay Janapa Reddi。The people’s speech:一个用于商业用途的大规模多样化英语语音识别数据集,2021。URL https://arxiv.org/abs/2111.09344。
Jort F. Gemmeke, Daniel P. W. Ellis, Dylan Freedman, Aren Jansen, Wade Lawrence, R. Channing Moore, Manoj Plakal, 和 Marvin Ritter。Audio Set:一个用于音频事件的本体和人工标注数据集。在 IEEE 国际声学、语音和信号处理会议 (ICASSP) 论文集,美国路易斯安那州新奥尔良,2017。IEEE。
Tiantian Geng, Jinrui Zhang, Qingni Wang, Teng Wang, Jinming Duan, 和 Feng Zheng。Longvale:面向长视频时间感知全模态感知的视觉-音频-语言-事件基准,2025。URL https://arxiv.org/abs/2411.19772。
Sreyan Ghosh, Arushi Goel, Lasha Koroshinadze, Sang-gil Lee, Zhifeng Kong, Joao Felipe Santos, Ramani Duraiswami, Dinesh Manocha, Wei Ping, Mohammad Shoeybi, 等人。Music flamingo:扩展音频语言模型中的音乐理解能力。arXiv 预印本 arXiv:2511.10289,2025a。
Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, 和 Bryan Catanzaro。Audio flamingo 2:具有长音频理解和专家推理能力的音频-语言模型,2025b。URL https://arxiv.org/abs/2503.03983。
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, 和 Wei Ping。Audio flamingo next:面向语音、声音和音乐的下一代开源音频-语言模型,2026。URL https://arxiv.org/abs/2604.10905。
John J. Godfrey 和 Edward Holliman。Switchboard-1 release 2 (ldc97s62)。语言数据联盟,费城,1993。网络下载。
Arushi Goel, Karan Sapra, Matthieu Le, Rafael Valle, Andrew Tao, 和 Bryan Catanzaro。Omcat:全上下文感知 Transformer。arXiv 预印本 arXiv:2410.12109,2024。
Arushi Goel, Sreyan Ghosh, Jaehyeon Kim, Sonal Kumar, Zhifeng Kong, Sang-gil Lee, Chao-Han Huck Yang, Ramani Duraiswami, Dinesh Manocha, Rafael Valle, 等人。Audio flamingo 3:通过完全开源的大型音频语言模型推进音频智能。arXiv 预印本 arXiv:2507.08128,2025。
Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, 等人。Mmou:面向长且复杂真实世界视频的大规模多任务全理解与推理基准。arXiv 预印本 arXiv:2603.14145,2026。
13
第 14 页
Kaixiong Gong, Kaituo Feng, Bohao Li, Yibing Wang, Mofan Cheng, Shijia Yang, Jiaming Han, Benyou Wang, Yutong Bai, Zhuoran Yang, 和 Xiangyu Yue. Av-odyssey bench: Can your multimodal llms really understand audio-visual information?, 2024. URL https://arxiv.org/abs/2412.02611.
Yuan Gong, Alexander H. Liu, Hongyin Luo, Leonid Karlinsky, 和 James Glass. Joint audio and speech understanding, 2023a. URL https://arxiv.org/abs/2309.14405.
Yuan Gong, Hongyin Luo, Alexander H Liu, Leonid Karlinsky, 和 James Glass. Listen, think, and understand. arXiv preprint arXiv:2305.10790, 2023b.
Yuxin Guo, Shuailei Ma, Shijie Ma, Xiaoyi Bao, Chen-Wei Xie, Kecheng Zheng, Tingyu Weng, Siyang Sun, Yun Zheng, 和 Wei Zou. Aligned better, listen better for audio-visual large language models, 2025. URL https://arxiv.org/abs/2504.02061.
Haorui He, Zengqiang Shang, Chaoren Wang, Xuyuan Li, Yicheng Gu, Hua Hua, Liwei Liu, Chen Yang, Jiaqi Li, Peiyang Shi, 等. Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation. In 2024 IEEE Spoken Language Technology Workshop (SLT), pages 885–890. IEEE, 2024.
François Hernandez, Vincent Nguyen, Sahar Ghannay, Natalia Tomashenko, 和 Yannick Estève. TED-LIUM 3: Twice as Much Data and Corpus Repartition for Experiments on Speaker Adaptation, page 198–208. Springer International Publishing, 2018. ISBN 9783319995793. doi: 10.1007/978-3-319-99579-3_21. URL http://dx.doi.org/10.1007/978-3-319-99579-3_21.
Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, 和 Weidi Xie. Worldsense: Evaluating real-world omnimodal understanding for multimodal llms, 2026. URL https://arxiv.org/abs/2502.04326.
Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Zhou Zhao, 和 Shinji Watanabe. Audiogpt: Understanding and generating speech, music, sound, and talking head, 2023. URL https://arxiv.org/abs/2304.12995.
Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, 等. Gpt-4o system card. arXiv preprint arXiv:2410.21276, 2024.
Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, 和 Yuxiong He. Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models. arXiv preprint arXiv:2309.14509, 2023.
Xuan Ju, Yiming Gao, Zhaoyang Zhang, Ziyang Yuan, Xintao Wang, Ailing Zeng, Yu Xiong, Qiang Xu, 和 Ying Shan. Miradata: A large-scale video dataset with long durations and structured captions, 2024. URL https://arxiv.org/abs/2407.06358.
Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle, 和 Bryan Catanzaro. Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities, 2024. URL https://arxiv. org/abs/2402.01831.
Naveen Kumar. 93 video marketing statistics 2026 [latest data & trends]. https://www.demandsage.com/ video-marketing-statistics/, April 2026. DemandSage. Published April 9, 2026. Accessed April 14, 2026.
Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, 和 Justin Salamon. Tac: Timestamped audio captioning, 2026. URL https://arxiv.org/abs/2602.15766.
Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, 和 Chunyuan Li. Llava-onevision: Easy visual task transfer, 2024a. URL https://arxiv.org/abs/2408.03326.
14
第 15 页
Gang Li, Jizhong Liu, Heinrich Dinkel, Yadong Niu, Junbo Zhang, 和 Jian Luan. 强化学习优于监督微调:以音频问答为例的研究。 arXiv 预印本 arXiv:2503.11197, 2025a.
Junnan Li, Dongxu Li, Silvio Savarese, 和 Steven Hoi. Blip-2:利用冻结的图像编码器和大型语言模型引导语言-图像预训练。在国际机器学习会议 (International Conference on Machine Learning) 上,第 19730–19742 页。PMLR, 2023.
Tianpeng Li, Jun Liu, Tao Zhang, Yuanbo Fang, Da Pan, Mingrui Wang, Zheng Liang, Zehuan Li, Mingan Lin, Guosheng Dong, Jianhua Xu, Haoze Sun, Zenan Zhou, 和 Weipeng Chen. Baichuan-audio:端到端语音交互的统一框架, 2025b. URL https://arxiv.org/abs/2502.17239.
Yanwei Li, Chengyao Wang, 和 Jiaya Jia. Llama-vid:在大型语言模型中,一张图像值 2 个 token。在欧洲计算机视觉会议 (European Conference on Computer Vision) 上,第 323–340 页。Springer, 2024b.
Yixuan Li, Changli Tang, Jimin Zhuang, Yudong Yang, Guangzhi Sun, Wei Li, Zejun Ma, 和 Chao Zhang. 通过每秒 16 帧提升大语言模型的视频理解能力, 2025c. URL https://arxiv.org/abs/2503.13956.
Zinuo Li, Xian Zhang, Yongxin Guo, Mohammed Bennamoun, Farid Boussaid, Girish Dwivedi, Luqi Gong, 和 Qiuhong Ke. 观看与聆听:利用多模态大语言模型理解视听语音时刻。 arXiv 预印本 arXiv:2505.18110, 2025d.
Ji Lin, Hongxu Yin, Wei Ping, Yao Lu, Pavlo Molchanov, Andrew Tao, Huizi Mao, Jan Kautz, Mohammad Shoeybi, 和 Song Han. Vila:关于视觉语言模型的预训练, 2024. URL https://arxiv.org/abs/2312.07533.
Hao Liu, Matei Zaharia, 和 Pieter Abbeel. 使用块状 Transformer 进行环形注意力以实现近乎无限的上下文。 arXiv 预印本 arXiv:2310.01889, 2023a.
Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee. 视觉指令微调。神经信息处理系统进展 (Advances in Neural Information Processing Systems), 36:34892–34916, 2023b.
Xu Liu, Junfeng Hu, Yuan Li, Shizhe Diao, Yuxuan Liang, Bryan Hooi, 和 Roger Zimmermann. Unitime:一种语言赋能的统一模型,用于跨领域时间序列预测。在 ACM Web Conference 2024 会议论文集上,第 4095–4106 页, 2024.
Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, 和 Yao Lu. Nvila:高效的前沿视觉语言模型, 2025a. URL https://arxiv.org/abs/2412.04468.
Zuyan Liu, Yuhao Dong, Jiahui Wang, Ziwei Liu, Winston Hu, Jiwen Lu, 和 Yongming Rao. Ola:推动全模态语言模型的前沿。 arXiv 预印本 arXiv:2502.04328, 2025b.
George Lucas. 声音是电影体验的一半。纽约时报, 1992年5月。引自 C. Hodenfield, “In the Action With ‘Star Wars’ Sound,” Section 2, p. 24.
Ziyang Ma, Yinghao Ma, Yanqiao Zhu, Chen Yang, Yi-Wen Chao, Ruiyang Xu, Wenxi Chen, Yuanzhe Chen, Zhuo Chen, Jian Cong, Kai Li, Keliang Li, Siyou Li, Xinfeng Li, Xiquan Li, Zheng Lian, Yuzhe Liang, Minghao Liu, Zhikang Niu, Tianrui Wang, Yuping Wang, Yuxuan Wang, Yihao Wu, Guanrou Yang, Jianwei Yu, Ruibin Yuan, Zhisheng Zheng, Ziya Zhou, Haina Zhu, Wei Xue, Emmanouil Benetos, Kai Yu, Eng-Siong Chng, 和 Xie Chen. Mmar:一个具有挑战性的基准,用于语音、音频、音乐及其混合中的深度推理, 2025. URL https://arxiv.org/abs/2505.13032.
Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, 等. Open-o3 video:基于显式时空证据的接地视频推理。 arXiv 预印本 arXiv:2510.20579, 2025.
15
第 16 页
Antoine Miech, Dimitri Zhukov, Jean-Baptiste Alayrac, Makarand Tapaswi, Ivan Laptev, 和 Josef Sivic。 Howto100m:通过观看一亿条旁白视频片段学习文本-视频嵌入,2019。 URL https://arxiv.org/abs/1906.03327。
Patrick K. O’Neill, Vitaly Lavrukhin, Somshubra Majumdar, Vahid Noroozi, Yuekai Zhang, Oleksii Kuchaiev, Jagadeesh Balam, Yuliya Dovzhenko, Keenan Freyberg, Michael D. Shulman, Boris Ginsburg, Shinji Watanabe, 和 Georg Kucsko。Spgispeech:用于全格式端到端语音识别的5000小时转录金融音频,2021。URL https://arxiv.org/abs/2104.02014。
Vassil Panayotov, Guoguo Chen, Daniel Povey, 和 Sanjeev Khudanpur。Librispeech:基于公共领域有声读物的ASR语料库。在2015年IEEE国际声学、语音和信号处理会议(ICASSP)上,第5206–5210页。IEEE,2015。doi: 10.1109/ICASSP.2015.7178964。
Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Shuangrui Ding, Dahua Lin, 和 Jiaqi Wang。使用大型语言模型流式处理长视频理解。神经信息处理系统进展, 37:119336–119360,2024。
Jeff Rasley, Samyam Rajbhandari, Olatunji Ruwase, 和 Yuxiong He。Deepspeed:系统优化使得训练拥有超过1000亿参数的深度学习模型成为可能。在第26届ACM SIGKDD知识发现与数据挖掘国际会议上,第3505–3506页,2020。
Anna Rohrbach, Atousa Torabi, Marcus Rohrbach, Niket Tandon, Christopher Pal, Hugo Larochelle, Aaron Courville, 和 Bernt Schiele。电影描述,2016。URL https://arxiv.org/abs/1605.03705。
S Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, 和 Dinesh Manocha。Mmau:一个大规模多任务音频理解和推理基准,2024。URL https://arxiv.org/abs/2410.19168。
Christoph Schuhmann, Romain Beaumont, Richard Vencu, Cade Gordon, Ross Wightman, Mehdi Cherti, Theo Coombes, Aarush Katta, Clayton Mullis, Mitchell Wortsman, 等人。Laion-5b:用于训练下一代图像-文本模型的开放大规模数据集。神经信息处理系统进展, 35:25278–25294,2022。
Ramaneswaran Selvakumar, Ashish Seth, Nishit Anand, Utkarsh Tyagi, Sonal Kumar, Sreyan Ghosh, 和 Dinesh Manocha。MULTIVOX:用于评估语音助手多模态交互能力的基准。 在 Christos Christodoulopoulos, Tanmoy Chakraborty, Carolyn Rose, 和 Violet Peng 编辑的《2025年自然语言处理实证方法会议论文集》中,第28481–28493页,中国苏州,2025年11月。计算语言学协会。ISBN 979-8-89176-332-6。doi: 10.18653/ v1/2025.emnlp-main.1447。URL https://aclanthology.org/2025.emnlp-main.1447/。
Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, 和 Dinesh Manocha。音视频大型语言模型真的能看和听吗?在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集(Findings)中,第5892–5902页,2026年6月。
Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, 和 Dinesh Manocha。EGOILLUSION:基准测试自我中心视频理解中的幻觉。在 Christos Christodoulopoulos, Tanmoy Chakraborty, Carolyn Rose, 和 Violet Peng 编辑的《2025年自然语言处理实证方法会议论文集》中,第28461–28480页,中国苏州,2025年11月。计算语言学协会。 ISBN 979-8-89176-332-6。doi: 10.18653/v1/2025.emnlp-main.1446。URL https://aclanthology.org/ 2025.emnlp-main.1446/。
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, 等人。Deepseekmath:推动开放语言模型中数学推理的极限。arXiv预印本 arXiv:2402.03300,2024。
Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Yuxuan Wang, 和 Chao Zhang。video-salmonn:语音增强的音视频大型语言模型。arXiv预印本 arXiv:2406.15704,2024。
16
第 17 页
Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, 和 Chao Zhang。 Salmonn: 面向大语言模型的通用听觉能力。arXiv 预印本 arXiv:2310.13289, 2023。
Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zejun Ma, 和 Chao Zhang。 video-salmonn 2: 字幕增强的音视频大语言模型。arXiv 预印本 arXiv:2506.15220, 2025。
Gemini Team。Gemini 2.5: 通过高级推理、多模态、长上下文和下一代智能体能力推动前沿,2025。URL https://arxiv.org/abs/2507.06261。
Gemini Team, Petko Georgiev, Ving Ian Lei, Ryan Burnell, Libin Bai, Anmol Gulati, Garrett Tanzer, Damien Vincent, Zhufeng Pan, Shibo Wang, 等。Gemini 1.5: 解锁跨越数百万 token 上下文的多模态理解。arXiv 预印本 arXiv:2403.05530,2024。
Qwen Team。Qwen2.5 技术报告,2025。URL https://arxiv.org/abs/2412.15115。
Qwen Team。Qwen3.5: 通过原生多模态智能体加速生产力,2026年2月。URL https://qwen.ai/blog?id=qwen3.5。
Qwen Team。Qwen3.5-omni: 扩展规模,迈向原生全模态人工智能,2026年3月。URL https: //qwen.ai/blog?id=qwen3.5-omni。
Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, 等。Step-audio-r1 技术报告。arXiv 预印本 arXiv:2511.15848,2025。
Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan, 和 Chenliang Xu。非受限视频中的音视频事件定位, 2018。URL https://arxiv.org/abs/1803.08842。
Emmanuel Vincent, Jon Barker, Shinji Watanabe, Jonathan Le Roux, Francesco Nesta, 和 Marco Matassoni。 第二届 CHiME 语音分离与识别挑战赛:数据集、任务和基线。在 Proc. IEEE 国际声学、语音和信号处理会议 (ICASSP) 上,加拿大温哥华, 2013。IEEE。
Changhan Wang, Anne Wu, 和 Juan Pino。Covost 2 和大规模多语言语音到文本翻译。 arXiv 预印本 arXiv:2007.10310,2020。
Dingdong Wang, Junan Li, Jincenzi Wu, Dongchao Yang, Xueyuan Chen, Tianhua Zhang, 和 Helen Meng。 Mmsu: 一个大规模多任务口语理解与推理基准,2026。URL https://arxiv.org/abs/2506.04779。
Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, 和 Junyang Lin。Qwen2-vl: 增强视觉语言模型在任何分辨率下对世界的感知,2024a。URL https://arxiv.org/abs/2409.12191。
Yi Wang, Yinan He, Yizhuo Li, Kunchang Li, Jiashuo Yu, Xin Ma, Xinhao Li, Guo Chen, Xinyuan Chen, Yaohui Wang, Conghui He, Ping Luo, Ziwei Liu, Yali Wang, Limin Wang, 和 Yu Qiao。Internvid: 用于多模态理解和生成的大规模视频-文本数据集,2024b。URL https: //arxiv.org/abs/2307.06942。
Haoning Wu, Dongxu Li, Bei Chen, 和 Junnan Li。Longvideobench: 一个用于长上下文交错视频-语言理解的基准,2024。URL https://arxiv.org/abs/2407.15754。
Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, Kai Dang, Bin Zhang, Xiong Wang, Yunfei Chu, 和 Junyang Lin。Qwen2.5-omni 技术报告,2025a。 URL https://arxiv.org/abs/2503.20215。
Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting He, Xinfa Zhu, 等。Qwen3-omni 技术报告。arXiv 预印本 arXiv:2509.17765,2025b。
17
第 18 页
Hongwei Xue, Tiankai Hang, Yanhong Zeng, Yuchong Sun, Bei Liu, Huan Yang, Jianlong Fu, 和 Baining Guo. 利用大规模视频转录提升高分辨率视频-语言表示,2022. URL https://arxiv.org/abs/2111.10337.
Antoine Yang, Arsha Nagrani, Ivan Laptev, Josef Sivic, 和 Cordelia Schmid. Vidchapters-7m: 大规模视频章节,2023. URL https://arxiv.org/abs/2309.13952.
Hanrong Ye, Chao-Han Huck Yang, Arushi Goel, Wei Huang, Ligeng Zhu, Yuanhang Su, Sean Lin, An-Chieh Cheng, Zhen Wan, Jinchuan Tian, 等. Omnivinci: 增强全模态理解大语言模型的架构与数据. arXiv 预印本 arXiv:2510.15870, 2025.
Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, 和 Hui Bu. M2MeT: ICASSP 2022 多通道多方会议转录挑战赛. 在 Proc. ICASSP. IEEE, 2022.
Zhou Yu, Dejing Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, 和 Dacheng Tao. Activitynet-qa: 通过问答理解复杂网络视频的数据集,2019. URL https://arxiv.org/ abs/1906.02467.
Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, 和 Lucas Beyer. 用于语言图像预训练的 Sigmoid 损失,2023. URL https://arxiv.org/abs/2303.15343.
Boqiang Zhang, Kehan Li, Zesen Cheng, Zhiqiang Hu, Yuqian Yuan, Guanzheng Chen, Sicong Leng, Yuming Jiang, Hang Zhang, Xin Li, 等. Videollama 3: 面向图像和视频理解的尖端多模态基础模型. arXiv 预印本 arXiv:2501.13106, 2025.
Hang Zhang, Xin Li, 和 Lidong Bing. Video-llama: 用于视频理解的指令微调音视频语言模型. 在 Proceedings of the 2023 conference on empirical methods in natural language processing: system demonstrations, 第 543–553 页, 2023.
Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, 和 Ziwei Liu. 从语言到视觉的长上下文迁移. arXiv 预印本 arXiv:2406.16852, 2024a.
Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, 和 Chunyuan Li. Llava-video: 使用合成数据进行视频指令微调. arXiv 预印本 arXiv:2410.02713, 2024b.
Zitang Zhou, Ke Mei, Yu Lu, Tianyi Wang, 和 Fengyun Rao. Harmonyset: 用于理解视频-音乐语义对齐和时间同步的综合数据集. 在 Proceedings of the Computer Vision and Pattern Recognition Conference, 第 3152–3162 页, 2025.
Ziwei Zhou, Rui Wang, Zuxuan Wu, 和 Yu-Gang Jiang. Daily-omni: 迈向跨模态时间对齐的音视频推理,2026. URL https://arxiv.org/abs/2505.17862.
Jinguo Zhu, Weiyun Wang, Zhe Chen, Zhaoyang Liu, Shenglong Ye, Lixin Gu, Hao Tian, Yuchen Duan, Weijie Su, Jie Shao, Zhangwei Gao, Erfei Cui, Xuehui Wang, Yue Cao, Yangzhou Liu, Xingguang Wei, Hongjie Zhang, Haomin Wang, Weiye Xu, Hao Li, Jiahao Wang, Nianchen Deng, Songze Li, Yinan He, Tan Jiang, Jiapeng Luo, Yi Wang, Conghui He, Botian Shi, Xingcheng Zhang, Wenqi Shao, Junjun He, Yingtong Xiong, Wenwen Qu, Peng Sun, Penglong Jiao, Han Lv, Lijun Wu, Kaipeng Zhang, Huipeng Deng, Jiaye Ge, Kai Chen, Limin Wang, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, 和 Wenhai Wang. Internvl3: 探索开源多模态模型的先进训练和测试时策略,2025. URL https://arxiv.org/abs/2504.10479.
18
第 19 页
A. 音视频Flamingo训练数据集
表2总结了用于训练音视频Flamingo模型的所有数据集,包括总时长、训练对数量以及在每个训练阶段使用的轮数(遍历数据集的次数)。与(Ye et al., 2025; Goel et al., 2025)类似,我们将所有基础数据集(如描述、分类等)转换为问答格式,并为每个任务使用相同的一组提示词。
AV-Safety QA。除了专注于技能的子集外,表2还包含了AV-Safety QA,这是一组包含9.2万个问答对的数据集,覆盖536小时的视频,用于长上下文监督微调(SFT)。该子集将音视频输入与旨在探测不安全、有害或违反政策请求的问题配对(例如,要求识别私人个体、生成骚扰性描述或从音视频内容中提取敏感信息),并配以安全拒绝或重定向但同时在请求的良性部分保持有帮助的目标响应。其目的是在模型习得长上下文音视频能力的同时,保持安全对齐。
表2:预训练和微调数据集列表及其训练组成。
| 数据集 | 时长 | 实例数 | AVF-Short-SFT | AVF-Long-SFT | CoT-Training | | :— | :— | :— | :— | :— | :— | | AV-Skills-Short (Ours) | 100k hrs | 3.8M | 1.0 | 0.5 | – | | Long AV Captioning (Ours) | 51k hrs | 1.2M | – | 2.0 | – | | Long Comparative AVQA (Ours) | 8.3K hrs | 169K | – | 2.0 | – | | Long Context AVQA (Ours) | 8.3K hrs | 175K | – | 2.0 | – | | Long Subscene AVQA (Ours) | 6.8K hrs | 157K | – | 2.0 | – | | Long Counting AVQA (Ours) | 6.2K hrs | 136K | – | 2.0 | – | | Long Needle AVQA (Ours) | 8K hrs | 169K | – | 2.0 | – | | Long Referring AVQA (Ours) | 7.2K hrs | 160K | – | 2.0 | – | | Long Topic AVQA (Ours) | 7.3K hrs | 172K | – | 2.0 | – | | Long Holistic Reas. AVQA (Ours) | 8.9K hrs | 180K | – | 2.0 | – | | Long Event Alignment AVQA (Ours) | 7.9K hrs | 160K | – | 2.0 | – | | Long Event Sequence AVQA (Ours) | 7.4K hrs | 153K | – | 2.0 | – | | Long Inference AVQA (Ours) | 4.5K hrs | 63K | – | 2.0 | – | | Long Temporal AVQA (Ours) | 9K hrs | 200K | – | 2.0 | – | | AV-Safety QA (Ours) | 536 hrs | 92K | – | 2.0 | – | | AF3-training mix (Goel et al., 2025) | 308k hrs | 48.6M | 1.0 | – | – | | AudioSkills-XL (Goel et al., 2025) | – | 9700K | 1.0 | 0.5 | – | | MF-Skills (Ghosh et al., 2025a) | – | 3M | 1.0 | 0.5 | – | | Image-text (Ye et al., 2025) | – | 3M | 0.5 | – | – | | Video-text (Ye et al., 2025) | – | 3M | 0.5 | – | – | | CHiME (Vincent et al., 2013) | 342 hrs | 30k | 1.0 | 1.0 | – | | AliMeeting (Yu et al., 2022) | 118.75 hrs | 387k | 1.0 | 1.0 | – | | EMILIA (He et al., 2024) | 5000 hrs | 1.7M | 1.0 | 1.0 | – | | MuST-C (Cattoni et al., 2021) | 500 hrs | 245k | 1.0 | 1.0 | – | | CoVoST (Wang et al., 2020) | 2880 hrs | 5M | 1.0 | 1.0 | – | | Aidatatang (Beijing DataTang Technology Co., Ltd., 2018) | 139.39 hrs | 165k | 1.0 | 1.0 | – | | Aishell-1 (Bu et al., 2017) | 150.85 hrs | 120k | 1.0 | 1.0 | – | | Multi-talker Switchboard (Godfrey and Holliman, 1993) | 109.9 hrs | 76.6K | 1.0 | 1.0 | – | | Audio-Think-Time (Ours) | 3954 hrs | 43K | – | 2.0 | – | | Video-Think-Time (Ours) | 1238 hrs | 22K | – | 2.0 | – | | AV-Think (Ours) | 1500 hrs | 24K | – | – | 2.0 |
B. 数据集示例与类别分布
图4展示了用于训练的15个主要视频类别的类别分布。图5和表3提供了AV-Skills-Long和AV-Skills-Short的代表性示例。
19
第 20 页
图 4:训练数据集中使用的视频类别分布。
C. 音视频 Flamingo 训练细节
在本节中,我们展示了模型在所有阶段的训练设置,每个阶段都有特定的配置。详细信息见表 4;简化的分阶段配方总结见表 5。
D. 额外消融实验
AV-Skills-Short 和 AV-Skills-Long 的影响。本节隔离了精心策划的 AV-Skills 数据在训练课程中的贡献。我们比较了三个模型:(i) OmniVinci,AVF 初始化的基础检查点;(ii) AVF-Stage1,我们的模型在 AV-Skills-Short 和单模态数据上进行预训练(阶段 1 + 阶段 2)后的模型;以及 (iii) AVF-Instruct,在 AV-Skills-Long 上进行中期训练后获得的最终模型。
如表 6 所示,在 AV-Skills-Short 上进行训练(AVF-Stage1)在音视频和视频-only 基准测试中均优于 OmniVinci,这证实了精心策划的 AV-Skills 数据注入了单模态监督无法捕捉的跨模态推理能力。在中期训练期间添加 AV-Skills-Long(AVF-Instruct)进一步改善了在扩展时间上下文和更紧密的音视频接地方面的推理能力。
20
第 21 页
图 5:来自 AV-Skills-Long 的其他问答对示例。代表性样本涵盖了中期训练中使用的八个长程技能类别:Haystack 中的针(Needle-in-the-Haystack)、时间顺序(Temporal Order)、时间指代(Temporal Referring)、主题摘要(Topic Summary)、计数(Counting)、子场景(Sub-scene)、比较(Comparative)和时间属性(Temporal Attribute)。示例包括开放式和多项选择题格式。
E. 基于 GRPO 的强化训练细节
用于视听理解和推理的 GRPO。基于组相对策略优化(GRPO)的最新进展,我们采用标准的 GRPO 框架来训练 AV-Flamingo。GRPO 消除了对显式价值函数的需求,而是使用同一输入的多重采样输出的平均奖励来估计优势。对于每个输入问题或图像描述提示 $q$,策略模型从旧策略 $\pi_{\theta_{old}}$ 生成一组候选输出 $\{o_1, o_2, \dots, o_G\}$,以及使用基于规则的奖励函数(如格式、答案准确性和结构化奖励匹配)计算出的相应奖励 $\{r_1, r_2, \dots, r_G\}$。然后使用 GRPO 目标优化策略 $\pi_{\theta}$:
$$ J(\theta) = \mathbb{E}_{q, \{o_i\}} \left[ \frac{1}{G} \sum_{i=1}^{G} \min \left( \frac{\pi_{\theta}(o_i|q)}{\pi_{\theta_{old}}(o_i|q)} A_i, \text{clip} \left( \frac{\pi_{\theta}(o_i|q)}{\pi_{\theta_{old}}(o_i|q)}, 1-\epsilon, 1+\epsilon \right) A_i \right) – \beta D_{KL}(\pi_{\theta} \| \pi_{ref}) \right], \quad (1) $$
其中 $\epsilon$ 是重要性采样比的裁剪范围,$\beta$ 是 KL 正则化项的系数,用于使学习到的策略接近参考策略,$G$ 表示组大小,即每个输入的采样候选输出数量,我们在实验中将其设置为 5。为了稳定优化,在每个组内对奖励进行归一化以计算优势:
$$ A_i = \frac{r_i – \text{mean}(\{r_1, \dots, r_G\})}{\text{std}(\{r_1, \dots, r_G\})}. $$
接下来我们描述用于 AV-Flamingo 的奖励函数。
格式奖励。为了鼓励结构良好的输出,我们使用类似于先前推理工作的基于正则表达式的格式奖励。模型被要求生成中间推理过程,并将其包含在 〈think〉 和 〈/think〉 标签内,
21
第 22 页
随后是包含在 〈answer〉 〈/answer〉 标签内的最终响应。严格遵循此格式的输出将获得 1 的奖励,否则为 0。这种二元奖励鼓励模型一致地生成结构化的推理轨迹和最终答案。
准确性奖励。对于问答实例,我们使用基于从 〈answer〉 〈/answer〉 标签中提取的最终答案的准确性奖励。给定一个问题及其真实答案,奖励是通过将归一化的预测答案与归一化的参考答案进行匹配来计算的。该奖励直接鼓励音频视觉问答的正确最终响应。
开放式描述和响应的结构化奖励。对于开放式描述和自由形式响应生成,由于有效输出的长篇幅和语义多样性,严格的字符串匹配并不适用。为了解决这个问题,我们设计了一种结构化奖励,首先使用大语言模型(LLM)将参考输出和生成输出解析为结构化的 JSON,然后比较生成的字段。具体而言,给定一个真实的描述或响应,我们提示 LLM 提取显著的结构化元数据,如场景类型、参与者、环境、主题、事件、情感基调和关键结论。例如,对于一段讨论人工智能的播客视频,解析后的 JSON 可能包含以下字段:
{“Scene”: podcast studio, “Participants”: two individuals, speaker in light blue shirt; listener in black blazer, “Environment”: professional studio, beige walls, microphones, “Topic”: artificial intelligence, “Main Discussion”: limitations of neural networks for human-level intelligence, “Speaker 1 View”: skeptical of scaling neural networks alone, “Speaker 2 View”: emphasizes physical-world understanding for reasoning and planning, “Tone”: analytical, technical, collaborative, “Key Themes”: human-level AI, neural network limitations, reasoning, planning, collaboration in research community }
然后我们将模型生成的描述或响应解析为相同的模式,并通过测量预测字段与参考字段之间的重叠来计算结构化匹配奖励。最终奖励是通过跨类别的平均字段匹配获得的,从而允许以结构化和一致的方式评估语义丰富的开放式输出。
GRPO 中的整体奖励函数将格式奖励与问答数据的准确性奖励相结合,并将格式奖励与开放式描述和响应生成数据的结构化奖励相结合。这使得 AV-Flamingo 能够提高答案的正确性以及长篇幅接地音频视觉生成的质量。
F. AV-Think 和 TAVIT 详情
本节记录了第 F.1 节中的 AV-Think 生成约束以及第 F.2 节中代表性的时间音视频交错链式思维(TAVIT)示例。
F.1 AV-Think 生成约束
对于每个长视频,生成器接收带时间戳的音频片段,包括语音转录和非语音事件描述,以及带时间戳的视觉描述。它生成开放式问答推理三元组、带有合理干扰项的多选题变体以及整合的音视频描述。我们明确要求问题必须依赖两种模态,要求多跳时间推理而非表面转录,并使用 <t>…</t> 时间戳标签为每个中间推理步骤提供依据;排除仅凭音频或仅凭视觉即可回答的问题。
22
第 23 页
F.2 TAVIT 示例
表 7 展示了具有代表性的 TAVIT 示例,包括问题、接地思维链(grounded thinking chain)和真实响应(ground-truth response)。表 8 提供了五个额外的 TAVIT 样本,将合并的音视频描述(附带 YouTube 链接)与相应的思维链问题和真实响应配对。
表 8:来自 TAVIT 的五个重叠样本:合并的音视频描述(含 YouTube 链接)、思维链问题和真实(GT)响应。所有条目均已截断;完整文本可在数据集中获取。
| [YouTubeID] | Caption | Question | GT Response | | :— | :— | :— | :— | | [youtube.com/watch?v=-0EraoJmdhk] | A bartender shakes a cocktail shaker containing a pink liquid. The liquid is poured through a fine mesh strainer into a martini glass. A close-up shows the finished pink cocktail garnished with an orange peel; text overlays display “Cosmopolitan”, its Hindi transliteration, and “DRINK IT EASY 2.0”. The bartender sets down an empty shaker, removes its lid, then measures and pours vodka, lemon juice, cranberry juice, and triple sec with bilingual text callouts for each ingredient. Ice cubes are added, the shaker sealed and shaken vigorously. The cocktail is strained into a frosted martini glass and finished with a twisted orange peel garnish before the final beauty shot. | How do the changes in the lo-fi hip-hop soundtrack support the visual progression from ingredient preparation to the final presentation and branding of the Cosmopolitan cocktail, and what does this reveal about the intended mood and viewing experience of the video as a whole? | The soundtrack and visuals are tightly coordinated so that the music’s evolving texture mirrors the cocktail’s journey from raw ingredients to a polished, branded product, creating a relaxed, tutorial-meets-aesthetic experience rather than a purely instructional one. At the very beginning, the ambient pad without drums (0–2 s) plays over the first glimpse of shaking and pouring and the hero close-up of the finished Cosmopolitan with multilingual overlays (0–8 s), framing the drink as aspirational, not just a recipe. When the main synth melody and full beat enter (2–18 s), the visuals shift into step-by-step recipe work: measuring and pouring each spirit with bilingual callouts, adding ice, sealing, and shaking. The steady, looping groove makes these repetitive actions feel smooth and unhurried. A slightly thinned bridge (27–35 s) coincides with the refinement phase: the frosted glass, straining, and the orange-peel garnish. Finally, during the gentle fade-out (35–44 s), the camera lingers on the completed cocktail before cutting to a branded outro screen with social-media handles and a website. [. . . ] |
Continued on next page
23
第 24 页
表 8 – 接上一页
[YouTubeID] 字幕 问题 地面真值 (GT) 回答 [youtube.com/watch?v=- EDM 配乐与猪肉 Sor- 视频将 EDM 曲目作为持续的情感基调,与从原始食材到成品猪肉 0ItZ8fGUNc] potel 食谱画面的不 索波特尔(Pork Sorpotel)的视觉进展相呼应,将一种有条不紊的 一碗深色、浓郁的红褐色炖菜的特写,上面撒有香菜;文字显示“猪肉 Sor- 断增强如何共同引导 食谱转化为充满活力和令人食欲大增的体验,而非缓慢或乏味。 potel”。一个深色平底锅中依次加入整颗丁香(“4–5”颗)、黑胡椒粒(“4–5”颗)、绿色豆蔻(“3”颗)、半根肉桂棒、孜然籽和 3–4 根干红辣椒。香料在电磁炉上摇晃,然后转移到温水中浸泡 30–40 分钟,最后在万得厨(Wonderchef)搅拌机中打成液体糊状。将油倒入黑色锅中;将煮沸并切块的猪肉和猪肝煎至金黄色后盛出备用。将生姜、大蒜、青辣椒、洋葱和盐炒至洋葱变褐;加入红色香料糊和猪肉高汤并搅拌。加入糖、罗望子酱、醋和盐;盖上锅盖小火慢炖 15–20 分钟,然后将成品菜肴舀入碗中,撒上新鲜香菜作为装饰。
potel 食谱的演变画面,引导观众从原始香料和肉类一直到最终装盘的菜肴,这揭示了视频如何平衡有条不紊的指导与充满活力、令人食欲大增的氛围?
开始时的音乐节奏平稳、适中,但编曲轻盈(0–2 秒),与装饰好的菜肴的特写标题相呼应。随着整颗香料被烘烤并逐一加入(3–16 秒),节拍保持能量,使重复的单个镜头显得目的明确。当猪肉和肝脏煎至金黄色(38–49 秒)时,EDM 过渡到更具活力的部分,随着食谱从准备阶段进入积极烹饪阶段,提升了能量水平。短暂的停顿(75–91 秒)伴随着最后的调味步骤——糖、罗望子、醋——预示着高潮的到来。随着锅中小火慢炖(91–104 秒),完整的节拍回归,然后在菜肴装盘并撒上装饰时逐渐减弱,完成了音乐和食谱的平行弧线。 [. . . ]
[youtube.com/watch?v=– 该片段如何利用拜登 该片段系统地重新构建了拜登的告别警告,将原则性的担忧转化为 ccsQMua_s] 本人的告别警告以 失败且充满怨恨的总统任期的证据,通过将其本人的话语与高度煽 福克斯与朋友(Fox & Friends)的标志出现在橙蓝色图形上。拜登坐在椭圆形办公室的坚毅桌前;屏幕上的文字显示“拜登从椭圆形办公室发表告别演讲”。彼得·多西(Peter Doocy)从白雪覆盖的白宫草坪进行现场报道。拜登警告称“权力集中在极少数超级富有的人手中”以及“美国正在形成寡头政治”。拜登引用艾森豪威尔的军工复合体,创造了“科技工业复合体”一词。拜登身穿黑衣的家人坐在卡玛拉·哈里斯和道格·埃姆霍夫旁边的镜头上叠加了拜登的鬼影图像。CNN 民调图形出现:拜登工作批准率 36%,61% 的人认为他的总统任期是一场失败。演播室主持人讨论拜登的遗产,同时分屏显示他与福克斯与朋友小组并排。
及演播室的视觉和对话框架——特别是他身穿黑衣的家人身上的鬼影叠加、民调图形,以及与特朗普和科技领袖的对比——将他关于寡头政治和科技工业复合体的明确担忧重新塑造为一个与国家未来脱节的失败、怨恨的总统任期的叙事?
动剪辑的视觉画面和演播室评论编织在一起。拜登在坚毅桌前被视觉锚定为一位正式、传统的总统(1–15 秒,42–60 秒),而音频中他警告集中财富和科技工业复合体(48–60 秒,128–145 秒)。主持人没有就实质内容进行互动,而是立即转向嘲讽:史蒂夫·多西(Steve Doocy)开玩笑说“提词器寡头政治”(130–147 秒),而拜登身穿黑衣的家人身上的鬼影叠加(152–157 秒)在视觉上将其警告与葬礼般的阴郁联系在一起,而非公民紧迫感。显示 36% 批准率和 61% “失败”的 CNN 民调图形(374–388 秒)随后被呈现为选民对这些相同警告的裁决。这种对比通过主持人赞扬科技首席执行官们为拜登总统任期受益的经济增长做出了贡献而得以完成,将其寡头政治框架逆转为忘恩负义。 [. . . ]
下一页继续
第 25 页
表 8 – 接上一页
[YouTubeID] 字幕 问题 真实回答 [youtube.com/watch?v=- 合唱颂歌的歌词和音乐层层递进 这一刻显然不仅仅是一个普通的赛 0YyxReol5E] 如何与南非球员的行为和编排相 前仪式,因为宗教、祭祀性的语言和 一名身穿绿、黑、黄三色球衣、戴 结合,以及看台上所有展现出的 不断高涨的结构与体育场内展现出的 着白色头带的南非橄榄球运动员的 包容性相融合,从而表明这一刻 强度、姿态以及每个人的包容性相呼 特写镜头,双眼紧闭,雨水落下。 不仅仅是一个普通的赛前仪式, 应。合唱团唱着被上帝眷顾的人民 镜头转向他的背部,显示出“南非 而是一场深刻的精神和国家凝聚 ——诸如“Para que seas su pueblo, y 橄榄球”徽章和“2023年法国橄榄 的典礼? su nación”这样的歌词将歌手们框定 球世界杯”字样。第二名球员睁着 为在神圣关怀下的被选中的社区 眼睛唱歌;镜头扫过一排表情严 (6–16 秒)。反复 invoked 的 肃地在拥挤体育场中唱歌的球员。 “Oh, Señor”以及对“Su sangre” 看台包厢里的观众观看并拍摄这 (37–57 秒)的引用赋予了颂歌一 场典礼。特写镜头展示了一名浅 种礼拜般的特征,而音乐则逐渐 肤色和一名秃顶的黑人球员,两 演变为完整的管弦乐和合唱高潮 人都流着汗,闭着眼睛唱歌。穿 (33–84 秒)。视觉上,球员们闭 着绿黄色球衣的球迷抬头歌唱; 着的眼睛、汗水和向上倾斜的头 一名金发长发球员闭着眼睛唱了 部姿态与私人祈祷的姿态相映照 一个长镜头。 (0–84 秒)。官员和球迷在看台 所有 15 名球员肩并肩站在一起, 上合唱(17–33 秒)将这场典礼 一名身穿黑白队服的小男孩加入 扩展为一项国家行为。最有力的 其中,随后转身走开,人群爆发 是,小男孩加入球员队列(77–83 欢呼。 秒)象征着身份的代际传承,而 颂歌结束瞬间人群的爆发(84–86 秒)证实了整个体育场都参与 了一场共同的精神时刻。[. . . ]
G. 提示模板
对于 AV-Skills-Long 数据集,我们使用 GPT 为来自各类别的问题策划合成问答对和选项。 各类别特定的 AV-Skills-Long 提示模板如图 6–19 所示。图 20 展示了用于构建 AV-Think 中 问题–答案–推理三元组的完整提示。
H. 资产与许可
表 9 列出了本文使用的数据集和模型检查点,以及相关的许可或分发条款。对于以元数据、 字幕或 URL 形式分发的网络视频数据集,所列条款指的是已发布的数据集制品;底层源媒体 仍受原始平台和版权持有者条款的约束。Aidatatang 语料库在我们训练运行完成后被其分发 商撤回;为了透明地说明用于训练已发布检查点的数据,我们将其保留在表 9 中,并且它 不作为任何 AVF 发布制品的一部分进行重新分发。
25
第 26 页
I. 更广泛的影响
AV-Flamingo 推动了开放音视频智能的发展,在无障碍应用(例如,为视障人士提供自动音频描述)、教育(例如,讲座和纪录片理解)以及媒体分析(例如,自动字幕生成和内容审核)等方面具有积极的社会应用价值。通过公开发布模型、训练代码以及 AV-Skills 数据集,我们还降低了缺乏大规模专有资源的研究人员的门槛,支持更加包容的研究生态。
然而,具备联合音视频理解能力的模型也带来潜在风险。它们可能被滥用于自动化监控、辅助生成或验证深度伪造(deepfakes),或通过联合分析与合成音视频内容,实现大规模的多模态虚假信息传播。为缓解这些风险,我们在明确禁止有害应用的许可下,仅将 AV-Flamingo 和 AV-Skills 用于非商业研究用途。此外,我们在训练过程中引入了 AV-Safety QA(见附录 A),以鼓励模型对有害音视频请求采取安全拒绝行为。我们鼓励社区继续为开放音视频系统开发保障措施、评估协议和治理框架。
第 27 页
表 3:AV-Skills-Short 训练数据示例
| 类别 | 提示 (Prompt) | 回答 (Response) | | :— | :— | :— | | 因果推理 | 为什么那个人在尝试卷蛋糕卷后切开了它? | 因为在卷蛋糕时,奶油溢出来了,而且其他人不同意吃溢出的部分,所以那个人决定切开蛋糕,而不是继续卷。 | | 空间感知 | 在房间有木地板、大电视、人和狗在地板上的场景中,名叫 Lala 的小毛茸茸的狗相对于穿着星星图案睡衣玩狗的人在哪里?<br>A) Lala 在人前面<br>B) Lala 在人腿下面<br>C) Lala 在人腿上<br>D) Lala 站在人旁边 | C) Lala 在人腿上 | | 情绪变化 | 在关于儿童虐待举报的小组讨论中,坐在面板右侧、留着深色长发、戴眼镜、穿毛衣的女士,当问题出现且一个漫画风格的对话框弹出显示“wae?”(为什么?)时,她的情绪/心情发生了什么变化?<br>A) 惊讶<br>B) 困惑<br>C) 好笑<br>D) 好奇 | A) 惊讶 | | 幻觉检测 | 米老鼠在视频中戴红帽子吗?<br>A. 我不确定。<br>B. 不,米老鼠没有戴红帽子。<br>C. 以上都不是。<br>D. 是的,米老鼠戴着红帽子。 | B. 不,米老鼠没有戴红帽子。 | | 音频计数 | 音频中打喷嚏声出现了几次?<br>A. 0<br>B. 2<br>C. 3<br>D. 1 | D. 1 | | 视频计数 | 手调整压力开关的次数是多少?<br>A. 五次<br>B. 六次<br>C. 四次<br>D. 三次 | C. 四次 | | 时序推理 | 按视频中事件发生的顺序排列以下视听事件列表。使用箭头 ‘→’ 指示事件的顺序。<br>A) 演讲者讨论表面处理,同时戴手套的手打开一支白色的 ‘CHASER’ 管,旁边放着一罐打开的 Bondo 填料。<br>B) 演讲者提到涂抹像 Bondo 这样的填料,同时一个人将紫色填料涂抹在吹风机上。<br>C) 演讲者提到 ‘400 目砂纸’,此时屏幕上出现文字,同时一个人拿着打磨块。<br>D) 一个戴手套的人混合 Bondo 和硬化剂,屏幕上的文字解释了该过程。 | A → D → B → C | | 关系推理 | 在房间有鱼缸和器乐电子音乐的场景中,靠近鱼缸的男人相对于穿连帽衫的男人处于什么位置?<br>A) 穿连帽衫的男人在穿 T 恤的男人后面<br>B) 穿连帽衫的男人在穿 T 恤的男人前面<br>C) 穿连帽衫的男人在穿 T 恤的男人右边<br>D) 穿连帽衫的男人在穿 T 恤的男人左边 | C) 穿连帽衫的男人在穿 T 恤的男人右边 |
27
第 28 页
表 4:各阶段的训练设置。
设置 预训练 中期训练 后训练
全局批次大小 128 128 64 学习率 1e-5 1e-5 2e-5 学习调度 余弦衰减 预热比例 0.03 权重衰减 0.0 轮数 1 1 2 bf16 ✓ ✓ ✓ 梯度累积 8 并行策略 Zero-3 Zero-3 + SP Zero-3 + SP GPU 数量 512×H100
表 5:AV-Flamingo 的紧凑训练配方。数据集级别的混合比例见表 2。
阶段 主要数据混合体 最大输入/上下文 轮数 批次 学习率 计算/并行策略
短上下文 SFT AV-Skills-Short + AF3/AudioSkills/MF + 图像/视频/语音 5 分钟 / 16K 1 128 1e-5 512×H100; ZeRO-3 长上下文 SFT AV-Skills-Long + 下采样的短/音频/音乐/语音 + 思考时间数据 15 分钟 / 32K 1 128 1e-5 512×H100; ZeRO-3 + SP 链式思维后训练 带有 SFT + GRPO 的 AV-Think 推理三元组 15 分钟 / 32K 2 64 2e-5 512×H100; ZeRO-3 + SP
表 6:关于 AV-Skills-Short 和 AV-Skills-Long 影响的消融研究。AVF-Stage1 隔离了 AV-Skills-Short 在预训练期间的贡献,而 AVF-Instruct 在中期训练期间添加了 AV-Skills-Long。越高越好。
模型 DailyOmni WorldSense VideoMME
OmniVinci 66.5 48.2 67.3 AVF-Stage1 69.5 48.5 68.5 AVF-Instruct 72.4 50.3 70.7
28
第 29 页
表 7:时间音视频交错链式思维(TAVIT)数据示例
问题 [YouTube 链接] 思维链 标准答案
视频如何利用欢快的音乐、简短的 我需要追踪视频目的如何演变, 视频首先专注于教观众制作蘑菇 口播订阅信息以及不断变化的烹饪 以及声音和视觉如何参与这种变化。 挞,然后逐渐转向鼓励观众与 画面,引导观众从学习制作蘑菇挞 片段以完成的蘑菇挞的特写和标有 频道进行持续互动。在烹饪部分, 到被引导去进一步与频道互动,并 “MUSHROOM TART”(蘑菇挞)的图形 没有语音——只有一首稳定、欢快 具体哪些时刻显示了这种目的的转 标签(0–3 秒),然后立即展示生 的放克/迪斯科乐曲(0–40 秒)。 变? 酥皮面团,并带有文字叠加层,指定 视觉上,这一阶段逐步展示了食谱 [https://www.youtube.com/watch?v=- “200 克酥皮面团”(3–5 秒)。这 的步骤:完成的挞和标题叠加层 2tPqC6quZQ] 告诉我初始目标是教学性的。视觉 (0–3 秒),擀制和切割酥皮面 画面逐步展示烹饪过程:擀面 团(3–15 秒),烘烤(17–22 秒), 团(5–9 秒),切割圆形面团 炒蒜和蘑菇(24–37 秒),以及 (9–15 秒),刷牛奶并烘烤 填充、加顶层、重新烘烤和装饰 (17–22 秒),炒蒜和蘑菇 (42– 并加入调味料(22–37 秒),填充 51 秒)。当出现“enjoy!”(享用!) 烤好的面团并用马苏里拉奶酪 时(51–53 秒),目的发生了转变。 覆盖(42– 视觉画面变为带有缩略图、 49 秒),并用百里香装饰(49–51 订阅按钮和 Sanjeev Kapoor 社交 秒)。整首欢快的放克/迪斯科 媒体链接的片尾屏幕(53–63 秒)。 音乐贯穿始终,烹饪步骤期间 一位友好的男声说道:“如果你喜欢 没有语音。转折点出现在出现 我们在 YouTube 上分享的视频, “enjoy!”(51–53 秒)。紧接着, 请在我们的 YouTube 频道上订阅 视觉画面变为带有视频缩略图、 我们”(54–59 秒)。烹饪画面和 YouTube 订阅按钮以及 Sanjeev 音乐建立了信任,一旦提供了价值, Kapoor 的社交媒体链接的片尾 音频便转变为行动号召,而视觉 屏幕(53–63 秒)。男说话者的 画面则转变为订阅提示和社交链接。 台词——“如果你喜欢我们在 第一阶段结合烹饪画面和音乐来 YouTube 上分享的视频,请在 教授食谱(0–51 秒);第二阶段 我们的 YouTube 频道上订阅 转向频道品牌宣传和口播订阅 我们”——发生在(54–59 秒), 的行动号召(53–63 秒)。 明确具有情感号召力。
在整个精彩片段中,比赛序列 我需要找到最能解释为什么整个 (C)因为该序列将狂热的现场 被呈现为七人制橄榄球卓越的 片段将其定位为七人制橄榄球 呼喊和欢呼的人群与慢动作重 主要原因是什么,而不仅仅是一 卓越的展示的原因的最佳选项。 放和快速触地、假动作传球及 种常规的进攻动作? 从音频来看:人群欢呼声很大 熟练步法的详细分析相结合,同时 (A) 解说员关注人群呐喊多于 (4–24 秒),激动的解说员大喊 突出了兴奋感和潜在的技巧。 球员的动作 “一些步法”、“传给沃顿,他 从音频来看:人群欢呼声很大 (B) 片段显示记分牌和剩余 扔出假动作”,以及“这就是我们 (4–24 秒),激动的解说员大喊 时间 如此热爱七人制比赛的原因” “一些步法”、“传给沃顿,他 (C) 序列将狂热的现场呼喊 (10–24 秒)。然后是分析性 扔出假动作”,以及“这就是我们 和人群与慢动作回放以及 评论:“林赛快速触地,单脚 如此热爱七人制比赛的原因” 对快速触地、假动作传球 触地”,“他像闪电一样,然后是 (10–24 秒)。然后是分析性 和步法的详细分析相结合 单手传球”,“展示和跑动,英 评论:“林赛快速触地,单脚 (D) 视觉画面集中在裁判的 国步法回报了在伦斯伯里俱乐 触地”,“他像闪电一样,然后是 判罚上 部俱乐部数小时的训练”(25– 单手传球”,“展示和跑动,英 (E) 球员与队友争吵 46 秒)。从视觉画面来看:现场 国步法回报了在伦斯伯里俱乐 (F) 专注于争球和密集阵 航拍/特写镜头显示一名身穿 部俱乐部数小时的训练”(25– (G) 片段显示赛前热身 白衬衫的球员突破红色防守 46 秒)。从视觉画面来看:现场 (H) 视频强调赞助商标志 员(4–17 秒),然后是慢动作 航拍/特写镜头显示一名身穿 (I) 解说员描述了一场防守 回放,显示 9 号球员快速触 白衬衫的球员突破红色防守 大师课 地(28–30 秒),11 号球员 员(4–17 秒),然后是慢动作 [https://www.youtube.com/watch?v=- 完成单手传球(32–35 秒), 回放,显示 9 号球员快速触 2hY4Ap7xkA] 1 号球员反复变向和躲避 地(28–30 秒),11 号球员 (30–47 秒)。这种组合—— 完成单手传球(32–35 秒),1 现场的情感高潮加上慢动作 号球员反复变向和躲避 的技术分解——正是选项 (30–47 秒)。这种组合—— (C)。排除其他选项:(A) 现场的情感高潮加上慢动作 人群不是焦点;(B) 未显示 的技术分解——正是选项 记分牌;(D) 没有裁判争议; (C)。排除其他选项:(A) (E) 手抱头不是愤怒;(F) 人群不是焦点;(B) 未显示 这是开放比赛;(G) 伦斯 记分牌;(D) 没有裁判争议; 伯里俱乐部仅在口头提及; (E) 手抱头不是愤怒;(F) (H) 品牌标识只是框架; 这是开放比赛;(G) 伦斯伯 (I) 进攻成功。 里俱乐部仅在口头提及;(H) 品牌标识只是框架;(I) 进攻 成功。
29
第 30 页
图 6:比较推理问答生成的提示。指示大型语言模型生成一道多项选择题(最多包含 10 个选项),该问题基于长视频中两个不同音视频片段之间的关键对比或相似性,且需要结合两种模态才能作答。
30
第 31 页
图 7:用于上下文理解问答生成的提示。指示大型语言模型生成一个多项选择题,该问题依赖于更广泛的情境设置、背景或场景条件,这些条件只能通过联合推理视觉、声音和语音来推断。
31
第 32 页
图 8:用于计数问答生成的提示。指示大型语言模型生成一个问题,要求模型在整个视频中统计特定音视频事件的出现次数,并通过视觉线索验证嘈杂的音频字幕。
32
第 33 页
图 9:带有转录文本的详细描述提示。(第 1 部分,共 2 部分)
33
第 34 页
图 9:带有转录文本的详细描述提示。(第 2 部分,共 2 部分)指示大型语言模型生成一个全面的音视频描述(最多 1000 字),该描述将语音转录文本与整个视频中视觉、声音和场景动态的描述整合在一起。
表 9:AV-Flamingo 使用的所有数据集和模型检查点的许可证。
| 资产 | 类型 | 许可证 | 参考文献 | | :— | :— | :— | :— | | 模型检查点 | | | | | OmniVinci | 初始检查点 | NVIDIA OneWay 非商业许可证 | Ye 等人 (2025) | | AF-Whisper | 音频编码器 | NVIDIA OneWay 非商业许可证 | Goel 等人 (2025) | | Qwen2.5-7B | 基础大型语言模型 | Apache 2.0 | Team. (2025) | | 训练数据集 | | | | | YouTube-8M | 视频 | CC BY 4.0 | Abu-El-Haija 等人 (2016) | | HD-VILA | 视频 | 微软研究许可证(非商业) | Xue 等人 (2022) | | InternVid | 视频 | CC BY-NC-SA 4.0 | Wang 等人 (2024b) | | VidChapters-7M | 视频 | MIT 许可证;源媒体的 YouTube/API 条款 | Yang 等人 (2023) | | HarmonySet | 视频 | 未指定;适用源视频条款 | Zhou 等人 (2025) | | LSMDC | 视频 | 仅限研究使用 | Rohrbach 等人 (2016) | | MMTrail | 视频 | R-UDA 1.0(非商业研究) | Chi 等人 (2024) | | MovieCLIP | 视频 | 未指定;适用源媒体条款 | Bose 等人 (2022) | | MiraData | 视频 | GPL-3.0 元数据;适用源视频条款 | Ju 等人 (2024) | | AF3 训练混合 | 音频 | NVIDIA OneWay 非商业许可证 | Goel 等人 (2025) | | AudioSkills-XL | 音频 | NVIDIA OneWay 非商业许可证 | Goel 等人 (2025) | | MF-Skills | 音频 | NVIDIA OneWay 非商业许可证 | Ghosh 等人 (2025a) | | OmniVinci 图像-文本混合 | 图像-文本 | 混合公共来源;见源许可证 | Ye 等人 (2025) | | OmniVinci 视频-文本混合 | 视频-文本 | 混合公共来源;见源许可证 | Ye 等人 (2025) | | LibriSpeech | 语音 | CC BY 4.0 | Panayotov 等人 (2015) | | CHiME | 语音 | 研究使用/源语料库条款 | Vincent 等人 (2013) | | AliMeeting | 语音 | 研究/竞赛使用条款 | Yu 等人 (2022) | | CoVoST | 语音 | CC0(基于 Common Voice) | Wang 等人 (2020) | | GigaSpeech | 语音 | Apache 2.0 | Chen 等人 (2021) | | EMILIA | 语音 | CC BY-NC 4.0 | He 等人 (2024) | | Aishell-1 | 语音 | Apache 2.0 | Bu 等人 (2017) | | Aidatatang | 语音 | CC BY-NC-ND 4.0(由分销商撤回) | 北京数据堂科技有限公司 (2018) | | Multi-talker Switchboard | 语音 | LDC 用户协议 | Godfrey 和 Holliman (1993) | | MuST-C | 语音 | CC BY-NC-ND 4.0 | Cattoni 等人 (2021) | | AV-Safety QA | 音视频安全 | AVF 发布条款 | 本文 | | Audio-Think-Time | 音频推理 | AVF 发布条款 | 本文 | | Video-Think-Time | 视频推理 | AVF 发布条款 | 本文 | | AV-Think | 音视频推理 | AVF 发布条款 | 本文 | | 基线模型(仅用于评估) | | | | | Gemini 1.5/2.0/2.5 | 音视频模型 | 专有(API 服务条款) | Team 等人 (2024);Team (2025) | | GPT-4o | 大型语言模型 | 专有(API 服务条款) | Hurst 等人 (2024) | | Qwen2.5-Omni | 音视频模型 | Apache 2.0 | Xu 等人 (2025a) | | Qwen3-Omni | 音视频模型 | Apache 2.0 | Xu 等人 (2025b) | | Audio Flamingo 3 | 音频模型 | NVIDIA OneWay 非商业许可证 | Goel 等人 (2025) | | Phi-4-mm | 音视频模型 | MIT 许可证 | Abouelenin 等人 (2025) | | NVILA | 视觉语言模型 | 权重采用 CC BY-NC-SA 4.0;代码采用 Apache 2.0 | Liu 等人 (2025a) |
34
第 35 页
图 10:详细描述提示。指示大型语言模型从联合感知视角生成一段单一音视频描述(最多 500 字),以总结整个视频,不包含分段结构或显式时间戳。
35
第 36 页
图 11:用于音频-视觉事件对齐问答生成的提示。指示大型语言模型生成一个多项选择题,要求识别与特定视觉帧同时发生的精确音频线索,或反之,这需要紧密的跨模态同步。
36
第 37 页
图 12:事件序列问答生成的提示。指示大型语言模型生成一个多项选择题,涉及跨越视频时间线的两个或多个显著音视频事件的相对时间顺序。
37
第 38 页
图 13:用于生成整体推理问答的提示。指示大型语言模型生成一个开放式问题,该问题需要整合分布在视频大部分片段中的音视频证据,而非仅依赖某个局部时刻。
38
第 39 页
图 14:用于推理问答生成的提示。指示大型语言模型生成一道多项选择题,其答案只能通过结合视频中分散的多个隐含音视频线索来推断,且正确选项被刻意不直接陈述。
39
第 40 页
图 15:用于“大海捞针”问答生成的提示。指示大型语言模型生成一个开放式问题,针对长视频中的某个特定但重要的时刻,其中仍需更广泛的音视频上下文才能正确识别该时刻。
40
第 41 页
图 16:用于音频视觉指代问答生成的提示。指示大型语言模型生成最多两个问答对,将视觉事件与其对应的声音或声音与其对应的视觉场景联系起来,以锻炼跨模态定位能力。
41
第 42 页
图 17:子场景理解问答生成的提示。指示大型语言模型(LLM)针对长视频中由前后事件定义的有意义中间部分生成开放式问题。
42
第 43 页
图 18:用于时序推理问答生成的提示。(第 1/2 部分)。
43
第 44 页
图 18:用于时序推理问答生成的提示。(第 2 部分,共 2 部分)指示大型语言模型生成四个问答对,涵盖对视频的时间结构和动态演变进行的时间顺序、时间指代和时间属性推理。
44
第 45 页
图 19:用于主题级推理问答生成的提示。指示大型语言模型生成一个关于视频的主要活动、目标或整体主题的开放式问题,要求对整个时间线进行综合。
45
第 46 页
图 20:用于合成 AV-Think 推理三元组的提示词(第 1/2 部分)。
46
第 47 页
图 20:用于合成 AV-Think 推理三元组的提示词(第 2/2 部分)。给定从长视频中提取的带时间戳的音频和视觉描述,我们提示大型语言模型(LLM)生成一个问答-推理三元组,并附带一个整合的音视频描述。该提示词指示模型:(i) 要求对两种模态进行整体理解,(ii) 要求多跳时间推理,而非表面转录,以及 (iii) 使用 <t>…</t> 标签将每个中间思维步骤锚定到具体的时间戳。我们 additionally 强制规定,没有任何问题可以仅凭单一模态回答,从而确保生成的推理链真正交错地融合了音频和视觉证据。