OmniReasoner:原生工具调用实现长音频视频自适应推理

OmniReasoner 框架概览

本文介绍 OmniReasoner,一种针对长音频视频推理的工具使用后训练框架。针对长视频中证据稀疏且全量高保真处理成本高的问题,OmniReasoner 让模型先进行低成本全局预览,再决定调用 zoom-in 工具获取特定区间的高保真片段。核心创新包括 TimeAnchor 解决跨采样率时间锚定,以及 Temporal Augmented Data Engine 合成训练数据。实验显示在 OmniVideoBench 和 VideoHolmes 上显著超越基线。需注意当前框架对全模态模型支持有限,且存在幻觉风险。

MoD-VLLM:模块化动态粒度长视频理解,突破Token预算与多事件定位瓶颈

MoD-VLLM框架概览

本文提出MoD-VLLM框架,旨在解决长视频理解中Token预算有限与多事件细节捕捉之间的矛盾。现有方法如Token剪枝或关键帧选择易导致细节丢失或错误传播。MoD-VLLM通过正负视频片段定位模块识别相关片段,并利用模块化动态粒度反射模块,对正片段进行细粒度编码以捕捉细节,对负片段进行粗粒度编码以保留全局上下文。结合DPO优化与反事实验证,该框架实现了迭代式自我修正。实验显示,在VideoMME和MEventBench等基准上,MoD-VLLM显著优于LLaVA-Video和Qwen2.5-VL等基线模型。

VideoTreeSearch:用离散树导航解决长视频接地问答中的错误收敛问题

方法概览:VideoTreeSearch框架

本文提出VideoTreeSearch (VTS),针对长视频接地问答中传统智能体缺乏回溯机制、易过早收敛的问题。VTS利用CLIP构建语义树,通过zoom_in/out/shift离散动作实现显式自纠错。实验显示,VTS在CG-Bench上mIoU达16.8,显著优于LongVT,且平均处理帧数更少。需注意当前方法对多段分散证据支持有限,且依赖CLIP场景分割。

Nemotron AV-Flamingo:开源长视频音视频联合推理模型解析

方法概述

本文介绍Nemotron Labs发布的AV-Flamingo,一个面向长视频与复杂场景的开放音视频智能模型。针对现有模型缺乏长上下文联合理解能力的问题,该工作提出了包含约700万实例的AV-Skills数据集,以及将推理步骤锚定时间戳的TAVIT框架。实验显示,在MMOU、WorldSense等基准上,AVF-Think表现优异,部分指标超越OmniVinci等开源模型,但在MMOU上略低于Gemini-2.5 Pro。模型完全开源,包括权重、代码及数据集,适合需要透明训练流程的研究者。需注意数据集存在来源偏差风险,且极长密集视频推理仍具挑战。