OmniReasoner:原生工具调用实现长音频视频自适应推理
本文介绍 OmniReasoner,一种针对长音频视频推理的工具使用后训练框架。针对长视频中证据稀疏且全量高保真处理成本高的问题,OmniReasoner 让模型先进行低成本全局预览,再决定调用 zoom-in 工具获取特定区间的高保真片段。核心创新包括 TimeAnchor 解决跨采样率时间锚定,以及 Temporal Augmented Data Engine 合成训练数据。实验显示在 OmniVideoBench 和 VideoHolmes 上显著超越基线。需注意当前框架对全模态模型支持有限,且存在幻觉风险。