单卡RTX 5090实时推演:ABot-World-0的LongForcing与全栈优化

数据:WorldExplorer闭环系统

本文介绍ABot-World-0,一种基于动作条件的视频世界模型。针对现有世界模型在长时程一致性、控制耦合及部署效率上的瓶颈,研究提出WorldExplorer闭环数据系统、LongForcing长时程分布匹配机制,以及基于LightVAE、FP8/MXFP4量化和SageAttention2的全栈推理协同设计。在WorldRoamBench基准上,该模型在Strict Accuracy等指标上优于Genie 3等基线,并在单张RTX 5090上实现16 FPS实时交互。需注意,性能数据基于特定硬件,且部分基线模型参数量较大,比较时需考虑规模差异。

视频生成器具备因果推理能力吗?CGDJ基准揭示“感知-预测鸿沟”

方法:CGDJ基准框架概述

本文提出CGDJ基准,通过显式因果感知和隐式生成预测评估视频生成器的推理能力。研究发现Sora-2、Veo-3.1等模型存在显著的“感知-预测鸿沟”,即能口头描述因果逻辑但无法生成一致的物理结果。高视觉保真度不等于因果正确性,模型可能依赖语言先验而非内部世界模型。

MoD-VLLM:模块化动态粒度长视频理解,突破Token预算与多事件定位瓶颈

MoD-VLLM框架概览

本文提出MoD-VLLM框架,旨在解决长视频理解中Token预算有限与多事件细节捕捉之间的矛盾。现有方法如Token剪枝或关键帧选择易导致细节丢失或错误传播。MoD-VLLM通过正负视频片段定位模块识别相关片段,并利用模块化动态粒度反射模块,对正片段进行细粒度编码以捕捉细节,对负片段进行粗粒度编码以保留全局上下文。结合DPO优化与反事实验证,该框架实现了迭代式自我修正。实验显示,在VideoMME和MEventBench等基准上,MoD-VLLM显著优于LLaVA-Video和Qwen2.5-VL等基线模型。

FVAttn:解决视频生成稀疏注意力负载不均的运行时负载均衡方案

FVAttn 系统架构概览

本文介绍 FVAttn,一种用于视频生成的自适应稀疏注意力系统。针对 Top-p 路由在多 GPU 序列并行中导致的负载不均问题,FVAttn 提出运行时负载均衡与松弛感知稀疏增强机制。实验显示,在 Wan2.2 I2V 上相比 FlashAttention 实现 4.41x 注意力加速。需注意该方法对长序列和硬件通信带宽敏感。

Nemotron AV-Flamingo:开源长视频音视频联合推理模型解析

方法概述

本文介绍Nemotron Labs发布的AV-Flamingo,一个面向长视频与复杂场景的开放音视频智能模型。针对现有模型缺乏长上下文联合理解能力的问题,该工作提出了包含约700万实例的AV-Skills数据集,以及将推理步骤锚定时间戳的TAVIT框架。实验显示,在MMOU、WorldSense等基准上,AVF-Think表现优异,部分指标超越OmniVinci等开源模型,但在MMOU上略低于Gemini-2.5 Pro。模型完全开源,包括权重、代码及数据集,适合需要透明训练流程的研究者。需注意数据集存在来源偏差风险,且极长密集视频推理仍具挑战。

VideoChat3:全开源高效视频理解新基准

I3D-ViT架构

本文分析VideoChat3,一种全开源的视频多模态大语言模型。针对现有模型泛化能力有限、计算效率低下及可复现性差的问题,VideoChat3提出I3D-ViT架构和自适应帧分辨率机制。实验显示其在MotionBench和TempCompass上取得全开源最佳成绩。需注意自适应分辨率依赖状态预测准确性,且长视频数据依赖LLM生成。