视频大语言模型真的在“观看”吗?诊断长视频中的角色追踪失败

论文代表图:figure-01-p001-01

本文通过九条件诊断协议,对InternVL2-8B、Qwen2.5-VL-7B等模型在InfiniBench基准上的表现进行深度剖析。研究发现,尽管模型在BBT验证集上达到37-38%的准确率,但主要依赖性别线索和位置偏差(如偏好选项E),而非真正的角色身份追踪。名称替换测试显示,模型对跨性别替换敏感,但对同性别替换不敏感。此外,帧采样策略导致的“注释结构混淆”也是性能波动的主因。本文提醒研究者警惕高基准准确率背后的虚假理解。

AsySplat:解耦几何与外观的高效长序列3D高斯泼溅

AsySplat非对称架构设计

本文提出AsySplat,针对长序列3D Gaussian Splatting中的计算冗余问题,设计了非对称的几何与外观分支。几何分支使用粗粒度Token和稀疏注意力,外观分支使用细粒度Token。实验显示,在DL3DV-140和MipNeRF-360上,AsySplat在参数量减少30%的情况下,推理效率显著提升,且在新视角合成质量上优于基线模型LongLRM。

HandFlow:基于流匹配的完全生成式4D手部重建

方法概览:完全生成式流匹配

本文介绍HandFlow,一种用于单目4D手部重建的完全生成式框架。针对现有确定性回归方法在遮挡和模糊下易产生抖动和姿态错误的问题,HandFlow利用流匹配(Flow Matching)在MANO参数空间进行条件生成。核心创新包括双流Transformer架构和置信度感知连续掩码(cmask),有效处理视觉歧义。实验显示,该方法在DexYCB和HOT3D数据集上达到SOTA精度,且推理速度显著优于基线。需注意,模型性能依赖前端检测器质量,且VRAM占用较高。

FlowPET:利用辛流匹配解决低计数PET重建中的信号洗出问题

FlowPET核心思想

低计数PET重建面临信号洗出与过度平滑难题。FlowPET提出辛流匹配框架,利用可分哈密顿系统和Range-Null空间分解,实现体积守恒传输。实验显示其在BrainWeb和UDPET数据集上显著优于扩散模型基线,但需注意辛积分器的计算成本。

NeuralActuator:低成本伺服平台无传感器力感知与动力学建模

数据集:NAD与数据验证

针对低成本伺服平台(如无刷直流电机)存在的摩擦、滞后及背隙等非线性效应,传统线性电流-扭矩近似(τ=KtI)失效,导致Sim-to-Real误差大且缺乏力感知能力。本文提出NeuralActuator,基于Transformer架构处理历史状态与遥测数据,结合可微分仿真(Differentiable Simulation)进行训练。创新点在于利用仿真姿态轨迹作为代理监督信号(Torque Surrogate),无需直接扭矩标签即可训练。模型同时输出等效广义力代理、外部力估计、接触概率及电机状态。在NAD数据集上训练,并在OpenManipulator-X、SO-101及Franka Panda

MM-ToolSandBox:视觉工具调用代理评估基准与失败模式分析

MM-ToolSandBox框架概览

本文介绍MM-ToolSandBox,一个包含500+工具、支持多轮多图交互的视觉工具调用代理评估基准。研究揭示了当前模型在视觉精度和规划能力上的瓶颈,以及随规模变化的失败模式转移。

FoundationGeo:通过空间尺度场与射线校正实现单目度量几何

方法概览:两阶段框架

单目度量深度估计面临尺度歧义、空间尺度漂移及射线方向偏差。FoundationGeo采用两阶段框架:第一阶段利用DINOv3初始化的ViT编码器学习高保真仿射不变相对几何;第二阶段引入空间尺度场(Spatial Scale Field)进行空间变化的度量校准,并引入射线方向校正场(Ray-Direction Correction Field)修正3D不一致性。针对训练数据中相机内参(特别是焦距)分布与测试数据不匹配的问题,通过Blender合成多样化焦距数据增强模型鲁棒性。实验显示,该方法在七个基准数据集上平均AbsRel为14.8%,δ1为80.8%,显著超越MoGe-2等基线。

Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积

方法概览:Cycle-World框架

自回归视频模型在长时域生成中面临严重的误差累积(Error Accumulation)和生成漂移(Generative Drift),导致结构崩塌和主体身份丢失。Cycle-World提出基于时间可逆性的框架,通过训练时的循环一致性学习(CCL)和推理时的循环引导推理(CGI)来抑制这些问题。实验显示,在VBench基准上,60秒生成的Total Score达到82.88,优于LongLive的82.62,且在VideoPhy物理一致性评估中表现最佳。需注意CGI策略可能增加推理延迟,且循环损失权重需仔细调优。

E-VQA:通过时空证据掩码实现可解释视频问答

数据:自动化流水线

本文提出E-VQA任务,解决现有Video LLMs缺乏可验证视觉Grounding的问题。通过构建ST-Evidence基准和160k规模指令数据集,模型需输出时间片段与密集分割掩码作为证据。实验显示,Ours-7B在ST-Evidence-Gen上t-mean提升27.2,但单纯增加参数量效果有限,数据质量与架构设计更为关键。

十年视觉语言AI模型的准确性与视觉认知误差演变

方法:CSB数据集的构建

本研究通过构建包含100张电影场景图像的CSB数据集,评估了2017-2025年间9个视觉语言模型在描述复杂场景时的表现。研究发现,尽管MLLMs在准确性上已接近人类水平,但仍存在空间依赖误差。研究还建立了五类视觉认知误差分类体系,并开发了基于掩码范式的空间依赖误差(SDE)量化方法。