ScanFocus:解耦时空扫描与边界聚焦,突破视频定位高频线索抑制瓶颈
本文提出ScanFocus框架,针对现有Transformer方法因全局下采样抑制高频时间线索、导致边界定位模糊的问题,采用由粗到细的解耦范式。首先通过全局扫描生成粗略时空管,随后在局部窗口内利用语义引导的时间聚合器显式建模帧间依赖,精确回归起止时间戳。实验显示在HC-STVGv1上vIoU@0.3达67.5%,显著超越TA-STVG等基线。需注意细化阶段窗口大小需权衡精度与噪声,且依赖上游预训练质量。
本文提出ScanFocus框架,针对现有Transformer方法因全局下采样抑制高频时间线索、导致边界定位模糊的问题,采用由粗到细的解耦范式。首先通过全局扫描生成粗略时空管,随后在局部窗口内利用语义引导的时间聚合器显式建模帧间依赖,精确回归起止时间戳。实验显示在HC-STVGv1上vIoU@0.3达67.5%,显著超越TA-STVG等基线。需注意细化阶段窗口大小需权衡精度与噪声,且依赖上游预训练质量。
本文提出ALTR框架,解决VLM中视觉Token冗余导致的计算瓶颈。通过Rényi熵估计重要性和基于MLP变换一致性的多样性采样,ALTR在不依赖注意力图或成对比较的情况下,实现即插即用的Token缩减。实验显示,在LLaVA-v1.5-7B上保留192个Token时,平均性能保留98.86%,且额外FLOPs仅为4.13M,完全兼容FlashAttention-2。该方法适用于需要高效部署VLM的边缘场景。
本文介绍FOLIO系统,一种面向流式视频理解的无训练方法。针对流式场景中记忆成本随视频增长及冗余细节保留的问题,FOLIO采用动态焦点状态引导记忆写入,区分重要实体与上下文。系统包含短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。实验显示,在OVO-Bench上Perception达82.0%,在StreamingBench上整体准确率达74.5%。需注意记忆写入成本随视频长度线性增长,且错误多源于检索证据区分度不足而非记忆缺失。
本文提出视觉依赖差距(VDG)指标,证明视频大语言模型的基准准确率与视觉 grounding 能力是可解离的。通过黑屏对照和 McNemar 检验,揭示多数基准测试中的“推理”任务实际上由语言先验驱动。实验覆盖 20 个模型,发现帧多样性是视觉贡献的主要来源,而时间顺序贡献接近于零。
本文提出UniPhysGen,解决3D资产缺乏物理语义的问题。通过感知引导分解、几何感知关节接地和仿真验证,将异构网格转化为仿真就绪资产。在UniPhys-Bench上关节类型准确率达89.96%,优于现有基线。需注意极端旋转下轴推理仍有挑战,且仿真验证目前以定性为主。
本文提出REAL框架,旨在解决现有具身智能依赖特权Oracle感知API、难以处理模糊指令及仿真现实差距的问题。通过移除全局物体列表等特权信息,构建无Oracle感知的闭环视觉环境,并集成LLM驱动的模拟用户进行交互式消歧。采用SFT对齐Qwen3-VL-8B工具接口,随后使用GSPO进行在线强化学习以优化自适应推理。实验显示,该框架在REAL-Bench基准SUL任务成功率达56.9%,超越所有Zero-shot VLM基线;在Ark LIFT2真实机器人部署中端到端成功率达78.3%。需注意SFT阶段存在行为克隆过拟合风险,且底层VLA策略的执行稳定性直接影响整体表现。
本文提出SIVA-RL框架,针对多模态强化学习中视觉干预效果异质性问题,通过基于奖励下降幅度的动态路由,将样本分为敏感性对齐和不变性对齐。实验显示,该方法在Qwen2.5-VL-3B和7B模型上显著提升视觉依赖任务准确率,但需注意PatchSwap超参数敏感性及黑屏正确性的误导性。
本文介绍M4World,一种基于DiT的多视角多模态驾驶世界模型。针对现有模型在物体级细粒度可控性和长时程生成稳定性上的不足,M4World通过融合3D几何、语义、图像描述和文本属性的控制接口,实现了空间布局与视觉外观的双重控制。训练采用五阶段配方,包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD及迭代长视频微调,支持4步自回归流式生成。实验显示,在10秒视频上FID为34.8,FVD为288.7,优于MagicDriveV2。在60秒长视频生成中,通过潜在上下文刷新保持稳定性。针对“运载树木的卡车”长尾场景,通过LoRA少样本适配,使BEV检测Recall从1.0
传统视频Tokenizer依赖像素级重建,导致潜在空间语义不足。VideoRAE利用冻结的视频基础模型(VFM)作为特征提取器,通过1D投影器和表示对齐(REPA)模块构建紧凑且语义丰富的潜在空间。该方法支持连续(DiT)和离散(AR)两种生成范式,在UCF-101和VBench上显著提升了重建质量并加速了下游生成模型的收敛。需注意其性能高度依赖所选VFM的预训练范式。
本文对WSI VLM基准测试进行系统性审计,揭示因TCGA数据源重叠导致的严重患者级和机构级数据泄露。通过计算案例级重叠率ρcase和机构级重叠率ρTSS,并在CONCH-v1和TITAN编码器上验证特征空间中的泄露信号,证明当前报告的高准确率主要源于对记忆化特征的检索而非真正的多模态推理。