LongE2V:如何用视频扩散模型解决事件相机长视界生成难题?

论文代表图:figure-04-p004-02

事件相机视频生成面临回归方法纹理模糊、长程预测时序漂移及插值重影等挑战。本文介绍LongE2V方法,通过微调CogVideoX并引入自回归展开、重编码对齐等创新机制,在ECD、MVSEC等数据集上实现SOTA重建与预测性能。需注意其推理速度较慢且对稀疏事件流敏感。

HIVE:幻觉如何重塑VLM推理

相关工作与对比

传统观点认为VLM幻觉有害,但HIVE框架发现,在部分可观测场景下,幻觉生成的语义线索能拓宽推理路径,提升准确率。本文通过HIVE引擎对比忠实与幻觉路径,在PlantVillage等数据集上验证了适度幻觉的收益,并揭示了倒U型性能曲线。注意:此结论不适用于所有场景,过度幻觉仍会导致失效。

Wat3R:无标注水下3D重建,VGGT水下适配新范式

Wat3R核心方法

水下环境存在光衰减、散射及视图依赖退化,且缺乏大规模高质量3D标注,导致现有基于陆地数据的Feed-forward 3D重建模型泛化能力差。Wat3R提出了一种跨域半监督学习框架,利用合成数据和未标注真实视频,无需水下3D标注即可将VGGT适配至水下场景,并引入跨视图一致性损失以应对水体退化。实验表明,Wat3R在Sea-thru、FLSea Stereo、SQUID、SeaThru-NeRF及Water3D上均显著优于基线。但需注意,处理高动态元素能力有限,且在极端退化条件下性能仍受限于可见性。

SAM-MT:实时交互式多目标视频分割,延迟与目标数无关

SAM-MT的核心架构

现有视频对象分割方法如SAM2在处理多目标时,计算成本随目标数量线性增长,难以在密集场景中保持实时性。SAM-MT通过解耦全局上下文与个体目标查询,引入稀疏记忆和身份变换器,实现了高效的多目标跟踪与分割。实验显示,在MOSEv2等基准上性能优于SAM2.1-B+,且在10个目标场景下FPS从7.8提升至36.3。需注意,该方法仍为纯视觉架构,极端遮挡下可能存在身份漂移。

APIVOT:用视觉思维解决长程机器人规划的几何困境

方法核心:交错视觉-语言思维

长 horizon 机器人规划常因语义与几何脱节而失败。APIVOT 通过自适应交错语言推理与视觉思维(Visual Thoughts),在内部验证几何可行性。实验显示其在 KitchenWorlds 中成功率显著优于 Gemini-ER-1.5 等基线,且在复杂几何场景下优势更明显。需注意其目前仅在模拟器中验证,且自适应行为基于 SFT 学习。

EmbodiedGen V2:具身智能仿真环境自动化生成与Sim-to-Real验证

核心方法概述

本文介绍EmbodiedGen V2,一个面向具身智能的仿真就绪3D世界引擎。针对现有3D生成模型缺乏物理属性和交互语义的问题,该系统通过代理式生成、Affordance自动标注和Vibe Coding编辑,实现从自然语言到可执行物理环境的自动化构建。实验显示,在生成环境中进行在线RL训练,仿真成功率从9.7%提升至79.8%,Sim-to-Real任务成功率从21.7%提升至75.0%。需注意,完全在线生成耗时较长,且部分资产需手动调整。

ZipDepth:6.1M参数实现零样本单目深度估计的实时部署

Method: ZipDepth 架构概览

ZipDepth 是一个仅含 6.1M 参数的轻量级单目深度估计网络,通过从 Foundation Model 进行大规模知识蒸馏和硬件自适应架构设计,在嵌入式设备上实现了实时推理与卓越的零样本泛化能力。本文介绍了 ZipDepth 的架构设计、训练策略、实验结果及局限性,为嵌入式设备上的实时深度估计提供了新的解决方案。

OPSD-V:自回归视频长程退化问题的策略内自蒸馏解决方案

论文代表图:figure-01-p002-01

自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。OPSD-V通过策略内自蒸馏,利用真实长视频数据作为特权上下文,对少步生成器进行后训练。实验显示,该方法在MovieGenBench和MeiBench上显著提升了质量分数和动态程度,用户研究也证实其在运动质量和视觉质量上的优势。需注意语义匹配可能略有下降,且依赖高质量长视频数据。

视频生成也能推理?OpenCoF用17K数据与推理Token破解长程逻辑难题

OpenCoF-17K数据集

现有视频生成模型缺乏针对Chain-of-Frame推理的专用训练信号,导致长程连贯性不足。本文提出OpenCoF框架,构建OpenCoF-17K数据集并在Wan2.2基座上微调得到Wan-CoF。实验显示,在MME-CoF、Gen-ViRe等基准上性能显著提升。进一步引入Visual/Textual Reasoning Tokens,通过注意力机制显式捕捉推理线索。需注意,高视觉真实感不等同于可靠推理,且Token效果依赖任务特性。