LongE2V:如何用视频扩散模型解决事件相机长视界生成难题?
事件相机视频生成面临回归方法纹理模糊、长程预测时序漂移及插值重影等挑战。本文介绍LongE2V方法,通过微调CogVideoX并引入自回归展开、重编码对齐等创新机制,在ECD、MVSEC等数据集上实现SOTA重建与预测性能。需注意其推理速度较慢且对稀疏事件流敏感。
事件相机视频生成面临回归方法纹理模糊、长程预测时序漂移及插值重影等挑战。本文介绍LongE2V方法,通过微调CogVideoX并引入自回归展开、重编码对齐等创新机制,在ECD、MVSEC等数据集上实现SOTA重建与预测性能。需注意其推理速度较慢且对稀疏事件流敏感。
传统观点认为VLM幻觉有害,但HIVE框架发现,在部分可观测场景下,幻觉生成的语义线索能拓宽推理路径,提升准确率。本文通过HIVE引擎对比忠实与幻觉路径,在PlantVillage等数据集上验证了适度幻觉的收益,并揭示了倒U型性能曲线。注意:此结论不适用于所有场景,过度幻觉仍会导致失效。
水下环境存在光衰减、散射及视图依赖退化,且缺乏大规模高质量3D标注,导致现有基于陆地数据的Feed-forward 3D重建模型泛化能力差。Wat3R提出了一种跨域半监督学习框架,利用合成数据和未标注真实视频,无需水下3D标注即可将VGGT适配至水下场景,并引入跨视图一致性损失以应对水体退化。实验表明,Wat3R在Sea-thru、FLSea Stereo、SQUID、SeaThru-NeRF及Water3D上均显著优于基线。但需注意,处理高动态元素能力有限,且在极端退化条件下性能仍受限于可见性。
现有视频对象分割方法如SAM2在处理多目标时,计算成本随目标数量线性增长,难以在密集场景中保持实时性。SAM-MT通过解耦全局上下文与个体目标查询,引入稀疏记忆和身份变换器,实现了高效的多目标跟踪与分割。实验显示,在MOSEv2等基准上性能优于SAM2.1-B+,且在10个目标场景下FPS从7.8提升至36.3。需注意,该方法仍为纯视觉架构,极端遮挡下可能存在身份漂移。
长 horizon 机器人规划常因语义与几何脱节而失败。APIVOT 通过自适应交错语言推理与视觉思维(Visual Thoughts),在内部验证几何可行性。实验显示其在 KitchenWorlds 中成功率显著优于 Gemini-ER-1.5 等基线,且在复杂几何场景下优势更明显。需注意其目前仅在模拟器中验证,且自适应行为基于 SFT 学习。
本文介绍EmbodiedGen V2,一个面向具身智能的仿真就绪3D世界引擎。针对现有3D生成模型缺乏物理属性和交互语义的问题,该系统通过代理式生成、Affordance自动标注和Vibe Coding编辑,实现从自然语言到可执行物理环境的自动化构建。实验显示,在生成环境中进行在线RL训练,仿真成功率从9.7%提升至79.8%,Sim-to-Real任务成功率从21.7%提升至75.0%。需注意,完全在线生成耗时较长,且部分资产需手动调整。
ZipDepth 是一个仅含 6.1M 参数的轻量级单目深度估计网络,通过从 Foundation Model 进行大规模知识蒸馏和硬件自适应架构设计,在嵌入式设备上实现了实时推理与卓越的零样本泛化能力。本文介绍了 ZipDepth 的架构设计、训练策略、实验结果及局限性,为嵌入式设备上的实时深度估计提供了新的解决方案。
自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。OPSD-V通过策略内自蒸馏,利用真实长视频数据作为特权上下文,对少步生成器进行后训练。实验显示,该方法在MovieGenBench和MeiBench上显著提升了质量分数和动态程度,用户研究也证实其在运动质量和视觉质量上的优势。需注意语义匹配可能略有下降,且依赖高质量长视频数据。
现有视频生成模型缺乏针对Chain-of-Frame推理的专用训练信号,导致长程连贯性不足。本文提出OpenCoF框架,构建OpenCoF-17K数据集并在Wan2.2基座上微调得到Wan-CoF。实验显示,在MME-CoF、Gen-ViRe等基准上性能显著提升。进一步引入Visual/Textual Reasoning Tokens,通过注意力机制显式捕捉推理线索。需注意,高视觉真实感不等同于可靠推理,且Token效果依赖任务特性。
NoPA用固定大小的3D粒子集替代高斯近似,并通过Hellinger距离、MMD和关系传播构建在线场景图。本期核对3DSSG、ReplicaSSG与消融结果,并讨论2D检测器上限、长尾谓词和粒子数量权衡。