FilmGPT:用自回归Transformer学习电影剪辑语法

方法:离散标记与自回归框架

本文提出FilmGPT,一种基于自回归Transformer的电影剪辑模型。它将电影表示为离散视频标记和显式⟨CUT⟩标记的序列,通过滑动窗口注意力和音频条件约束进行训练。推理时采用素材约束解码算法,确保生成的镜头严格来自输入素材。在AVE数据集上,Acc@1达到53.9%,优于SOTA方法UQNet。用户研究显示,FilmGPT在连贯性和电影感上优于Transcript2Video和EditDuet。模型存在上下文长度限制,且无法直接处理L-cut/J-cut等音频主导技巧。

D2DF:单步视频物体移除,无需草稿的高保真重建

方法:D2DF框架概述

传统视频物体移除方法存在伪影,扩散方法虽真实但慢且依赖草稿。本文提出D2DF框架,通过特权一致性蒸馏(PPCD)和自引导快速植入(SGFP),将多步扩散教师模型蒸馏为单步无草稿模型。实验显示D2DF-DF在RORD上PSNR达31.56,推理仅需1.05秒,比ROSE快40倍。注意:单步去噪在极端遮挡下仍有模糊,伪草稿视觉粗糙但潜在空间有效。

Wan-Streamer v0.3:世界与事件流解耦的实时全双工交互模型

预训练数据构造:世界上下文摘要

本文分析 Wan-Streamer v0.3 的核心创新:将视频重构为持久世界上下文与随时间变化的事件流。相比 v0.1/v0.2 针对单一交互任务训练的局限,v0.3 通过通用预训练学习世界动态,支持实时全双工音频视觉交互及开放词汇自由行为生成。实验显示模型侧响应延迟约 200 ms,总交互延迟约 550 ms。需注意预训练数据中的世界上下文摘要可能存在信息丢失,且行为生成依赖语言描述的准确性。

FoMoVLA:通过联合视觉前瞻与运动引导增强VLA模型

方法:FoMoVLA框架概览

本文提出FoMoVLA框架,解决现有VLA模型缺乏显式世界动态预测的问题。通过联合优化未来特征前瞻和稀疏2D点追踪,并利用FCCA模块耦合两者,模型在LIBERO基准上达到98.8%平均成功率,在RoboCasa上优于基线9.1%。推理时无额外开销。需注意模型对固定视角训练数据的依赖及FCCA初始化的稳定性。

MAGiSt3R:首个多代理前馈3D重建框架,突破单目视频全局一致性难题

方法:MAGiSt3R框架概览

本文介绍MAGiSt3R,首个用于单目RGB视频的多代理前馈3D重建框架。针对现有NeRF/3DGS SLAM依赖每场景迭代优化导致速度慢,以及前馈3R模型缺乏全局优化易产生累积漂移的问题,MAGiSt3R通过MAGMA模块实现子图聚合,结合位姿图优化(PGO)减少漂移。实验显示,在ReplicaMultiagent和AriaMultiagent数据集上,其重建精度和轨迹跟踪(ATE RMSE)均优于SOTA前馈基线,推理速度约10 FPS。需注意,部分RGB-D SLAM基线使用RGB-D输入,对比时仅作为参考上限。

SceneBind:跨视觉、音频和语言的语义与空间绑定

方法概述:全局嵌入与对象中心槽

SceneBind提出了一种结合全局语义嵌入和对象中心语义-空间槽的通用模态场景表示方法。通过显式建模3D空间属性,解决了现有模型缺乏显式空间结构的问题。实验显示,SceneBind在跨模态场景检索(V↔T R@1: 65.3)和对象级空间检索(Spatial mAP: 48.0)上显著优于ImageBind和M2D-SigLIP2*。该方法依赖真实世界空间对齐的多模态数据,且对象槽数量需根据任务调整。

DriftWorld:单步漂移世界模型,实现30+ FPS实时机器人规划

方法:漂移生成架构

扩散世界模型因多步去噪导致推理缓慢,限制实时控制。DriftWorld利用漂移生成模型,通过单步前向传播实现30+ FPS视频生成。实验显示其在Push-T、Bridge-V2等基准上视觉质量优异,且通过GPC-RANK显著提升策略性能。注意:训练需较大显存,依赖预训练特征提取器。

VideoChat3:全开源高效视频理解新基准

I3D-ViT架构

本文分析VideoChat3,一种全开源的视频多模态大语言模型。针对现有模型泛化能力有限、计算效率低下及可复现性差的问题,VideoChat3提出I3D-ViT架构和自适应帧分辨率机制。实验显示其在MotionBench和TempCompass上取得全开源最佳成绩。需注意自适应分辨率依赖状态预测准确性,且长视频数据依赖LLM生成。

HDR:分层去噪实现视频多步逻辑推理与流式生成

方法:HDR分层去噪框架

本文提出HDR框架,解决视频生成中逻辑一致性与低延迟流式生成的矛盾。通过树状分层潜在变量和SHAP稀疏注意力,实现从粗到细的去噪推理。实验显示,整体成功率从34.22提升至60.29,推理延迟仅为0.70s/latent,比双向扩散快54.2倍。

AnomExpert:无需平面标注的产前超声异常诊断原型选择框架

方法:AnomExpert框架概览

本文提出AnomExpert,针对产前超声多实例学习(MIL)中混合异构图像、缺乏平面语义的问题。方法通过可学习的Plane Prototype将无序图像组织为潜在解剖平面,并利用Disease-aware sparse selection机制为每种异常选择相关平面进行聚合。实验在多中心数据集上验证,Accuracy达86.9%,AUC 97.9%,显著优于AttentionMIL、TransMIL等基线。需注意依赖ViT骨干及超参数敏感性。