ShotPlan:基于可学习规划令牌的电影级多镜头视频生成
本文提出ShotPlan框架,解决现有视频生成模型难以在单一过程中生成具有明确镜头边界和跨镜头语义一致性的多镜头视频的问题。通过引入可学习规划令牌和分数时间旋转位置编码,实现帧级转场控制。实验显示,ShotPlan在转场偏差、角色一致性等指标上优于CineTrans、HoloCine等基线,并在摄像机运动控制上超越Kling 2.6和Seedance 1.5 Pro。需注意该方法依赖高质量合成数据训练,且规划令牌需保持干净以加速收敛。
本文提出ShotPlan框架,解决现有视频生成模型难以在单一过程中生成具有明确镜头边界和跨镜头语义一致性的多镜头视频的问题。通过引入可学习规划令牌和分数时间旋转位置编码,实现帧级转场控制。实验显示,ShotPlan在转场偏差、角色一致性等指标上优于CineTrans、HoloCine等基线,并在摄像机运动控制上超越Kling 2.6和Seedance 1.5 Pro。需注意该方法依赖高质量合成数据训练,且规划令牌需保持干净以加速收敛。
本文提出FSC-VLN方法,解决标准行为克隆在长程导航中因缺乏未来状态监督导致的误差累积问题。通过在训练阶段引入冻结SigLIP编码器提取的未来视觉嵌入作为目标,对齐可学习的未来查询token,实现未来状态监督。实验显示在R2R+RxR数据集上SR提升1.47pp,且在长程任务中增益显著。需注意该方法依赖专家轨迹,且增益主要集中在长距离导航。
本文提出ConsiSpace框架,针对多模态大模型在视频空间推理中缺乏几何建模、冗余证据多及跨视角不稳定等问题,设计了几何一致性记忆(GCM)和统一一致性自监督强化学习(UC-SSRL)。GCM通过门控写入和融合减少冗余,UC-SSRL利用自监督奖励提升稳定性。实验显示在VSI-Bench和OSI-Bench上显著超越基线,且在长视频场景下显存占用和推理时间大幅降低。需注意GCM依赖几何基础模型准确性,噪声输入可能影响性能。
传统视频虚假信息检测常因处理冗余数据而效率低下且缺乏可解释性。本文提出SIEVE框架,通过Evidence Agent在预算约束下主动搜寻OCR、ASR及视觉线索,构建紧凑证据包供Verifier判定。实验显示,SIEVE在FakeSV和FakeTT上分别达到92.62%和91.64%准确率,刷新SOTA;在跨域基准FakeVV上亦展现良好泛化能力。需注意,模型对特定数据集证据分布存在依赖,且视觉读取受限于24张图像上限。
本文介绍VGOcc方法,针对3D占据预测中稀疏高斯缺乏显式几何信息的问题,提出Visual-Geometric Gaussians表示。通过冻结VGGT基础模型提取视觉和几何线索,结合VGBirth和PFLearn模块优化高斯初始化与特征学习。在nuScenes数据集上,SC IoU达到34.07,SSC mIoU达到21.75,优于GaussianFormer-2。方法依赖准确相机标定,且存在计算开销,适用于对精度和效率有平衡要求的自动驾驶场景。
本文介绍ReViV框架,旨在解决第一人称视觉中人体运动与场景几何重建分离、依赖辅助输入及推理慢的问题。方法通过模态特定VQ-VAE将连续信号离散化为统一token序列,利用Masked Generative Egocentric Transformer (MGET) 学习多模态联合分布,并在推理时基于RGB条件迭代解码。实验显示,在ADT、HoloAssist等基准上,ReViV在身体、手部、视线、相机跟踪和深度估计上达到SOTA性能,且推理速度显著提升。需注意,离散化可能丢失高频细节,且部分基线使用了GT相机轨迹,比较时需考虑此差异。
本文提出CGDJ基准,通过显式因果感知和隐式生成预测评估视频生成器的推理能力。研究发现Sora-2、Veo-3.1等模型存在显著的“感知-预测鸿沟”,即能口头描述因果逻辑但无法生成一致的物理结果。高视觉保真度不等于因果正确性,模型可能依赖语言先验而非内部世界模型。
本文介绍FlowMimic方法,通过像素对时间扭曲流场从图像编辑样本实时生成视频编辑数据,并利用模态模仿损失对齐图像与视频模态。该方法无需外部掩码或大型多模态模型,实现了统一的视频编辑与生成。实验表明,模型在Wan2.1-T2V-1.3B基础上后训练,在FiVE-Bench和UNIC-Bench上表现出良好的编辑能力,包括对象插入、风格化、头部替换等。但需注意颜色漂移和复杂非刚性编辑的局限性。
现有视觉相似性度量(如LPIPS, DreamSim)将相似性坍缩为单一标量,无法根据特定视觉方面(如颜色、姿态)进行条件化。本文提出TPIPS,通过微调Qwen3-VL-8B-Emb并构建包含25K图像三元组的大规模数据集,实现基于自由文本提示的细粒度、多面视觉相似性度量。实验显示,TPIPS在Odd-one-out任务上将模型-人类一致性差距从9.1%缩小至2.8%,在2AFC域外任务上将误差从15.8%降低至10.0%。该方法在条件化检索和生成模型评估中展现出新能力,但计算成本高于传统度量。
本文提出LUCID框架,针对多模态 AI Agent的长期记忆系统发起黑盒视觉攻击。现有防御机制往往忽视视觉数据的语义完整性,导致攻击者可通过植入不可察觉的对抗性图像,在无需访问模型权重或文本通道的情况下,成功污染记忆。实验显示,在Mem-Gallery基准上,上下文中毒攻击成功率高达61.6%,上下文注入攻击成功率达58.4%。本文分析了不同记忆后端(如MuRAG, NGMemory, UniversalRAG)的脆弱性,并评估了高斯模糊等防御策略的有效性,指出当前防御手段的局限性。