未来渲染≠未来表面:超越观测窗口的动态表面重建基准与数据集
本文提出FUTURESURF基准,针对动态场景重建中缺乏“未来表面”评估的问题,构建了包含8个解析定义合成运动的数据集。实验显示,DG-Mesh和Deformable-3DGS在观测窗口外的Chamfer Distance显著增加,且渲染质量(PSNR/LPIPS)与几何精度(CD)几乎无关。本文揭示了当前方法在时间外推时的几何保持能力不足,为评估动态重建模型提供了新的标准化协议。
本文提出FUTURESURF基准,针对动态场景重建中缺乏“未来表面”评估的问题,构建了包含8个解析定义合成运动的数据集。实验显示,DG-Mesh和Deformable-3DGS在观测窗口外的Chamfer Distance显著增加,且渲染质量(PSNR/LPIPS)与几何精度(CD)几乎无关。本文揭示了当前方法在时间外推时的几何保持能力不足,为评估动态重建模型提供了新的标准化协议。
本文介绍UniD模型,解决统一密集预测需共标注数据的痛点。通过训练Task Specialist并利用Latent Projector蒸馏至Unified Backbone,UniD从Disjoint Data中学习深度、法线、语义等八种任务。实验显示,UniD在NYUv2深度估计AbsRel达0.059,超越DINOv3-H;视频时序一致性超越DICEPTION。需注意分割任务需轻量级微调,且时序性能依赖视频训练数据。
本文介绍HyWorldVLA,一种用于自动驾驶的视觉-语言-动作模型。针对纯像素级模型对噪声敏感、纯潜在级模型缺乏解释性的问题,HyWorldVLA采用混合世界建模,结合视频VAE压缩与联合注意力机制。实验显示其在NAVSIM v1/v2基准上达到SOTA,PDMS达90.59,且在雨雾噪声下表现优异。需注意单目摄像头在转弯场景的视野限制及损失权重平衡。
本文提出ProVisE框架,解决图像生成模型与文本VLM在空间推理评估中的接口不匹配问题。通过构建SpatialGen-Bench基准和Agentic协议构建机制,实现像素级输出的结构化解析与指标对齐。实验显示视觉外化与文本推理具有互补性,但通用VLM解析器会显著改变模型排名。
Axolotl3D提出了一种多模态、遮挡感知的3D生成框架,通过联合条件输入图像、可见性掩码、相机参数和部分点云,实现了单视图生成、稀疏多视图重建、遮挡补全及几何感知编辑的统一处理。在Toys4K和OmniObject3D数据集上,该方法在单视图无遮挡、多视图无遮挡、单视图有遮挡及多视图有遮挡场景下均取得最优F-score,显著优于ShapeR和Hunyuan3D-Omni。模型通过掩码偏置交叉注意力机制和合成数据增强策略,增强了对部分和异构观测的鲁棒性。但需注意,模型对相机视角变化鲁棒性有限,极度细薄结构可能无法完全连接,且仅生成形状不预测纹理。
本文介绍Lumera流水线,通过SpatialLM解析对象3D框和参数化灯光,结合SAM3D网格重建与IntrinsicHDR环境估计,生成可直接导入Blender或UE5的结构化场景。实验显示Lumera-Box在检测指标上领先,但灯光定位F1仅为0.209。Agent精炼循环作为受限编辑器,防止错误传播。
本文提出RealVDeblur框架,利用3D Gaussian Splatting (3DGS)合成大规模物理真实模糊数据,解决现实世界视频去模糊的泛化难题。通过Frame-wise VAE编码保留帧级模糊细节,利用Distribution Matching Distillation (DMD)将多步扩散蒸馏为单步生成器。引入无需训练的Temporal Window Mask (TWM)限制自注意力范围,消除RoPE外推不稳定性,实现恒定内存的长视频推理。在BSD、RealBlur等基准上验证了有效性,并展示了作为3DGS重建预处理步骤的提升作用。
本文介绍WorldWeaver,一种流式Multi-Agent视频扩散模型。针对现有方法难以维持共享世界状态的问题,引入世界状态寄存器(WSR)和混合Transformer(MoT)。实验显示,在Minecraft任务上WorldScore达105.1,优于Solaris基线。需注意该方法依赖显式状态监督,且WorldScore对FID尺度敏感。
本文分析 SANA-Video 2.0 如何解决全 3D Softmax 视频 DiT 的 O(N^2) 计算瓶颈。方法核心为混合线性-Softmax 注意力(25% 锚点)与 Block AttnRes 机制。实验显示,该模型在 VBench 上取得 84.30 分,720p/5s 延迟仅 13.06 秒,比 Wan 2.2 快 120 倍。需注意当前算子为双向,且长视频训练课程仍在完善中。
多模态大语言模型推理成本高,现有方法如FastV或AdaLLaVA仅独立优化Token剪枝或层跳过,忽略视觉密度与LLM容量的耦合。本文提出SmartVL,联合控制视觉Token数、Transformer层数及注意力头组。通过可微延迟估计器和非对称损失,在VQAv2等基准上,50%预算下准确率显著优于基线。需注意不同任务最优配置差异,且FLOP节省需硬件支持才能转化为实际加速。