ReflexTrack:用闭环反馈解决无训练视频分割的目标漂移问题
现有无训练RVOS方法多采用开环设计,缺乏对初始提示和时序传播的显式验证,导致在遮挡或形变场景下易失效。ReflexTrack通过Mask-guided Spatial Refinement和Video-level Mask Reflection构建闭环反馈,迭代优化空间提示并修复时序错误。实验显示其在Ref-VPS上显著优于基线,但在ReasonVOS上仍有提升空间。注意:该方法依赖强大MLLM,计算成本较高。
现有无训练RVOS方法多采用开环设计,缺乏对初始提示和时序传播的显式验证,导致在遮挡或形变场景下易失效。ReflexTrack通过Mask-guided Spatial Refinement和Video-level Mask Reflection构建闭环反馈,迭代优化空间提示并修复时序错误。实验显示其在Ref-VPS上显著优于基线,但在ReasonVOS上仍有提升空间。注意:该方法依赖强大MLLM,计算成本较高。
传统深度传感器在玻璃表面失效,导致机器人导航危险。SILICA利用Stable Diffusion先验,联合预测玻璃分割和深度。通过CLIP条件化机制解决任务纠缠,并利用非玻璃区域校准深度。实验显示其在Mirage 18k等数据集上显著优于现有方法。注意:该方法依赖非玻璃区域的传感器读数进行校准。
现有多模态大模型在定位任务中难以兼顾精细感知与复杂推理。Motto提出Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens,通过动态切换感知与推理模式,在PR-Bench等基准上实现SOTA。视频解析其核心机制与实验证据,并指出计算开销等局限。
多模态大模型在低分辨率下性能骤降,传统蒸馏方法成本高且存在分布偏移。本文提出RP-OPSD,利用同一图像的高/低分辨率视图构建教师-学生差距,通过在线自蒸馏提升细粒度视觉能力。实验显示该方法在Qwen3.5系列上显著提升性能,并实现1.78倍训练加速。注意:加速仅指训练阶段,且对非细粒度任务提升有限。
本文分析FLOWCTS论文,指出传统基于KL散度的在线蒸馏(OPD)在流模型中存在时序监督错配:损失集中在去噪后期,忽略了早期关键的速度场差异。FLOWCTS通过连续轨迹监督重新定义目标,在GenEval和OCR上取得更好结果。注意:监督步数K并非越大越好,需权衡结构一致性与细节保留。
现有3D风格化方法常面临风格与几何纠缠导致的伪影,或依赖缓慢的2D-to-3D流程。DreamStyle3D通过Decoupled Dual Cross-Attention (DDCA)将几何与风格特征解耦,并结合Style Disentanglement Augmentation训练策略,在保持结构一致性的同时实现高效风格迁移。实验显示其在CLIP和DINO指标上优于StyleTex等基线,且推理时间仅需约10秒。需注意其依赖预训练编码器的潜在偏差。
现有视频编辑方法难以同时控制焦距、分辨率和相机姿态。CameraAnything 提出将 Plücker 射线注入 3D RoPE,在 Wan2.1 基础上实现内/外参联合控制。实验显示其在合成与真实数据上均优于 ReCamMaster 等基线,但复杂多镜头切换仍有局限。
本文探讨MicroZoom如何解决极端超分辨率中的结构不一致问题。通过级联扩散模型与SAM分割引导,该方法在吉像素尺度下保持材料边界清晰。实验显示其在视觉质量上优于UltraZoom等基线,但需注意其高推理成本与实例级微调需求。
具身智能缺乏像多模态大模型那样统一的互联网级数据源。本文提出“具身数据金字塔”分类法,从可扩展性与机器人对齐度两个维度系统梳理了真实机器人、UMI、第一人称、仿真及通用数据五大来源,并分析其在具身基础模型中的应用与挑战。视频通过具体案例和数据对比,揭示了不同数据源的优势与局限,为具身智能体的数据整合提供了系统化指导。
单图像散焦去模糊(SIDD)长期受限于合成数据和固定光圈的小规模数据集。本文介绍 RealDefocus 基准,通过 23,000 对真实高分辨率图像对,证明训练数据的真实性与规模是提升模型泛化能力的关键。实验显示,在 RealDefocus 上训练的模型在 RealDOF 测试集上表现显著优于传统 DPDDS 训练模型。注意:高容量模型计算成本较高,且真实 Ground Truth 可能存在残留模糊。