UDT:用数据自适应Token缩减统一U-Net与扩散Transformer
提出U-Net扩散Transformer (UDT),通过数据自适应token合并实现无参数下/上采样,在保持token特征维度的同时显著加速训练收敛并提升生成性能。
提出U-Net扩散Transformer (UDT),通过数据自适应token合并实现无参数下/上采样,在保持token特征维度的同时显著加速训练收敛并提升生成性能。
PhotoHOI从单张RGB照片和开放词汇指令出发,通过VLM任务解析、任务相关场景恢复和可迁移交互先验,生成场景一致的3D手物交互序列。
关键洞察在于:我们不需要3D蒙皮真值,因为2D视觉基础模型已经内化了丰富的运动先验。G-Skin的做法是,先微调一个骨骼可控的图像生成模型——给它参考图像、骨骼控制点和动态掩码,它就能合成出姿态变化后的引导图像。然后,用这些2D引导图像作为监督,去优化一个CNN蒙皮网络。整个过程不需要任何3D蒙皮数据集,2D生成先验就是我们的老师。
提出DiffeoAfford管道,从手术器械轨迹中自动生成组织可供性热图标签,训练实时预测模型驱动AffordView应用进行预测性视野调整,并在12对腹腔镜胆囊切除术中验证其降低外科医生认知负荷的有效性。
关键洞察在于:运动和相机最终都表现为视频中的视觉变化。既然如此,为什么不把它们统一成一种视觉信号?现有方法恰恰缺失了这种统一视角——运动用视觉表示,相机用参数表示,两者之间存在根本性的语义鸿沟。
当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。
通过统一的掩码自回归整流流模型,系统比较了原始像素、SD-VAE潜变量、DINOv2和MAE特征四种目标空间,发现压缩率、重建保真度等常见属性无法单独预测生成行为,目标表征实质上是将难度重新分配到上下文建模、局部去噪和推理控制等不同组件中。