G-Skin:用2D生成先验为3D高斯绑定骨骼

核心思路:用2D生成先验替代3D标注

关键洞察在于:我们不需要3D蒙皮真值,因为2D视觉基础模型已经内化了丰富的运动先验。G-Skin的做法是,先微调一个骨骼可控的图像生成模型——给它参考图像、骨骼控制点和动态掩码,它就能合成出姿态变化后的引导图像。然后,用这些2D引导图像作为监督,去优化一个CNN蒙皮网络。整个过程不需要任何3D蒙皮数据集,2D生成先验就是我们的老师。

从器械轨迹到手术意图:无需人工标注的预测性腹腔镜自动取景

核心方法:从动作到可供性

提出DiffeoAfford管道,从手术器械轨迹中自动生成组织可供性热图标签,训练实时预测模型驱动AffordView应用进行预测性视野调整,并在12对腹腔镜胆囊切除术中验证其降低外科医生认知负荷的有效性。

UniMoCa:统一运动与相机控制的视觉代理

方法贡献与验证

关键洞察在于:运动和相机最终都表现为视频中的视觉变化。既然如此,为什么不把它们统一成一种视觉信号?现有方法恰恰缺失了这种统一视角——运动用视觉表示,相机用参数表示,两者之间存在根本性的语义鸿沟。

WorldExam:从表观外观到内在反应性的世界模型基准评测

论文代表图:figure-03-p006-01

当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。

生成难度究竟在哪里?目标表征的实证研究

论文代表图:figure-01-p005-01

通过统一的掩码自回归整流流模型,系统比较了原始像素、SD-VAE潜变量、DINOv2和MAE特征四种目标空间,发现压缩率、重建保真度等常见属性无法单独预测生成行为,目标表征实质上是将难度重新分配到上下文建模、局部去噪和推理控制等不同组件中。