UniMoCa:统一运动与相机控制的视觉代理

快速导读:关键洞察在于:运动和相机最终都表现为视频中的视觉变化。既然如此,为什么不把它们统一成一种视觉信号?现有方法恰恰缺失了这种统一视角——运动用视觉表示,相机用参数表示,两者之间存在根本性的语义鸿沟。

可控人体视频生成长期面临一个根本性矛盾:运动控制依赖像素对齐的视觉线索(如骨架图),而相机控制依赖非视觉的参数化信号(如 Plücker 坐标嵌入)。这种异构控制接口迫使模型在两个不兼容的空间中协调运动与相机的关系,导致多人物、遮挡和动态相机场景下的归因歧义与质量退化。

UniMoCa 的核心洞察是:既然运动与相机最终都表现为视频中的视觉变化,为什么不将它们统一表达为视觉信号?基于这一思想,论文提出 Motion-Camera Visual Proxy(MCVP),一种将 3D 人体运动与相机轨迹渲染为单一视觉帧的统一表示,从而在共享的视觉空间中实现忠实的联合控制。

英文题目:UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2608.01944

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有方法通常采用双轨控制策略:运动控制使用骨架图、深度图等视觉条件,相机控制使用 Plücker 坐标等几何嵌入。这两种信号在语义空间、分辨率和几何性质上截然不同,模型需要学习复杂的跨模态映射来协调它们。当运动与相机变化同时发生时,模型难以判断某个像素变化应归因于人物运动还是相机运动,导致生成结果出现伪影、人物变形或相机漂移。

这一问题在多人物场景中尤为严重。不同人物可能有不同的运动模式,而相机运动又全局地影响所有人物在画面中的位置和透视。异构控制接口无法显式建模这种层次化的因果关系,使得模型容易混淆个体运动与全局相机变化。

此外,参数化相机控制的精度高度依赖中间估计模块(如相机位姿估计)的准确性。在快速运动、严重遮挡或复杂背景的野外视频中,这些估计往往不可靠,误差会直接传播到生成结果中。UniMoCa 的视觉代理方法天然对这些估计误差更具鲁棒性,因为视觉渲染过程本身具有一定的容错能力。

值得注意的是,Uni3C 等工作也曾尝试联合控制运动与相机,但使用场景点云和 SMPL-X 参数模型,局限于单人场景且依赖精确的 3D 重建。UniMoCa 通过视觉代理绕过了这些限制,支持多人场景和更灵活的输入条件。

核心创新

方法概览

关键洞察在于:运动和相机最终都表现为视频中的视觉变化。既然如此,为什么不把它们统一成一种视觉信号?现有方法恰恰缺失了这种统一视角——运动用视觉表示,相机用参数表示,两者之间存在根本性的语义鸿沟。

  • MCVP 的构建分为三步:首先从驱动视频中恢复相机视角下的 3D 人体运动和相机轨迹,使用 SAM 3D Body 和 Depth Anything 3 等现成工具;然后将运动变换到全局坐标系并进行平滑处理,消除相机运动对人体运动的污染;最后将人体视觉因子(身份无关的身体几何)和相机视觉因子(显式轨迹标记)渲染为单一视觉帧。
  • 人体视觉因子使用中性 3D 身体模型渲染,不携带任何外观信息,确保控制信号与生成内容的身份解耦。相机视觉因子则渲染为场景中的轨迹线和参考标记,直观地编码相机的旋转和平移变化。两者在同一视觉帧中通过空间布局自然区分,模型可以通过位置信息隐式学习运动与相机的归因关系。
  • MCVP 通过专门的代理编码器映射为视觉令牌,该编码器与主视频编码器结构相同但参数独立。编码后的 MCVP 令牌与噪声视频令牌沿序列维度拼接,共同输入冻结的 Wan2.2 I2V 扩散 Transformer。
  • 为区分控制令牌与生成令牌的时序角色,UniMoCa 引入 Shifted RoPE:对 MCVP 令牌施加固定的位置偏移(offset=120),使模型在注意力计算中明确区分“控制信号的时间位置”与“生成内容的时间位置”,从而保持精确的时序对齐。
  • 训练时采用 MCVP dropout(概率 0.15),随机丢弃部分 MCVP 帧,迫使模型不完全依赖完美的代理信号,提升对不完美输入和估计误差的鲁棒性。这一设计在消融实验中被证明对最终性能至关重要。
  • 整个训练在 8 块 H100 GPU 上运行约一周,使用 MCVP-Video 数据集,该数据集从大规模视频中自动提取并过滤了重建不完整的片段。
  • 推理时,用户只需提供一段驱动视频,系统自动提取 MCVP 序列,再结合外观参考图像和文本提示,即可生成同时遵循运动与相机控制的新视频。
  • 与 Plücker 编码和 PRoPE(Positional RoPE)等替代方案相比,MCVP 在统一的视觉空间中隐式编码了运动与相机的相对关系,避免了显式几何编码带来的精度敏感性和跨模态对齐困难。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 5: Heterogeneous motion-camera controls degrade video generation quality.

图 5 直接展示了异构运动-相机控制导致的生成失败案例。观察当使用分离的视觉运动信号和参数化相机信号时,生成结果中人物姿态与相机运动之间的不协调现象,这验证了统一视觉空间的核心动机。

核心区分与研究空白

核心区分与研究空白
Figure 1: Illustration of our Motivation. Prior methods combine visual motion cues with geometric camera codes, creating ambiguous motion-camera attribution across het- erogeneous control spaces (top). UniMoCa instead expresses both controls as MCVP in a shared visual space for faithful motion and camera control (bottom).

图 1 对比了异构控制与 MCVP 统一控制的范式差异。上半部分展示传统方法将视觉运动线索与几何相机编码混合,导致归因歧义;下半部分展示 UniMoCa 将两者统一为视觉代理,在共享空间中实现清晰的控制分离。注意观察异构控制下人物运动与相机运动的混淆现象。

方法贡献与验证

方法贡献与验证
Figure 2: Overview of UniMoCa. Top: we recover camera-view human motion and camera trajectories from a driving video, transform and smooth the motion in global coordinates, and render the human and camera visual factors into MCVP. Bottom: a proxy encoder maps MCVP to visual tokens with Shifted RoPE; these tokens are concatenated with noisy video and appearance/text condition tokens and processed by the diffusion transformer.

图 2 展示 UniMoCa 的完整流程。上方是从驱动视频恢复 3D 运动与相机轨迹、渲染 MCVP 的过程;下方是代理编码器将 MCVP 转为视觉令牌并与噪声视频拼接输入扩散 Transformer 的架构。重点关注 Shifted RoPE 如何区分控制令牌与生成令牌。

核心结论

核心结论
Table 3: Ablation study of key components.

UniMoCa 证明了一个简洁的原则:将异构控制统一到共享的视觉空间,是解决运动-相机归因歧义的有效途径。视觉代理不仅简化了控制接口,还天然对中间估计误差具有更强的鲁棒性。

实验如何设计?

  • 运动控制评估:与 MultiAnimate、SCAIL、SCAIL2 和 Seedance 2.0 对比,使用 Video-Bench 的 Motion Consistency 和 Temporal Consistency 指标,辅以人工评估。
  • 相机控制评估:与 ReCamMaster 和 Seedance 2.0 对比,使用 RotErr(旋转误差)和 TransErr(平移误差)衡量相机轨迹精度,同时评估 Video-Bench 的视频质量指标。
  • 消融实验:对比统一视觉条件(Plücker Enc.、PRoPE、MCVP)的效果差异,验证 Shifted RoPE 和 MCVP dropout 的贡献。
  • 定性分析:展示多人物运动控制、复杂相机运动、遮挡场景下的生成对比,突出 MCVP 在关节运动精度和画面布局保持上的优势。
  • 所有评估均在跨身份设定下进行,即生成视频中的人物身份与驱动视频不同,因此不使用 FID/FVD 等依赖身份一致性的指标。

关键结果与论文证据

  • 运动控制方面,UniMoCa 在 Video-Bench 上取得 Motion Consistency 4.55 和 Temporal Consistency 4.60,超越所有开源基线,并在运动相关指标上超过商业模型 Seedance 2.0(第 6 页 Table 1)。
  • 相机控制方面,UniMoCa 取得 RotErr 1.13 和 TransErr 4.53,显著优于 ReCamMaster(2.10, 5.35)和 Seedance 2.0(1.25, 4.74),证明视觉代理在相机精度上的优势(第 7 页 Table 2)。
  • 消融实验证实 MCVP 全面优于 Plücker Enc. 和 PRoPE:RotErr 1.13 vs 1.53/1.21,TransErr 4.53 vs 5.12/4.89,Motion Consistency 4.21 vs 3.89/4.05(第 7 页 Table 3)。
  • MCVP dropout 对鲁棒性贡献显著:移除 dropout 后,模型对不完美代理信号的容忍度明显下降,生成质量在困难场景中波动增大。
  • Shifted RoPE 的消融显示,若不使用位置偏移,控制信号与生成内容的时序耦合变弱,导致运动跟随精度下降。
  • 定性结果(第 5 页 Figure 3)显示,UniMoCa 在多人物场景中能准确保持每个人的独立运动,而基线方法常出现人物混淆或运动串扰。
  • 相机控制定性对比(第 6 页 Figure 4)表明,UniMoCa 在动态变焦和旋转场景中能精确保持主体在画面中的位置和比例,ReCamMaster 则出现明显的构图漂移。
  • 异构控制的可视化分析(第 7 页 Figure 5)直接展示了混合视觉-参数化控制导致的运动-相机归因失败案例,验证了统一视觉空间的核心动机。

阅读时需要注意

  • 依赖 SAM 3D Body 和 Depth Anything 3 等中间估计模块,在严重遮挡或极端快速运动的野外视频中,3D 重建可能失败,导致 MCVP 质量下降。
  • MCVP-Video 数据集在构建时丢弃了重建不完整的片段,可能引入数据选择偏差,限制模型在极端场景下的泛化能力。
  • 图像质量(Image Quality 4.26)仍落后于 Seedance 2.0(4.75),说明视觉代理方法在生成细节和真实感上还有提升空间。
  • MCVP dropout 率(0.15)和 Shifted RoPE 偏移量(120)为固定值,针对不同骨干网络可能需要重新调优。
  • 训练资源需求较高(8×H100 一周),对学术复现构成一定门槛。

关联工作

  • MultiAnimate 和 SCAIL 系列代表了基于视觉骨架的运动控制路线,但缺乏相机控制能力,且在多人物场景中易出现身份混淆。
  • ReCamMaster 和 Cameractrl 使用 Plücker 坐标嵌入进行相机控制,属于典型的异构参数化控制方法,与 UniMoCa 的视觉统一路线形成直接对比。
  • Seedance 2.0 作为商业模型同时支持运动和相机控制,但其内部机制未公开,UniMoCa 在运动精度上超越它,在图像质量上仍有差距。
  • Uni3C 是少数同时处理运动与相机的工作,但依赖场景点云和 SMPL-X,限制在单人场景,UniMoCa 的视觉代理方法在通用性上有本质提升。

发表评论