三分钟导读:本文提出Crowd4D框架,通过引入人类-场景交互代理(HSIP)和人群结构相干正则化(CSCR),实现了复杂大场景中单目视频的人群与场景联合优化重建。
英文题目:Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction
论文出处:arXiv 每日论文精选 · arXiv:2607.19517
原始论文:PDF / 论文页面
对应视频标题:Crowd4D:场景感知的单目4D人群重建,解决大场景深度歧义|推荐指数:★★★★★
这篇论文解决什么问题?
现有单目人群重建方法多依赖单平面假设,在复杂地形和大尺度场景下存在严重的深度歧义、度量尺度漂移和空间不一致问题。
核心创新
- 提出人类-场景交互代理(HSIP),结合场景几何先验和时间相干深度线索,解决单目深度歧义和尺度漂移。
- 构建紧凑的场景交互表示(SIPC&SIS),从密集噪声点云中提取地形感知几何,支持非平面地形上的人体锚定。
- 引入人群结构相干正则化(CSCR),利用局部人群拓扑的时间相干性,在遮挡情况下保持群体结构的稳定性。
方法概览
Crowd4D是一个多阶段联合优化框架:1) 初始化阶段获取相机轨迹、场景点云和初始SMPL运动;2) 构建场景交互点云(SIPC)和场景交互曲面(SIS)以生成人类-场景交互代理(HSIP),作为中间优化代理约束人体在复杂地形上的可行区域;3) 三阶段联合优化:阶段1优化全局尺度和根位置;阶段2优化姿态;阶段3优化运动先验并应用人群结构相干正则化(CSCR)。
逐图理解论文
Crowd4D框架概览

Crowd4D是一个多阶段联合优化框架,旨在实现复杂大场景中人群与场景的联合重建。框架首先初始化相机轨迹、场景点云和初始SMPL运动,随后通过构建场景交互表示生成人类-场景交互代理,最后分三阶段联合优化全局尺度、姿态及运动先验,确保重建结果的几何一致性和时间相干性。
人类-场景交互代理HSIP

核心创新之一是提出人类-场景交互代理HSIP。该代理结合场景几何先验和时间相干深度线索,约束人体在复杂地形上的可行区域。通过构建紧凑的场景交互点云SIPC和场景交互曲面SIS,从密集噪声点云中提取地形感知几何,支持非平面地形上的人体锚定,有效缓解单目深度歧义。
定量评估:VirtualCrowd数据集

在合成数据集VirtualCrowd上进行定量评估,对比DyCrowd、Crowd3D等SOTA方法。在统一跟踪设置下,PPDS达到89.04,MPJPE降至61.83。在真值跟踪设置下,PPDS进一步提升至91.43,MPJPE降至59.35,显著优于现有方法,验证了框架在标准场景下的有效性。
定性评估:PANDA数据集

在真实世界数据集PANDA上进行定性评估,展示在千兆像素视频和复杂地形下的重建效果。与小型场景方法VideoMimic对比,Crowd4D在大规模场景下表现出更强的全局一致性约束能力。定性结果显示,重建的人群在复杂地形上分布合理,无明显穿透或悬浮现象。
应用场景与隐私保护

该方法主要用于城市管理和公共安全,需注意隐私保护,不重建面部细节。在复杂大场景中,Crowd4D提供了高精度的人群重建能力,有助于行为分析和事件检测。尽管计算成本较高,但其重建质量在离线分析场景中具有重要价值,为后续实时化优化提供了基础。
实验与关键结果
- 在合成数据集VirtualCrowd上进行定量评估,对比DyCrowd、Crowd3D、GroupRec等SOTA方法。
- 在真实世界数据集PANDA上进行定性评估,展示在千兆像素视频和复杂地形下的重建效果。
- 与小型场景方法VideoMimic进行对比,验证其在大规模场景下的鲁棒性。
- 进行消融实验,验证多阶段优化策略、HSIP对齐机制和CSCR正则化的有效性。
- 在VirtualCrowd数据集统一跟踪设置下,PPDS达到89.04,MPJPE降至61.83。(第 8 页)
- 在VirtualCrowd数据集真值跟踪设置下,PPDS达到91.43,MPJPE降至59.35。(第 8 页)
- 在遮挡实例上,MPJPE为64.19,优于DyCrowd的66.09。(第 8 页)
阅读时需要注意
- Crowd4D是离线优化框架,计算成本较高(100人200帧约需4小时)。
- 性能依赖于单目场景重建、人体初始化和跟踪的质量,特别是在严重遮挡情况下。
- 真实世界大尺度人群数据集缺乏3D姿态标注,限制了定量评估。
- 该方法主要用于城市管理和公共安全,需注意隐私保护,不重建面部细节。
- 在近距离场景中,由于前景遮挡,SIPC/SIS构建可能不可靠,需采用替代策略。
关联工作
- DyCrowd:主要基线方法,本文在跟踪和重建性能上均优于该方法。(第 7 页)
- Crowd3D:早期大场景重建方法,使用HVIP进行2D到3D锚定,对投影误差敏感。(第 3 页)
- VideoMimic:小型场景重建方法,在大规模场景下缺乏全局一致性约束,性能显著低于Crowd4D。(第 8 页)
- GroupRec:基于超图推理的人群重建方法,仅适用于单张图像,无法处理视频动态。(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Crowd4D:场景感知的单目4D人群重建
洪波康 1 天一 Zhou 1 庆阳 Yang 1 宏伟 Wen 1 静 Huang 1 玉坤 Lai 2 Kun Li 1
摘要
从大规模场景的单目视频中恢复场景一致的4D人群运动仍然具有挑战性,因为存在严重的深度模糊和复杂的场景几何。现有的单目人群重建方法通常依赖于单平面假设,导致在复杂地形下度量尺度不可靠且出现空间漂移。我们提出了Crowd4D,这是第一个场景感知的4D人群重建框架,能够从大规模场景的单目RGB视频中联合优化人群和场景。Crowd4D明确地融入了场景几何,并通过多阶段优化策略确保图像空间和场景空间的一致性。
1. 引言
大规模场景下的单目4D人群重建对于城市管理、公共安全、智能交通和行为理解中的大规模人群感知至关重要。与小规模或近距离设置相比,大规模场景(例如广场、街道监控、无人机视频)具有广泛的空间分布、强烈的尺度变化以及频繁的静态-动态遮挡。仅凭单目RGB输入,严重的深度模糊使得世界空间定位成为不适定问题,通常导致时间抖动和空间漂移。因此,在像素空间和世界空间中实现时空一致的重建仍然是核心挑战。
现有的大规模场景人群重建方法(Wen 等人,2023;2025;Huang 等人,2024)通常依赖于简化的场景假设(例如单平面地形),这使得像素-世界一致性在复杂或非平面地面上变得脆弱。同时,大多数单目多人重建方法是针对小规模场景开发的:全图方法(Baradel* 等人,2024;Patel & Black,2025;Wang 等人,2025b)难以处理远处微小的人体,而基于裁剪的流水线(Goel 等人,2023;Huang 等人,2023;Wang 等人,2024)对尺度高度敏感,微小的误差会被放大为世界空间中的巨大偏差。基于深度先验的方法(Liu 等人,2025;Chen 等人,2025;Allshire 等人,2025)通过场景重建来缓解这一问题,但它们主要在近距离设置中运行;对于仅有几个像素的远处人群,深度模糊仍然严重,限制了在大型和复杂场景中的鲁棒性。
近期场景重建的进展(Wang 等人,2025a;c)提供了全局一致的几何结构和准确的相机注册,为超越单平面假设的人群重建提供了强大的几何锚点(Wen 等人,2023;2025;Huang 等人,2024)。然而,密集的多帧点云是冗余且嘈杂的,其计算成本随人群规模的增长而急剧增加,这促使我们需要一种紧凑且一致交互表示。
总体而言,准确的大规模人群重建需要:(1) 人群与场景之间精确的尺度对齐,(2) 能够保留多帧几何一致性的高效表示,以及 (3) 与场景几何和图像一致的稳健的人-场景几何锚定。
该任务的一个关键瓶颈在于准确的人-场景对齐,特别是在尺度和位置方面。然而,人和场景的重建通常是解耦的。为了解决这个问题,我们引入了人类-场景交互代理(Human-Scene Interaction Proxy, HSIP)作为中间表示,它源自场景交互点云(Scene Interaction Point Cloud, SIPC)和场景交互曲面(Scene Interaction Surface, SIS),编码了显式的场景感知几何先验,并重新定义了大规模单目4D人群重建的优化空间。为了进一步提高遮挡下的时间稳定性,我们引入了人群结构相干正则化(Crowd Structural Coherence Regularization, CSCR),它利用基于HSIP的空间先验,对局部人群邻域内的成对相对位移和方向施加软时间一致性约束。
大量实验表明,Crowd4D一致地优于现有的最先进方法,并能够在复杂的大规模真实场景中实现稳健的单目4D人群重建。项目页面位于 https://cic.tju.edu.cn/faculty/likun/projects/Crowd4D。
1天津大学,中国天津 2卡迪夫大学,英国卡迪夫。通讯作者:Kun Li <lik@tju.edu.cn>。
第43届国际机器学习会议论文集,韩国首尔。PMLR 306,2026。版权所有 © 2026 作者。
第 2 页
Crowd4D:场景感知的单目4D人群重建
输入 叠加结果 输入 叠加结果 输入 叠加结果
优化结果 优化结果 优化结果
26753×15052像素;单平面地形;静态相机 1920×1080像素;复杂地形;静态相机 3640×2048像素;单平面地形;动态相机 1.吉像素监控场景 2.传统监控场景 3.无人机场景
图1. 跨多种大场景的场景感知4D人群重建。从左至右:吉像素静态相机监控场景、具有复杂地形的传统监控场景,以及动态相机运动的无人机拍摄场景。我们的方法支持所有三种场景,而之前的大场景方法通常仅限于最左侧的场景。第一行显示输入视频和叠加结果,第二行展示最终优化的重建结果。不同的颜色代表不同的行人,随时间变化的单人3D重建形成场景一致的4D表示。
观察结果。 用于大规模复杂地形场景的单目4D人群重建框架(图1)。Crowd4D联合 针对这些挑战,我们引入了人类-场景交互代理(Human-Scene 优化人群和场景,采用多阶段策略从单目RGB视频中进行优化。我们的贡献包括三个方面: Interaction Proxy (HSIP)),这是一种中间优化 (1)用于大场景中单目4D人群重建的统一场景感知框架;(2)基于 代理,连接解耦的人群和场景重建。 SIPC和SIS构建的HSIP,将场景几何与人群分布耦合,以稳定度量尺度和个体位置;(3)CSCR,利用局部人群结构在遮挡下提高时间稳定性。大量实验表明,我们在大规模场景上达到了最先进的性能。 HSIP并不直接使用密集且嘈杂的场景几何来约束人体姿态,而是结合场景级别的几何先验与时间相干的深度线索,将每个个体限制在一个稳定且与场景一致的可行区域内,从而缓解单目深度估计的病态问题。HSIP在联合优化全局场景尺度的同时约束每个个体的世界空间位置,有效减少了严重深度模糊下的尺度漂移和位置不稳定性。我们使用由场景交互点云(Scene Interaction Point Clouds, SIPC)和场景交互曲面(Scene Interaction Surface, SIS)组成的紧凑场景表示来实例化HSIP,将多帧重建提炼为与交互相关的结构。基于SIPC和SIS,HSIP在复杂地形上定义了一个可行的支撑区域,实现了超越平面假设的鲁棒的像素到世界锚定。
此外,仅靠轨迹的时间平滑性在密集人群中是不足的,因为存在遮挡和观测碎片化的问题。虽然个体运动高度动态,但由邻居间相对空间关系捕捉的人群局部结构拓扑表现出强烈的时空相干性。利用这一特性以及基于HSIP的空间先验,我们引入了人群结构相干正则化(Crowd Structural Coherence Regularization, CSCR),这是一种群体级约束,强制成对相对位移和方向之间的软时间一致性,防止在遮挡下出现不合理的结构扭曲。
总之,我们提出了Crowd4D,这是第一个场景感知的单目4D人群重建框架(图1)。Crowd4D联合优化人群和场景,采用多阶段策略从单目RGB视频中进行优化。我们的贡献包括三个方面:(1)用于大场景中单目4D人群重建的统一场景感知框架;(2)基于SIPC和SIS构建的HSIP,将场景几何与人群分布耦合,以稳定度量尺度和个体位置;(3)CSCR,利用局部人群结构在遮挡下提高时间稳定性。大量实验表明,我们在大规模场景上达到了最先进的性能。
2. 相关工作
2.1. 人-场景重建
联合人-场景重建旨在在共同的世界坐标系中恢复人类、相机和场景几何。传感器辅助方法,如CIMI4D (Yan et al., 2023) 和 HiSC4D (Dai et al., 2024),利用可穿戴惯性传感器和激光雷达(LiDAR)捕捉准确的人-场景交互,但需要专用硬件。基于视觉的方法从视觉观测中联合推理人类和场景:SynCHMR (Zhao et al., 2024) 从单目视频中重建度量尺度的相机、人类和密集场景;HSfM (Müller et al., 2024) 从稀疏未校准的多视图图像中联合恢复人类、相机和场景点云;而基于优化的方法,如JOSH (Liu et al., 2025) 和 VideoMimic (Allshire et al., 2025),将人体运动与重建的环境耦合,以实现场景一致的运动恢复。然而,现有的基于视觉的方法主要针对相对局部场景中的人类个体或稀疏交互。
第 3 页
Crowd4D: 场景感知的单目 4D 人群重建
(a) 人群与场景初始化 (第 3.1 节) (b) 人-场景交互处理 (第 3.2 节) (c) 多阶段联合优化 (第 3.3 节)
交互 场景交互 几何 人-场景 阶段 1: 基于 HSIP 尺度 检测 和 !𝑏!,# #𝑚!,#̅ 代理锚定 提取 和根 优化 人群 𝛽, 𝜏, 𝛾, 𝛼 跟踪 𝐽!,#()*+ 结构 先验 参考 根 位置 度量尺度初始化 场景和相机 提取 阶段 2: 像素一致 重建 𝒞#̅ 𝒮# 置信度引导的地形 射线空间序列 姿态优化 𝛽, 𝜏, 𝛾, 𝑧& 几何先验 采样 校正 … 个体 阶段 3: 群体引导 运动 !𝑄!,# 𝐽!,#$%̅ 曲面 重建 垂直 映射到 SIS 重建 运动先验 优化 𝛽, 𝑧' 运动先验
未对齐的场景和 4D 人群结果 场景一致的 4D 人群结果 射线̅ SIPC 和 SIS 投影
场景一致性❌ HSIP 场景一致性 ✅ 像素一致性 ✅ 像素一致性 ✅
图 2. Crowd4D 框架概览。我们的方法从人群和场景初始化开始;然而,初始结果在场景尺度和个体空间位置上存在显著偏差。为了解决这个问题,我们引入了人-场景交互处理,其中通过场景交互点云和场景交互曲面 (SIPC&SIS) 施加几何约束,以构建引导后续优化的人-场景交互代理 (HSIP)。最后,利用人群结构、几何和运动先验,执行多阶段联合优化,以获得场景一致且像素一致的 4D 人群重建结果。
在大规模人群视频中,远距离观测、严重的个体间遮挡以及复杂的非平面地形使得直接的人-场景对齐变得不可靠。相比之下,我们构建了紧凑的地形感知交互几何结构 SIPC&SIS,并导出 HSIP 锚点,以稳定复杂地形上密集的人群分布。
2.2. 人群重建
ROMP (Sun et al., 2021)、Multi-HMR (Baradel* et al., 2024) 和 AiOS (Sun et al., 2024) 等多人方法同时重建网格,但仅关注小场景,无法处理跨越数百米的密集人群。对于大场景重建,Crowd3D (Wen et al., 2023) 引入了 HVIP (Human-scene Virtual Interaction Point,人-场景虚拟交互点),利用预估计的相机和地面平面将 3D 定位转换为 2D 像素估计。GroupRec (Huang et al., 2023) 通过超图推理对个体间交互进行建模。RCR (Huang et al., 2024) 定义了地面感知归一化以消除对相机内参的依赖。然而,这些单图像方法无法从视频中推断人群运动。DyCrowd (Wen et al., 2025) 扩展到视频领域,采用群体引导优化和异步一致性损失,并同样采用基于 HVIP 的定位。然而,HVIP 风格的 2D 到 3D 平面锚定对投影误差敏感:微小的 2D 偏差可能导致巨大的 3D 漂移,特别是在低海拔、长距离的场景中。相比之下,我们的 HSIP 结合场景级几何先验和时间相干的深度线索来定义稳定的可行区域,并通过超越个体时间平滑性的局部结构相干性来稳定密集人群。
3. 方法
Crowd4D 旨在通过联合估计全局相机轨迹、静态场景几何结构以及统一世界坐标系中多个个体的 3D 位置、姿态和形状,从单目 RGB 视频中恢复场景一致的 4D 人群运动。为了解决由深度模糊和复杂地形引起的尺度不一致和空间漂移问题,我们将人群和场景重建表述为一个紧密耦合的联合优化问题,包含几何、群体级和运动约束,从而强制执行图像空间和场景空间之间的一致性(图 2)。
人体表示。我们使用 SMPL 模型 (Loper et al., 2015) 来表示人体几何和运动。在时间 $t$,每个人 $n$ 由姿态 $\theta_{n,t} \in \mathbb{R}^{23 \times 3}$、形状 $\beta_{n,t} \in \mathbb{R}^{10}$、全局方向 $\gamma_{n,t} \in \mathbb{R}^3$ 和全局平移 $\tau_{n,t} \in \mathbb{R}^3$ 参数化。我们记 $Q_{n,t} = (\theta_{n,t}, \beta_{n,t}, \gamma_{n,t}, \tau_{n,t})$,时间序列为 $Q_n = \{Q_{n,t}\}_{t=1}^T$。SMPL 前向函数将这些参数映射到世界坐标系中的姿态网格 $V_{n,t} \in \mathbb{R}^{6890 \times 3}$ 和关节位置 $J_{n,t} \in \mathbb{R}^{24 \times 3}$:
$$ (V_{n,t}, J_{n,t}) = \mathcal{M}(\gamma_{n,t}, \theta_{n,t}, \beta_{n,t}) + \tau_{n,t}. \quad (1) $$
3.1. 人群与场景初始化
我们构建全局一致的初始化以启动后续的联合优化,其输出:(i) 带有跟踪身份的单帧人体检测结果,(ii) 与重力对齐的全局相机轨迹和静态场景点云,以及 (iii) 共享世界帧中每个人的初始 SMPL 运动序列。
第 4 页
Crowd4D: 场景感知的单目 4D 人群重建
检测与跟踪。给定帧 $I_t \in \mathbb{R}^{H \times W \times 3}$,我们应用 YOLOX (Ge et al., 2021) 在全帧中检测人员。对于每个检测到的人员,我们使用 SAM 2 (Ravi et al., 2025) 获取实例掩码,并从 DWPose (Yang et al., 2023) 获取每关节观测置信度分数。BoostTrack++ (Stanojevi´c & Todorovi´c, 2024) 关联随时间变化的检测结果,产生 $N$ 个持久身份。对于每个有效的人员-帧对 $(n, t)$,我们将关联的边界框、实例掩码和每关节观测置信度分数分别记为 $\bar{b}_{n,t} \in \mathbb{R}^4$,$\bar{m}_{n,t} \in \{0, 1\}^{H \times W}$,以及 $\bar{J}_{conf_{n,t}} \in [0, 1]^{17}$。
场景与相机重建。我们均匀采样 $T_{key}$ 个关键帧,并应用 $\pi_3$ (Wang et al., 2025c) 来重建相机参数和场景几何。对于每个关键帧 $t$,我们获得相机参数 $\bar{C}_t = \{\bar{K}_t, \bar{R}_t, \bar{t}_t\}$,以及定义在其局部相机坐标系中的像素对齐 3D 点图和相应的置信度图,其中 $\bar{K}_t$ 是相机内参矩阵,$\bar{R}_t \in SO(3)$ 是旋转矩阵,$\bar{t}_t \in \mathbb{R}^3$ 是平移向量。我们从预测的点图中收集有效点以形成每帧场景点云 $\bar{S}^{scn}_t = \{(\bar{s}_{tj}, \bar{c}_{tj})\}_{j=1}^{N^{scn}_t}$,其中 $N^{scn}_t$ 是关键帧 $t$ 中保留的点数,$\bar{s}_{tj} \in \mathbb{R}^3$ 表示第 $j$ 个点的 3D 坐标,$\bar{c}_{tj} \in [0, 1]$ 是其置信度分数。最后,我们使用 GeoCalib (Veicht et al., 2024) 估计重力方向,并将所有相机位姿和点云转换到以第一帧为参考、重力对齐的世界坐标系中。
个体运动重建。对于每个跟踪身份 $n$,我们应用单目运动重建方法 (Wang et al., 2024) 来估计时间一致的 SMPL 参数 $(\bar{\theta}_{n,t}, \bar{\beta}_{n,t}, \bar{\gamma}_{n,t}, \bar{\tau}_{n,t})$。重建的运动被转换到重力对齐的世界坐标系中以初始化 $\bar{Q}_{n,t}$。我们进一步将对应的初始化 SMPL 关节(映射到采用的 17 关键点布局)投影到帧 $t$ 上,以获得 2D 参考关节 $\bar{J}^{2D}_{n,t} \in \mathbb{R}^{17 \times 2}$,用于后续优化。
3.2. 人与场景交互处理
为了减少密集场景点云中的冗余和噪声,我们提取紧凑的地形感知几何,形式为 Scene Interaction Point Cloud (SIPC) 和连续的 Scene Interaction Surface (SIS),它们共同支持 Human-Scene Interaction Proxy (HSIP) 的构建,以耦合场景和人群。
3.2.1. 场景交互几何提取
度量尺度初始化。单目重建存在固有的尺度模糊性。我们通过将重建的人体深度与场景几何对齐来估计全局尺度因子 $\alpha \in \mathbb{R}^+$,使用度量 SMPL 先验。对于每个有效的人员-帧对 $(n, t)$,我们使用沿重力轴最低的体顶点,记为 $\bar{v}^{\downarrow}_{n,t}$,作为地面接触的代理。初始尺度 $\alpha_0$ 计算为人基于深度 $d^{smpl}_{n,t}$ 与场景基于深度 $d^{scnn}_{n,t}$ 之间比值的加权平均:
$$ \alpha_0 = \frac{1}{Z} \sum_{(n,t) \in \Omega} \omega_{n,t} \frac{d^{smpl}_{n,t}}{d^{scnn}_{n,t}}, \quad Z = \sum_{(n,t) \in \Omega} \omega_{n,t}, \quad (2) $$
其中 $\omega_{n,t}$ 为靠近相机的人员分配更高的权重。估计的尺度被应用于初始化度量场景和相机轨迹。
置信度引导的地形采样。在度量尺度初始化之后,我们将来自所有 $T_{key}$ 关键帧的缩放场景点云聚合到统一的重力对齐表示 $S = \{(s_m, c_m)\}_{m=1}^M$ 中。而不是直接在密集且嘈杂的点云上操作,我们引入 Scene Interaction Point Cloud (SIPC) 作为一种紧凑的地形感知抽象,它在抑制冗余的同时保留交互相关的几何。$\bar{S}_t = \{(\bar{s}_{tj}, \bar{c}_{tj})\}_{j=1}^{N^{scn}_t}$。具体而言,我们将水平 $(x, z)$ 平面离散化为单元格大小为 $\ell$ 的规则度量网格。对于由 $u = (u_x, u_z) \in \mathbb{Z}^2$ 索引的每个网格单元,我们收集落入该单元内的场景点:
$$ G_u = \{(s_m, c_m) \in S \mid \lfloor x_m/\ell \rfloor = u_x, \lfloor z_m/\ell \rfloor = u_z \}. \quad (3) $$
我们仅保留每个单元内的高置信度测量值:
$$ G^{conf}_u = \{(s_m, c_m) \in G_u \mid c_m \ge \tau_c\}, \quad (4) $$
其中 $\tau_c$ 表示置信度阈值。对于每个非空的可靠单元,我们选择沿重力轴最低高程的点作为局部地形代表:
$$ s^\star_u = \arg \min_{(s_m, c_m) \in G^{conf}_u} y_m. \quad (5) $$
所得集合 $S^{SIPC} = \{s^\star_u\}$ 构成了 Scene Interaction Point Cloud,它为后续的人-场景交互建模提供了稀疏但结构一致的可导航表面代理。
表面重建。为了实现连续的交互查询,我们从离散的 SIPC 锚点构建 Scene Interaction Surface (SIS)。我们拟合一个参考支撑平面,并在规则水平网格上插值 SIPC 点的重力方向残差。在观察不足的区域,残差场平滑地衰减至零,使重建的表面回退到参考平面,并防止不稳定的外推。我们对所得的高度场进行三角剖分
第 5 页
Crowd4D: 场景感知的单目 4D 人群重建
人类-场景交互代理锚定
令 $l_{vert}(x)$ 表示穿过点 $x$ 的重力对齐垂直线。我们将参考位置定义为根观察射线与穿过探针对应点的重力对齐垂直线之间的交点:
$$ r'_{n,t} = r(\mu | \bar{\tau}_{n,t}) \cap l_{vert}(s'_{n,t}). \quad (11) $$
射线空间序列校正。参考位置 $r'_{n,t}$ 是逐帧独立估计的,可能会表现出时间抖动。因此,我们将其参数化为沿根观察射线的深度 $\mu_{n,t}$,
$$ r'_{n,t} = r(\mu_{n,t} | \bar{\tau}_{n,t}), \quad (12) $$
并应用鲁棒的时间平滑:
$$ \hat{\mu}_{n,t} = F \{ \mu_{n,\tau} \}_{\tau \in T} \quad (13) $$
细化后的参考位置为
$$ r^*_{n,t} = r(\hat{\mu}_{n,t} | \bar{\tau}_{n,t}), \quad (14) $$
这在保持图像空间对齐的同时产生了时间连贯的轨迹。
映射到场景交互曲面 (SIS)。最后,我们将细化后的参考位置通过穿过 $r^*_{n,t}$ 的重力对齐垂直线与场景交互曲面 (SIS) 相交映射到场景中:
$$ s^*_{n,t} = l_{vert}(r^*_{n,t}) \cap S_{SIS}. \quad (15) $$
我们将 $s^*_{n,t}$ 称为人类-场景交互代理 (HSIP)。为了表征其空间范围,我们将 HSIP 支持范围定义为
$$ r^{HSIP}_{n,t} = \max \| s^*_{n,t} – s_{n,t} \|, \| s^*_{n,t} – s'_{n,t} \| \quad . \quad (16) $$
对于开放和中距离场景,我们如上所述从 SIPC 和 SIS 构建人类-场景交互代理 (HSIP)。对于近距离场景,前景身体通常会遮挡局部支撑区域并阻碍可靠的表面构建,我们绕过 SIPC/SIS 并在射线空间中直接估计 HSIP。具体而言,我们使用支撑平面锚点 $a_{n,t}$ 的图像空间投影定义一条锚定射线,从可靠身体关节或人员掩码周围的局部场景深度观测中推断目标水平支撑位置,并将 $s^*_{n,t}$ 确定为锚定射线上水平位置最接近推断支撑位置的点。由于在此设置中不可用基于 SIS 的对应关系,我们将近距离场景的 HSIP 支持范围 $r^{HSIP}_{n,t}$ 设置为固定常数。
图 3. 人类-场景交互代理锚定。
水平面并丢弃具有过长边缘的三角面,以避免无支撑的连接。生成的曲面表示为
$$ S_{SIS} = (V_{SIS}, F_{SIS}), \quad (6) $$
其中 $V_{SIS}$ 和 $F_{SIS}$ 分别表示网格顶点和三角面。SIS 支持后续 HSIP 构建中的重力方向投影和射线-曲面求交。
3.2.2. 人类-场景交互代理锚定
单目重建提供了可靠的图像空间对齐,但留下了深度和支撑关系欠约束的问题。因此,我们构建了一个场景感知的交互代理,通过逐步限制人体根部的允许 3D 位置,同时保持与其原始 2D 投影的一致性,如图 3 所示。
参考位置提取。对于帧 $t$ 中的每个人 $n$,我们使用最低身体顶点 $\bar{v}^{\downarrow}_{n,t}$ 作为重力一致的支撑参考。我们首先通过将初始化的根平移垂直投影到穿过该点的水平平面上来定义平面锚点:
$$ a_{n,t} = (x(\bar{\tau}_{n,t}), y(\bar{v}^{\downarrow}_{n,t}), z(\bar{\tau}_{n,t}))^\top. \quad (7) $$
通过固定偏移 $v$ 向下延伸,可以获得辅助探针锚点:
$$ a'_{n,t} = a_{n,t} – (0, v, 0)^\top. \quad (8) $$
给定相机外参,世界空间点 $x$ 对应的观察射线参数化为
$$ r(\mu | x) = -\bar{R}_t^\top \bar{t}_t + \mu (x + \bar{R}_t^\top \bar{t}_t). \quad (9) $$
将 $a_{n,t}$ 和 $a'_{n,t}$ 的射线与场景交互曲面相交,得到场景对应点
$$ s_{n,t} = r(\mu | a_{n,t}) \cap S_{SIS}, \quad s'_{n,t} = r(\mu | a'_{n,t}) \cap S_{SIS}. \quad (10) $$
3.3. 多阶段优化策略
给定重建的相机轨迹 $\{\bar{C}_t\}$、初始人体运动序列 $\{\bar{Q}_{n,t}\}$、场景交互曲面 (SIS) 以及人类-场景交互代理 (HSIP),我们将人群重建表述为
第 6 页
Crowd4D: 场景感知的单目4D人群重建
| 阶段 | 优化变量 | 能量项 | | :— | :— | :— | | Stage-1 | $\beta, \tau, \gamma, \alpha$ | $E_{proj} + E_{(proj)}^{HSIP} + E_{(xz)}^{HSIP} + E_{(y)}^{HSIP} + E_{\beta} + E_{(t)}^{\tau} + E_{(t)}^{\gamma} + E_{(t)}^{crowd}$ | | Stage-2 | $\beta, \tau, \gamma, z_{\theta}$ | $E_{proj} + E_{(proj)}^{HSIP} + E_{(y)}^{HSIP} + E_{\theta}^{prior} + E_{\beta} + E_{(t)}^{\tau} + E_{(t)}^{\gamma} + E_{(t)}^{\theta} + E_{(t)}^{crowd}$ | | Stage-3 | $\beta, z_{\xi}$ | $E_{proj} + E_{(y)}^{HSIP} + E_{(v)}^{contact} + E_{\xi}^{prior} + E_{\beta} + E_{(t)}^{\tau} + E_{(t)}^{\gamma} + E_{(t)}^{\theta} + E_{connect} + E_{AMC}$ |
表1. 多阶段优化策略概述:各阶段使用的变量和能量项。
在统一的世界坐标系中对人体运动变量 $\{Q_{n,t}\}$ 和残差全局场景尺度 $\alpha$ 进行联合优化问题,并使用三阶段优化策略求解,其中不同子集的变量和能量项被逐步激活以提高稳定性和收敛性(见表1);人群结构相干正则化(CSCR)和基于人类-场景交互代理(HSIP)的人群-场景对齐的能量项分别在第3.5节和第3.4节中介绍,其余项见附录A。
阶段1:HSIP引导的尺度和根节点位置细化。 本阶段显式优化全局场景尺度和根节点位置,利用几何和人群结构先验。残差尺度参数 $\alpha$ 与根节点平移和方向 $(\tau, \gamma)$ 联合优化。基于HSIP的可行区域约束,包括 $E_{(proj)}^{HSIP}$、$E_{(xz)}^{HSIP}$ 和 $E_{(y)}^{HSIP}$,是将人群分布与场景几何对齐并解决全局尺度歧义的主要驱动力。基于HSIP锚点,根节点位置进一步通过人群级结构正则化 $E_{(t)}^{crowd}$ 以及根节点平移和旋转的时间平滑项 $E_{(t)}^{\tau}$ 和 $E_{(t)}^{\gamma}$ 进行细化,从而产生稳定且几何合理的根节点轨迹。
阶段2:像素一致的姿态细化。 在全局尺度和根节点轨迹稳定后,本阶段利用姿态级先验和图像证据细化每帧的关节身体姿态。姿态潜变量 $z_{\theta}$ 在VPoser先验 (Pavlakos et al., 2019) $E_{\theta}^{prior}$ 下进行优化,以确保解剖学上合理的配置。像素级关节一致性通过重投影损失 $E_{proj}$ 强制执行,而时间姿态平滑性通过 $E_{(t)}^{\theta}$ 鼓励,以维持随时间变化的稳定关节运动。
阶段3:群体引导的运动先验细化。 本阶段通过学习到的运动先验 $E_{\xi}^{prior}$ 下优化运动潜变量 $z_{\xi}$,遵循DyCrowd (Wen et al., 2025) 中的运动先验公式。通过接触速度项 $E_{(v)}^{contact}$ 施加接触感知的运动正则化以抑制滑动伪影,并通过段连接损失 $E_{connect}$ 强制执行相邻运动段之间的时间连续性。此外,由 $E_{AMC}$ 编码的群体引导运动一致性在个体间传播可靠的动态信息,提高了拥挤和遮挡场景下的鲁棒性。
3.4. 基于HSIP的人群与场景对齐
为了确保尺度一致且物理上合理的人-场景关系,我们在联合优化过程中显式引入人群-场景交互约束。我们利用第3.2.2节中定义的人类-场景交互代理(HSIP)将人群分布与重建的场景几何对齐。残差全局场景尺度 $\alpha \in \mathbb{R}^+$ 被视为可优化变量,并初始化为1。HSIP点 $s^*_{n,t}$ 及其支持范围 $r^{HSIP}_{n,t}$ 在由 $\alpha_0$ 缩放的规范帧中构建(公式(2)),而 $\alpha$ 进一步优化过程中的进一步细化人群-场景对齐。
通过利用动态缩放的HSIP约束人体根节点平移,我们联合稳定了全局场景尺度,并强制个体在复杂地形上的有效放置。我们将这种一致性分解为水平可行区域对齐、垂直地形适应和投影一致性。此外,一旦全局尺度在优化过程中变得稳定,我们通过将根节点平移设置为沿视线的HSIP对应参考位置来直接更新根节点位置,即 $\tau_{n,t} \leftarrow r^*_{n,t}$。
水平可行区域对齐。 HSIP点 $s^*_{n,t}$ 连同局部支持范围 $r^{HSIP}_{n,t}$ 提供了一个基于场景的代理位置。我们约束水平根节点平移 $(\tau_{n,t})_{xz}$ 保持在以 $\alpha(s^*_{n,t})_{xz}$ 为中心的缩放可行区域内。当人物漂移出该区域时,铰链损失会对偏差进行惩罚:
$$ E_{(xz)}^{HSIP} = \lambda_{xz} \sum_{(n,t) \in \Omega} h \left( (\tau_{n,t})_{xz} – \alpha (s^*_{n,t})_{xz} \right)^2 – \alpha r^{HSIP}_{n,t} \quad (17) $$
垂直地形适应。 HSIP点 $s^*_{n,t}$ 提供了地形高度参考。我们约束人体网格的最低顶点 $v^{\downarrow}_{n,t}$ 以匹配缩放的HSIP高度:
$$ E_{(y)}^{HSIP} = \lambda_{y} \sum_{(n,t) \in \Omega} \left( v^{\downarrow}_{n,t, y} – \alpha s^*_{n,t, y} \right)^2 \quad (18) $$
投影一致性。 为了保持图像空间对齐,我们引入投影一致性约束。有效锚点定义为根节点平移在水平平面上的投影:
$$ a^{proj}_{n,t} = x(\tau_{n,t}), y(v^{\downarrow}_{n,t}), z(\tau_{n,t}) \quad (19) $$
第 7 页
Crowd4D: 场景感知的单目4D人群重建
我们强制其图像投影与探针锚点的投影保持一致:
$$ E^{(proj)}_{HSIP} = \lambda_{proj} \sum_{(n,t) \in \Omega} \| \Pi_t a^{proj}_{n,t} – \Pi_t a'_{n,t} \|^2, \quad (20) $$
其中 $\Pi_t(\cdot)$ 表示在相机参数 $\bar{C}_t$ 下的透视投影。
3.5. 人群结构相干正则化
仅依靠单人时间平滑在密集人群中变得不可靠,因为频繁遮挡和深度模糊问题严重。因此,我们引入了人群结构相干正则化(CSCR),利用基于HSIP的空间先验,对局部人群邻域内的成对相对位移施加软时间一致性约束。
动态交互图。 在每一帧 $t$,我们构建一个有向交互图 $G_t = (V_t, E_t)$,其中节点对应可见个体。邻域关系利用HSIP点 $(s^*_{n,t})_{xz}$(见第3.2.2节)在水平面上确定,边 $(n, m) \in E_t$ 连接空间邻居 $m \in \mathcal{N}^t_n$,并根据空间邻近度赋予交互权重 $w^t_{nm}$。使用时间步长 $\Delta$ 来评估随时间变化的结构一致性。
人群结构相干损失。 令 $u^t_{nm} = \tau^{n,t} – \tau^{m,t}$ 表示相邻个体之间的3D相对位移。人群结构相干能量定义为:
$$ E^{(t)}_{crowd} = \lambda_{crowd} \sum_{t > \Delta} \sum_{(n,m) \in E_t} \tilde{w}^t_{nm} \rho \left( u^t_{nm} – u^{t-\Delta}_{nm} \right)^2 + \lambda_{dir} \rho \left( 1 – \frac{u^t_{nm} \cdot u^{t-\Delta}_{nm}}{\|u^t_{nm}\|_2 \|u^{t-\Delta}_{nm}\|_2 + \epsilon} \right), \quad (21) $$
其中 $\tilde{w}^t_{nm}$ 是有效交互权重,$\rho(\cdot)$ 表示Charbonnier惩罚函数,$\lambda_{dir}$ 平衡方向感知一致性,$\epsilon$ 确保数值稳定性。该损失仅在 $t$ 和 $t-\Delta$ 时刻均被有效跟踪的成对个体上计算。
4. 实验
4.1. 数据集与评估指标
数据集。 我们在 VirtualCrowd (Wen et al., 2025) 上评估 Crowd4D,这是一个具有复杂地形和密集人群(每场景60-200人)的合成基准。由于 Crowd4D 基于优化且无需训练,VirtualCrowd 仅用于定量评估。我们还在真实世界的 PANDA 数据集 (Wanget al., 2020) 上报告了定性结果,该数据集提供吉像素级视频,但无3D姿态标注。
评估指标。 我们使用基于距离的指标评估全局人群一致性,包括 PPDS 及其 Procrustes 对齐变体 (PA-PPDS) (Wen et al., 2023),以及正确序数深度百分比 (PCOD) (Zhen et al., 2020)。对于姿态精度,我们报告 MPJPE 和 PA-MPJPE。为了评估全局坐标系下的姿态序列,我们进一步报告了 WA-MPJPE 和 W-MPJPE,遵循 (Ye et al., 2023) 的方法。运动平滑度通过加速度误差 (ACCEL) 进行测量。
4.2. 实现细节
我们在 PyTorch (Paszke et al., 2019) 中实现了我们的方法,并使用 Adam 优化器优化所有模型。优化过程分三个阶段进行(stage-1, stage-2 和 stage-3),迭代次数分别为 150、150 和 300。三个阶段的设置学习率分别为 0.01、0.01 和 0.02。所有实验均在配备 NVIDIA 4090D GPU 和 128 GB 系统内存的工作站上运行。优化包含100个个体、持续200帧的大规模场景大约需要4小时。将每个阶段的优化预算减少到100次迭代,可以实现小时级的重建,同时在效率和重建质量之间提供实用的权衡。
4.3. 比较
遵循 DyCrowd (Wen et al., 2025) 的做法,我们在 VirtualCrowd 数据集上的两种跟踪设置下,将我们的方法与最先进的人群重建方法进行了比较:统一跟踪检测(Unified Tracking-by-Detection),它使用检测到的轨迹,因此保留了实际的身份关联误差;以及真值对象跟踪(Ground-truth Object Tracking),它使用真值身份关联,以将重建质量与跟踪误差隔离开来(表2)。
对于大规模动态人群重建,DyCrowd 是主要基线,此外还有基于图像的方法 Crowd3D 和 GroupRec。在统一跟踪检测协议下,我们的方法在全局和人群级别指标上始终优于 DyCrowd,PPDS 提高了 5.8,且 PPDS–PA-PPDS 差距更小,这表明全局人群一致性更好。我们还减少了 7.9 mm 的 MPJPE,且无需依赖事后对齐。在真值对象跟踪设置下,我们的方法实现了最佳的全局一致性,PPDS 达到 91.43(比 DyCrowd 高 6.8),MPJPE 减少了 9.5 mm。
我们的方法在遮挡方面表现出比 DyCrowd 更强的鲁棒性,如表3和图4所示,特别是在严重遮挡和深度模糊的情况下。此外,我们的重建结果表现出更连贯且物理上合理的运动,在平坦和非平坦地形设置下的 PANDA 数据集上的结果也显示
第 8 页
Crowd4D: 场景感知的单目 4D 人群重建
方法 PPDS↑ PA-PPDS↑ PCOD↑ MPJPE↓ PA-MPJPE↓ WA-MPJPE↓ W-MPJPE↓ ACCEL↓
统一检测跟踪
Crowd3D (Wen 等, 2023) CVPR’23 82.61 87.98 91.11 122.99 73.70 – – – GroupRec (Huang 等, 2023) ICCV’23 74.25 75.04 86.22 89.04 58.98 82.20 94.34 165.50 DyCrowd (Wen 等, 2025) TPAMI’25 83.21 89.10 92.20 69.74 48.57 68.99 83.39 15.72 本文方法 89.04 89.46 92.92 61.83 45.32 65.77 74.15 16.10
真实物体跟踪 SLAHMR-Large⋆(Ye 等, 2023) CVPR’23 84.41 87.95 90.34 106.35 69.41 90.10 108.40 12.25 DyCrowd (Wen 等, 2025) TPAMI’25 84.66 91.23 95.38 68.81 45.34 65.91 80.34 15.53 本文方法 91.43 92.38 95.57 59.35 44.36 63.98 73.32 12.93 表 2. VirtualCrowd 数据集上的定量比较。其中“-”表示结果不可用,“*”表示针对大场景视频修改的方法。最佳和次佳结果分别以粗体和下划线突出显示。
输入
6 7 1 3 7 1 3 6 2 2 2DyCrowd 1 3 5 4 2 4 4 3 4
7 6 1 7 3 6本文方法 2 1 5 2 2 1 3 3 4 4 2 4 3 4 严重遮挡和深度模糊 平坦和非平坦地形
图 4. 本文方法与 DyCrowd 在 VirtualCrowd 和 PANDA 数据集上的定性比较。相同的索引表示同一个体。高亮区域展示了在平坦和非平坦地形以及严重遮挡和深度模糊情况下的结果。
方法 MPJPE↓ PA-MPJPE↓ 场景一致性 ❌ 射线 投影 DyCrowd (Wen 等, 2025) 66.09 56.21 本文方法 64.19 54.81 VideoMimic 表 3. VirtualCrowd 数据集上遮挡实例的定量比较。 场景一致性 ✅ 射线 投影
方法 PPDS↑ PA-PPDS↑ PCOD↑ MPJPE↓ ACCEL↓ 本文方法
VideoMimic 80.03 80.09 91.34 62.49 23.80 本文方法 91.43 92.38 96.57 59.35 12.93 图 5. 本文方法与小型场景方法 表 4. 在真实物体跟踪协议下与小型场景方法 VideoMimic (Allshire 等, 2025) 在 VirtualCrowd 数据集上的侧视视角定性比较。 VideoMimic (Allshire 等, 2025) 的定量比较。 表 4. 如图 5 所示,这导致了累积的深度 漂移和不合理的人群配置。 更合理地与场景几何对齐。
我们进一步将小型场景方法 VideoMimic (All- 4.4. 消融实验 shire 等, 2025) 适配到大规模场景中,使用相同的重 多阶段优化策略消融在 VirtualCrowd 的所有测试视频上进行评估。对于其余的消融实验,我们使用来自场景 1 的两个具有不同视角(一个较高和一个较低视角)的视频以促进受控分析。 建相机、场景几何和评估协议,正如本文方法一样。由于它主要依赖于人与场景之间的迭代深度对齐,VideoMimic 缺乏在大规模上维持全局一致人群布局的约束,导致其 PPDS 显著降低至 80.03,而本文方法达到了 91.43。
多阶段优化策略。如表 5 所示,
8
第 9 页
Crowd4D: 场景感知的单目 4D 人群重建
| 阶段 | PPDS↑ | PA-PPDS↑ | PCOD↑ | MPJPE↓ | ACCEL↓ | | :— | :— | :— | :— | :— | :— | | Stage-1 | 仅 | | | | | | Stage-1 | + | Stage-2 | 88.76 | 89.19 | 92.67 | 76.23 | 34.85 | | Stage-1 + Stage-2 + Stage-3 | | | 88.88 | 89.34 | 92.89 | 67.28 | 62.92 | | | | | 89.04 | 89.46 | 92.92 | 61.83 | 16.10 |
表 5. 多阶段优化策略的消融研究。
| 方法 | PPDS↑ | PA-PPDS↑ | PCOD↑ | MPJPE↓ | ACCEL↓ | | :— | :— | :— | :— | :— | :— | | w/o joint processing | 67.92 | 68.40 | 77.38 | 154.08 | 41.04 | | w/ joint distance | 79.26 | 79.22 | 89.50 | 62.89 | 25.58 | | w/ direct projection anchor | 84.81 | 87.95 | 92.22 | 65.73 | 24.80 | | Ours (w/ HSIP Alignment) | 90.71 | 91.22 | 93.57 | 61.76 | 16.66 |
表 6. 人景联合处理策略的消融研究。
| 方法 | PPDS↑ | PA-PPDS↑ | PCOD↑ | MPJPE↓ | ACCEL↓ | | :— | :— | :— | :— | :— | :— | | w/o E(t)crowd | 90.57 | 91.04 | 93.44 | 66.24 | 16.79 | | Ours | 90.71 | 91.22 | 93.57 | 61.76 | 16.66 |
表 7. 人群结构相干正则化的消融研究。
在多样化的大规模场景中实现连贯的重建。然而,Crowd4D 仍然是一个离线优化框架,具有不可忽视的计算成本,其性能依赖于单目场景重建、人体初始化和跟踪的质量,特别是在严重遮挡的情况下。此外,真实世界大规模人群数据集中缺乏姿态级 3D 标注,限制了真实场景中的定量评估。未来的工作将研究更高效的前馈近似方法和基于伪标签的学习。
我们的分阶段优化稳步提升了性能。Stage-1 提供了具有高全局一致性(PPDS/PCOD = 88.76/92.67)但相对较大姿态误差(MPJPE = 76.23)的强初始化。Stage-2 主要关注姿态细化,将 MPJPE 降低至 67.28,同时保持全局指标几乎不变(PPDS/PCOD = 88.88/92.89)。最后,Stage-3 进一步细化整个序列,提高了姿态精度和运动平滑度(MPJPE = 61.83, ACCEL = 16.10)。
人景联合处理。表 6 比较了将人体与重建场景几何耦合的不同策略。移除联合处理会导致严重的尺度漂移和不一致的人群布局。联合距离约束部分减少了漂移,但对噪声场景点仍然敏感。基于投影的锚点(Crowd3D (Wen et al., 2023))改善了大场景中的全局指标,但缺乏时间稳定的代理,使其在低视角下容易放大 3D 误差。相比之下,我们基于 HSIP 的人群-场景对齐(第 3.4 节)实现了最佳的全局一致性(PPDS, PCOD)和运动平滑度(ACCEL)。
人群结构相干正则化。我们对提出的 HSIP 诱导的局部邻域内成对相对位移的时间一致性约束项 $E(t)_{crowd}$ 进行了消融。如表 7 所示,移除 $E(t)_{crowd}$ 会轻微降低全局人群一致性(PPDS, PA-PPDS, PCOD),但导致姿态精度明显下降,MPJPE 从 61.76 增加到 66.24。这表明 CSCR 在稳定局部人群结构随时间的变化方面起着重要作用,特别是在遮挡情况下,并有助于产生时间上更连贯且物理上更合理的运动。
5. 结论
我们提出了 Crowd4D,用于在大型复杂地形场景中进行场景一致的单目 4D 人群重建。通过联合优化人群运动和残差全局场景尺度,并引入基于 SIPC 和 SIS 构建的 HSIP 以实现场景感知和时间稳定的人群-场景锚定,以及用于邻域级时间相干性的 CSCR,Crowd4D 生成了全局一致且时间连贯的重建结果。
致谢
本研究部分得到了国家重点研发计划(2023YFC3082100)和天津市杰出青年科学基金(No.22JCJQJC00040)的支持。
影响声明
本文介绍了旨在推进机器学习领域的工作。从积极的一面来看,所提出的研究可用于城市设计和管理、公共安全、智能交通、人群模拟等。与许多其他涉及从视觉数据进行人体重建的工作一样,这项工作也可能引发对隐私的担忧。我们的方法不重建面部细节,而面部细节通常对个人识别至关重要。该技术的使用应符合当地法规/法律,包括摄像头放置和透明沟通。
参考文献
Allshire, A., Choi, H., Zhang, J., McAllister, D., Zhang, A., Kim, C. M., Darrell, T., Abbeel, P., Malik, J., and Kanazawa, A. Visual imitation enables contextual humanoid control. *arXiv preprint arXiv:2505.03729*, 2025.
Baradel*, F., Armando, M., Galaaoui, S., Br´egier, R., Weinzaepfel, P., Rogez, G., and Lucas*, T. Multi-HMR: Multi-person whole-body human mesh recovery in a single shot. In *Proc. European Conference on Computer Vision*, 2024.
Chen, Y., Chen, X., Xue, Y., Chen, A., Xiu, Y., and Gerard P.-M. Human3R: Everyone everywhere all at once. *arXiv preprint arXiv:2510.06219*, 2025.
Dai, Y., Wang, Z., Lin, X., Wen, C., Xu, L., Shen, S., Ma,
9
第 10 页
Crowd4D: 场景感知的单目 4D 人群重建
Y., 和 Wang, C. HiSC4D: 使用可穿戴 IMU 和 LiDAR 在大尺度空间中进行以人为中心的交互和 4D 场景捕获。IEEE 模式分析与机器智能汇刊, 46(12):11236–11253, 2024. doi: 10.1109/TPAMI.2024.3457229.
Ge, Z., Liu, S., Wang, F., Li, Z., 和 Sun, J. YOLOX: 超越 YOLO 系列于 2021 年。arXiv 预印本 arXiv:2107.08430, 2021.
Goel, S., Pavlakos, G., Rajasegaran, J., Kanazawa, A., 和 Malik, J. Humans in 4D: 使用 Transformer 重建和跟踪人类。在 IEEE 国际计算机视觉会议论文集 (Proc. IEEE International Conference on Computer Vision) 中, pp. 14783–14794, 2023.
Huang, B., Ju, J., Li, Z., 和 Wang, Y. 使用超图关系推理重建人群组。在 IEEE 国际计算机视觉会议论文集 (Proc. IEEE International Conference on Computer Vision) 中, pp. 14873–14883, 2023.
Huang, J., Wen, H., Zhou, T., Lin, H., Lai, Y.-K., 和 Li, K. RCR: 从单张大场景图像中以直立空间进行鲁棒的人群重建。arXiv 预印本 arXiv:2411.06232, 2024.
Liu, Z., Lin, J., Wu, W., 和 Zhou, B. 野外 4D 人景重建的联合优化。arXiv 预印本 arXiv:2501.02158, 2025.
Stanojevi´c, V. 和 Todorovi´c, B. BoostTrack++: 利用轨迹片段信息在多目标跟踪中检测更多对象。arXiv 预印本 arXiv:2408.13003, 2024.
Sun, Q., Wang, Y., Zeng, A., Yin, W., Wei, C., Wang, W., Mei, H., Leung, C.-S., Liu, Z., Yang, L., 等人. AiOS: 单阶段全能的表达性人体姿态和形状估计。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中, pp. 1834–1843, 2024.
Sun, Y., Bao, Q., Liu, W., Fu, Y., Michael J., B., 和 Mei, T. 单目、单阶段、多人的 3D 人体回归。在 ICCV, 2021.
Veicht, A., Sarlin, P.-E., Lindenberger, P., 和 Pollefeys, M. GeoCalib: 基于几何优化的单目相机标定。在 IEEE 欧洲计算机视觉会议论文集 (Proc. European Conference on Computer Vision) 中, 2024.
Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., 和 Novotny, D. VGGT: 视觉几何接地 Transformer。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中, 2025a.
Wang, X., Zhang, X., Zhu, Y., Guo, Y., Yuan, X., Xiang, L., Wang, Z., Ding, G., Brady, D., Dai, Q., 等人. PANDA: 十亿像素级以人为中心的视频数据集。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. IEEE Conference on Computer Vision and Pattern Recognition) 中, pp. 3268–3278, 2020.
Loper, M., Mahmood, N., Romero, J., Pons-Moll, G., 和 Black, M. J. SMPL: 蒙皮多人体线性模型。ACM 图形学汇刊 (Proc. SIGGRAPH Asia), 34(6): 248:1–248:16, 2015 年 10 月.
Wang, Y., Wang, Z., Liu, L., 和 Daniilidis, K. TRAM: 从野外视频中获取 3D 人体的全局轨迹和运动。在 IEEE 欧洲计算机视觉会议 (European Conference on Computer Vision) 中, pp. 467–487. Springer, 2024.
M¨uller, L., Choi, H., Zhang, A., Yi, B., Malik, J., 和 Kanazawa, A. 重建人、地点和时代。arXiv:2412.17806, 2024.
Wang, Y., Sun, Y., Patel, P., Daniilidis, K., Black, M. J., 和 Kocabas, M. PromptHMR: 可提示的人体网格恢复。在计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference) 中, pp. 1148–1159, 2025b.
Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., 等人. PyTorch: 一种命令式风格的高性能深度学习库。神经信息处理系统进展 (Proc. Adv. Neural Inform. Process. Syst.), 32, 2019.
Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., 和 He, T. π3: 置换等变视觉几何学习。arXiv 预印本 arXiv:2507.13347, 2025c.
Patel, P. 和 Black, M. J. CameraHMR: 将人与透视对齐。在 2025 国际 3D 视觉会议 (2025 International Conference on 3D Vision (3DV)) 中, pp. 1562–1571. IEEE, 2025.
Pavlakos, G., Choutas, V., Ghorbani, N., Bolkart, T., Osman, A. A., Tzionas, D., 和 Black, M. J. Expressive body capture: 从单张图像中获取 3D 手、脸和身体。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. IEEE Conference on Computer Vision and Pattern Recognition) 中, pp. 10975–10985, 2019.
Wen, H., Huang, J., Cui, H., Lin, H., Lai, Y.-K., Fang, L., 和 Li, K. Crowd3D: 从单张图像中向数百人重建迈进。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. IEEE Conference on Computer Vision and Pattern Recognition) 中, pp. 8937–8946, 2023.
Ravi, N., Gabeur, V., Hu, Y.-T., Hu, R., Ryali, C., Ma, T., Khedr, H., R¨adle, R., Rolland, C., Gustafson, L., 等人. SAM 2: 在图像和视频中立即分割任何事物。在国际学习表征会议 (International Conference on Learning Representations) 中, 卷 2025, pp. 28085–28128, 2025.
Wen, H., Kang, H., Ma, J., Huang, J., Yang, Y., Lin, H., Lai, Y.-K., 和 Li, K. DyCrowd: 面向大场景视频动态人群重建。IEEE 模式分析与机器智能汇刊 (IEEE Transactions on Pattern Analysis and Machine Intelligence), 2025.
10
第 11 页
Crowd4D:场景感知的单目 4D 人群重建
Yan, M., Wang, X., Dai, Y., Shen, S., Wen, C., Xu, L., Ma, Y., and Wang, C. CIMI4D:一个人-场景交互下的大型多模态攀岩运动数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,第 12977–12988 页, 2023 年 6 月。
Yang, Z., Zeng, A., Yuan, C., and Li, Y. 通过两阶段蒸馏实现有效的全身姿态估计。在 IEEE 国际计算机视觉会议论文集,第 4210–4220 页,2023 年。
Ye, V., Pavlakos, G., Malik, J., and Kanazawa, A. 从野外视频中解耦人和相机的运动。在 IEEE 计算机视觉与模式识别会议论文集,第 21222–21232 页,2023 年。
Zhao, Y., Wang, T. Y., Raj, B., Xu, M., Yang, J., and Huang, C.-H. P. 从视频中进行协同的全局空间相机和人体重建。2024 年 6 月。
Zhen, J., Fang, Q., Sun, J., Liu, W., Jiang, W., Bao, H., and Zhou, X. SMAP:单次多人的绝对 3D 姿态估计。在欧洲计算机视觉会议论文集,第 550–566 页。Springer,2020 年。
11
第 12 页
Crowd4D:场景感知的单目4D人群重建
A. 所有能量函数。
本附录总结了第3节所述三阶段优化策略中使用的能量项。每个能量项与其权重的对应关系已在正文中提供(表1)。请注意,基于HSIP的人群-场景对齐能量 $E_{\text{HSIP}}^{(xz)}$、$E_{\text{HSIP}}^{(y)}$ 和 $E_{\text{HSIP}}^{(\text{proj})}$ 已在正文(第3.4节)中介绍,而CSCR项 $E_{\text{crowd}}^{(t)}$ 定义在第3.5节;因此,此处不再重复。
观测一致性约束。为了使重建的运动与视觉观测对齐,我们采用尺度归一化的2D重投影损失。利用相机参数 $\bar{C}_t$,我们通过投影算子 $\pi(\cdot)$ 将世界空间关节 $J_{n,t,j}$ 投影到图像平面上。为了平衡不同深度个体的梯度,我们通过来自边界框的尺度因子 $\bar{A}_{n,t} = \sqrt{w_{n,t}h_{n,t}}$ 对残差进行归一化。该能量在有效关键点集合 $\Omega_{\text{reproj}}$ 上计算:
$$ E_{\text{proj}} = \lambda_{J^{2D}} \sum_{(n,t,j) \in \Omega_{\text{reproj}}} \frac{\| \pi(J_{n,t,j}; \bar{C}_t) – \bar{J}_{n,t,j}^{2D} \|_2^2}{\bar{A}_{n,t}^2}. \quad (22) $$
个体时间平滑性。为了减少时间抖动并提高运动稳定性,我们对全局平移、根方向(root orientation)和关节身体姿态施加个体时间平滑约束。具体而言,我们惩罚帧间平移速度($E_{\tau}^{(t)}$)以及根方向和关节旋转在李代数中的相对角速度($E_{\gamma}^{(t)}$ 和 $E_{\theta}^{(t)}$)。
对于全局平移 $\tau_{n,t}$,我们惩罚帧间速度:
$$ E_{\tau}^{(t)} = \lambda_{\tau} \sum_{(n,t) \in \Omega_{\text{adj}}} \| \tau_{n,t+1} – \tau_{n,t} \|_2^2. \quad (23) $$
我们对根方向 $\gamma$ 和身体姿态 $\theta$ 应用统一的正则化策略。对于身体姿态,我们对 $J$ 个关节平均损失,以保持关节间梯度的平衡。令 $R(\mathbf{v})$ 表示对应于轴角向量 $\mathbf{v}$ 的旋转矩阵。损失公式如下:
$$ E_{\gamma}^{(t)} = \lambda_{\gamma} \sum_{(n,t) \in \Omega_{\text{adj}}} \left\| \log \left( R(\gamma_{n,t})^\top R(\gamma_{n,t+1}) \right) \right\|_2^2 \quad (24) $$
$$ E_{\theta}^{(t)} = \frac{\lambda_{\theta}}{J} \sum_{(n,t) \in \Omega_{\text{adj}}} \sum_{j=1}^{J} \left\| \log \left( R(\theta_{n,t}^{(j)})^\top R(\theta_{n,t+1}^{(j)}) \right) \right\|_2^2, $$
形状先验。为了防止不自然的身体形状,我们对SMPL形状参数施加各向同性高斯先验:
$$ E_{\beta} = \lambda_{\beta} \sum_{(n,t) \in \Omega} \| \beta_{n,t} \|_2^2. \quad (25) $$
姿态先验。我们在VPoser潜在空间中用高斯先验对关节姿态进行正则化。令 $\tilde{z}_{\theta_{n,t}} \in \mathbb{R}^{32}$ 表示对应于第 $t$ 帧SMPL姿态的可优化VPoser (Pavlakos et al., 2019) 潜在代码。我们定义
$$ E_{\theta_{\text{prior}}} = \lambda_{\theta_{\text{prior}}} \sum_{(n,t) \in \Omega} \| \tilde{z}_{\theta_{n,t}} \|_2^2, \quad (26) $$
其中等价性在相差一个加法常数的意义下成立。
运动先验。我们遵循DyCrowd (Wen et al., 2025),引入运动级先验和组级一致性,以在遮挡下稳定长序列。对于每个人 $n$,我们将运动划分为 $S_n$ 个重叠的时间段,并为每个时间段优化运动潜在代码 $z_{\xi_{n,s}}$。假设标准正态先验,我们惩罚潜在空间中的偏差:
$$ E_{\xi_{\text{prior}}} = \lambda_{\text{mp}} \sum_{n} \sum_{s=1}^{S_n} \| z_{\xi_{n,s}} \|_2^2. \quad (27) $$
第 13 页
Crowd4D: 场景感知的单目 4D 人群重建
接触静止性。令 $c_{n,t,j} \in [0, 1]$ 表示在时间 $t$ 时,第 $n$ 个人的关节 $j$ 的预测接触置信度,并令 $\Delta^t J_{n,t,j} = J_{n,t+1,j} – J_{n,t,j}$ 表示世界空间中的帧间关节位移。我们鼓励接触关节保持静止: $$ \mathcal{E}_{\text{contact}} = \lambda_{\text{contact}} \sum_{n} \sum_{t} \sum_{j} c_{n,t,j} \| \Delta^t J_{n,t,j} \|_2^2. \quad (28) $$
片段连接。为了确保相邻片段之间的连续性,我们对一个片段的最后一帧 $s_l$ 与其后续片段的第一帧 $s+1$ 之间的关节差异进行惩罚:
$$ \mathcal{E}_{\text{connect}} = \lambda_{\text{con}} \sum_{n,s} \| J_{n,s+1} – J_{n,s_l} \|_2^2. \quad (29) $$
群体引导的异步运动一致性(AMC)。为了恢复视频序列中被遮挡或不可靠的运动,我们采用了 DyCrowd (Wen et al., 2025) 中的异步运动一致性(Asynchronous Motion Consistency, AMC)损失。在每个片段内,不可靠的个体通过软动态时间规整(Soft-DTW)与可信的群体参考进行对齐:
$$ \mathcal{E}_{\text{AMC}} = \lambda_{\text{amc}} \sum_{s} \sum_{n \in U_s} w_{n,s} \, \text{sDTW}(P_{n,s}, P_{\text{ref},s}). \quad (30) $$
这里,$P_{n,s}$ 表示第 $n$ 个人在片段 $s$ 中的姿态序列,当不可用时,$P_{\text{ref},s}$ 从最可信的群体成员或规范模板中选择。