快速导读:TGRHuman通过解耦几何与纹理生成,利用显式多视角2D观测生成与优化,实现高效、高质量、视角一致的文本驱动3D人体生成。
TGRHuman解决的核心问题是:文本到3D人体生成能否在不依赖SDS优化的情况下,同时兼顾多样性、高质量、3D一致性、推理效率以及对宽松衣物的支持。论文给出的答案是肯定的——通过将几何与纹理生成解耦,并引入显式多视角2D观测生成与维度提升机制,TGRHuman在约5分钟内即可从文本描述生成具有高质量几何与纹理的3D人体。
该方法的独特之处在于它绕开了SDS这一隐式监督路径。SDS虽然通用,但容易导致纹理过度平滑、多面伪影(Janus问题)以及数小时的优化耗时。TGRHuman转而先显式生成多视角法线图和RGB观测,再通过几何雕刻与可微光栅化将2D观测提升为3D表示,从而让优化过程具备明确的3D结构感知。
英文题目:TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer
论文出处:arXiv 每日论文精选 · arXiv:2608.12175
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有文本到3D人体方法大致分为两类:原生3D生成模型和两阶段生成方法。原生3D模型如En3D基于tri-plane生成器与DMTet,训练成本高且泛化能力受限;两阶段方法如HumanNorm、TADA依赖SDS优化DMTet或SMPL-X,推理耗时从30分钟到数小时不等,且纹理容易过度平滑。
多视角扩散方法如MVDream虽然通过跨视角交互实现了全局感知的多视角生成,但受限于视角数量和分辨率,难以直接支撑高保真3D重建。MagicMan等3D感知扩散模型输出24张512分辨率多视角图像,仍不足以覆盖360度密集视角需求。
Chupa基于双法线图生成模型和几何优化实现了3D人体生成,但不支持纹理生成;SCULPT基于StyleGAN在SMPL上学习位移图,受限于固定拓扑,难以处理宽松衣物。TEXTure基于2D扩散模型逐视角迭代绘制网格纹理,缺乏全局一致性。
这些方法的共同困境在于:要么牺牲质量换效率,要么牺牲效率换质量,且对宽松衣物的支持普遍不足。TGRHuman的出发点正是打破这一权衡。
核心创新
- 解耦几何与纹理生成,通过显式2D观测生成与维度提升替代隐式SDS优化,显著提升效率
- 高分辨率多视角法线图生成模块(1024、四视角)与几何雕刻策略,支持宽松衣物且无需后处理
- 基于SMPL UV空间的纹理先验获取策略(形状引导扩散+UV修复),解决自遮挡区域纹理问题
- 扩散渲染器(RenderNet+ReferenceNet)实现360度高分辨率一致自由视角渲染,用于纹理提取
方法概览
TGRHuman解耦几何与纹理生成。几何阶段:高分辨率多视角法线图生成模块(1024分辨率、四视角)结合几何雕刻策略重建人体网格。纹理阶段:先通过形状引导扩散模型生成正面外观,经SMPL UV展开与UV修复构建纹理先验;再基于该先验训练扩散渲染器(RenderNet+ReferenceNet),从32个环绕视角生成一致RGB观测,最后通过可微光栅化优化提取完整纹理图。
- 几何阶段:TGRHuman使用高分辨率多视角法线图生成模块,在1024分辨率下生成四个视角的法线图。这些法线图作为显式2D观测,通过Geometry Carving策略优化变形SMPL网格,逐步雕刻出符合文本描述的人体形状。
- Geometry Carving的核心思想是将多视角法线图视为几何约束,通过可微渲染将网格法线与生成法线对齐,从而在优化过程中保持3D一致性。该策略支持宽松衣物,因为法线图可以表达任意表面朝向,不受SMPL固定拓扑限制。
- 纹理先验获取阶段:TGRHuman先通过形状引导扩散模型生成正面外观图像,再将其展开到SMPL UV空间,通过UV Inpainting补全不可见区域,构建全局Texture Prior。这一先验解决了自遮挡区域(如腋下、背部)的纹理缺失问题。
- 扩散渲染器阶段:基于Texture Prior,TGRHuman训练Diffusion Renderer,由RenderNet和ReferenceNet组成。RenderNet负责从32个环绕视角生成一致RGB观测,ReferenceNet注入正面外观特征以保持身份一致性。
- 纹理提取阶段:32个视角的RGB观测通过可微光栅化优化,提取完整纹理图。图3展示了不同视角数量对纹理优化结果的影响,验证了密集视角观测的必要性。
- 整个流水线使用v-prediction作为扩散模型训练目标,在THuman2.1、2K2K、Human4DiT数据集上训练。
逐图理解论文
SDS的困境

图5是几何定性对比,法线图从生成的3D人体网格渲染而来。观察TGRHuman在宽松衣物、身体轮廓和表面细节上的几何精度,特别是与SDS方法相比的锐利度。
研究缺口

图2是整体架构图,分为几何阶段、纹理先验获取阶段和纹理阶段三部分。重点观察多视角法线图生成、Geometry Carving、UV Inpainting和Diffusion Renderer之间的数据流向,理解显式2D观测如何逐步提升为3D表示。
验证与结论

这套显式流水线是否真的有效?消融实验给出了最直接的证据:移除ReferenceNet后,新视角合成的PSNR从28.3掉到24.6;移除Texture Prior后更是跌到19.3。这说明扩散渲染器的两个核心组件缺一不可。定性对比也显示,TGRHuman生成的纹理更真实、几何更锐利,而且推理时间从小时级压缩到了分钟级。
意义与局限

图10展示了手指相关的失败案例。注意观察融合手指和模糊指节的伪影,理解高频细节退化在极端小区域的表现。
实验如何设计?
- 3D人体生成对比:与HumanNorm、En3D、TADA、Joint2Human、Chupa、SCULPT、TEXTure七种方法对比,使用FID、CLIP score评估生成质量。
- 新视角合成对比:与Wonder3D、SV3D、Stable Zero123、MagicMan、TRELLIS.2、LHM六种方法对比,使用PSNR、SSIM、LPIPS评估视角一致性。
- 消融实验:验证ReferenceNet和Texture Prior在扩散渲染器中的作用,分别移除这两个模块进行对比。
- 复杂姿态评估:在复杂姿态条件下对比Chupa和Joint2Human,验证方法在分布外姿态下的鲁棒性。
- 推理时间对比:在单张A800 GPU上测试,仅对比能同时生成几何和纹理的方法。
关键结果与论文证据
- 3D人体生成质量:TGRHuman在FIDnormal上达到29.48,FIDrgb达到25.36,CLIPrgb达到0.2552,CLIPnormal达到0.2171,均优于所有对比方法(Table 2,第8页)。
- 新视角合成质量:TGRHuman在PSNR上达到28.3,SSIM达到0.951,LPIPS达到0.043,优于LHM的26.5/0.947/0.047(Table 4,第8页)。
- 推理效率:TGRHuman推理时间约5分钟,而HumanNorm超过2小时,TADA超过1小时,En3D超过30分钟(Table 5,第8页)。
- 复杂姿态鲁棒性:在复杂姿态下,TGRHuman的FIDnormal为28.91,CLIPnormal为0.2059,优于Chupa和Joint2Human(Table 3,第8页)。
- 消融实验:移除ReferenceNet后PSNR降至24.6,移除Texture Prior后PSNR降至19.3,移除整个纹理阶段后PSNR降至22.7,完整模型为28.3(Table 6,第9页)。
- 定性结果:图4和图5展示了纹理和几何的定性对比,TGRHuman生成的纹理更真实,几何更精细,且未进行推理后处理(如SMPL手部替换),保证了公平性。
- 宽松衣物支持:图13展示了宽松衣物的生成结果,验证了几何雕刻策略对非紧身衣物的支持能力。
阅读时需要注意
- 手指和头发等小区域高频细节退化,可能产生融合手指或模糊发丝(图10、图11,第12页)。
- 分布外姿态(严重遮挡、异常姿态)下可能产生局部解剖伪影(图12,第12页)。
- 多阶段流水线非端到端,相比单次前馈方法推理时间更长。
- UV Inpainting在次优条件下可能产生纹理伪影(图14,第12页)。
关联工作
- Chupa:基于双法线图生成模型和几何优化的3D人体生成,但不支持纹理生成,TGRHuman在其几何思路基础上扩展了完整的纹理生成能力。
- HumanNorm:基于SDS优化DMTet的文本到3D人体生成,纹理易过度平滑,TGRHuman通过显式观测生成避免了这一问题。
- MVDream:多视角扩散模型,通过跨视角交互实现全局感知的多视角生成,TGRHuman的扩散渲染器借鉴了这一思想但扩展到32个密集视角。
- LHM:单图可动画化人体重建模型,作为新视角合成对比基线,TGRHuman在PSNR、SSIM、LPIPS上均优于LHM。