ROAD:不堆数据不堆算力,靠对齐3D基础模型先验实现高保真生成

论文代表图:figure-02-p003-01

高保真3D生成通常依赖大规模模型与海量数据,计算成本极高。ROAD框架另辟蹊径:它冻结一个现成的3D基础模型,通过互惠目标对齐策略将其判别语义先验注入扩散Transformer,在仅用3万训练资产、8块A100训练3.5天的条件下,生成质量超越TRELLIS等更大规模模型,逼近商业模型Step1X-3D。核心创新在于识别并解决了生成模型与判别模型之间的语义-结构异构性问题——全局语义凝聚(HSC)和结构最优对齐(SOA)两个组件协同工作,让生成器真正“理解”3D形状的语义结构。该方法可迁移至CraftsMan和TRELLIS等不同框架,但生成质量受限于所选基础模型的语义能力。

3D风格化新突破:DreamStyle3D如何用10秒生成高保真资产?

论文代表图:figure-10-p013-01

现有3D风格化方法常面临风格与几何纠缠导致的伪影,或依赖缓慢的2D-to-3D流程。DreamStyle3D通过Decoupled Dual Cross-Attention (DDCA)将几何与风格特征解耦,并结合Style Disentanglement Augmentation训练策略,在保持结构一致性的同时实现高效风格迁移。实验显示其在CLIP和DINO指标上优于StyleTex等基线,且推理时间仅需约10秒。需注意其依赖预训练编码器的潜在偏差。

Axolotl3D:统一框架实现遮挡感知与多模态3D形状补全

背景与动机

Axolotl3D提出了一种多模态、遮挡感知的3D生成框架,通过联合条件输入图像、可见性掩码、相机参数和部分点云,实现了单视图生成、稀疏多视图重建、遮挡补全及几何感知编辑的统一处理。在Toys4K和OmniObject3D数据集上,该方法在单视图无遮挡、多视图无遮挡、单视图有遮挡及多视图有遮挡场景下均取得最优F-score,显著优于ShapeR和Hunyuan3D-Omni。模型通过掩码偏置交叉注意力机制和合成数据增强策略,增强了对部分和异构观测的鲁棒性。但需注意,模型对相机视角变化鲁棒性有限,极度细薄结构可能无法完全连接,且仅生成形状不预测纹理。

Hallo4D:基于多模态大模型共识的3D/4D生成时空一致性优化

背景:SDS方法的局限与4D挑战

本文介绍Hallo4D框架,旨在解决3D/4D生成中的Janus问题和时间抖动。通过引入LMMs进行幻觉检测与校正,结合共识驱动的重一致性优化和运动显著性采样,显著提升一致性。实验显示CLIP Score提升,但需注意LMM推理开销及单前景假设。

EmbodiedGen V2:具身智能仿真环境自动化生成与Sim-to-Real验证

核心方法概述

本文介绍EmbodiedGen V2,一个面向具身智能的仿真就绪3D世界引擎。针对现有3D生成模型缺乏物理属性和交互语义的问题,该系统通过代理式生成、Affordance自动标注和Vibe Coding编辑,实现从自然语言到可执行物理环境的自动化构建。实验显示,在生成环境中进行在线RL训练,仿真成功率从9.7%提升至79.8%,Sim-to-Real任务成功率从21.7%提升至75.0%。需注意,完全在线生成耗时较长,且部分资产需手动调整。

绕过VAE,在像素空间统一3D生成与重建:PixWorld

核心方法架构

PixWorld直接在像素空间优化多视图渲染,把3D场景重建和生成放入统一DiT框架。本期解释Pixel-space Flow Matching与Geometry Perception Loss,核对重建、生成和WorldScore结果,并讨论NFE、分辨率和户外泛化限制。