深度解析腾讯混元 3D (Hunyuan3D):大规模扩散模型的 3D 资产生成

3553 字
18 分钟
深度解析腾讯混元 3D (Hunyuan3D):大规模扩散模型的 3D 资产生成

1. 引言:腾讯的 3D 生成版图#

1.1 Hunyuan3D 系列概览#

Hunyuan3D(混元 3D)是腾讯 AI Lab 推出的开源 3D 资产生成系统,从 2024 年底的 1.0 版本到 2025 年的 2.5 版本,持续引领着开源 3D 生成的发展。

“Living out everyone’s imagination on creating and manipulating 3D assets.” —— Hunyuan3D 官方愿景

核心定位:腾讯混元 3D 是目前开源社区中规模最大、功能最全面的 3D 生成系统,包含形状生成、纹理合成、PBR 材质、局部编辑等完整能力。

1.2 版本演进时间线#

版本时间核心创新参数量
Hunyuan3D 1.02024.11统一文本/图像到 3D 框架~1B
Hunyuan3D 2.02025.01大规模 DiT 形状生成 + Paint 纹理合成1.1B + 1.3B
Hunyuan3D 2mini2025.030.6B 轻量模型 + Step/Guidance 蒸馏0.6B
Hunyuan3D 2mv2025.03多视角图像到形状模型1.1B
Hunyuan3D 2.12025.06PBR 材质 + 全量开源(权重 + 训练代码)3.3B + 2B
Hunyuan3D 2.52025.06极致细节 + 生产级质量更大规模

1.3 核心亮点一览#

特性详情
双阶段管线DiT 形状生成 → Paint 纹理合成,解耦几何与外观
大规模预训练超过 100 万 3D 资产数据
Flow Matching基于 Rectified Flow 的高效扩散范式
PBR 材质2.1 版本引入物理材质(金属度、粗糙度、法线等)
多格式支持生成 Mesh + 可导出 GLB/OBJ
全量开源2.1 版本开放权重 + 训练代码
工业集成Blender 插件、API 服务、ComfyUI 支持

2. 技术架构:双阶段生成管线#

2.1 为什么需要两个阶段?#

3D 资产的**几何(Shape)纹理(Texture)**有本质区别:

维度形状生成纹理生成
任务目标预测 SDF / 密度场预测 UV 贴图 / PBR 参数
数据模态几何(无纹理 3D 模型)带纹理 3D 模型
训练难度需要大量无纹理 3D需要大量带纹理 3D
分辨率要求中等(几何精度)高(纹理清晰度)
后处理Marching Cubes 提取 MeshUV 展开 + 贴图烘焙

解耦设计让每个子任务可以独立优化、单独升级,而不会相互干扰。

2.2 整体管线流程#

单张输入图像 / 文本
┌─────────────────────────────┐
│ 阶段一:Hunyuan3D-DiT │
│ (形状生成模型) │
│ 输入:图像特征 + 条件嵌入 │
│ 输出:3D SDF 场 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ Marching Cubes │
│ SDF → Mesh(白模) │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 阶段二:Hunyuan3D-Paint │
│ (纹理合成模型) │
│ 输入:白模 + 原始图像 │
│ 输出:PBR 材质贴图 │
└────────────┬────────────────┘
高质量带纹理 3D Mesh
可导出 GLB / OBJ

2.3 与其他方法的对比#

方法形状生成纹理生成是否解耦
One-2-3-45多视角扩散 + 重建无独立纹理
TripoSGRectified Flow DiT依赖形状阶段部分解耦
Hunyuan3D 2.0/2.1独立 DiT独立 Paint 模型完全解耦
TrellisSLAT + RF多解码器部分解耦
Michelangelo端到端端到端

3. 阶段一:Hunyuan3D-DiT 形状生成#

3.1 DiT 架构的演进#

Hunyuan3D-DiT 是整个系统的核心骨架,借鉴了 HunyuanDiT(腾讯文生图模型)的架构设计。

DiT vs 传统 UNet 在 3D 生成中的优势

  • 更好的可扩展性:Transformer 的参数规模可以轻松扩展到数十亿
  • 更强的条件注入:DiT 的条件机制(如 DiT-XL 的 Adaptive Layer Norm)更适合复杂的 3D 条件
  • 与 2D 扩散模型协同:DiT 架构可以复用 Stable Diffusion / FLUX 的训练策略

3.2 3D 表示:Sparse Neural Radiance Field#

Hunyuan3D-DiT 使用一种稀疏神经辐射场作为中间表示:

Fθ:(x,d)(c,σ)\mathcal{F}_\theta: (\mathbf{x}, \mathbf{d}) \rightarrow (\mathbf{c}, \sigma)

与原始 NeRF 的区别在于:

  1. 稀疏化:只预测”有意义”的空间区域(物体表面附近),节省计算
  2. 无 MLP:用稀疏特征网格替代 MLP,实现更高效的推理
  3. 与图像条件对齐:特征网格的初始化受到输入图像的监督

3.3 条件注入机制#

Hunyuan3D-DiT 使用 Cross-Attention + Adaptive Layer Norm 双重条件注入:

图像条件(输入图像)
CLIP / DINOv2 编码器
条件嵌入向量 c
┌─────────────────────────────────────────┐
│ Cross-Attention: │
│ Attention(Q, K(c), V(c)) │
│ 让 3D 表示查询图像的语义特征 │
├─────────────────────────────────────────┤
│ AdaLN-Zero: │
│ scale, shift = MLP(c) │
│ x = scale * Norm(x) + shift │
│ 实现全局风格/内容控制 │
└─────────────────────────────────────────┘

为什么需要双重机制?

  • Cross-Attention:捕捉图像的细粒度语义(物体部件、材质)
  • AdaLN-Zero:控制输出的全局风格(卡通、写实、风格化)

3.4 Flow Matching 训练目标#

Hunyuan3D-DiT 基于 Flow Matching(与 Rectified Flow 等价)进行训练:

前向过程(线性插值)

xt=(1t)x0+tx1,t[0,1]x_t = (1 - t) \cdot x_0 + t \cdot x_1, \quad t \in [0, 1]

其中 x0pdatax_0 \sim p_{\text{data}}(真实 SDF 场),x1N(0,I)x_1 \sim \mathcal{N}(0, I)(纯噪声)。

训练目标(速度场预测)

L=Et,x0,x1,cvθ(xt,t,c)(x0x1)22\mathcal{L} = \mathbb{E}_{t, x_0, x_1, c} \left\| v_\theta(x_t, t, c) - (x_0 - x_1) \right\|_2^2

推理过程(ODE 求解)

dxdt=vθ(xt,t,c),x1x0\frac{dx}{dt} = v_\theta(x_t, t, c), \quad x_1 \rightarrow x_0

通过 Euler / Heun 积分,从噪声逐步去噪得到 SDF 场。

3.5 模型规模与变体#

模型参数量推理显存特点
Hunyuan3D-DiT-v2-01.1B~6 GB标准版
Hunyuan3D-DiT-v2-0-Turbo1.1B~6 GBStep 蒸馏(步数减少)
Hunyuan3D-DiT-v2-0-Fast1.1B~6 GBGuidance 蒸馏(速度提升)
Hunyuan3D-DiT-v2-mini0.6B~4 GB轻量版
Hunyuan3D-DiT-v2-mini-Turbo0.6B~4 GB轻量 + 蒸馏
Hunyuan3D-DiT-v2-13.3B~10 GB2.1 大模型版
Hunyuan3D-DiT-v2-mv1.1B~6 GB多视角输入版

4. 阶段二:Hunyuan3D-Paint 纹理合成#

4.1 为什么需要独立的纹理模型?#

纹理生成面临独特的挑战:

  1. 高分辨率要求:纹理贴图通常需要 2K~4K 分辨率
  2. PBR 材质:需要预测多个通道(Albedo、Normal、Roughness、Metallic 等)
  3. 视角一致性:纹理需要与几何形状对齐
  4. 光照解耦:需要区分固有色(Albedo)和光照效果

独立纹理模型允许纹理分辨率独立于几何分辨率升级,这是 Hunyuan3D 架构的核心优势之一。

4.2 RGB 纹理 vs PBR 材质#

Hunyuan3D 2.0 使用传统的 RGB 纹理

纹理贴图 = [R, G, B] × 3 通道

Hunyuan3D 2.1 升级为 PBR(Physically Based Rendering)材质

通道含义示例
Albedo固有色(无光)红色塑料球 → 纯红色
Normal法线贴图凹凸细节
Roughness粗糙度光滑金属球 → 0,砖墙 → 0.8
Metallic金属度纯金属 → 1,塑料 → 0
AO环境光遮蔽缝隙、凹陷处的阴影

PBR 材质的优势

  • 物理正确:在不同光照下都能正确渲染
  • 工业标准:Game / Film 管线的事实标准
  • 风格迁移友好:可以独立修改光照效果而不改变材质

4.3 Paint 模型架构#

Hunyuan3D-Paint 使用 多视角 UV 投影 + 扩散模型的管线:

输入:白模 + 原始图像
┌─────────────────────────────┐
│ 多视角渲染 │
│ 将 3D Mesh 渲染为 N 张 UV 视图 │
│ 如:前/后/左/右/上/下 6 张 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 2D 扩散模型(类似 SDXL) │
│ 输入:多视角图像 + Mesh 特征 │
│ 输出:高清纹理贴图 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ UV 贴图烘焙 │
│ 将渲染结果烘焙到 Mesh 的 UV 坐标 │
└────────────┬────────────────┘
PBR 材质贴图

4.4 模型规模#

模型参数量纹理分辨率PBR 支持
Hunyuan3D-Paint-v2-01.3B1024~2048RGB
Hunyuan3D-Paint-v2-0-Turbo1.3B1024~2048RGB(蒸馏)
Hunyuan3D-Paint-v2-12B2048~4096PBR 材质

5. 技术细节:FlashVDM 与蒸馏#

5.1 FlashVDM:极速推理#

FlashVDM 是腾讯为 Hunyuan3D 开发的极速推理引擎,通过多步预测单步化(Step Distillation) 大幅缩短生成时间。

原理

传统 Rectified Flow 需要 20~50 步 ODE 积分:

x0=ODESolve(vθ,x1,c,N=50)x_0 = \text{ODESolve}(v_\theta, x_1, c, N=50)

FlashVDM 训练一个学生网络,直接预测最终结果:

x^0=vθstudent(x1,c)\hat{x}_0 = v_\theta^{\text{student}}(x_1, c)

蒸馏目标:

Ldistill=Ex0,x1,cvθstudent(x1,c)x022\mathcal{L}_{\text{distill}} = \mathbb{E}_{x_0, x_1, c} \left\| v_\theta^{\text{student}}(x_1, c) - x_0 \right\|_2^2

5.2 推理速度对比#

模型步数生成时间(单 A100)
Hunyuan3D-DiT-v2-050 步~25 秒
Hunyuan3D-DiT-v2-0-Turbo1 步~5 秒
Hunyuan3D-DiT-v2-0-Fast1 步~5 秒
Hunyuan3D-DiT-v2-mini-Turbo1 步~3 秒

蒸馏版本将形状生成时间从 25 秒压缩到 3~5 秒,整体管线(形状 + 纹理)控制在 10~30 秒。

5.3 Guidance Distillation#

除了 Step Distillation,腾讯还引入了 Guidance Distillation

  • 教师模型:带 Classifier-Free Guidance(CFG)的推理
  • 学生模型:学习隐式 CFG 效果,无需在推理时应用 CFG
  • 优势:减少推理时的计算量,同时保持生成质量

6. 性能评测与对比#

6.1 形状生成质量#

Hunyuan3D 2.0 vs 其他方法(图像条件对齐与质量):

模型CMMD (↓)FID_CLIP (↓)FID (↓)CLIP-score (↑)
Top 开源模型3.59154.639289.2870.787
Top 闭源模型 13.60055.866305.9220.779
Top 闭源模型 23.36849.744294.6280.806
Top 闭源模型 33.21851.574295.6910.799
Hunyuan3D 2.03.19349.165282.4290.809

6.2 纹理生成质量#

Hunyuan3D 2.1 (PBR) vs 其他方法

模型ULIP-T (↑)ULIP-I (↑)Uni3D-T (↑)Uni3D-I (↑)
Michelangelo0.07520.11520.21330.2611
Craftsman0.07450.12960.23750.2987
TripoSG0.07670.12250.25060.3129
Step1X-3D0.07350.11830.25540.3195
Trellis0.07690.12670.24960.3116
Hunyuan3D-Shape-2.10.07740.13950.25560.3213

纹理贴合质量(CLIP-I / LPIPS)

模型CLIP-FiD (↓)CMMD (↓)CLIP-I (↑)LPIPS (↓)
SyncMVD-IPA28.392.3970.88230.1423
TexGen28.242.4480.88180.1331
Hunyuan3D-2.026.442.3180.88930.1261
Hunyuan3D-Paint-2.124.782.1910.92070.1211

6.3 评测指标解读#

指标含义越低/越高越好
CMMD3D 几何质量(多视角 CLIP 距离)
FID / FID_CLIP生成质量与真实分布的距离
CLIP-score / CLIP-I与输入条件的语义对齐程度
ULIP-T / ULIP-I3D 形状的语言-几何对齐
Uni3D-T / Uni3D-I统一的 3D 表示对齐质量
LPIPS感知相似度(纹理质量)

7. 开源生态与工程实践#

7.1 完整开源承诺#

Hunyuan3D 2.1 实现了全量开源

  • 推理代码
  • 预训练模型权重
  • 技术报告(arXiv)
  • 训练代码(2.1 版本)
  • ComfyUI 支持
  • TensorRT 优化(进行中)

7.2 社区生态#

工具/集成描述来源
ComfyUI-3D-PackComfyUI 完整 3D 生成节点社区
ComfyUI-Hunyuan3DWrapper专用 ComfyUI 封装社区
Windows 整合包一键安装包社区
Unity / XR 支持游戏引擎集成社区
Blender 插件官方提供腾讯
HuggingFace Space在线体验官方
Python APIdiffusers 风格官方

7.3 代码使用示例#

形状生成(DiT)

from hy3dgen.shapegen import Hunyuan3DDiTFlowMatchingPipeline
pipeline = Hunyuan3DDiTFlowMatchingPipeline.from_pretrained('tencent/Hunyuan3D-2.1')
mesh = pipeline(image='assets/demo.png')[0]
mesh.export('output.glb')

纹理合成(Paint)

from hy3dgen.texgen import Hunyuan3DPaintPipeline
paint_pipeline = Hunyuan3DPaintPipeline.from_pretrained('tencent/Hunyuan3D-2.1')
mesh_textured = paint_pipeline('output.glb', image='assets/demo.png')
mesh_textured.export('output_textured.glb')

Turbo 极速模式

pipeline = Hunyuan3DDiTFlowMatchingPipeline.from_pretrained(
'tencent/Hunyuan3D-2',
subfolder='hunyuan3d-dit-v2-0-turbo' # 1 步生成
)

7.4 显存需求#

任务显存需求
形状生成(DiT)~6 GB(标准)/ ~10 GB(2.1 大模型)
纹理生成(Paint)~16 GB
完整管线(形状 + 纹理)~29 GB(2.1 版本)
轻量版(2mini)~4 GB

8. 与其他工作的对比#

8.1 技术路线对比#

工作形状生成方式纹理生成方式输出格式开源程度发布时间
One-2-3-45多视角扩散 + NeRFMesh部分2023
Zero-1-to-3稀疏视角扩散图像序列2023
TripoSGRectified Flow DiT两阶段Mesh2024
Trellis双阶段 RF TransformerSLAT 解码Mesh / RF / GS2025
Hunyuan3D 1.0统一 DiT统一Mesh2024
Hunyuan3D 2.0DiT + Flow Matching独立 PaintMesh + RGB 纹理2025
Hunyuan3D 2.1DiT + Flow Matching独立 Paint + PBRMesh + PBR全量开源2025
Hunyuan3D 2.5DiT + 极致细节PBR + 超分Mesh + PBR2025

8.2 Hunyuan3D 的差异化优势#

  1. 规模最大:2.1 版本形状模型达 3.3B 参数,远超同期开源模型
  2. 完全解耦:形状与纹理独立训练、独立升级
  3. PBR 工业标准:首个开源 PBR 纹理生成能力
  4. 全量开源:权重 + 训练代码全部开放
  5. 蒸馏成熟:Turbo / Fast 版本实现亚秒级推理
  6. 生态完善:Blender / ComfyUI / API / Windows 整合包

9. Hunyuan3D 2.5:极致细节#

9.1 核心改进#

Hunyuan3D 2.5(2025.06)是目前最新的版本,核心目标是极致细节

  1. 几何精度提升:更精细的 SDF 场预测
  2. 纹理清晰度:支持 4K+ 分辨率纹理
  3. 背面完整性:改进不可见区域的生成质量
  4. 材质真实性:更准确的 PBR 参数预测

9.2 评测结果#

2.5 版本在各项指标上进一步提升:

  • CMMD、FID_CLIP 等几何质量指标再创新低
  • CLIP-score 提升至 0.82+
  • 纹理贴合 LPIPS 降至 0.11 以下

10. 核心数学公式汇总#

  1. Flow Matching 前向过程(线性插值)
xt=(1t)x0+tx1,t[0,1]x_t = (1 - t) \cdot x_0 + t \cdot x_1, \quad t \in [0, 1]
  1. Flow Matching 训练目标(速度场预测)
L=Et,x0,x1,cvθ(xt,t,c)(x0x1)22\mathcal{L} = \mathbb{E}_{t, x_0, x_1, c} \left\| v_\theta(x_t, t, c) - (x_0 - x_1) \right\|_2^2
  1. AdaLN-Zero 条件注入
h=AdaLN-Zero(x,c)=(scalex+shift)+βgate\mathbf{h}' = \text{AdaLN-Zero}(x, c) = (\text{scale} \cdot x + \text{shift}) + \beta \cdot \text{gate}
  1. Cross-Attention 条件融合
Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left( \frac{QK^T}{\sqrt{d_k}} \right) V
  1. Step Distillation 目标
Ldistill=Ex0,x1,cvθstudent(x1,c)x022\mathcal{L}_{\text{distill}} = \mathbb{E}_{x_0, x_1, c} \left\| v_\theta^{\text{student}}(x_1, c) - x_0 \right\|_2^2
  1. SDF 到 Mesh 提取(Marching Cubes)
M={xR3s(x)=0}\mathcal{M} = \{ \mathbf{x} \in \mathbb{R}^3 \mid s(\mathbf{x}) = 0 \}

11. 总结与展望#

Hunyuan3D 的核心贡献#

  1. 大规模 DiT 架构:将 NLP/CV 领域验证的 DiT 扩展到 3D 生成,规模达 3.3B 参数
  2. 双阶段解耦管线:DiT 形状 + Paint 纹理,独立优化、独立升级
  3. Flow Matching 范式:高效扩散训练,蒸馏后可达 1 步生成
  4. PBR 工业标准:首个开源 PBR 材质纹理生成,符合 Game / Film 管线需求
  5. 全量开源生态:权重 + 训练代码 + 工具链 + 社区支持

当前局限#

局限描述潜在解决方案
显存需求完整管线需 29 GB模型量化、梯度检查点
推理速度最快 3~5 秒形状生成TensorRT 加速
复杂拓扑极端拓扑(如镂空结构)仍有挑战增强 SDF 表示能力
文本控制主要依赖图像条件,文本控制较弱强化语言-3D 对齐

未来方向#

方向描述进展
HunyuanWorld3D 场景级生成(物体 → 室内 → 城市)已发布 1.0
Hunyuan3D-Part局部零件分割与生成已发布
Hunyuan3D-Omni统一可控 3D 生成框架已发布
端侧部署移动端 / WebGPU 推理进行中
实时编辑集成 3DGS 的实时编辑能力规划中

在 3D 生成版图中的位置#

Hunyuan3D 与本系列文章中的其他工作形成互补:

  • NeRF / 3DGS:3D 表示与渲染技术
  • TRELLIS:结构化隐表示 + 多格式解码
  • LRM:前馈重建的基本范式
  • Hunyuan3D大规模工程化落地的典范,提供从研究到生产的完整解决方案

Hunyuan3D 代表了腾讯在 3D 生成领域的系统级工程能力——从 DiT 架构设计、Flow Matching 训练、PBR 材质合成到蒸馏加速,每一环都有扎实的技术创新。 更难得的是,腾讯选择了全量开源,让整个社区都能站在这一基础上继续推进 3D 生成技术的发展。

参考资料#

  1. Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation.” arXiv<2501>.12202.
  2. Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material.” arXiv<2506>.15442.
  3. Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details.” arXiv<2506>.16504.
  4. Tencent Hunyuan3D Team. (2024). “Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation.” arXiv<2411>.02293.
  5. “Tencent-Hunyuan/Hunyuan3D-2.” GitHub: Tencent-Hunyuan/Hunyuan3D-2.
  6. “Tencent-Hunyuan/Hunyuan3D-2.1.” GitHub: Tencent-Hunyuan/Hunyuan3D-2.1.
  7. “Tencent-Hunyuan/HunyuanWorld-1.0.” GitHub: Tencent-Hunyuan/HunyuanWorld-1.0.
  8. Peebles, W., & Xie, S. (2023). “Scalable Diffusion Models with Transformers.” ICCV 2023 (DiT).
  9. Lipman, Y., et al. (2023). “Flow Matching: A Simple Approach to Competitive Generative Modeling.” NeurIPS 2022 / 2023.
  10. Xiang, J., et al. (2024). “Structured 3D Latents for Scalable and Versatile 3D Generation.” CVPR 2025 (Spotlight).
  11. “VAST-AI-Research/TripoSG.” GitHub: VAST-AI-Research/TripoSG.
  12. Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” ACM TOG (SIGGRAPH).
  13. Liu, M., et al. (2023). “One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Multi-View Training.” ICLR 2024.
  14. Deitke, M., et al. (2023). “Objaverse: A Universe of Annotated 3D Objects.” CVPR 2023.
  15. “Tencent-Hunyuan/HunyuanDiT.” GitHub: Tencent-Hunyuan/HunyuanDiT.
  16. “Tencent-Hunyuan/HunyuanVideo.” GitHub: Tencent-Hunyuan/HunyuanVideo.

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

深度解析腾讯混元 3D (Hunyuan3D):大规模扩散模型的 3D 资产生成
https://aiattnstudio.link/posts/hunyuan3d/
作者
Federico
发布于
2026-07-16
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author

Federico

AI Research Lab

Hello, I'm Federico.

关于实验室 / About
公告

欢迎来到Federico的个人博客

分类
标签
站点统计
57文章
7分类
404标签