深度解析腾讯混元 3D (Hunyuan3D):大规模扩散模型的 3D 资产生成
1. 引言:腾讯的 3D 生成版图
1.1 Hunyuan3D 系列概览
Hunyuan3D(混元 3D)是腾讯 AI Lab 推出的开源 3D 资产生成系统,从 2024 年底的 1.0 版本到 2025 年的 2.5 版本,持续引领着开源 3D 生成的发展。
“Living out everyone’s imagination on creating and manipulating 3D assets.” —— Hunyuan3D 官方愿景
核心定位:腾讯混元 3D 是目前开源社区中规模最大、功能最全面的 3D 生成系统,包含形状生成、纹理合成、PBR 材质、局部编辑等完整能力。
1.2 版本演进时间线
| 版本 | 时间 | 核心创新 | 参数量 |
|---|---|---|---|
| Hunyuan3D 1.0 | 2024.11 | 统一文本/图像到 3D 框架 | ~1B |
| Hunyuan3D 2.0 | 2025.01 | 大规模 DiT 形状生成 + Paint 纹理合成 | 1.1B + 1.3B |
| Hunyuan3D 2mini | 2025.03 | 0.6B 轻量模型 + Step/Guidance 蒸馏 | 0.6B |
| Hunyuan3D 2mv | 2025.03 | 多视角图像到形状模型 | 1.1B |
| Hunyuan3D 2.1 | 2025.06 | PBR 材质 + 全量开源(权重 + 训练代码) | 3.3B + 2B |
| Hunyuan3D 2.5 | 2025.06 | 极致细节 + 生产级质量 | 更大规模 |
1.3 核心亮点一览
| 特性 | 详情 |
|---|---|
| 双阶段管线 | DiT 形状生成 → Paint 纹理合成,解耦几何与外观 |
| 大规模预训练 | 超过 100 万 3D 资产数据 |
| Flow Matching | 基于 Rectified Flow 的高效扩散范式 |
| PBR 材质 | 2.1 版本引入物理材质(金属度、粗糙度、法线等) |
| 多格式支持 | 生成 Mesh + 可导出 GLB/OBJ |
| 全量开源 | 2.1 版本开放权重 + 训练代码 |
| 工业集成 | Blender 插件、API 服务、ComfyUI 支持 |
2. 技术架构:双阶段生成管线
2.1 为什么需要两个阶段?
3D 资产的**几何(Shape)和纹理(Texture)**有本质区别:
| 维度 | 形状生成 | 纹理生成 |
|---|---|---|
| 任务目标 | 预测 SDF / 密度场 | 预测 UV 贴图 / PBR 参数 |
| 数据模态 | 几何(无纹理 3D 模型) | 带纹理 3D 模型 |
| 训练难度 | 需要大量无纹理 3D | 需要大量带纹理 3D |
| 分辨率要求 | 中等(几何精度) | 高(纹理清晰度) |
| 后处理 | Marching Cubes 提取 Mesh | UV 展开 + 贴图烘焙 |
解耦设计让每个子任务可以独立优化、单独升级,而不会相互干扰。
2.2 整体管线流程
单张输入图像 / 文本 ↓ ┌─────────────────────────────┐ │ 阶段一:Hunyuan3D-DiT │ │ (形状生成模型) │ │ 输入:图像特征 + 条件嵌入 │ │ 输出:3D SDF 场 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ Marching Cubes │ │ SDF → Mesh(白模) │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 阶段二:Hunyuan3D-Paint │ │ (纹理合成模型) │ │ 输入:白模 + 原始图像 │ │ 输出:PBR 材质贴图 │ └────────────┬────────────────┘ ↓ 高质量带纹理 3D Mesh ↓ 可导出 GLB / OBJ2.3 与其他方法的对比
| 方法 | 形状生成 | 纹理生成 | 是否解耦 |
|---|---|---|---|
| One-2-3-45 | 多视角扩散 + 重建 | 无独立纹理 | 否 |
| TripoSG | Rectified Flow DiT | 依赖形状阶段 | 部分解耦 |
| Hunyuan3D 2.0/2.1 | 独立 DiT | 独立 Paint 模型 | 完全解耦 |
| Trellis | SLAT + RF | 多解码器 | 部分解耦 |
| Michelangelo | 端到端 | 端到端 | 否 |
3. 阶段一:Hunyuan3D-DiT 形状生成
3.1 DiT 架构的演进
Hunyuan3D-DiT 是整个系统的核心骨架,借鉴了 HunyuanDiT(腾讯文生图模型)的架构设计。
DiT vs 传统 UNet 在 3D 生成中的优势:
- 更好的可扩展性:Transformer 的参数规模可以轻松扩展到数十亿
- 更强的条件注入:DiT 的条件机制(如 DiT-XL 的 Adaptive Layer Norm)更适合复杂的 3D 条件
- 与 2D 扩散模型协同:DiT 架构可以复用 Stable Diffusion / FLUX 的训练策略
3.2 3D 表示:Sparse Neural Radiance Field
Hunyuan3D-DiT 使用一种稀疏神经辐射场作为中间表示:
与原始 NeRF 的区别在于:
- 稀疏化:只预测”有意义”的空间区域(物体表面附近),节省计算
- 无 MLP:用稀疏特征网格替代 MLP,实现更高效的推理
- 与图像条件对齐:特征网格的初始化受到输入图像的监督
3.3 条件注入机制
Hunyuan3D-DiT 使用 Cross-Attention + Adaptive Layer Norm 双重条件注入:
图像条件(输入图像) ↓ CLIP / DINOv2 编码器 ↓ 条件嵌入向量 c ↓ ┌─────────────────────────────────────────┐ │ Cross-Attention: │ │ Attention(Q, K(c), V(c)) │ │ 让 3D 表示查询图像的语义特征 │ ├─────────────────────────────────────────┤ │ AdaLN-Zero: │ │ scale, shift = MLP(c) │ │ x = scale * Norm(x) + shift │ │ 实现全局风格/内容控制 │ └─────────────────────────────────────────┘为什么需要双重机制?
- Cross-Attention:捕捉图像的细粒度语义(物体部件、材质)
- AdaLN-Zero:控制输出的全局风格(卡通、写实、风格化)
3.4 Flow Matching 训练目标
Hunyuan3D-DiT 基于 Flow Matching(与 Rectified Flow 等价)进行训练:
前向过程(线性插值):
其中 (真实 SDF 场),(纯噪声)。
训练目标(速度场预测):
推理过程(ODE 求解):
通过 Euler / Heun 积分,从噪声逐步去噪得到 SDF 场。
3.5 模型规模与变体
| 模型 | 参数量 | 推理显存 | 特点 |
|---|---|---|---|
| Hunyuan3D-DiT-v2-0 | 1.1B | ~6 GB | 标准版 |
| Hunyuan3D-DiT-v2-0-Turbo | 1.1B | ~6 GB | Step 蒸馏(步数减少) |
| Hunyuan3D-DiT-v2-0-Fast | 1.1B | ~6 GB | Guidance 蒸馏(速度提升) |
| Hunyuan3D-DiT-v2-mini | 0.6B | ~4 GB | 轻量版 |
| Hunyuan3D-DiT-v2-mini-Turbo | 0.6B | ~4 GB | 轻量 + 蒸馏 |
| Hunyuan3D-DiT-v2-1 | 3.3B | ~10 GB | 2.1 大模型版 |
| Hunyuan3D-DiT-v2-mv | 1.1B | ~6 GB | 多视角输入版 |
4. 阶段二:Hunyuan3D-Paint 纹理合成
4.1 为什么需要独立的纹理模型?
纹理生成面临独特的挑战:
- 高分辨率要求:纹理贴图通常需要 2K~4K 分辨率
- PBR 材质:需要预测多个通道(Albedo、Normal、Roughness、Metallic 等)
- 视角一致性:纹理需要与几何形状对齐
- 光照解耦:需要区分固有色(Albedo)和光照效果
独立纹理模型允许纹理分辨率独立于几何分辨率升级,这是 Hunyuan3D 架构的核心优势之一。
4.2 RGB 纹理 vs PBR 材质
Hunyuan3D 2.0 使用传统的 RGB 纹理:
纹理贴图 = [R, G, B] × 3 通道Hunyuan3D 2.1 升级为 PBR(Physically Based Rendering)材质:
| 通道 | 含义 | 示例 |
|---|---|---|
| Albedo | 固有色(无光) | 红色塑料球 → 纯红色 |
| Normal | 法线贴图 | 凹凸细节 |
| Roughness | 粗糙度 | 光滑金属球 → 0,砖墙 → 0.8 |
| Metallic | 金属度 | 纯金属 → 1,塑料 → 0 |
| AO | 环境光遮蔽 | 缝隙、凹陷处的阴影 |
PBR 材质的优势:
- 物理正确:在不同光照下都能正确渲染
- 工业标准:Game / Film 管线的事实标准
- 风格迁移友好:可以独立修改光照效果而不改变材质
4.3 Paint 模型架构
Hunyuan3D-Paint 使用 多视角 UV 投影 + 扩散模型的管线:
输入:白模 + 原始图像 ↓ ┌─────────────────────────────┐ │ 多视角渲染 │ │ 将 3D Mesh 渲染为 N 张 UV 视图 │ │ 如:前/后/左/右/上/下 6 张 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 2D 扩散模型(类似 SDXL) │ │ 输入:多视角图像 + Mesh 特征 │ │ 输出:高清纹理贴图 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ UV 贴图烘焙 │ │ 将渲染结果烘焙到 Mesh 的 UV 坐标 │ └────────────┬────────────────┘ ↓ PBR 材质贴图4.4 模型规模
| 模型 | 参数量 | 纹理分辨率 | PBR 支持 |
|---|---|---|---|
| Hunyuan3D-Paint-v2-0 | 1.3B | 1024~2048 | RGB |
| Hunyuan3D-Paint-v2-0-Turbo | 1.3B | 1024~2048 | RGB(蒸馏) |
| Hunyuan3D-Paint-v2-1 | 2B | 2048~4096 | PBR 材质 |
5. 技术细节:FlashVDM 与蒸馏
5.1 FlashVDM:极速推理
FlashVDM 是腾讯为 Hunyuan3D 开发的极速推理引擎,通过多步预测单步化(Step Distillation) 大幅缩短生成时间。
原理:
传统 Rectified Flow 需要 20~50 步 ODE 积分:
FlashVDM 训练一个学生网络,直接预测最终结果:
蒸馏目标:
5.2 推理速度对比
| 模型 | 步数 | 生成时间(单 A100) |
|---|---|---|
| Hunyuan3D-DiT-v2-0 | 50 步 | ~25 秒 |
| Hunyuan3D-DiT-v2-0-Turbo | 1 步 | ~5 秒 |
| Hunyuan3D-DiT-v2-0-Fast | 1 步 | ~5 秒 |
| Hunyuan3D-DiT-v2-mini-Turbo | 1 步 | ~3 秒 |
蒸馏版本将形状生成时间从 25 秒压缩到 3~5 秒,整体管线(形状 + 纹理)控制在 10~30 秒。
5.3 Guidance Distillation
除了 Step Distillation,腾讯还引入了 Guidance Distillation:
- 教师模型:带 Classifier-Free Guidance(CFG)的推理
- 学生模型:学习隐式 CFG 效果,无需在推理时应用 CFG
- 优势:减少推理时的计算量,同时保持生成质量
6. 性能评测与对比
6.1 形状生成质量
Hunyuan3D 2.0 vs 其他方法(图像条件对齐与质量):
| 模型 | CMMD (↓) | FID_CLIP (↓) | FID (↓) | CLIP-score (↑) |
|---|---|---|---|---|
| Top 开源模型 | 3.591 | 54.639 | 289.287 | 0.787 |
| Top 闭源模型 1 | 3.600 | 55.866 | 305.922 | 0.779 |
| Top 闭源模型 2 | 3.368 | 49.744 | 294.628 | 0.806 |
| Top 闭源模型 3 | 3.218 | 51.574 | 295.691 | 0.799 |
| Hunyuan3D 2.0 | 3.193 | 49.165 | 282.429 | 0.809 |
6.2 纹理生成质量
Hunyuan3D 2.1 (PBR) vs 其他方法:
| 模型 | ULIP-T (↑) | ULIP-I (↑) | Uni3D-T (↑) | Uni3D-I (↑) |
|---|---|---|---|---|
| Michelangelo | 0.0752 | 0.1152 | 0.2133 | 0.2611 |
| Craftsman | 0.0745 | 0.1296 | 0.2375 | 0.2987 |
| TripoSG | 0.0767 | 0.1225 | 0.2506 | 0.3129 |
| Step1X-3D | 0.0735 | 0.1183 | 0.2554 | 0.3195 |
| Trellis | 0.0769 | 0.1267 | 0.2496 | 0.3116 |
| Hunyuan3D-Shape-2.1 | 0.0774 | 0.1395 | 0.2556 | 0.3213 |
纹理贴合质量(CLIP-I / LPIPS):
| 模型 | CLIP-FiD (↓) | CMMD (↓) | CLIP-I (↑) | LPIPS (↓) |
|---|---|---|---|---|
| SyncMVD-IPA | 28.39 | 2.397 | 0.8823 | 0.1423 |
| TexGen | 28.24 | 2.448 | 0.8818 | 0.1331 |
| Hunyuan3D-2.0 | 26.44 | 2.318 | 0.8893 | 0.1261 |
| Hunyuan3D-Paint-2.1 | 24.78 | 2.191 | 0.9207 | 0.1211 |
6.3 评测指标解读
| 指标 | 含义 | 越低/越高越好 |
|---|---|---|
| CMMD | 3D 几何质量(多视角 CLIP 距离) | ↓ |
| FID / FID_CLIP | 生成质量与真实分布的距离 | ↓ |
| CLIP-score / CLIP-I | 与输入条件的语义对齐程度 | ↑ |
| ULIP-T / ULIP-I | 3D 形状的语言-几何对齐 | ↑ |
| Uni3D-T / Uni3D-I | 统一的 3D 表示对齐质量 | ↑ |
| LPIPS | 感知相似度(纹理质量) | ↓ |
7. 开源生态与工程实践
7.1 完整开源承诺
Hunyuan3D 2.1 实现了全量开源:
- 推理代码
- 预训练模型权重
- 技术报告(arXiv)
- 训练代码(2.1 版本)
- ComfyUI 支持
- TensorRT 优化(进行中)
7.2 社区生态
| 工具/集成 | 描述 | 来源 |
|---|---|---|
| ComfyUI-3D-Pack | ComfyUI 完整 3D 生成节点 | 社区 |
| ComfyUI-Hunyuan3DWrapper | 专用 ComfyUI 封装 | 社区 |
| Windows 整合包 | 一键安装包 | 社区 |
| Unity / XR 支持 | 游戏引擎集成 | 社区 |
| Blender 插件 | 官方提供 | 腾讯 |
| HuggingFace Space | 在线体验 | 官方 |
| Python API | diffusers 风格 | 官方 |
7.3 代码使用示例
形状生成(DiT):
from hy3dgen.shapegen import Hunyuan3DDiTFlowMatchingPipeline
pipeline = Hunyuan3DDiTFlowMatchingPipeline.from_pretrained('tencent/Hunyuan3D-2.1')mesh = pipeline(image='assets/demo.png')[0]mesh.export('output.glb')纹理合成(Paint):
from hy3dgen.texgen import Hunyuan3DPaintPipeline
paint_pipeline = Hunyuan3DPaintPipeline.from_pretrained('tencent/Hunyuan3D-2.1')mesh_textured = paint_pipeline('output.glb', image='assets/demo.png')mesh_textured.export('output_textured.glb')Turbo 极速模式:
pipeline = Hunyuan3DDiTFlowMatchingPipeline.from_pretrained( 'tencent/Hunyuan3D-2', subfolder='hunyuan3d-dit-v2-0-turbo' # 1 步生成)7.4 显存需求
| 任务 | 显存需求 |
|---|---|
| 形状生成(DiT) | ~6 GB(标准)/ ~10 GB(2.1 大模型) |
| 纹理生成(Paint) | ~16 GB |
| 完整管线(形状 + 纹理) | ~29 GB(2.1 版本) |
| 轻量版(2mini) | ~4 GB |
8. 与其他工作的对比
8.1 技术路线对比
| 工作 | 形状生成方式 | 纹理生成方式 | 输出格式 | 开源程度 | 发布时间 |
|---|---|---|---|---|---|
| One-2-3-45 | 多视角扩散 + NeRF | 无 | Mesh | 部分 | 2023 |
| Zero-1-to-3 | 稀疏视角扩散 | 无 | 图像序列 | 是 | 2023 |
| TripoSG | Rectified Flow DiT | 两阶段 | Mesh | 是 | 2024 |
| Trellis | 双阶段 RF Transformer | SLAT 解码 | Mesh / RF / GS | 是 | 2025 |
| Hunyuan3D 1.0 | 统一 DiT | 统一 | Mesh | 是 | 2024 |
| Hunyuan3D 2.0 | DiT + Flow Matching | 独立 Paint | Mesh + RGB 纹理 | 是 | 2025 |
| Hunyuan3D 2.1 | DiT + Flow Matching | 独立 Paint + PBR | Mesh + PBR | 全量开源 | 2025 |
| Hunyuan3D 2.5 | DiT + 极致细节 | PBR + 超分 | Mesh + PBR | 是 | 2025 |
8.2 Hunyuan3D 的差异化优势
- 规模最大:2.1 版本形状模型达 3.3B 参数,远超同期开源模型
- 完全解耦:形状与纹理独立训练、独立升级
- PBR 工业标准:首个开源 PBR 纹理生成能力
- 全量开源:权重 + 训练代码全部开放
- 蒸馏成熟:Turbo / Fast 版本实现亚秒级推理
- 生态完善:Blender / ComfyUI / API / Windows 整合包
9. Hunyuan3D 2.5:极致细节
9.1 核心改进
Hunyuan3D 2.5(2025.06)是目前最新的版本,核心目标是极致细节:
- 几何精度提升:更精细的 SDF 场预测
- 纹理清晰度:支持 4K+ 分辨率纹理
- 背面完整性:改进不可见区域的生成质量
- 材质真实性:更准确的 PBR 参数预测
9.2 评测结果
2.5 版本在各项指标上进一步提升:
- CMMD、FID_CLIP 等几何质量指标再创新低
- CLIP-score 提升至 0.82+
- 纹理贴合 LPIPS 降至 0.11 以下
10. 核心数学公式汇总
- Flow Matching 前向过程(线性插值):
- Flow Matching 训练目标(速度场预测):
- AdaLN-Zero 条件注入:
- Cross-Attention 条件融合:
- Step Distillation 目标:
- SDF 到 Mesh 提取(Marching Cubes):
11. 总结与展望
Hunyuan3D 的核心贡献
- 大规模 DiT 架构:将 NLP/CV 领域验证的 DiT 扩展到 3D 生成,规模达 3.3B 参数
- 双阶段解耦管线:DiT 形状 + Paint 纹理,独立优化、独立升级
- Flow Matching 范式:高效扩散训练,蒸馏后可达 1 步生成
- PBR 工业标准:首个开源 PBR 材质纹理生成,符合 Game / Film 管线需求
- 全量开源生态:权重 + 训练代码 + 工具链 + 社区支持
当前局限
| 局限 | 描述 | 潜在解决方案 |
|---|---|---|
| 显存需求 | 完整管线需 29 GB | 模型量化、梯度检查点 |
| 推理速度 | 最快 3~5 秒形状生成 | TensorRT 加速 |
| 复杂拓扑 | 极端拓扑(如镂空结构)仍有挑战 | 增强 SDF 表示能力 |
| 文本控制 | 主要依赖图像条件,文本控制较弱 | 强化语言-3D 对齐 |
未来方向
| 方向 | 描述 | 进展 |
|---|---|---|
| HunyuanWorld | 3D 场景级生成(物体 → 室内 → 城市) | 已发布 1.0 |
| Hunyuan3D-Part | 局部零件分割与生成 | 已发布 |
| Hunyuan3D-Omni | 统一可控 3D 生成框架 | 已发布 |
| 端侧部署 | 移动端 / WebGPU 推理 | 进行中 |
| 实时编辑 | 集成 3DGS 的实时编辑能力 | 规划中 |
在 3D 生成版图中的位置
Hunyuan3D 与本系列文章中的其他工作形成互补:
- NeRF / 3DGS:3D 表示与渲染技术
- TRELLIS:结构化隐表示 + 多格式解码
- LRM:前馈重建的基本范式
- Hunyuan3D:大规模工程化落地的典范,提供从研究到生产的完整解决方案
Hunyuan3D 代表了腾讯在 3D 生成领域的系统级工程能力——从 DiT 架构设计、Flow Matching 训练、PBR 材质合成到蒸馏加速,每一环都有扎实的技术创新。 更难得的是,腾讯选择了全量开源,让整个社区都能站在这一基础上继续推进 3D 生成技术的发展。
参考资料
- Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation.” arXiv<2501>2501>.12202.
- Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material.” arXiv<2506>2506>.15442.
- Tencent Hunyuan3D Team. (2025). “Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details.” arXiv<2506>2506>.16504.
- Tencent Hunyuan3D Team. (2024). “Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation.” arXiv<2411>2411>.02293.
- “Tencent-Hunyuan/Hunyuan3D-2.” GitHub: Tencent-Hunyuan/Hunyuan3D-2.
- “Tencent-Hunyuan/Hunyuan3D-2.1.” GitHub: Tencent-Hunyuan/Hunyuan3D-2.1.
- “Tencent-Hunyuan/HunyuanWorld-1.0.” GitHub: Tencent-Hunyuan/HunyuanWorld-1.0.
- Peebles, W., & Xie, S. (2023). “Scalable Diffusion Models with Transformers.” ICCV 2023 (DiT).
- Lipman, Y., et al. (2023). “Flow Matching: A Simple Approach to Competitive Generative Modeling.” NeurIPS 2022 / 2023.
- Xiang, J., et al. (2024). “Structured 3D Latents for Scalable and Versatile 3D Generation.” CVPR 2025 (Spotlight).
- “VAST-AI-Research/TripoSG.” GitHub: VAST-AI-Research/TripoSG.
- Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” ACM TOG (SIGGRAPH).
- Liu, M., et al. (2023). “One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Multi-View Training.” ICLR 2024.
- Deitke, M., et al. (2023). “Objaverse: A Universe of Annotated 3D Objects.” CVPR 2023.
- “Tencent-Hunyuan/HunyuanDiT.” GitHub: Tencent-Hunyuan/HunyuanDiT.
- “Tencent-Hunyuan/HunyuanVideo.” GitHub: Tencent-Hunyuan/HunyuanVideo.
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!

