深度解析 LRM:大型重建模型与单图像 3D 重建的突破
1. 引言:从”数十小时”到”十秒钟”
1.1 传统 3D 生成的困境
在 LRM 出现之前,单张图像到 3D 资产生成面临一个根本性的效率问题:
DreamFusion 路线(2022-2023 年主流):
单张图像 + 文本提示 ↓ 2D 扩散模型(SDS 损失) ↓ NeRF 逐样本优化 ↓ ~数小时(单个资产)每生成一个 3D 资产都需要数十分钟到数小时的优化过程,这使得 3D 生成无法用于任何实际的生产场景。
1.2 LRM 的核心思想
大型重建模型(Large Reconstruction Model, LRM) 的核心洞察来自一个简单的问题:
如果我们训练一个足够大的神经网络,直接从单张图像预测 3D 表示——而不是对每个样本进行迭代优化——能否实现秒级的 3D 资产生成?
答案是:完全可以。
LRM 通过以下方式实现这一突破:
- 大规模 3D 数据预训练:在数十万到数百万的 3D 资产数据集(Objaverse、GSO 等)上训练
- 3D 原生的表示设计:设计支持高效推理的 3D 表示(如 Triplane、Dense Blob)
- 大型 Vision-Language 模型的知识迁移:利用预训练的 CLIP/DINO 等视觉模型的知识
1.3 LRM 的时间线
| 年份 | 方法 | 核心创新 | 生成时间 |
|---|---|---|---|
| 2023 | One-2-3-45 | 开创前馈 3D 重建 | ~45 秒 |
| 2023 | Zero-1-to-3 | 稀疏视角扩散引导重建 | ~10-30 秒 |
| 2024 | OpenLRM | 大型 Transformer + Triplane | ~10 秒 |
| 2024 | TripoSG | Rectified Flow + 高质量 SDF | ~8 秒 |
| 2024 | InstantMesh | 前馈 Mesh 生成 + 抗锯齿 | ~10 秒 |
| 2025 | SPAR3D | 点扩散 + Triplane Transformer | ~0.7 秒 |
2. LRM 的技术基础
2.1 为什么需要大型预训练?
早期 3D 重建方法(如 COLMAP + Multi-View Stereo)严重依赖多视角一致性——没有足够多的视角,就无法恢复可靠的 3D 结构。
但单张图像本身隐含了丰富的 3D 信息:
- 纹理梯度暗示表面朝向(Shading / Specularity)
- 遮挡关系暗示物体深度顺序
- 先验知识(来自大规模 2D 图像的语义理解)
大型预训练模型的核心价值,是将 2D 图像中隐含的 3D 先验”蒸馏”到可泛化的神经网络权重中。
2.2 LRM vs SDS 优化
这是两种截然不同的 3D 生成范式:
| 维度 | SDS 优化路线 | LRM 前馈路线 |
|---|---|---|
| 推理范式 | 每个样本迭代优化 | 一次性前馈预测 |
| 推理时间 | 30 分钟 ~ 数小时 | 5 ~ 60 秒 |
| 模型参数 | 小型 MLP(NeRF) + 固定 2D 扩散 | 大型 Transformer / Diffusion(数亿参数) |
| 3D 先验 | 间接(通过 2D 扩散引导) | 直接(从 3D 数据学习) |
| 泛化能力 | 受 2D 扩散质量限制 | 受 3D 数据规模和多样性限制 |
| 编辑灵活性 | 高(迭代过程中可干预) | 低(一次性生成) |
| 多视角一致性 | 中等(SDS 伪损失) | 高(端到端训练保证) |
2.3 LRM 的三大挑战
尽管 LRM 前景广阔,它必须解决三个核心问题:
挑战一:3D 数据稀缺
- 2D 图像:互联网规模(数十亿张)
- 3D 资产:高质量标注数据极为稀缺(Objaverse ~80 万,GSO ~1000)
- 解决方案:数据增强(多视角渲染)、合成数据、伪标签
挑战二:3D 表示的选择
- 3D 体积表示(NeRF / Voxel):内存爆炸,
- 3D 表面表示(SDF / Mesh):拓扑变化难以建模
- 2.5D 表示(Triplane / Depth):内存高效但需要解码器
挑战三:几何一致性
- 单张图像缺少多视角约束
- 需要足够强的 3D 先验来”填补”缺失信息
- 需要避免”Janus 问题”(同一语义出现在多个位置)
3. 核心表示:Triplane 与相关表示
3.1 Triplane 表示
Triplane 是 LRM 中最流行的 3D 表示之一,最早由 EG3D(2022) 提出。
Triplane 将 3D 场景表示为三个正交的 2D 特征平面:
X-Y 平面(沿 Z 轴投影)Z-X 平面(沿 Y 轴投影)Y-Z 平面(沿 X 轴投影)每个平面是一个 的特征图(典型配置:)。
查询 3D 点 的特征:
只需三次 2D 特征查询 + 拼接,即可得到任意 3D 点的特征——这使得 Triplane 可以用标准的 2D 卷积网络高效处理。
3.2 Triplane 的优势与局限
| 特性 | 评价 |
|---|---|
| 内存效率 | 高(3 个 2D 平面 vs 体积) |
| 查询速度 | 快(2D 插值) |
| 表达能力 | 中等(受分辨率限制) |
| 拓扑灵活性 | 高(不预设拓扑) |
| 与 2D 生成模型结合 | 天然(共用 VAE) |
3.3 其他表示方案
Sparse NeRF / Dense Blob
- 直接预测每个空间位置的 SDF 或密度值
- 优点:端到端,概念简单
- 缺点:内存消耗大,需要特殊设计(如 Octree)
Multi-View Latent
- 先预测多视角的隐表示,再融合为 3D
- 优点:利用已有的多视角扩散模型
- 缺点:需要额外的一致性处理
Point Cloud + Graph
- 预测稀疏点云,再通过图神经网络精化
- 优点:适合编辑和交互
- 缺点:难以生成稠密表面
4. 代表性工作详解
4.1 One-2-3-45:开创前馈 3D 重建
One-2-3-45(Liu et al., ICCV 2023 / ICLR 2024)是第一个真正意义上的”前馈单图像 3D 重建”工作。
核心管线:
单张输入图像 ↓ ┌─────────────────────────────┐ │ 阶段一:多视角条件扩散模型 │ │ Zero-1-to-3 风格的 2D 扩散 │ │ 生成目标视角的 4~6 张图像 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 阶段二:基于 NeRF 的 3D 重建 │ │ 使用 NeRF-MM 等方法 │ │ 从多视角图像重建 NeRF │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 阶段三:Mesh 提取 │ │ Marching Cubes 提取 SDF Mesh │ └─────────────────────────────┘ ↓ 带纹理 3D Mesh关键创新:
- 不依赖迭代优化:将 3D 重建问题转化为”生成多视角图像 + 传统重建”的组合
- 利用预训练的 2D 扩散:Zero-1-to-3 的先验保证了多视角一致性
- 完整管线:从图像输入到带纹理 Mesh 输出,约 45 秒
局限性:
- 两阶段管线导致信息损失(2D → 3D 映射不是端到端的)
- 多视角扩散的质量限制了最终 3D 质量
- 生成时间仍较长(~45 秒)
4.2 OpenLRM:大型 Transformer 的力量
OpenLRM 是最早真正体现”Large”一词的工作,核心是一个大型 Vision-Language Transformer。
架构设计:
输入图像 ↓ 视觉编码器(ViT-L / ViT-G) ↓ 大型 Transformer 解码器 ↓ 三组 Triplane 预测头 ↓ 3D 解码器(NeRF / Mesh)关键技术:
- 大型视觉编码器:使用 OpenCLIP 的 ViT-G(1B 参数),获得强大的视觉-语言联合表示
- 三平面独立解码:每个平面由独立的 Transformer Head 预测
- 大规模 3D 预训练:在 Objaverse(~80 万资产)上训练
训练目标:
OpenLRM 采用重建损失直接优化:
其中 是渲染图像, 是深度图, 表示模型预测。
4.3 TripoSG:Rectified Flow + 高保真 SDF
TripoSG(VAST-AI Research, 2024)是 VAST-AI 团队发布的高质量 3D 生成模型,SIGGRAPH 2024 同期工作。
核心创新:
- Rectified Flow 代替 DDPM:采样效率更高,少步即可生成高质量结果
- SDF 表示:直接预测 SDF 值而非密度场,几何精度更高
- 两阶段生成:
- 阶段一:预测 SDF 场
- 阶段二:预测颜色/纹理(使用超分辨率网络)
与 TRELLIS 的关系:
TripoSG 可以视为 TRELLIS 的前身——两者都使用 Rectified Flow,但 TRELLIS 在此基础上引入了 SLAT(Structured LATent)表示,实现了真正的多格式输出能力。
4.4 InstantMesh:前馈高效 Mesh 生成
InstantMesh(Tencent ARC, 2024)专注于快速生成可直接使用的 3D Mesh。
核心设计:
单张图像 ↓ ┌─────────────────────────────┐ │ 大型 Vision Transformer │ │ 预测多视角图像序列 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ Sparse-view 3D 重建网络 │ │ (基于 Transformer) │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 几何细化模块 │ │ (基于 Marching Cubes 的 │ │ differentiable 采样) │ └────────────┬────────────────┘ ↓ 3D Mesh关键技术:
- 抗锯齿渲染:引入多尺度渲染策略,解决高分辨率下的锯齿问题
- 可微 Marching Cubes:端到端可训练的几何提取
- 快速推理:单张 A100 上约 10 秒生成
4.5 SPAR3D:实时编辑与完整结构生成
SPAR3D(Stable Point Aware 3D, Stability AI, CES 2025)代表了 LRM 的最新进展。
核心洞察:
将 3D 生成分解为两个独立子任务——结构生成(点云)和表面生成(Mesh)——可以同时获得精确的几何和灵活的编辑能力。
两阶段架构:
单张输入图像 ↓ ┌─────────────────────────────┐ │ 阶段一:点扩散模型 │ │ 生成稀疏点云(3D 结构) │ │ ~0.4 秒 │ └────────────┬────────────────┘ ↓ ┌─────────────────────────────┐ │ 阶段二:Triplane Transformer │ │ 接收点云 + 原始图像特征 │ │ 生成高分辨率 Triplane │ │ → 最终 Mesh │ │ ~0.3 秒 │ └─────────────────────────────┘ ↓ 高质量 Mesh + 实时编辑关键创新:
- 点云作为中间表示:用户可以直接编辑点云(删除、复制、拉伸、添加)
- 精确背面预测:提供完整的 360° 结构预测,包括通常不可见的背面
- 闪电级生成:从单张图像到高质量 Mesh 仅需 0.7 秒
5. LRM 的技术路线对比
5.1 两条主流路线
| 路线 | 代表工作 | 核心思想 | 输出质量 | 生成速度 |
|---|---|---|---|---|
| 多视角扩散 + 重建 | One-2-3-45, Zero-1-to-3 | 先生成多视角图像,再重建 3D | 高 | 较慢(~45s) |
| 端到端 Transformer | OpenLRM, TripoSG | 直接从图像预测 3D 表示 | 最高 | 快(~10s) |
5.2 各方法详细对比
| 方法 | 主干网络 | 3D 表示 | 输出格式 | 训练数据 | 参数量 | 推理时间 |
|---|---|---|---|---|---|---|
| One-2-3-45 | SD + NeRF-MM | NeRF → Mesh | Mesh | Objaverse | ~2B | ~45s |
| Zero-1-to-3 | SD-XL | 多视角图像 | 图像序列 | LAION-5B | ~3B | ~30s |
| OpenLRM | ViT-G + Transformer | Triplane | RF / Mesh | Objaverse | ~5B | ~10s |
| TripoSG | SD + RF-Transformer | SDF Triplane | Mesh | Objaverse | ~2B | ~8s |
| InstantMesh | ViT + Transformer | Mesh 直接预测 | Mesh | Objaverse | ~1B | ~10s |
| SPAR3D | Point Diffusion + Triplane | Point → Mesh | Mesh | Objaverse+ | ~1B | ~0.7s |
6. 训练策略与损失函数
6.1 多视角渲染监督
大多数 LRM 的训练依赖于多视角渲染监督:
其中:
- :预测的 3D 表示(Triplane / SDF / Mesh)
- :可微渲染器(NeRF 体积渲染 / 屏幕空间渲染)
- :第 个相机位姿和对应的真实图像
6.2 几何正则化
为防止模型生成”病态”的 3D 结构,通常引入几何正则化项:
其中:
- :拉普拉斯平滑项,防止法线突变
- :Eikonal 项(SDF 场景使用),保证
6.3 CLIP / DINO 对比学习
部分方法(如 OpenLRM)还引入视觉语言对齐损失,利用 CLIP 或 DINO 的预训练表示:
这确保生成的 3D 资产在语义上与输入图像保持一致。
7. 核心数学公式汇总
- Triplane 特征查询:
- Eikonal 正则化:
- 多视角渲染损失:
- SDS 损失(第一代方法):
- Rectified Flow ODE(TripoSG / TRELLIS 使用):
- CLIP 对齐损失:
8. 应用场景与工程实践
8.1 游戏与影视
- 概念艺术:从草图快速生成 3D 概念模型
- 场景布置:AI 生成 + 人工精调的混合工作流
- 资产库扩充:批量生成多样化的 3D 资产
8.2 电商与数字人
- 商品展示:单张照片生成可 360° 查看的商品模型
- 虚拟试穿:用户照片 → 3D 人体模型
- 数字分身:Avatar 自动生成
8.3 机器人与自动驾驶
- 物体识别前哨:单视角 2D 图像 → 3D 几何用于规划
- 仿真数据生成:大量合成 3D 场景用于训练
- 抓取规划:快速获取物体几何用于抓取策略学习
8.4 工业设计与建筑
- 概念验证:快速 3D 原型
- 逆向工程:扫描物体 → 可编辑 CAD 模型
- 建筑可视化:照片 → BIM 模型
9. 当前局限与未来方向
9.1 当前局限
| 局限 | 描述 | 典型案例 |
|---|---|---|
| 纹理质量 | 生成纹理的清晰度和真实性仍有提升空间 | 复杂材质(金属、毛发) |
| 语义一致性 | Janus 问题(同一语义出现在多个位置) | 人物的手、脚 |
| 编辑可控性 | 前馈生成后难以精准编辑 | 需要反演方法 |
| 训练数据偏差 | 对训练数据分布过度依赖 | 特定类别(车辆 > 家具) |
| 推理资源 | 大型模型(5B+)难以在消费级 GPU 运行 | 实时应用 |
9.2 未来方向
| 方向 | 描述 | 代表工作 |
|---|---|---|
| 更高质量 | 提升几何精度和纹理质量 | TripoSG-2, InstantMesh-2 |
| 实时推理 | 压缩模型、蒸馏、量化 | TinyLRM, MobileLRM |
| 局部编辑 | 结合 3DGS 的编辑能力 | LRM + Gaussian 编辑 |
| 文本控制 | 从文本直接生成 3D(无图像输入) | OpenLRM-text |
| 4D 生成 | 加入时间维度的动态 3D 生成 | LRM-4D |
| 世界模型 | 从单图像生成完整 3D 场景 | Scene-LRM |
| 工业集成 | 与 CAD、游戏引擎的深度集成 | Omniverse 插件 |
10. 总结
LRM 的核心贡献
- 前馈推理:将 3D 生成从”每样本迭代优化”转变为”一次性前馈预测”
- 秒级生成:从数十分钟缩短到 10 秒以内(SPAR3D ~0.7 秒)
- 大规模预训练:证明了 3D 数据 + 大型模型 = 强泛化的 3D 生成能力
- 多格式输出:从 Triplane 到 Mesh / RF / 3DGS 的灵活解码
LRM 与 TRELLIS / 3DGS 的关系
LRM 是 3D 生成领域的推理范式革新:
- LRM 解决的是”如何快速从 2D 生成 3D”的问题(前馈 vs 优化)
- 3DGS 解决的是”如何高效渲染 3D 表示”的问题(高斯 vs 采样)
- TRELLIS 则将两者结合:LRM 生成 SLAT → 3DGS 渲染 SLAT
三者共同构成了现代 3D 生成管线的三个核心组件:生成(LRM)→ 表示(SLAT)→ 渲染(3DGS)。
发展趋势
- 质量趋近手工:LRM 生成质量正在快速接近人工建模
- 速度趋近实时:从分钟级到亚秒级,实时应用成为可能
- 控制趋于精细:从”随机生成”到”局部编辑”到”精确控制”
- 领域趋于融合:3D 生成 + 物理仿真 + 神经渲染的端到端管线
LRM 代表了 3D 生成从”实验室研究”走向”工业生产”的转折点。 随着模型规模的增长、训练数据的丰富、以及工程优化的深入,LRM 有望在游戏、影视、电商、机器人等领域催生出全新的创作范式和商业应用。
参考资料
- Liu, M., et al. (2023). “One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Multi-View Training.” ICLR 2024.
- Tang, J., et al. (2023). “Zero-1-to-3: Zero-shot One Image to 3D Object.” ICCV 2023.
- “OpenLRM: Large Reconstruction Model for Single Image to 3D.” GitHub: Axecting/OpenLRM.
- “TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models.” GitHub: VAST-AI-Research/TripoSG.
- “InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models.” GitHub: TencentARC/InstantMesh.
- “SPAR3D: Stable Point Aware 3D.” Stability AI, 2025. GitHub: stabilityai/stable-point-aware-3d.
- Xiang, J., et al. (2024). “Structured 3D Latents for Scalable and Versatile 3D Generation.” CVPR 2025 (Spotlight).
- Chan, E. R., et al. (2022). “EG3D: Efficient Geometry-aware 3D Generative Adversarial Networks.” CVPR 2022.
- Poole, B., et al. (2022). “DreamFusion: Text-to-3D using 2D Diffusion.” ICLR 2023.
- Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” ACM TOG (SIGGRAPH).
- Deitke, M., et al. (2023). “Objaverse: A Universe of Annotated 3D Objects.” CVPR 2023.
- Kirillova, A., et al. (2023). “RealFusion: 360° Reconstruction of Any Object from a Single Image.” CVPR 2023.
- Li, W., et al. (2023). “大米饭/DreamGaussian.” GitHub.
- Wang, H., et al. (2023). “LucidDreamer: Domain-Free 3D Animate. Generation via Single-Image 3D Prior.” SIGGRAPH Asia 2023.
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!

