深度解析 LRM:大型重建模型与单图像 3D 重建的突破

3879 字
19 分钟
深度解析 LRM:大型重建模型与单图像 3D 重建的突破

1. 引言:从”数十小时”到”十秒钟”#

1.1 传统 3D 生成的困境#

在 LRM 出现之前,单张图像到 3D 资产生成面临一个根本性的效率问题:

DreamFusion 路线(2022-2023 年主流):

单张图像 + 文本提示
2D 扩散模型(SDS 损失)
NeRF 逐样本优化
~数小时(单个资产)

每生成一个 3D 资产都需要数十分钟到数小时的优化过程,这使得 3D 生成无法用于任何实际的生产场景。

1.2 LRM 的核心思想#

大型重建模型(Large Reconstruction Model, LRM) 的核心洞察来自一个简单的问题:

如果我们训练一个足够大的神经网络,直接从单张图像预测 3D 表示——而不是对每个样本进行迭代优化——能否实现秒级的 3D 资产生成?

答案是:完全可以

LRM 通过以下方式实现这一突破:

  1. 大规模 3D 数据预训练:在数十万到数百万的 3D 资产数据集(Objaverse、GSO 等)上训练
  2. 3D 原生的表示设计:设计支持高效推理的 3D 表示(如 Triplane、Dense Blob)
  3. 大型 Vision-Language 模型的知识迁移:利用预训练的 CLIP/DINO 等视觉模型的知识

1.3 LRM 的时间线#

年份方法核心创新生成时间
2023One-2-3-45开创前馈 3D 重建~45 秒
2023Zero-1-to-3稀疏视角扩散引导重建~10-30 秒
2024OpenLRM大型 Transformer + Triplane~10 秒
2024TripoSGRectified Flow + 高质量 SDF~8 秒
2024InstantMesh前馈 Mesh 生成 + 抗锯齿~10 秒
2025SPAR3D点扩散 + Triplane Transformer~0.7 秒

2. LRM 的技术基础#

2.1 为什么需要大型预训练?#

早期 3D 重建方法(如 COLMAP + Multi-View Stereo)严重依赖多视角一致性——没有足够多的视角,就无法恢复可靠的 3D 结构。

但单张图像本身隐含了丰富的 3D 信息

  • 纹理梯度暗示表面朝向(Shading / Specularity)
  • 遮挡关系暗示物体深度顺序
  • 先验知识(来自大规模 2D 图像的语义理解)

大型预训练模型的核心价值,是将 2D 图像中隐含的 3D 先验”蒸馏”到可泛化的神经网络权重中。

2.2 LRM vs SDS 优化#

这是两种截然不同的 3D 生成范式:

维度SDS 优化路线LRM 前馈路线
推理范式每个样本迭代优化一次性前馈预测
推理时间30 分钟 ~ 数小时5 ~ 60 秒
模型参数小型 MLP(NeRF) + 固定 2D 扩散大型 Transformer / Diffusion(数亿参数)
3D 先验间接(通过 2D 扩散引导)直接(从 3D 数据学习)
泛化能力受 2D 扩散质量限制受 3D 数据规模和多样性限制
编辑灵活性高(迭代过程中可干预)低(一次性生成)
多视角一致性中等(SDS 伪损失)高(端到端训练保证)

2.3 LRM 的三大挑战#

尽管 LRM 前景广阔,它必须解决三个核心问题:

挑战一:3D 数据稀缺

  • 2D 图像:互联网规模(数十亿张)
  • 3D 资产:高质量标注数据极为稀缺(Objaverse ~80 万,GSO ~1000)
  • 解决方案:数据增强(多视角渲染)、合成数据、伪标签

挑战二:3D 表示的选择

  • 3D 体积表示(NeRF / Voxel):内存爆炸,O(N3)O(N^3)
  • 3D 表面表示(SDF / Mesh):拓扑变化难以建模
  • 2.5D 表示(Triplane / Depth):内存高效但需要解码器

挑战三:几何一致性

  • 单张图像缺少多视角约束
  • 需要足够强的 3D 先验来”填补”缺失信息
  • 需要避免”Janus 问题”(同一语义出现在多个位置)

3. 核心表示:Triplane 与相关表示#

3.1 Triplane 表示#

Triplane 是 LRM 中最流行的 3D 表示之一,最早由 EG3D(2022) 提出。

Triplane 将 3D 场景表示为三个正交的 2D 特征平面

X-Y 平面(沿 Z 轴投影)
Z-X 平面(沿 Y 轴投影)
Y-Z 平面(沿 X 轴投影)

每个平面是一个 H×W×CH \times W \times C 的特征图(典型配置:H=W=256,C=80H=W=256, C=80)。

查询 3D 点 p=(x,y,z)\mathbf{p} = (x, y, z) 的特征

f(p)=Concat(Fxy(x,y),Fyz(y,z),Fzx(z,x))\mathbf{f}(\mathbf{p}) = \text{Concat}\left( F_{xy}(x, y), F_{yz}(y, z), F_{zx}(z, x) \right)

只需三次 2D 特征查询 + 拼接,即可得到任意 3D 点的特征——这使得 Triplane 可以用标准的 2D 卷积网络高效处理。

3.2 Triplane 的优势与局限#

特性评价
内存效率高(3 个 2D 平面 vs 2563256^3 体积)
查询速度快(2D 插值)
表达能力中等(受分辨率限制)
拓扑灵活性高(不预设拓扑)
与 2D 生成模型结合天然(共用 VAE)

3.3 其他表示方案#

Sparse NeRF / Dense Blob

  • 直接预测每个空间位置的 SDF 或密度值
  • 优点:端到端,概念简单
  • 缺点:内存消耗大,需要特殊设计(如 Octree)

Multi-View Latent

  • 先预测多视角的隐表示,再融合为 3D
  • 优点:利用已有的多视角扩散模型
  • 缺点:需要额外的一致性处理

Point Cloud + Graph

  • 预测稀疏点云,再通过图神经网络精化
  • 优点:适合编辑和交互
  • 缺点:难以生成稠密表面

4. 代表性工作详解#

4.1 One-2-3-45:开创前馈 3D 重建#

One-2-3-45(Liu et al., ICCV 2023 / ICLR 2024)是第一个真正意义上的”前馈单图像 3D 重建”工作。

核心管线

单张输入图像
┌─────────────────────────────┐
│ 阶段一:多视角条件扩散模型 │
│ Zero-1-to-3 风格的 2D 扩散 │
│ 生成目标视角的 4~6 张图像 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 阶段二:基于 NeRF 的 3D 重建 │
│ 使用 NeRF-MM 等方法 │
│ 从多视角图像重建 NeRF │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 阶段三:Mesh 提取 │
│ Marching Cubes 提取 SDF Mesh │
└─────────────────────────────┘
带纹理 3D Mesh

关键创新

  1. 不依赖迭代优化:将 3D 重建问题转化为”生成多视角图像 + 传统重建”的组合
  2. 利用预训练的 2D 扩散:Zero-1-to-3 的先验保证了多视角一致性
  3. 完整管线:从图像输入到带纹理 Mesh 输出,约 45 秒

局限性

  • 两阶段管线导致信息损失(2D → 3D 映射不是端到端的)
  • 多视角扩散的质量限制了最终 3D 质量
  • 生成时间仍较长(~45 秒)

4.2 OpenLRM:大型 Transformer 的力量#

OpenLRM 是最早真正体现”Large”一词的工作,核心是一个大型 Vision-Language Transformer

架构设计

输入图像
视觉编码器(ViT-L / ViT-G)
大型 Transformer 解码器
三组 Triplane 预测头
3D 解码器(NeRF / Mesh)

关键技术

  1. 大型视觉编码器:使用 OpenCLIP 的 ViT-G(1B 参数),获得强大的视觉-语言联合表示
  2. 三平面独立解码:每个平面由独立的 Transformer Head 预测
  3. 大规模 3D 预训练:在 Objaverse(~80 万资产)上训练

训练目标

OpenLRM 采用重建损失直接优化:

L=E(I,M)[Lrgb(I^,I)+λLdepth(D^,D)]\mathcal{L} = \mathbb{E}_{(\mathbf{I}, \mathbf{M})} \left[ \mathcal{L}_{\text{rgb}}(\hat{\mathbf{I}}, \mathbf{I}) + \lambda \cdot \mathcal{L}_{\text{depth}}(\hat{\mathbf{D}}, \mathbf{D}) \right]

其中 I\mathbf{I} 是渲染图像,D\mathbf{D} 是深度图,^\hat{\cdot} 表示模型预测。

4.3 TripoSG:Rectified Flow + 高保真 SDF#

TripoSG(VAST-AI Research, 2024)是 VAST-AI 团队发布的高质量 3D 生成模型,SIGGRAPH 2024 同期工作。

核心创新

  1. Rectified Flow 代替 DDPM:采样效率更高,少步即可生成高质量结果
  2. SDF 表示:直接预测 SDF 值而非密度场,几何精度更高
  3. 两阶段生成
    • 阶段一:预测 SDF 场
    • 阶段二:预测颜色/纹理(使用超分辨率网络)

与 TRELLIS 的关系

TripoSG 可以视为 TRELLIS 的前身——两者都使用 Rectified Flow,但 TRELLIS 在此基础上引入了 SLAT(Structured LATent)表示,实现了真正的多格式输出能力。

4.4 InstantMesh:前馈高效 Mesh 生成#

InstantMesh(Tencent ARC, 2024)专注于快速生成可直接使用的 3D Mesh

核心设计

单张图像
┌─────────────────────────────┐
│ 大型 Vision Transformer │
│ 预测多视角图像序列 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ Sparse-view 3D 重建网络 │
│ (基于 Transformer) │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 几何细化模块 │
│ (基于 Marching Cubes 的 │
│ differentiable 采样) │
└────────────┬────────────────┘
3D Mesh

关键技术

  1. 抗锯齿渲染:引入多尺度渲染策略,解决高分辨率下的锯齿问题
  2. 可微 Marching Cubes:端到端可训练的几何提取
  3. 快速推理:单张 A100 上约 10 秒生成

4.5 SPAR3D:实时编辑与完整结构生成#

SPAR3D(Stable Point Aware 3D, Stability AI, CES 2025)代表了 LRM 的最新进展。

核心洞察

将 3D 生成分解为两个独立子任务——结构生成(点云)和表面生成(Mesh)——可以同时获得精确的几何和灵活的编辑能力。

两阶段架构

单张输入图像
┌─────────────────────────────┐
│ 阶段一:点扩散模型 │
│ 生成稀疏点云(3D 结构) │
│ ~0.4 秒 │
└────────────┬────────────────┘
┌─────────────────────────────┐
│ 阶段二:Triplane Transformer │
│ 接收点云 + 原始图像特征 │
│ 生成高分辨率 Triplane │
│ → 最终 Mesh │
│ ~0.3 秒 │
└─────────────────────────────┘
高质量 Mesh + 实时编辑

关键创新

  1. 点云作为中间表示:用户可以直接编辑点云(删除、复制、拉伸、添加)
  2. 精确背面预测:提供完整的 360° 结构预测,包括通常不可见的背面
  3. 闪电级生成:从单张图像到高质量 Mesh 仅需 0.7 秒

5. LRM 的技术路线对比#

5.1 两条主流路线#

路线代表工作核心思想输出质量生成速度
多视角扩散 + 重建One-2-3-45, Zero-1-to-3先生成多视角图像,再重建 3D较慢(~45s)
端到端 TransformerOpenLRM, TripoSG直接从图像预测 3D 表示最高快(~10s)

5.2 各方法详细对比#

方法主干网络3D 表示输出格式训练数据参数量推理时间
One-2-3-45SD + NeRF-MMNeRF → MeshMeshObjaverse~2B~45s
Zero-1-to-3SD-XL多视角图像图像序列LAION-5B~3B~30s
OpenLRMViT-G + TransformerTriplaneRF / MeshObjaverse~5B~10s
TripoSGSD + RF-TransformerSDF TriplaneMeshObjaverse~2B~8s
InstantMeshViT + TransformerMesh 直接预测MeshObjaverse~1B~10s
SPAR3DPoint Diffusion + TriplanePoint → MeshMeshObjaverse+~1B~0.7s

6. 训练策略与损失函数#

6.1 多视角渲染监督#

大多数 LRM 的训练依赖于多视角渲染监督

Lmv=i=1NviewRender(M^,ci)Iigt1\mathcal{L}_{\text{mv}} = \sum_{i=1}^{N_{\text{view}}} \left\| \text{Render}(\hat{\mathcal{M}}, \mathbf{c}_i) - \mathbf{I}_i^{\text{gt}} \right\|_1

其中:

  • M^\hat{\mathcal{M}}:预测的 3D 表示(Triplane / SDF / Mesh)
  • Render\text{Render}:可微渲染器(NeRF 体积渲染 / 屏幕空间渲染)
  • ci,Iigt\mathbf{c}_i, \mathbf{I}_i^{\text{gt}}:第 ii 个相机位姿和对应的真实图像

6.2 几何正则化#

为防止模型生成”病态”的 3D 结构,通常引入几何正则化项:

Lgeo=λ1Lsmooth+λ2Leikonal\mathcal{L}_{\text{geo}} = \lambda_1 \mathcal{L}_{\text{smooth}} + \lambda_2 \mathcal{L}_{\text{eikonal}}

其中:

  • Lsmooth\mathcal{L}_{\text{smooth}}:拉普拉斯平滑项,防止法线突变
  • Leikonal\mathcal{L}_{\text{eikonal}}:Eikonal 项(SDF 场景使用),保证 s(x)1| \nabla s(\mathbf{x}) | \approx 1

6.3 CLIP / DINO 对比学习#

部分方法(如 OpenLRM)还引入视觉语言对齐损失,利用 CLIP 或 DINO 的预训练表示:

Lclip=1sim(CLIP(I^),CLIP(Iinput))\mathcal{L}_{\text{clip}} = 1 - \text{sim}\left( \text{CLIP}(\hat{\mathbf{I}}), \text{CLIP}(\mathbf{I}_{\text{input}}) \right)

这确保生成的 3D 资产在语义上与输入图像保持一致。

7. 核心数学公式汇总#

  1. Triplane 特征查询
f(p)=Concat(Fxy(x,y),Fyz(y,z),Fzx(z,x))\mathbf{f}(\mathbf{p}) = \text{Concat}\left( F_{xy}(x, y), F_{yz}(y, z), F_{zx}(z, x) \right)
  1. Eikonal 正则化
Leikonal=ExX[(s(x)1)2]\mathcal{L}_{\text{eikonal}} = \mathbb{E}_{\mathbf{x} \sim \mathcal{X}} \left[ \left( \| \nabla s(\mathbf{x}) \| - 1 \right)^2 \right]
  1. 多视角渲染损失
Lmv=Ec,M[iRender(M^,ci)Iigt1]\mathcal{L}_{\text{mv}} = \mathbb{E}_{\mathbf{c}, \mathbf{M}} \left[ \sum_i \left\| \text{Render}(\hat{\mathcal{M}}, \mathbf{c}_i) - \mathbf{I}_i^{\text{gt}} \right\|_1 \right]
  1. SDS 损失(第一代方法)
LSDS=Et,ϵ[w(t)θlogpϕ(gθ(ϵ,t);c)]\mathcal{L}_{\text{SDS}} = \mathbb{E}_{t, \epsilon} \left[ w(t) \cdot \nabla_\theta \log p_\phi(\mathbf{g}_\theta(\epsilon, t); c) \right]
  1. Rectified Flow ODE(TripoSG / TRELLIS 使用)
dxtdt=vθ(xt,t,c),xt=(1t)x0+tx1\frac{d x_t}{dt} = v_\theta(x_t, t, c), \quad x_t = (1 - t) \cdot x_0 + t \cdot x_1
  1. CLIP 对齐损失
Lclip=1Encclip(I^)Encclip(I)Encclip(I^)Encclip(I)\mathcal{L}_{\text{clip}} = 1 - \frac{\text{Enc}_{\text{clip}}(\hat{\mathbf{I}}) \cdot \text{Enc}_{\text{clip}}(\mathbf{I})}{\| \text{Enc}_{\text{clip}}(\hat{\mathbf{I}}) \| \cdot \| \text{Enc}_{\text{clip}}(\mathbf{I}) \|}

8. 应用场景与工程实践#

8.1 游戏与影视#

  • 概念艺术:从草图快速生成 3D 概念模型
  • 场景布置:AI 生成 + 人工精调的混合工作流
  • 资产库扩充:批量生成多样化的 3D 资产

8.2 电商与数字人#

  • 商品展示:单张照片生成可 360° 查看的商品模型
  • 虚拟试穿:用户照片 → 3D 人体模型
  • 数字分身:Avatar 自动生成

8.3 机器人与自动驾驶#

  • 物体识别前哨:单视角 2D 图像 → 3D 几何用于规划
  • 仿真数据生成:大量合成 3D 场景用于训练
  • 抓取规划:快速获取物体几何用于抓取策略学习

8.4 工业设计与建筑#

  • 概念验证:快速 3D 原型
  • 逆向工程:扫描物体 → 可编辑 CAD 模型
  • 建筑可视化:照片 → BIM 模型

9. 当前局限与未来方向#

9.1 当前局限#

局限描述典型案例
纹理质量生成纹理的清晰度和真实性仍有提升空间复杂材质(金属、毛发)
语义一致性Janus 问题(同一语义出现在多个位置)人物的手、脚
编辑可控性前馈生成后难以精准编辑需要反演方法
训练数据偏差对训练数据分布过度依赖特定类别(车辆 > 家具)
推理资源大型模型(5B+)难以在消费级 GPU 运行实时应用

9.2 未来方向#

方向描述代表工作
更高质量提升几何精度和纹理质量TripoSG-2, InstantMesh-2
实时推理压缩模型、蒸馏、量化TinyLRM, MobileLRM
局部编辑结合 3DGS 的编辑能力LRM + Gaussian 编辑
文本控制从文本直接生成 3D(无图像输入)OpenLRM-text
4D 生成加入时间维度的动态 3D 生成LRM-4D
世界模型从单图像生成完整 3D 场景Scene-LRM
工业集成与 CAD、游戏引擎的深度集成Omniverse 插件

10. 总结#

LRM 的核心贡献#

  1. 前馈推理:将 3D 生成从”每样本迭代优化”转变为”一次性前馈预测”
  2. 秒级生成:从数十分钟缩短到 10 秒以内(SPAR3D ~0.7 秒)
  3. 大规模预训练:证明了 3D 数据 + 大型模型 = 强泛化的 3D 生成能力
  4. 多格式输出:从 Triplane 到 Mesh / RF / 3DGS 的灵活解码

LRM 与 TRELLIS / 3DGS 的关系#

LRM 是 3D 生成领域的推理范式革新

  • LRM 解决的是”如何快速从 2D 生成 3D”的问题(前馈 vs 优化)
  • 3DGS 解决的是”如何高效渲染 3D 表示”的问题(高斯 vs 采样)
  • TRELLIS 则将两者结合:LRM 生成 SLAT → 3DGS 渲染 SLAT

三者共同构成了现代 3D 生成管线的三个核心组件:生成(LRM)→ 表示(SLAT)→ 渲染(3DGS)。

发展趋势#

  1. 质量趋近手工:LRM 生成质量正在快速接近人工建模
  2. 速度趋近实时:从分钟级到亚秒级,实时应用成为可能
  3. 控制趋于精细:从”随机生成”到”局部编辑”到”精确控制”
  4. 领域趋于融合:3D 生成 + 物理仿真 + 神经渲染的端到端管线

LRM 代表了 3D 生成从”实验室研究”走向”工业生产”的转折点。 随着模型规模的增长、训练数据的丰富、以及工程优化的深入,LRM 有望在游戏、影视、电商、机器人等领域催生出全新的创作范式和商业应用。

参考资料#

  1. Liu, M., et al. (2023). “One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Multi-View Training.” ICLR 2024.
  2. Tang, J., et al. (2023). “Zero-1-to-3: Zero-shot One Image to 3D Object.” ICCV 2023.
  3. “OpenLRM: Large Reconstruction Model for Single Image to 3D.” GitHub: Axecting/OpenLRM.
  4. “TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models.” GitHub: VAST-AI-Research/TripoSG.
  5. “InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models.” GitHub: TencentARC/InstantMesh.
  6. “SPAR3D: Stable Point Aware 3D.” Stability AI, 2025. GitHub: stabilityai/stable-point-aware-3d.
  7. Xiang, J., et al. (2024). “Structured 3D Latents for Scalable and Versatile 3D Generation.” CVPR 2025 (Spotlight).
  8. Chan, E. R., et al. (2022). “EG3D: Efficient Geometry-aware 3D Generative Adversarial Networks.” CVPR 2022.
  9. Poole, B., et al. (2022). “DreamFusion: Text-to-3D using 2D Diffusion.” ICLR 2023.
  10. Kerbl, B., et al. (2023). “3D Gaussian Splatting for Real-Time Radiance Field Rendering.” ACM TOG (SIGGRAPH).
  11. Deitke, M., et al. (2023). “Objaverse: A Universe of Annotated 3D Objects.” CVPR 2023.
  12. Kirillova, A., et al. (2023). “RealFusion: 360° Reconstruction of Any Object from a Single Image.” CVPR 2023.
  13. Li, W., et al. (2023). “大米饭/DreamGaussian.” GitHub.
  14. Wang, H., et al. (2023). “LucidDreamer: Domain-Free 3D Animate. Generation via Single-Image 3D Prior.” SIGGRAPH Asia 2023.

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

深度解析 LRM:大型重建模型与单图像 3D 重建的突破
https://aiattnstudio.link/posts/lrm/
作者
Federico
发布于
2026-07-16
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author

Federico

AI Research Lab

Hello, I'm Federico.

关于实验室 / About
公告

欢迎来到Federico的个人博客

分类
标签
站点统计
57文章
7分类
404标签