从图像到 3D 仅需 5 秒:LGM 开启 3D 生成的“大模型”时代

在 AIGC 领域,我们见证了从 DALL-E 到 Midjourney 的文字转图像革命,也经历了 Sora 带来的视频生成震撼。然而,高质量 3D 内容的生成一直是一块硬骨头。传统的 SDS(Score Distillation Sampling)方法虽然能产出不错的结果,但动辄数十分钟甚至数小时的迭代优化时间,让其实际应用场景大打折扣。

今天我们要聊的是 LGM (Large Gaussian Model),这是一个由 3DTopia 团队推出的、能够实现“秒级”高质量 3D 建模的框架。它不仅改变了生成速度,更展示了 3D 表征从隐式向显式演进的技术魅力。

什么是 LGM?

LGM 全称 Large Gaussian Model(大规模高斯模型)。它的核心目标非常明确:实现从单张图像到高分辨率 3D 模型的高速生成

与以往基于 NeRF(神经辐射场)或单纯网格优化的方法不同,LGM 巧妙地结合了 3D Gaussian Splatting (3DGS) 这一革命性的渲染技术,并采用了一种**前馈式(Feed-forward)**的架构。这意味着它不再需要针对每一个物体进行昂贵的反复迭代优化,而是像图像识别一样,通过一次模型前向推理直接输出 3D 数据。

核心技术特点

1. 显式 3D 高斯表征

LGM 选择了 3D Gaussian Splatting 作为其核心表征。相比于 NeRF 的 MLP 隐式表示,3D 高斯是显式的点云形式,每个点包含位置、旋转、缩放、不透明度和球谐函数(颜色)。这种表征方式天生具备极快的渲染速度和极高的细节捕捉能力。

2. 非对称 U-Net 骨干网络

LGM 设计了一个强大的非对称 U-Net 结构。由于 3D 生成本质上需要处理多视图信息,该网络通过融合多视角生成的 2D 特征,直接预测出数以万计的 3D 高斯点。这种架构能够处理高达 512x512 分辨率的输入,确保了生成的 3D 模型具有精细的纹理。

3. 多视图扩散作为先验

单纯靠一张图很难补全背后的信息。LGM 通常配合多视图扩散模型(如 MVDream 或 ImageDream)使用。先将单图转化为四个视角的正交图像,再由 LGM 将这些视图“缝合”并转化为完整的 3D 高斯模型。

4. 极速推理

这是 LGM 最具杀伤力的优势。在单块 NVIDIA A100 上,它可以在 5 秒钟内完成从图像到 3D 高斯模型的转换。这种速度让实时 3D 内容生成从可能变成了现实。

代码示例:快速上手

如果你想在本地尝试 LGM,其官方仓库提供了简洁的接口。以下是一个简化的推理流程示意:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
import torch
from lgm.models import LGM
from lgm.utils import save_ply

# 加载预训练模型
model = LGM.from_pretrained("3DTopia/LGM_base")
model.to("cuda")

# 准备输入:经过多视图扩散生成的 4 张视角图 [1, 4, 3, 512, 512]
input_imgs = load_multiview_images("path/to/views").to("cuda")

# 执行前向推理
with torch.no_grad():
# 直接预测 3D 高斯参数
gaussians = model.predict_gaussians(input_imgs)

# 将结果保存为可查看的 .ply 格式
save_ply(gaussians, "output_model.ply")

应用场景

  • 游戏资产生成:开发者可以快速生成大量的 NPC、道具或场景装饰物的初稿,极大缩短资产制作周期。
  • 电商 3D 展示:只需拍摄一张商品照片,即可自动生成 3D 模型,用于 VR 试穿或网页端的 360 度交互展示。
  • 虚拟现实(VR/AR):在元宇宙场景中,用户可以即时拍摄现实物体并将其“搬进”虚拟世界。
  • AI 辅助设计:工业设计师可以快速验证创意,将 2D 草图转化为空间概念模型。

未来展望

LGM 的出现标志着 3D 生成正在步入“大模型化”。未来的方向可能会集中在以下几点:

  1. 更强的泛化性:目前的模型在处理复杂几何结构(如镂空、精细机械件)时仍有进步空间。
  2. 拓扑一致性:将生成的 3D 高斯模型更完美地转化为带骨骼绑定的 Mesh(网格),以便于传统动画管线调用。
  3. 时序生成:从生成静态 3D 模型进化到生成带动作的动态 3D 内容。

总结

3DTopia/LGM 的突破在于它找到了速度与质量的最佳平衡点。通过引入 3D Gaussian Splatting 和高效的前馈网络,它打破了 3D 生成长久以来的“效率壁垒”。

虽然现在的 3D 高斯模型在导出为标准 CAD 或游戏引擎格式时仍需额外的处理步骤,但 LGM 已经为我们展示了一个令人兴奋的未来:在这个未来里,创作一个 3D 世界就像按下快门一样简单。随着算力和算法的进一步迭代,3D 内容的生产门槛将被彻底抹平。