描述
DreamFusion 在文本到 3D 合成方面取得了重大进展,克服了现有方法需要大规模 3D 数据集和专用架构的局限性。该 AI 模型利用预训练的 2D 文本到图像扩散模型(如 Imagen)作为强大的先验来生成 3D 内容。核心创新在于一种基于概率密度蒸馏的新型损失函数,它允许 2D 扩散模型指导参数化 3D 表示的优化。
其核心是,DreamFusion 采用类似 DeepDream 的优化过程。它初始化一个 3D 模型,特别是神经辐射场 (NeRF),并通过梯度下降对其进行迭代优化。目标是最小化从不同角度渲染 NeRF 的 2D 图像的损失函数。使用预训练的 2D 扩散模型根据文本提示评估这些渲染图像。这种方法有效地将 2D 模型中数十亿图像-文本对所包含的知识蒸馏成连贯的 3D 表示。
生成的 3D 模型用途广泛。它们可以从任何角度进行查看,从而可以进行全面的检查并集成到各种视觉环境中。此外,生成的对象是可重新照明的,这意味着它们的外观可以通过任意照明进行操纵,并且可以无缝地合成到现有的 3D 环境中。这种灵活性使 DreamFusion 成为创作者和开发者的宝贵工具。
DreamFusion 的方法不需要 3D 训练数据,也不需要修改底层图像扩散模型,这凸显了利用预训练模型作为先验的有效性。生成的 NeRF 展现出高保真度的外观、准确的深度信息和详细的法线。对于实际应用,可以使用 Marching Cubes 等算法将这些 NeRF 模型导出为标准网格格式,从而方便集成到流行的 3D 渲染器和建模软件中。该项目还展示了将生成的对象合成到场景中的示例,并提供了一个包含数百个生成资产的图库。
DreamFusion亮点
从文本提示生成 3D 对象
利用预训练的 2D 扩散模型作为先验
创建神经辐射场 (NeRF)
无需 3D 训练数据
无需修改图像扩散模型
输出可重新照明的 3D 模型
支持任意照明
允许合成到 3D 环境中
生成高保真度的外观、深度和法线
通过 Marching Cubes 进行网格导出功能
使用 Score Distillation Sampling (SDS) 进行生成
包含用于几何改进的正则化器和优化策略
DreamFusion入门
输入文本提示:为所需的 3D 对象提供描述性标题。
模型优化:DreamFusion 使用 2D 扩散模型作为先验来优化 3D NeRF 模型。
渲染和评估:从随机角度渲染 NeRF,并根据文本提示评估其 2D 图像。
迭代优化:梯度下降调整 NeRF 参数以最小化损失,提高连贯性和外观。
网格导出:优化后,可以将 NeRF 转换为网格,以便在其他 3D 软件中使用。
DreamFusion的使用案例
- 3D 资产生成
- 原型设计
- 内容创作
- 研究与开发
- 虚拟世界构建
- 教育工具






