Описание
DreamFusion представляет собой значительный прорыв в синтезе 3D-объектов из текста, преодолевая ограничения существующих методов, требующих масштабных 3D-наборов данных и специализированных архитектур. Эта ИИ-модель использует предварительно обученную 2D диффузионную модель для преобразования текста в изображение, такую как Imagen, в качестве мощного предиктора для генерации 3D-контента. Основное новшество заключается в новой функции потерь, основанной на дистилляции плотности вероятности, которая позволяет 2D диффузионной модели управлять оптимизацией параметрического 3D-представления.
По своей сути DreamFusion использует процесс оптимизации, подобный DeepDream. Она инициализирует 3D-модель, в частности Neural Radiance Field (NeRF), и итеративно уточняет ее с помощью градиентного спуска. Цель состоит в минимизации функции потерь, полученной из 2D-рендерингов NeRF под различными углами. Эти рендеринги оцениваются относительно текстового запроса с использованием предварительно обученной 2D диффузионной модели. Этот подход эффективно дистиллирует знания, заложенные в миллиардах пар изображений и текстов из 2D-модели, в связное 3D-представление.
Полученные 3D-модели обладают высокой универсальностью. Их можно просматривать под любым углом, что позволяет проводить всесторонний анализ и интеграцию в различные визуальные контексты. Кроме того, сгенерированные объекты релайтабельны, что означает возможность манипулирования их внешним видом с помощью произвольного освещения, и их можно беспрепятственно компоновать в существующие 3D-среды. Такая гибкость делает DreamFusion ценным инструментом для создателей и разработчиков.
Методология DreamFusion не требует 3D-обучающих данных и не предполагает модификаций базовой модели диффузии изображений, что подчеркивает эффективность использования предварительно обученных моделей в качестве предикторов. Сгенерированные NeRF демонстрируют высокое качество внешнего вида, точную информацию о глубине и детализированные нормали. Для практических применений эти модели NeRF могут быть экспортированы в стандартные форматы сетки с использованием таких алгоритмов, как marching cubes, что облегчает интеграцию в популярные 3D-рендеры и программы для моделирования. Проект также демонстрирует примеры компоновки сгенерированных объектов в сцены и предоставляет галерею из сотен сгенерированных ассетов.
Главное о DreamFusion
Генерирует 3D-объекты по текстовым запросам
Использует предварительно обученные 2D диффузионные модели в качестве предикторов
Создает Neural Radiance Fields (NeRF)
Не требует 3D-обучающих данных
Не требует модификаций модели диффузии изображений
Выводит релайтабельные 3D-модели
Поддерживает произвольное освещение
Позволяет компоновку в 3D-среды
Генерирует высококачественный внешний вид, глубину и нормали
Возможность экспорта сетки через marching cubes
Score Distillation Sampling (SDS) для генерации
Включает регуляризаторы и стратегии оптимизации для улучшения геометрии
Начало работы с DreamFusion
Ввод текстового запроса: Предоставьте описательный заголовок для желаемого 3D-объекта.
Оптимизация модели: DreamFusion использует 2D диффузионную модель в качестве предиктора для оптимизации 3D-модели NeRF.
Рендеринг и оценка: NeRF рендерится под случайными углами, и его 2D-изображения оцениваются относительно текстового запроса.
Итеративное уточнение: Градиентный спуск корректирует параметры NeRF для минимизации потерь, улучшая согласованность и внешний вид.
Экспорт сетки: После оптимизации NeRF может быть преобразован в сетку для использования в другом 3D-программном обеспечении.
Варианты использования DreamFusion
- Генерация 3D-ассетов
- Прототипирование
- Создание контента
- Исследования и разработки
- Создание виртуальных миров
- Образовательные инструменты






