Beschreibung
LGM, kurz für Large Multi-View Gaussian Model, ist ein fortschrittliches Framework zur Erstellung von 3D-Inhalten mit hoher Auflösung. Dieses Projekt, das auf der ECCV 2024 als Oral Paper vorgestellt wurde, bietet eine robuste Implementierung eines neuartigen Gaußschen Modells, das detaillierte 3D-Assets aus mehreren Eingabeansichten generieren kann. Der Kern von LGM liegt in seiner Fähigkeit, Multi-View-Informationen zu nutzen, um komplexe 3D-Szenen mit beeindruckender Genauigkeit zu rekonstruieren und zu rendern.
Das Projekt stellt eine umfassende Sammlung von Werkzeugen für Forscher und Entwickler bereit, die an der Generierung von 3D-Inhalten interessiert sind. Dazu gehören das offizielle Code-Repository, vortrainierte Modellgewichte zum Download und klare Anleitungen für die Inferenz. LGM unterstützt sowohl Text-zu-3D- als auch Bild-zu-3D-Generierungspipelines, was es zu einem vielseitigen Werkzeug für verschiedene kreative und technische Anwendungen macht. Die Implementierung baut auf bestehender Forschung im Bereich Gaussian Splatting und neuronaler Rendering-Techniken auf und zielt darauf ab, die Grenzen von Qualität und Auflösung in der 3D-Synthese zu erweitern.
Zu den Hauptfunktionen von LGM gehören die Ausgabe mit hoher Auflösung, die die Erstellung detaillierter 3D-Modelle und Szenen ermöglicht. Die Architektur des Modells ist für Multi-View-Eingaben optimiert, was eine genaue Rekonstruktion von Geometrie und Erscheinungsbild ermöglicht. Das Projekt bietet auch eine lokale GUI zur Visualisierung gespeicherter PLY-Dateien und Skripte zur Mesh-Konvertierung, was eine einfachere Integration in bestehende 3D-Workflows erleichtert. Obwohl der Trainingsdatensatz AWS-basiert und nicht direkt übertragbar ist, stellt das Projekt das Trainingscode-Framework und eine gefilterte Teilmenge des Objaverse-Datensatzes für Benutzer bereit, die ihre eigenen Modelle trainieren möchten.
LGM ist besonders relevant für Forscher in den Bereichen Computer Vision und Grafik, 3D-Künstler, Spieleentwickler und alle, die an der Erstellung oder Bearbeitung von 3D-Assets beteiligt sind. Die Open-Source-Natur des Projekts und die detaillierte Dokumentation fördern Community-Beiträge und Weiterentwicklungen. Der Schwerpunkt auf hochauflösender Ausgabe und Multi-View-Konsistenz positioniert LGM als einen bedeutenden Fortschritt auf dem Gebiet der generativen 3D-Modellierung.
LGM: Large Multi-View Gaussian Model's Kernfunktionen
Erstellung von 3D-Inhalten mit hoher Auflösung
Implementierung eines Large Multi-View Gaussian Models
Unterstützt Text-zu-3D-Generierung
Unterstützt Bild-zu-3D-Generierung
Offizieller Code und vortrainierte Gewichte bereitgestellt
Enthält Inferenz-Skripte
Lokale GUI zur Visualisierung von 3D-Modellen
Werkzeuge zur Mesh-Konvertierung
Basiert auf Gaussian Splatting-Techniken
ECCV 2024 Oral Paper
Erste Schritte mit LGM: Large Multi-View Gaussian Model
Repository klonen: Holen Sie sich den LGM-Code von GitHub.
Abhängigkeiten installieren: Richten Sie die erforderlichen Python-Pakete ein, einschließlich PyTorch und xformers.
Gewichte herunterladen: Holen Sie sich vortrainierte Modell-Checkpoints von Hugging Face.
Inferenz konfigurieren: Geben Sie Arbeitsbereichs- und Testpfade für die Generierung an.
Inferenz ausführen: Führen Sie das Skript `infer.py` für die 3D-Generierung aus.
Ergebnisse visualisieren: Verwenden Sie `gui.py`, um generierte PLY-Dateien anzuzeigen.
In Mesh konvertieren: Verwenden Sie `convert.py` zur Mesh-Extraktion.
LGM: Large Multi-View Gaussian Model's Anwendungsfälle
- Erstellung von 3D-Assets mit hoher Auflösung
- Text-zu-3D-Inhaltserstellung
- Bild-zu-3D-Rekonstruktion
- 3D-Inhalte für AR/VR
- Assets für die Spieleentwicklung
- Forschung im Bereich generatives 3D






