Deskripsi
LGM, singkatan dari Large Multi-View Gaussian Model, adalah kerangka kerja canggih yang dirancang untuk pembuatan konten 3D beresolusi tinggi. Proyek ini, yang dipresentasikan di ECCV 2024 sebagai makalah Oral, menawarkan implementasi yang kuat dari model Gaussian baru yang mampu menghasilkan aset 3D yang detail dari beberapa tampilan masukan. Inti dari LGM terletak pada kemampuannya untuk memanfaatkan informasi multi-tampilan untuk merekonstruksi dan merender adegan 3D yang kompleks dengan fidelitas yang mengesankan.
Proyek ini menyediakan seperangkat alat yang komprehensif bagi para peneliti dan pengembang yang tertarik pada pembuatan konten 3D. Ini termasuk repositori kode resmi, bobot model pra-terlatih yang tersedia untuk diunduh, dan instruksi yang jelas untuk inferensi. LGM mendukung pipeline generasi text-to-3D dan image-to-3D, menjadikannya alat yang serbaguna untuk berbagai aplikasi kreatif dan teknis. Implementasi ini dibangun di atas penelitian yang ada dalam teknik Gaussian splatting dan neural rendering, yang bertujuan untuk mendorong batas kualitas dan resolusi dalam sintesis 3D.
Kemampuan utama LGM meliputi keluaran beresolusi tinggi, yang memungkinkan pembuatan model dan adegan 3D yang detail. Arsitektur model dioptimalkan untuk masukan multi-tampilan, memungkinkan rekonstruksi geometri dan penampilan yang akurat. Proyek ini juga menawarkan GUI lokal untuk memvisualisasikan file PLY yang disimpan dan skrip untuk konversi mesh, memfasilitasi integrasi yang lebih mudah ke dalam alur kerja 3D yang ada. Meskipun dataset pelatihan berbasis AWS dan tidak dapat ditransfer secara langsung, proyek ini menyediakan kerangka kerja kode pelatihan dan subset yang difilter dari dataset Objaverse bagi pengguna yang ingin melatih model mereka sendiri.
LGM sangat relevan bagi para peneliti di bidang visi komputer dan grafis, seniman 3D, pengembang game, dan siapa pun yang terlibat dalam membuat atau memanipulasi aset 3D. Sifat open-source proyek dan dokumentasi terperinci mendorong kontribusi komunitas dan pengembangan lebih lanjut. Penekanan pada keluaran beresolusi tinggi dan konsistensi multi-tampilan memposisikan LGM sebagai kemajuan signifikan dalam bidang pemodelan 3D generatif.
Fitur Inti LGM: Large Multi-View Gaussian Model
Pembuatan konten 3D beresolusi tinggi
Implementasi Large Multi-View Gaussian Model
Mendukung pembuatan text-to-3D
Mendukung pembuatan image-to-3D
Kode resmi dan bobot pra-terlatih disediakan
Termasuk skrip inferensi
GUI lokal untuk visualisasi model 3D
Utilitas konversi mesh
Dibangun di atas teknik Gaussian Splatting
Makalah Oral ECCV 2024
Memulai dengan LGM: Large Multi-View Gaussian Model
Kloning repositori: Dapatkan kode LGM dari GitHub.
Instal dependensi: Siapkan paket Python yang diperlukan, termasuk PyTorch dan xformers.
Unduh bobot: Dapatkan checkpoint model pra-terlatih dari Hugging Face.
Konfigurasi inferensi: Tentukan jalur workspace dan test untuk generasi.
Jalankan inferensi: Jalankan skrip `infer.py` untuk generasi 3D.
Visualisasikan hasil: Gunakan `gui.py` untuk melihat file PLY yang dihasilkan.
Konversi ke mesh: Gunakan `convert.py` untuk ekstraksi mesh.
Kasus Penggunaan LGM: Large Multi-View Gaussian Model
- Pembuatan aset 3D beresolusi tinggi
- Pembuatan konten Text-to-3D
- Rekonstruksi Image-to-3D
- Konten 3D untuk AR/VR
- Aset pengembangan game
- Penelitian dalam 3D generatif






