Descripción
LGM, que significa Large Multi-View Gaussian Model, es un marco avanzado diseñado para la creación de contenido 3D de alta resolución. Este proyecto, presentado en ECCV 2024 como un artículo oral, ofrece una implementación robusta de un novedoso modelo Gaussiano capaz de generar activos 3D detallados a partir de múltiples vistas de entrada. El núcleo de LGM reside en su capacidad para aprovechar la información multivista para reconstruir y renderizar escenas 3D complejas con una fidelidad impresionante.
El proyecto proporciona un conjunto completo de herramientas para investigadores y desarrolladores interesados en la generación de contenido 3D. Esto incluye el repositorio de código oficial, pesos de modelos preentrenados disponibles para su descarga e instrucciones claras para la inferencia. LGM soporta flujos de trabajo de generación de texto a 3D e imagen a 3D, lo que lo convierte en una herramienta versátil para diversas aplicaciones creativas y técnicas. La implementación se basa en la investigación existente en técnicas de Gaussian splatting y renderizado neuronal, con el objetivo de ampliar los límites de calidad y resolución en la síntesis 3D.
Las capacidades clave de LGM incluyen su salida de alta resolución, que permite la creación de modelos y escenas 3D detallados. La arquitectura del modelo está optimizada para entradas multivista, lo que permite una reconstrucción precisa de la geometría y la apariencia. El proyecto también ofrece una GUI local para visualizar archivos PLY guardados y scripts para la conversión de mallas, lo que facilita su integración en flujos de trabajo 3D existentes. Si bien el conjunto de datos de entrenamiento se basa en AWS y no es directamente transferible, el proyecto proporciona el marco de código de entrenamiento y un subconjunto filtrado del conjunto de datos Objaverse para los usuarios que deseen entrenar sus propios modelos.
LGM es particularmente relevante para investigadores en visión por computadora y gráficos, artistas 3D, desarrolladores de juegos y cualquier persona involucrada en la creación o manipulación de activos 3D. La naturaleza de código abierto del proyecto y su detallada documentación fomentan las contribuciones de la comunidad y el desarrollo futuro. El énfasis en la salida de alta resolución y la consistencia multivista posiciona a LGM como un avance significativo en el campo de la modelización 3D generativa.
Características principales de LGM: Large Multi-View Gaussian Model
Creación de contenido 3D de alta resolución
Implementación de Large Multi-View Gaussian Model
Soporta generación de texto a 3D
Soporta generación de imagen a 3D
Código oficial y pesos preentrenados proporcionados
Incluye scripts de inferencia
GUI local para visualización de modelos 3D
Utilidades de conversión de mallas
Basado en técnicas de Gaussian Splatting
Artículo oral en ECCV 2024
Primeros pasos con LGM: Large Multi-View Gaussian Model
Clonar repositorio: Obtenga el código LGM de GitHub.
Instalar dependencias: Configure los paquetes de Python requeridos, incluyendo PyTorch y xformers.
Descargar pesos: Obtenga los checkpoints del modelo preentrenado desde Hugging Face.
Configurar inferencia: Especifique las rutas de trabajo y de prueba para la generación.
Ejecutar inferencia: Ejecute el script `infer.py` para la generación 3D.
Visualizar resultados: Use `gui.py` para ver los archivos PLY generados.
Convertir a malla: Emplee `convert.py` para la extracción de mallas.
Casos de uso de LGM: Large Multi-View Gaussian Model
- Generación de activos 3D de alta resolución
- Creación de contenido de texto a 3D
- Reconstrucción de imagen a 3D
- Contenido 3D para AR/VR
- Activos para desarrollo de juegos
- Investigación en 3D generativo






