Descrição
LGM, sigla para Large Multi-View Gaussian Model, é um framework avançado projetado para a criação de conteúdo 3D de alta resolução. Este projeto, apresentado na ECCV 2024 como um artigo Oral, oferece uma implementação robusta de um novo modelo Gaussiano capaz de gerar ativos 3D detalhados a partir de múltiplas visualizações de entrada. O cerne do LGM reside em sua capacidade de alavancar informações multi-view para reconstruir e renderizar cenas 3D complexas com fidelidade impressionante.
O projeto fornece um conjunto abrangente de ferramentas para pesquisadores e desenvolvedores interessados na geração de conteúdo 3D. Isso inclui o repositório oficial de código, pesos de modelo pré-treinados disponíveis para download e instruções claras para inferência. O LGM suporta pipelines de geração text-to-3D e image-to-3D, tornando-o uma ferramenta versátil para diversas aplicações criativas e técnicas. A implementação se baseia em pesquisas existentes em Gaussian splatting e técnicas de renderização neural, visando expandir os limites de qualidade e resolução na síntese 3D.
As principais capacidades do LGM incluem sua saída de alta resolução, permitindo a criação de modelos e cenas 3D detalhados. A arquitetura do modelo é otimizada para entradas multi-view, permitindo a reconstrução precisa de geometria e aparência. O projeto também oferece uma GUI local para visualização de arquivos PLY salvos e scripts para conversão de malha, facilitando a integração em fluxos de trabalho 3D existentes. Embora o conjunto de dados de treinamento seja baseado em AWS e não seja diretamente transferível, o projeto fornece o framework de código de treinamento e um subconjunto filtrado do conjunto de dados Objaverse para usuários que desejam treinar seus próprios modelos.
O LGM é particularmente relevante para pesquisadores em visão computacional e gráficos, artistas 3D, desenvolvedores de jogos e qualquer pessoa envolvida na criação ou manipulação de ativos 3D. A natureza de código aberto do projeto e a documentação detalhada incentivam contribuições da comunidade e desenvolvimento adicional. A ênfase na saída de alta resolução e consistência multi-view posiciona o LGM como um avanço significativo no campo da modelagem 3D generativa.
Recursos principais de LGM: Large Multi-View Gaussian Model
Criação de conteúdo 3D de alta resolução
Implementação do Large Multi-View Gaussian Model
Suporta geração text-to-3D
Suporta geração image-to-3D
Código oficial e pesos pré-treinados fornecidos
Inclui scripts de inferência
GUI local para visualização de modelos 3D
Utilitários de conversão de malha
Baseado em técnicas de Gaussian Splatting
Artigo Oral na ECCV 2024
Primeiros passos com LGM: Large Multi-View Gaussian Model
Clonar repositório: Obtenha o código LGM do GitHub.
Instalar dependências: Configure os pacotes Python necessários, incluindo PyTorch e xformers.
Baixar pesos: Obtenha checkpoints de modelo pré-treinados do Hugging Face.
Configurar inferência: Especifique os caminhos de workspace e de teste para geração.
Executar inferência: Execute o script `infer.py` para geração 3D.
Visualizar resultados: Use `gui.py` para visualizar arquivos PLY gerados.
Converter para malha: Utilize `convert.py` para extração de malha.
Casos de uso de LGM: Large Multi-View Gaussian Model
- Geração de ativos 3D de alta resolução
- Criação de conteúdo text-to-3D
- Reconstrução image-to-3D
- Conteúdo 3D para AR/VR
- Ativos para desenvolvimento de jogos
- Pesquisa em 3D generativo






