설명
Large Multi-View Gaussian Model을 의미하는 LGM은 고해상도 3D 콘텐츠 제작을 위해 설계된 고급 프레임워크입니다. ECCV 2024에서 구두 발표 논문으로 소개된 이 프로젝트는 여러 입력 뷰에서 상세한 3D 에셋을 생성할 수 있는 새로운 가우시안 모델의 강력한 구현을 제공합니다. LGM의 핵심은 다중 뷰 정보를 활용하여 복잡한 3D 장면을 인상적인 충실도로 재구성하고 렌더링하는 능력에 있습니다.
이 프로젝트는 3D 콘텐츠 생성에 관심 있는 연구원 및 개발자를 위한 포괄적인 도구 세트를 제공합니다. 여기에는 공식 코드 저장소, 다운로드 가능한 사전 학습된 모델 가중치, 명확한 추론 지침이 포함됩니다. LGM은 텍스트-투-3D 및 이미지-투-3D 생성 파이프라인을 모두 지원하여 다양한 창의적 및 기술적 응용 분야에 유용한 도구입니다. 이 구현은 가우시안 스플래팅 및 신경 렌더링 기술의 기존 연구를 기반으로 하며, 3D 합성의 품질과 해상도 경계를 넓히는 것을 목표로 합니다.
LGM의 주요 기능에는 상세한 3D 모델 및 장면 생성을 가능하게 하는 고해상도 출력이 포함됩니다. 모델 아키텍처는 다중 뷰 입력을 위해 최적화되어 기하학 및 외형의 정확한 재구성을 가능하게 합니다. 또한 이 프로젝트는 저장된 PLY 파일을 시각화하기 위한 로컬 GUI와 메시 변환 스크립트를 제공하여 기존 3D 워크플로우에 더 쉽게 통합할 수 있도록 합니다. 학습 데이터셋은 AWS 기반이며 직접 전송할 수 없지만, 프로젝트는 사용자가 자체 모델을 학습시키고자 할 때 필요한 학습 코드 프레임워크와 Objaverse 데이터셋의 필터링된 하위 집합을 제공합니다.
LGM은 컴퓨터 비전 및 그래픽스 연구원, 3D 아티스트, 게임 개발자 및 3D 에셋 생성 또는 조작에 관련된 모든 사람에게 특히 유용합니다. 프로젝트의 오픈 소스 특성과 상세한 문서는 커뮤니티 기여 및 추가 개발을 장려합니다. 고해상도 출력 및 다중 뷰 일관성에 대한 강조는 LGM을 생성적 3D 모델링 분야의 중요한 발전으로 자리매김하게 합니다.
LGM: Large Multi-View Gaussian Model의 핵심 기능
고해상도 3D 콘텐츠 제작
Large Multi-View Gaussian Model 구현
텍스트-투-3D 생성 지원
이미지-투-3D 생성 지원
공식 코드 및 사전 학습된 가중치 제공
추론 스크립트 포함
3D 모델 시각화를 위한 로컬 GUI
메시 변환 유틸리티
가우시안 스플래팅 기술 기반
ECCV 2024 구두 발표 논문
LGM: Large Multi-View Gaussian Model 시작하기
리포지토리 클론: GitHub에서 LGM 코드를 가져옵니다.
종속성 설치: PyTorch 및 xformers를 포함한 필요한 Python 패키지를 설정합니다.
가중치 다운로드: Hugging Face에서 사전 학습된 모델 체크포인트를 가져옵니다.
추론 구성: 생성을 위한 작업 공간 및 테스트 경로를 지정합니다.
추론 실행: 3D 생성을 위해 `infer.py` 스크립트를 실행합니다.
결과 시각화: `gui.py`를 사용하여 생성된 PLY 파일을 봅니다.
메시로 변환: 메시 추출을 위해 `convert.py`를 사용합니다.
LGM: Large Multi-View Gaussian Model의 사용 사례
- 고해상도 3D 에셋 생성
- 텍스트-투-3D 콘텐츠 제작
- 이미지-투-3D 재구성
- AR/VR용 3D 콘텐츠
- 게임 개발 에셋
- 생성적 3D 연구






