설명
StyleSwin은 CVPR 2022에서 발표된 고해상도 이미지 합성을 위한 트랜스포머 기반 생성적 적대 신경망(GAN)의 공식 구현입니다. 이 프로젝트는 순수 트랜스포머가 생성 모델링에서 갖는 잠재력을 탐구하며, 트랜스포머가 아직 고해상도 이미지 생성에서 ConvNet의 성능을 따라잡지 못하는 과제를 해결합니다.
StyleSwin의 핵심 혁신은 스타일 기반 프레임워크 내에서 Swin 트랜스포머를 활용하는 아키텍처에 있습니다. 효율성과 모델링 용량 모두를 향상시키기 위해 '이중 어텐션' 메커니즘을 도입했습니다. 이 접근 방식은 지역 창과 이동된 창의 컨텍스트를 동시에 고려하여 이미지 생성 품질을 개선합니다. 또한, StyleSwin은 창 기반 트랜스포머에서 종종 손실되는 절대 위치 정보를 통합하여 생성 프로세스에 크게 기여합니다.
이 모델은 고해상도로 확장 가능하도록 설계되었으며, 거친 기하 구조와 미세한 구조 모두 트랜스포머의 표현력으로부터 이점을 얻습니다. 해결된 주요 과제 중 하나는 고해상도 합성 중에 발생하는 블록킹 아티팩트인데, 이는 지역 어텐션이 블록 단위로 작동하여 공간적 일관성을 방해함으로써 발생할 수 있습니다. StyleSwin은 파동 변환기(wavelet discriminator)를 사용하여 스펙트럼 불일치를 검사함으로써 이러한 아티팩트를 효과적으로 억제합니다.
광범위한 실험을 통해 StyleSwin이 기존 트랜스포머 기반 GAN보다 우수하며, 특히 1024x1024와 같은 고해상도에서 뛰어난 성능을 보임을 입증했습니다. CelebA-HQ 1024x1024에서 StyleGAN을 능가하고 FFHQ 1024x1024에서는 유사한 성능을 달성하여, 복잡한 학습 전략 없이도 고해상도 이미지 생성을 위한 트랜스포머의 가능성을 보여줍니다.
이 저장소는 이미지 샘플 생성, FID 점수 평가, FFHQ, CelebA-HQ, LSUN Church 등 다양한 데이터셋에서 새로운 모델을 학습하기 위한 코드를 제공합니다. 또한 다양한 데이터셋과 해상도에서 생성된 이미지에 대한 낮은 FID 점수를 보여주는 정량적 결과도 포함되어 있습니다. 이 프로젝트는 책임감 있는 AI 고려 사항을 강조하며, 사칭을 위한 오용에 대한 경고와 공정한 데이터 관행을 장려합니다.
StyleSwin: Transformer-based GAN 하이라이트
트랜스포머 기반 GAN 아키텍처
최대 1024x1024 고해상도 이미지 생성
Swin 트랜스포머 통합
지역 및 이동된 창 컨텍스트를 위한 이중 어텐션 메커니즘
절대 위치 정보 통합
아티팩트 억제를 위한 파동 변환기(Wavelet Discriminator)
고해상도로 확장 가능
이전 트랜스포머 기반 GAN 능가
고해상도에서 StyleGAN과 경쟁력 있는 성능 달성
CVPR 2022 논문의 공식 구현
StyleSwin: Transformer-based GAN 시작하기
모델 액세스: GitHub 저장소를 클론합니다.
환경 설정: `pip install -r requirements.txt`를 사용하여 종속성을 설치합니다.
샘플 생성: 제공된 Python 스크립트를 사용하여 사전 학습된 모델로 이미지 샘플을 생성합니다.
FID 평가: 평가 스크립트를 실행하여 FID 점수를 사용하여 생성된 이미지의 품질을 평가합니다.
모델 학습: 데이터셋을 준비하고 FFHQ, CelebA-HQ 또는 LSUN Church에 대한 학습 스크립트를 사용합니다.
메모리 적응: 16GB 메모리가 있는 GPU에서 학습하려면 `--use_checkpoint`을 추가합니다.
StyleSwin: Transformer-based GAN의 사용 사례
- 고해상도 이미지 합성
- 트랜스포머 기반 생성 모델
- GAN 연구 및 개발
- 예술적 이미지 제작
- 데이터셋 증강





