설명
Make-An-Audio는 프롬프트 강화 확산 모델을 활용하여 제한된 고품질 데이터셋 및 긴 오디오 시퀀스 모델링의 복잡성과 같은 문제를 극복하는 텍스트-오디오 생성 분야의 중요한 발전을 나타냅니다. 이 시스템은 증류 후 재프로그래밍 접근 방식을 사용하는 새로운 의사 프롬프트 강화 기술을 도입합니다. 이 방법은 언어 없는 오디오를 포함한 약하게 지도된 데이터를 통합하여 데이터 부족을 효과적으로 완화합니다.
또한 Make-An-Audio는 스펙트로그램 오토인코더를 사용하여 원시 파형이 아닌 자기 지도 오디오 표현을 예측합니다. 강력한 CLAP(Contrastive Language-Audio Pretraining) 표현과 결합된 이 아키텍처 선택을 통해 모델은 객관적 및 주관적 평가 모두에서 최첨단 성능을 달성할 수 있습니다. 이 시스템은 분류기 없는 안내를 통해 놀라운 제어 가능성을 보여주며 사용자가 생성된 오디오 출력을 미세 조정할 수 있도록 합니다.
기본적인 텍스트-오디오를 넘어 Make-An-Audio는 "어떤 모달리티도 뒤처지지 않는다"는 원칙을 구현하여 X-to-Audio 작업에 대한 인상적인 일반화 기능을 보여줍니다. 이를 통해 사용자가 정의한 모달리티 입력을 기반으로 고화질, 고충실도 오디오를 생성할 수 있습니다. 이 시스템은 개인화된 텍스트-오디오 생성을 지원하여 새로운 장면에 고유한 객체를 주입하고 다양한 스타일로 변환할 수 있습니다. 예를 들어 초기 "천둥" 소리에서 "아기 울음"을 생성하여 사실적이고 충실한 오디오를 얻을 수 있습니다. 또한 오디오 인페인팅 및 이미지-오디오 생성을 지원하여 창의적인 잠재력을 확장합니다.
Make-An-Audio 하이라이트
텍스트-오디오 생성을 위한 프롬프트 강화 확산 모델
증류 후 재프로그래밍 접근 방식을 사용한 의사 프롬프트 강화
오디오 표현 예측을 위한 스펙트로그램 오토인코더
CLAP(Contrastive Language-Audio Pretraining) 표현
제어 가능성을 위한 분류기 없는 안내
X-to-Audio 작업에 대한 일반화 (예: 이미지-오디오, 비디오-오디오)
객체 주입 및 스타일 변환을 통한 개인화된 텍스트-오디오 생성
오디오 인페인팅 기능
고화질, 고충실도 오디오 생성
오디오 생성 시 데이터 부족 문제 해결
Make-An-Audio 시작하기
모델 액세스: Make-An-Audio 모델에 액세스합니다.
API를 통한 통합: 프로그래밍 방식 사용을 위해 모델의 API에 연결합니다.
텍스트 프롬프트 제공: 오디오 생성을 위한 원하는 텍스트 설명을 입력합니다.
모달리티 입력 지정 (선택 사항): X-to-Audio의 경우 관련 이미지 또는 비디오 입력을 제공합니다.
안내 구성: 분류기 없는 안내를 사용하여 오디오 특성을 미세 조정합니다.
오디오 생성: 오디오 생성 프로세스를 시작합니다.
출력 개선: 개인화된 오디오 또는 인페인팅 작업을 위해 매개변수를 조정합니다.
Make-An-Audio의 사용 사례
- 텍스트 음성 변환 합성
- 음향 효과 생성
- 오디오 인페인팅
- 이미지-오디오 변환
- 비디오-오디오 변환
- 개인화된 오디오 콘텐츠
- 음악 생성
- AI 연구


