본문으로 건너뛰기
ToolPotion

Jukebox | OpenAI

Jukebox는 원시 오디오 형태로 기본적인 노래를 포함한 음악을 생성하는 신경망입니다. 다양한 장르와 아티스트 스타일의 음악을 제작할 수 있으며, AI 기반 음악 제작에 대한 새로운 접근 방식을 제공합니다. 모델 가중치와 코드가 공개되었으며, 생성된 샘플을 탐색할 수 있는 도구도 함께 제공됩니다.

URL 방문

설명

OpenAI에서 개발한 Jukebox는 AI 기반 음악 생성을 위해 설계된 정교한 신경망입니다. 기본적인 노래를 포함하고 다양한 장르와 아티스트 스타일을 모방할 수 있는 원시 오디오 형태로 직접 음악을 생성합니다. 이는 기호 기반 음악 생성을 넘어 원시 오디오의 미묘한 차이를 포착하는 생성 모델의 중요한 발전입니다.

핵심적으로 Jukebox는 계층적 VQ-VAE(Vector Quantized Variational Autoencoder) 모델을 사용하여 원시 오디오를 이산적이고 저차원의 공간으로 압축합니다. 이 압축은 오디오 데이터에 내재된 매우 긴 시퀀스를 처리하는 데 중요하며, 모델이 높은 수준의 의미론적 구조를 학습할 수 있도록 합니다. VQ-VAE 아키텍처는 VQ-VAE-2에서 영감을 받았으며, 코드북 붕괴를 해결하고 스펙트럼 손실 추가를 포함한 재구성 품질을 개선하기 위한 수정이 이루어졌습니다. 이 모델은 44kHz 원시 오디오를 8배, 32배, 128배 다운샘플링하는 세 가지 압축 수준을 사용하여 음높이, 음색, 볼륨과 같은 필수적인 음악 정보를 유지합니다.

오디오 압축 후, 트랜스포머 모델은 이러한 압축된 오디오 코드의 분포를 학습하는 사전 모델로 훈련됩니다. 이러한 사전 모델은 이산 공간에서 음악을 생성하며, 최상위 사전 모델은 장거리 구조를 포착하고 하위 사전 모델은 지역적인 음악적 세부 사항을 추가합니다. 모델은 Sparse Transformers의 단순화된 변형을 사용하여 자기회귀적으로 훈련되며, 각 모델은 72개의 계층적 자기 주의(factorized self-attention)를 특징으로 합니다. 이러한 계층적 접근 방식을 통해 Jukebox는 인상적인 오디오 품질을 가진 일관된 음악 작품을 생성할 수 있습니다.

Jukebox는 장르, 아티스트, 가사와 같은 다양한 입력으로 조건화될 수 있습니다. 이러한 정보를 입력으로 제공함으로써 사용자는 원하는 스타일의 음악을 생성하도록 생성 프로세스를 제어할 수 있습니다. 이 모델은 LyricWiki의 가사와 메타데이터와 쌍을 이룬 120만 곡의 대규모 데이터셋으로 훈련되었습니다. 특히 가사 조건화는 가사 내용과 해당 오디오 세그먼트를 일치시키기 위한 정교한 정렬 기술을 필요로 하여 노래 생성 능력을 향상시켰습니다.

기능에도 불구하고 Jukebox에는 한계가 있습니다. 생성된 노래는 반복되는 후렴구와 같은 익숙한 대규모 음악 구조가 부족할 수 있으며, 다운샘플링/업샘플링 프로세스는 눈에 띄는 노이즈를 발생시킬 수 있습니다. 샘플링 프로세스도 느려서 1분 오디오를 렌더링하는 데 약 9시간이 소요되므로 대화형 애플리케이션에는 적합하지 않습니다. 향후 작업은 음악성 개선, 노이즈 감소, 샘플링 속도 증가를 목표로 하며, 잠재적으로 병렬 샘플러로의 증류를 통해 이루어질 수 있습니다. OpenAI는 또한 모델의 범위를 다른 언어 및 지역의 노래를 포함하도록 확장하여 음악 제작에서 인간과 모델 간의 협업을 촉진할 계획입니다.

Jukebox 하이라이트

  • 원시 오디오 형태로 음악 생성

  • 기본적인 노래 기능 포함

  • 장르, 아티스트, 가사 조건화 지원

  • 다양한 음악 장르 모방

  • 다양한 아티스트 스타일 모방

  • 오디오 압축을 위한 계층적 VQ-VAE 활용

  • 코드 생성을 위한 트랜스포머 모델 사용

  • 120만 곡의 대규모 데이터셋으로 훈련

  • 모델 가중치 및 코드 공개

  • 생성된 샘플 탐색 도구 포함

  • 여러 압축 수준으로 음악 출력

  • 장거리 음악 구조 학습

Jukebox 시작하기

  1. 모델 가중치 및 코드 액세스: 제공된 GitHub 리포지토리에서 공개된 Jukebox 모델 및 관련 코드를 다운로드합니다.

  2. 입력 데이터 준비: 음악 생성을 위해 원하는 장르, 아티스트, 가사 정보를 수집합니다.

  3. 생성 매개변수 구성: 원하는 오디오 품질, 길이 및 조건화 입력에 대한 매개변수를 설정합니다.

  4. 생성 프로세스 실행: Jukebox 모델을 실행하여 원시 오디오 음악 샘플을 생성합니다.

  5. 생성된 샘플 탐색: 제공된 도구를 사용하여 출력을 듣고 분석합니다.

  6. 프로젝트에 통합: 공개된 코드를 사용자 정의 음악 생성 애플리케이션에 맞게 조정합니다.

Jukebox의 사용 사례

  • AI 음악 생성
  • 음악 스타일 모방
  • 기본적인 노래 합성
  • 창의적인 음악 탐색
  • 사운드트랙 작곡
  • 음악 연구

Jukebox의 FAQ

Jukebox 리뷰

로딩 중...

Jukebox와(과) 비슷한 인기 AI 도구

AI GitHub 저장소

Audiocraft는 딥러닝 오디오 생성 및 처리를 위한 PyTorch 라이브러리입니다. 제어 가능한 음악 생성을 위한 MusicGen, 텍스트-사운드 생성을 위한 AudioGen과 같은 최첨단 모델을 제공합니다. 이 라이브러리에는 EnCodec 오디오 압축기와 연구용 학습 코드도 포함되어 있습니다.

AI 음악 생성기

AI 모델

AudioGen은 텍스트 설명을 기반으로 오디오 샘플을 생성하는 자동 회귀 생성 AI 모델입니다. 소스 분리, 실제 노이즈 처리, 텍스트 주석 부족과 같은 오디오 생성의 어려움을 해결합니다. 이 모델은 고품질 출력을 위해 학습된 이산 오디오 표현으로 작동합니다.

AI 음악 생성기

Lyria 3.5는 Google DeepMind의 고급 음악 생성 모델로, 사용자가 쉽게 곡을 작곡할 수 있도록 돕습니다. 기술적 제어와 다양한 장르의 트랙을 생성할 수 있는 기능을 제공하여 음악 창작을 접근 가능하고 혁신적으로 만듭니다.

추천AI 음악 생성기

AI 모델

MusicLM은 텍스트 설명에서 고음질 음악을 생성하는 AI 모델입니다. 최대 24kHz의 음악을 몇 분 동안 일관성 있게 생성할 수 있으며, 오디오 품질과 텍스트 준수 측면에서 이전 시스템을 능가합니다. 멜로디 조건화도 지원합니다.

AI 음악 생성기

AI 모델

AudioLDM은 잠재 확산 모델을 활용하는 텍스트-오디오 생성 프레임워크입니다. 음성, 음악, 음향 효과 생성을 위해 다양한 모달리티를 통합된 '오디오 언어'(LOA)로 변환합니다. 이 접근 방식은 인컨텍스트 학습을 가능하게 하고 자체 지도 사전 학습 모델을 활용하여 다목적 오디오 생성을 지원합니다.

AI 음악 생성기

Google Flow Music은 스튜디오 품질의 음악을 만들고, 리믹스하고, 공유할 수 있는 생성형 AI 플랫폼입니다. 사용자는 통합된 스튜디오 환경 내에서 AI 뮤직 비디오를 감독하고, 바이브 코드로 새로운 악기를 발명하며, 사운드를 손쉽게 개인화할 수 있습니다.

추천AI 음악 생성기

SongAI의 AI 음악 생성기는 남성 또는 여성 보컬, MP3 오디오 및 MP4 비디오로 독창적인 음악을 만듭니다. 오디오 파일이나 자신의 목소리로 음악을 생성하세요. 사용자 지정 모드를 탐색하고 스타일을 강화하며 다양한 창의적 요구에 맞는 혁신적이고 독보적인 음악을 즉시 즐기세요.

AI 음악 생성기

AI Music Generator는 50개 이상의 스타일로 1분 이내에 스튜디오 품질의 곡을 생성하는 텍스트-투-뮤직 플랫폼으로, 편집 도구, 스템 분리 및 유료 플랜에서의 완전 상업적 권리를 제공합니다.

AI 음악 생성기미디어 및 엔터테인먼트