설명
SoundStorm은 매우 효율적이고 비자기회귀적인 오디오 생성을 위해 설계된 고급 AI 모델입니다. AudioLM의 시맨틱 토큰을 입력으로 받아 양방향 주의(bidirectional attention)와 신뢰도 기반 병렬 디코딩(confidence-based parallel decoding)을 활용하여 신경망 오디오 코덱(neural audio codec)용 토큰을 생성합니다. 이 접근 방식은 오디오 제작 속도를 크게 향상시켜 AudioLM의 자기회귀 생성 방식보다 두 자릿수 이상 빠른 속도를 달성합니다.
이 모델은 이전 모델에 비해 동등한 품질과 우수한 음성 및 음향 조건의 일관성을 갖춘 오디오를 생성하는 데 탁월합니다. 핵심 기능 중 하나는 TPU-v4에서 단 0.5초 만에 30초 분량의 오디오를 생성할 수 있다는 것입니다. SoundStorm은 더 긴 오디오 시퀀스에 대한 확장성을 보여주며, 고품질의 자연스러운 대화 세그먼트 합성을 가능하게 합니다. 이는 화자 전환 정보가 포함된 전사본(transcript)과 원하는 화자의 짧은 음성 프롬프트(voice prompt)를 조건으로 하여 달성됩니다.
SPEAR-TTS와 같은 텍스트-시맨틱 모델링 단계와 통합될 때, SoundStorm은 자연스러운 대화를 합성할 수 있습니다. 사용자는 전사본을 통해 말하는 내용을 정확하게 제어하고, 짧은 음성 프롬프트를 통해 화자의 목소리를 제어하며, 화자 전환 주석을 통해 대화의 흐름을 제어할 수 있습니다. 예를 들어, 30초 분량의 대화 세그먼트 합성은 훈련 중에 보지 못한 텍스트와 화자의 경우에도 단일 TPU-v4에서 단 2초밖에 걸리지 않습니다.
SoundStorm은 프롬프트가 없는(unprompted) 오디오 생성과 프롬프트가 있는(prompted) 오디오 생성 모두에 대한 기능을 제공합니다. 프롬프트가 없는 시나리오에서는 다양한 화자를 샘플링하고, 프롬프트가 있는 경우에는 화자의 목소리를 높은 충실도로 유지합니다. 이는 다양한 오디오 합성 작업에 강력한 도구가 됩니다. AudioLM 및 그리디 디코딩(greedy decoding)과 같은 기본 방법과 비교할 때, SoundStorm은 프롬프트로부터 더 나은 음향 일관성과 음성 보존 능력을 제공하며, 오디오 품질도 더 높습니다.
이 모델의 효율적인 생성 파이프라인은 오디오 생성 연구를 더 쉽게 접근할 수 있도록 합니다. 목소리를 모방하는 능력은 신원 도용과 같은 잠재적 오용에 대한 우려를 제기하지만, 안전 장치가 개발 중입니다. SoundStorm의 생성된 오디오는 전용 분류기로 감지될 수 있음이 입증되어 일부 위험을 완화합니다. 이 연구는 오디오 생성 기술을 책임감 있게 발전시키는 것을 목표로 합니다.
SoundStorm 하이라이트
효율적인 비자기회귀 오디오 생성
AudioLM보다 두 자릿수 이상 빠른 오디오 생성 속도
음성 및 음향 조건의 높은 일관성 유지
화자 제어가 가능한 자연스러운 대화 세그먼트 합성
AudioLM의 시맨틱 토큰을 입력으로 수용
양방향 주의 및 신뢰도 기반 병렬 디코딩 활용
더 긴 오디오 시퀀스로 확장 가능
콘텐츠, 목소리, 화자 전환 제어를 통한 대화 합성 지원
텍스트-시맨틱 모델에서 오디오 생성 가능
프롬프트 기반 생성에서 높은 음향 일관성 및 음성 보존 능력 입증
그리디 디코딩 기반 모델 대비 높은 오디오 품질 생성
SoundStorm 시작하기
모델 액세스: SoundStorm 모델 및 관련 구성 요소에 대한 액세스를 얻습니다.
환경 설정: 모델 실행에 필요한 소프트웨어 및 하드웨어 환경을 구성합니다.
시맨틱 토큰 입력: AudioLM에서 생성된 시맨틱 토큰을 SoundStorm에 제공합니다.
API를 통한 통합: 모델의 API를 활용하여 오디오 생성 파이프라인에 원활하게 통합합니다.
조건 정보 제공: 제어된 합성을 위해 전사본, 화자 전환 주석, 음성 프롬프트를 공급합니다.
오디오 생성: 생성 프로세스를 실행하여 신경망 오디오 코덱 표현을 생성합니다.
오디오 디코딩: 생성된 표현을 신경망 오디오 코덱을 사용하여 들을 수 있는 소리로 변환합니다.
SoundStorm의 사용 사례
- 대화 합성
- 음성 복제
- 빠른 오디오 생성
- 음성 합성
- 오디오 콘텐츠 제작
- 접근성 도구
- 연구 가속화

