본문으로 건너뛰기
ToolPotion

SoundStorm

SoundStorm은 효율적인 비자기회귀(non-autoregressive) 오디오 생성 AI 모델입니다. 이전 방식보다 두 자릿수 이상 빠른 속도로 고품질 오디오를 생성하며, 음성 및 음향 조건의 일관성을 유지합니다. 말하는 내용, 화자 목소리, 화자 전환을 제어하여 자연스러운 대화 세그먼트를 합성할 수 있습니다.

URL 방문

설명

SoundStorm은 매우 효율적이고 비자기회귀적인 오디오 생성을 위해 설계된 고급 AI 모델입니다. AudioLM의 시맨틱 토큰을 입력으로 받아 양방향 주의(bidirectional attention)와 신뢰도 기반 병렬 디코딩(confidence-based parallel decoding)을 활용하여 신경망 오디오 코덱(neural audio codec)용 토큰을 생성합니다. 이 접근 방식은 오디오 제작 속도를 크게 향상시켜 AudioLM의 자기회귀 생성 방식보다 두 자릿수 이상 빠른 속도를 달성합니다.

이 모델은 이전 모델에 비해 동등한 품질과 우수한 음성 및 음향 조건의 일관성을 갖춘 오디오를 생성하는 데 탁월합니다. 핵심 기능 중 하나는 TPU-v4에서 단 0.5초 만에 30초 분량의 오디오를 생성할 수 있다는 것입니다. SoundStorm은 더 긴 오디오 시퀀스에 대한 확장성을 보여주며, 고품질의 자연스러운 대화 세그먼트 합성을 가능하게 합니다. 이는 화자 전환 정보가 포함된 전사본(transcript)과 원하는 화자의 짧은 음성 프롬프트(voice prompt)를 조건으로 하여 달성됩니다.

SPEAR-TTS와 같은 텍스트-시맨틱 모델링 단계와 통합될 때, SoundStorm은 자연스러운 대화를 합성할 수 있습니다. 사용자는 전사본을 통해 말하는 내용을 정확하게 제어하고, 짧은 음성 프롬프트를 통해 화자의 목소리를 제어하며, 화자 전환 주석을 통해 대화의 흐름을 제어할 수 있습니다. 예를 들어, 30초 분량의 대화 세그먼트 합성은 훈련 중에 보지 못한 텍스트와 화자의 경우에도 단일 TPU-v4에서 단 2초밖에 걸리지 않습니다.

SoundStorm은 프롬프트가 없는(unprompted) 오디오 생성과 프롬프트가 있는(prompted) 오디오 생성 모두에 대한 기능을 제공합니다. 프롬프트가 없는 시나리오에서는 다양한 화자를 샘플링하고, 프롬프트가 있는 경우에는 화자의 목소리를 높은 충실도로 유지합니다. 이는 다양한 오디오 합성 작업에 강력한 도구가 됩니다. AudioLM 및 그리디 디코딩(greedy decoding)과 같은 기본 방법과 비교할 때, SoundStorm은 프롬프트로부터 더 나은 음향 일관성과 음성 보존 능력을 제공하며, 오디오 품질도 더 높습니다.

이 모델의 효율적인 생성 파이프라인은 오디오 생성 연구를 더 쉽게 접근할 수 있도록 합니다. 목소리를 모방하는 능력은 신원 도용과 같은 잠재적 오용에 대한 우려를 제기하지만, 안전 장치가 개발 중입니다. SoundStorm의 생성된 오디오는 전용 분류기로 감지될 수 있음이 입증되어 일부 위험을 완화합니다. 이 연구는 오디오 생성 기술을 책임감 있게 발전시키는 것을 목표로 합니다.

SoundStorm 하이라이트

  • 효율적인 비자기회귀 오디오 생성

  • AudioLM보다 두 자릿수 이상 빠른 오디오 생성 속도

  • 음성 및 음향 조건의 높은 일관성 유지

  • 화자 제어가 가능한 자연스러운 대화 세그먼트 합성

  • AudioLM의 시맨틱 토큰을 입력으로 수용

  • 양방향 주의 및 신뢰도 기반 병렬 디코딩 활용

  • 더 긴 오디오 시퀀스로 확장 가능

  • 콘텐츠, 목소리, 화자 전환 제어를 통한 대화 합성 지원

  • 텍스트-시맨틱 모델에서 오디오 생성 가능

  • 프롬프트 기반 생성에서 높은 음향 일관성 및 음성 보존 능력 입증

  • 그리디 디코딩 기반 모델 대비 높은 오디오 품질 생성

SoundStorm 시작하기

  1. 모델 액세스: SoundStorm 모델 및 관련 구성 요소에 대한 액세스를 얻습니다.

  2. 환경 설정: 모델 실행에 필요한 소프트웨어 및 하드웨어 환경을 구성합니다.

  3. 시맨틱 토큰 입력: AudioLM에서 생성된 시맨틱 토큰을 SoundStorm에 제공합니다.

  4. API를 통한 통합: 모델의 API를 활용하여 오디오 생성 파이프라인에 원활하게 통합합니다.

  5. 조건 정보 제공: 제어된 합성을 위해 전사본, 화자 전환 주석, 음성 프롬프트를 공급합니다.

  6. 오디오 생성: 생성 프로세스를 실행하여 신경망 오디오 코덱 표현을 생성합니다.

  7. 오디오 디코딩: 생성된 표현을 신경망 오디오 코덱을 사용하여 들을 수 있는 소리로 변환합니다.

SoundStorm의 사용 사례

  • 대화 합성
  • 음성 복제
  • 빠른 오디오 생성
  • 음성 합성
  • 오디오 콘텐츠 제작
  • 접근성 도구
  • 연구 가속화

SoundStorm의 FAQ

SoundStorm 리뷰

로딩 중...

SoundStorm와(과) 비슷한 인기 AI 도구

AI 모델

AudioLM은 장기적인 일관성을 갖춘 고품질 오디오를 생성하는 AI 모델입니다. 오디오 생성을 언어 모델링 작업으로 취급하여 오디오를 이산 토큰으로 매핑합니다. 이 프레임워크는 보지 못한 화자나 스타일에서도 음성 및 음악에 대한 자연스럽고 일관된 연속 생성을 탁월하게 수행합니다.

AI 모델 및 LLM

HiFi-GAN은 효율적이고 고품질의 음성 합성을 위한 생성적 적대 신경망입니다. 오디오의 주기적 패턴을 모델링하여 샘플 품질을 향상시키고, 높은 속도로 사람과 유사한 품질을 달성합니다. 이 모델은 단일 화자, 알려지지 않은 화자, 종단 간 합성을 지원하며, CPU용 소형 버전도 제공합니다.

AI 모델 및 LLM

AI 모델

FastSpeech 2는 음성 품질과 학습 속도를 향상시키는 종단 간(end-to-end) 텍스트 음성 변환 모델입니다. 피치 및 에너지와 같은 음성 변형 정보를 직접 통합하여, 이전의 비자기회귀(non-autoregressive) 모델의 단점을 개선하고, 티처 증류(teacher distillation)를 제거하며,…

AI 모델 및 LLM

AI 모델

AudioGen은 텍스트 설명을 기반으로 오디오 샘플을 생성하는 자동 회귀 생성 AI 모델입니다. 소스 분리, 실제 노이즈 처리, 텍스트 주석 부족과 같은 오디오 생성의 어려움을 해결합니다. 이 모델은 고품질 출력을 위해 학습된 이산 오디오 표현으로 작동합니다.

AI 음악 생성기

AI 모델

Make-An-Audio는 프롬프트 강화 확산 모델을 사용하는 텍스트-오디오 생성 시스템입니다. 의사 프롬프트 강화 및 스펙트로그램 오토인코더를 사용하여 데이터 부족과 오디오 복잡성을 해결합니다. 이 시스템은 최첨단 결과를 달성하고 다양한 입력에서 고화질, 고충실도 오디오를 생성하기 위한 제어 가능성을 제공합니다.

AI 음악 생성기

다재다능한 확산 모델인 DiffWave를 기반으로 한 오디오 합성 데모를 살펴보세요. 이 리소스는 신경 보코딩, 클래스 조건부 생성, 비조건부 파형 생성 및 음성 노이즈 제거 기능을 보여줍니다. 다양한 데이터셋과 조건에서 모델의 성능에 대한 오디오 샘플과 통찰력을 제공하며 유연성을 강조합니다.

AI 모델 및 LLM

AI 모델

Voicebox는 최첨단 성능으로 여러 작업에 걸쳐 일반화되는 음성용 생성 AI 모델입니다. 6개 언어로 음성을 합성하고, 노이즈를 제거하고, 콘텐츠를 편집하고, 스타일을 변환하고, 다양한 샘플을 생성할 수 있으며, 단일 목적 모델보다 뛰어난 성능을 발휘합니다.

AI 음성 생성기

Lyra는 Google에서 개발한 혁신적인 초저비트율 음성 코덱입니다. 기계 학습을 활용하여 음성 신호를 압축함으로써 가장 느린 네트워크에서도 고품질 오디오 통신을 가능하게 합니다. Lyra는 생성 모델을 사용하여 추출된 특징으로부터 음성을 재구성함으로써 기존 코덱에 비해 상당한 대역폭 감소를 제공합니다.

AI 모델 및 LLM