본문으로 건너뛰기
ToolPotion

Lyra Speech Codec

Lyra는 Google에서 개발한 혁신적인 초저비트율 음성 코덱입니다. 기계 학습을 활용하여 음성 신호를 압축함으로써 가장 느린 네트워크에서도 고품질 오디오 통신을 가능하게 합니다. Lyra는 생성 모델을 사용하여 추출된 특징으로부터 음성을 재구성함으로써 기존 코덱에 비해 상당한 대역폭 감소를 제공합니다.

URL 방문

설명

Lyra는 가장 제약적인 네트워크 조건에서도 고품질 음성 통신을 제공하도록 설계된 획기적인 음성 압축 코덱입니다. Google에서 개발한 Lyra는 극도로 낮은 비트율에서도 오디오의 명료도와 자연스러움을 유지하는 오랜 과제를 해결합니다. 이는 역사적으로 로봇 같거나 저하된 음성으로 이어지는 경우가 많았습니다.

Lyra의 핵심 혁신은 기존 코덱 기술과 고급 기계 학습을 결합한 하이브리드 접근 방식에 있습니다. 이 코덱은 40밀리초마다 특징(feature)이라고 알려진 독특한 음성 속성을 추출합니다. 멜 스펙트로그램으로 표현되는 이러한 특징은 전송을 위해 압축됩니다. 수신 측에서는 DeepMind의 WaveNet과 같은 모델에서 영감을 받은 생성 모델이 이러한 압축된 특징을 사용하여 음성 신호를 재구성합니다. 이 방법을 통해 Lyra는 파라메트릭 코덱의 특징인 낮은 비트율을 달성하면서도 최첨단 파형 코덱과 유사한 오디오 품질을 제공할 수 있습니다.

오디오 샘플을 샘플 단위로 압축하여 더 높은 비트율이 필요한 기존 파형 코덱과 달리 Lyra의 생성적 접근 방식은 더 효율적입니다. 생성 모델의 주요 관심사는 계산 복잡성이지만, Lyra는 비용 효율적인 순환 생성 모델, 즉 WaveRNN의 변형을 사용하여 이를 완화합니다. 이 모델은 더 낮은 속도로 작동하지만, 서로 다른 주파수 범위에 걸쳐 여러 신호를 병렬로 생성한 다음 단일 출력 신호로 결합합니다. 이러한 최적화를 통해 Lyra는 클라우드 서버뿐만 아니라 중간 범위의 모바일 장치에서도 실시간으로 작동할 수 있으며, 처리 지연 시간은 90ms로 업계 표준과 일치합니다.

Lyra는 3kbps의 목표 비트율로 작동하도록 설계되었으며, 이 수준에서 기존 코덱보다 훨씬 뛰어난 성능을 발휘합니다. 청취 테스트에 따르면 Lyra는 8kbps의 Opus와 비교했을 때 유리하며, 이는 60% 이상의 대역폭 감소를 나타냅니다. 따라서 Lyra는 더 높은 비트율 코덱에 비해 대역폭이 부족하거나 기존의 낮은 비트율 옵션이 적절한 품질을 제공하지 못하는 환경에 이상적인 솔루션입니다. 이 코덱은 70개 이상의 언어에 걸쳐 수천 시간의 음성 데이터로 학습되어 전 세계 사용자 기반에 대한 견고성과 공정성을 보장합니다. Google은 Duo와 같은 제품에 Lyra를 적극적으로 배포하여 저대역폭 연결에서 오디오 통화 품질과 안정성을 향상시키고 있으며, 성능 최적화 및 비음성 오디오 사용 사례로의 확장에 대한 연구를 지속하고 있습니다.

Lyra Speech Codec 하이라이트

  • 매우 낮은 비트율에서의 고품질 음성 압축

  • 음성 재구성을 위한 기계 학습 및 생성 모델 활용

  • 목표 비트율 3kbps에서 작동

  • 8kbps Opus 대비 60% 이상의 대역폭 감소 달성

  • 중간 범위 모바일 장치에서의 실시간 성능

  • 90ms 처리 지연 시간

  • 70개 이상의 언어에 걸친 수천 시간의 음성 데이터로 학습

  • 기존 코덱 기술과 ML의 하이브리드 접근 방식

  • 비용 효율적인 WaveRNN 변형을 생성 모델링에 사용

  • 느리고 혼잡한 네트워크에서의 음성 통신 가능

  • 음성 신호의 효율적인 데이터 전송 및 저장 설계

Lyra Speech Codec 시작하기

  1. 모델 액세스: Lyra를 애플리케이션 또는 서비스에 통합합니다.

  2. 환경 설정: 필요한 컴퓨팅 리소스가 사용 가능한지 확인합니다.

  3. API를 통한 통합: Lyra API를 사용하여 음성 신호를 인코딩 및 디코딩합니다.

  4. 최적화: 특정 네트워크 조건 및 원하는 품질 수준에 맞게 매개변수를 미세 조정합니다.

Lyra Speech Codec의 사용 사례

  • 저대역폭 통신
  • 모바일 음성 통화
  • 신흥 시장
  • 실시간 협업
  • VoIP 애플리케이션
  • 화상 회의

Lyra Speech Codec의 FAQ

Lyra Speech Codec 리뷰

로딩 중...

Lyra Speech Codec와(과) 비슷한 인기 AI 도구

AI 모델

AudioLM은 장기적인 일관성을 갖춘 고품질 오디오를 생성하는 AI 모델입니다. 오디오 생성을 언어 모델링 작업으로 취급하여 오디오를 이산 토큰으로 매핑합니다. 이 프레임워크는 보지 못한 화자나 스타일에서도 음성 및 음악에 대한 자연스럽고 일관된 연속 생성을 탁월하게 수행합니다.

AI 모델 및 LLM

AI 모델

SoundStorm은 효율적인 비자기회귀(non-autoregressive) 오디오 생성 AI 모델입니다. 이전 방식보다 두 자릿수 이상 빠른 속도로 고품질 오디오를 생성하며, 음성 및 음향 조건의 일관성을 유지합니다. 말하는 내용, 화자 목소리, 화자 전환을 제어하여 자연스러운 대화 세그먼트를 합성할 수 있습니다.

AI 모델 및 LLM

AI 모델

Wav2vec 2.0은 자동 음성 인식(ASR)을 위한 자기 지도 학습 알고리즘입니다. 원시 오디오에서 학습하며 높은 정확도를 달성하기 위해 최소한의 전사 데이터만 필요로 합니다. 이를 통해 광범위한 레이블이 지정된 데이터셋에 대한 의존도를 줄이고 더 많은 언어, 방언 및 도메인에 대한 음성 인식이 가능해집니다.

AI 모델 및 LLM

Funnel-Transformer는 계산 비용을 줄이기 위해 은닉 상태를 압축하는 AI 모델입니다. 동일한 FLOPs로 더 깊거나 넓은 모델을 만들 수 있으며, 표준 사전 학습을 위한 토큰 수준 표현을 복구할 수 있습니다. 이 모델은 TensorFlow 및 PyTorch 구현으로 제공됩니다.

AI 모델 및 LLM

AI 모델

Voicebox는 최첨단 성능으로 여러 작업에 걸쳐 일반화되는 음성용 생성 AI 모델입니다. 6개 언어로 음성을 합성하고, 노이즈를 제거하고, 콘텐츠를 편집하고, 스타일을 변환하고, 다양한 샘플을 생성할 수 있으며, 단일 목적 모델보다 뛰어난 성능을 발휘합니다.

AI 음성 생성기

AI 모델

ESPnet은 엔드투엔드 음성 처리를 위한 오픈소스 툴킷입니다. 자동 음성 인식(ASR), 텍스트 음성 변환(TTS), 음성 향상과 같은 작업을 위한 포괄적인 레시피와 도구를 제공합니다. 사용자는 유연한 프레임워크를 통해 쉽게 추론을 실행하고, 기존 모델을 파인튜닝하거나, 사용자 정의 솔루션을 구현할 수 있습니다.

머신러닝 플랫폼

AI 모델

FastSpeech 2는 음성 품질과 학습 속도를 향상시키는 종단 간(end-to-end) 텍스트 음성 변환 모델입니다. 피치 및 에너지와 같은 음성 변형 정보를 직접 통합하여, 이전의 비자기회귀(non-autoregressive) 모델의 단점을 개선하고, 티처 증류(teacher distillation)를 제거하며,…

AI 모델 및 LLM

AI 모델

이 리포지토리는 MADE(Masked Autoencoder Density Estimation)의 PyTorch 구현을 제공합니다. MLP의 연결을 마스킹하여 오토인코더를 자기회귀적 밀도 모델로 변환할 수 있습니다. 이 코드는 이진화된 MNIST 예제를 통해 효율적인 가능도 평가 및 샘플링을 지원합니다.

AI 모델 및 LLM