설명
Lyra는 가장 제약적인 네트워크 조건에서도 고품질 음성 통신을 제공하도록 설계된 획기적인 음성 압축 코덱입니다. Google에서 개발한 Lyra는 극도로 낮은 비트율에서도 오디오의 명료도와 자연스러움을 유지하는 오랜 과제를 해결합니다. 이는 역사적으로 로봇 같거나 저하된 음성으로 이어지는 경우가 많았습니다.
Lyra의 핵심 혁신은 기존 코덱 기술과 고급 기계 학습을 결합한 하이브리드 접근 방식에 있습니다. 이 코덱은 40밀리초마다 특징(feature)이라고 알려진 독특한 음성 속성을 추출합니다. 멜 스펙트로그램으로 표현되는 이러한 특징은 전송을 위해 압축됩니다. 수신 측에서는 DeepMind의 WaveNet과 같은 모델에서 영감을 받은 생성 모델이 이러한 압축된 특징을 사용하여 음성 신호를 재구성합니다. 이 방법을 통해 Lyra는 파라메트릭 코덱의 특징인 낮은 비트율을 달성하면서도 최첨단 파형 코덱과 유사한 오디오 품질을 제공할 수 있습니다.
오디오 샘플을 샘플 단위로 압축하여 더 높은 비트율이 필요한 기존 파형 코덱과 달리 Lyra의 생성적 접근 방식은 더 효율적입니다. 생성 모델의 주요 관심사는 계산 복잡성이지만, Lyra는 비용 효율적인 순환 생성 모델, 즉 WaveRNN의 변형을 사용하여 이를 완화합니다. 이 모델은 더 낮은 속도로 작동하지만, 서로 다른 주파수 범위에 걸쳐 여러 신호를 병렬로 생성한 다음 단일 출력 신호로 결합합니다. 이러한 최적화를 통해 Lyra는 클라우드 서버뿐만 아니라 중간 범위의 모바일 장치에서도 실시간으로 작동할 수 있으며, 처리 지연 시간은 90ms로 업계 표준과 일치합니다.
Lyra는 3kbps의 목표 비트율로 작동하도록 설계되었으며, 이 수준에서 기존 코덱보다 훨씬 뛰어난 성능을 발휘합니다. 청취 테스트에 따르면 Lyra는 8kbps의 Opus와 비교했을 때 유리하며, 이는 60% 이상의 대역폭 감소를 나타냅니다. 따라서 Lyra는 더 높은 비트율 코덱에 비해 대역폭이 부족하거나 기존의 낮은 비트율 옵션이 적절한 품질을 제공하지 못하는 환경에 이상적인 솔루션입니다. 이 코덱은 70개 이상의 언어에 걸쳐 수천 시간의 음성 데이터로 학습되어 전 세계 사용자 기반에 대한 견고성과 공정성을 보장합니다. Google은 Duo와 같은 제품에 Lyra를 적극적으로 배포하여 저대역폭 연결에서 오디오 통화 품질과 안정성을 향상시키고 있으며, 성능 최적화 및 비음성 오디오 사용 사례로의 확장에 대한 연구를 지속하고 있습니다.
Lyra Speech Codec 하이라이트
매우 낮은 비트율에서의 고품질 음성 압축
음성 재구성을 위한 기계 학습 및 생성 모델 활용
목표 비트율 3kbps에서 작동
8kbps Opus 대비 60% 이상의 대역폭 감소 달성
중간 범위 모바일 장치에서의 실시간 성능
90ms 처리 지연 시간
70개 이상의 언어에 걸친 수천 시간의 음성 데이터로 학습
기존 코덱 기술과 ML의 하이브리드 접근 방식
비용 효율적인 WaveRNN 변형을 생성 모델링에 사용
느리고 혼잡한 네트워크에서의 음성 통신 가능
음성 신호의 효율적인 데이터 전송 및 저장 설계
Lyra Speech Codec 시작하기
모델 액세스: Lyra를 애플리케이션 또는 서비스에 통합합니다.
환경 설정: 필요한 컴퓨팅 리소스가 사용 가능한지 확인합니다.
API를 통한 통합: Lyra API를 사용하여 음성 신호를 인코딩 및 디코딩합니다.
최적화: 특정 네트워크 조건 및 원하는 품질 수준에 맞게 매개변수를 미세 조정합니다.
Lyra Speech Codec의 사용 사례
- 저대역폭 통신
- 모바일 음성 통화
- 신흥 시장
- 실시간 협업
- VoIP 애플리케이션
- 화상 회의




