Descrição
SoundStorm é um modelo avançado de IA projetado para geração de áudio altamente eficiente e não autorregressiva. Ele recebe tokens semânticos do AudioLM como entrada e utiliza atenção bidirecional juntamente com decodificação paralela baseada em confiança para gerar os tokens para um codec de áudio neural. Essa abordagem acelera significativamente a produção de áudio, atingindo velocidades duas ordens de magnitude mais rápidas do que a geração autorregressiva do AudioLM.
Este modelo se destaca na produção de áudio de qualidade equivalente e consistência superior em voz e condições acústicas em comparação com seus predecessores. Uma capacidade chave é sua habilidade de gerar 30 segundos de áudio em apenas 0,5 segundos em um TPU-v4. SoundStorm demonstra escalabilidade para sequências de áudio mais longas, permitindo a síntese de segmentos de diálogo naturais e de alta qualidade. Isso é alcançado condicionando em uma transcrição anotada com turnos de locutor e um breve prompt de voz do locutor desejado.
Quando integrado a estágios de modelagem de texto para semântica como SPEAR-TTS, SoundStorm pode sintetizar diálogos com som natural. Os usuários podem controlar precisamente o conteúdo falado através de transcrições, a voz do locutor através de breves prompts e o fluxo da conversa através de anotações de turnos de locutor. Por exemplo, sintetizar segmentos de diálogo de 30 segundos leva apenas 2 segundos em um único TPU-v4, mesmo para texto e locutores não vistos durante o treinamento.
SoundStorm também oferece capacidades para geração de áudio sem prompt e com prompt. No cenário sem prompt, ele amostra diferentes locutores, enquanto no caso com prompt, ele mantém a voz do locutor com alta fidelidade. Isso o torna uma ferramenta poderosa para várias tarefas de síntese de áudio. Comparado a métodos de base como AudioLM e decodificação gulosa, SoundStorm oferece consistência acústica aprimorada e melhor preservação da voz a partir de prompts, juntamente com maior qualidade de áudio.
O pipeline de geração eficiente do modelo torna a pesquisa em geração de áudio mais acessível. Embora a capacidade de imitar vozes levante preocupações sobre uso indevido potencial, como impersonação, salvaguardas estão sendo desenvolvidas. O áudio gerado pelo SoundStorm demonstrou ser detectável por classificadores dedicados, mitigando alguns riscos. A pesquisa visa avançar a tecnologia de geração de áudio de forma responsável.
Destaques de SoundStorm
Geração de áudio não autorregressiva eficiente
Gera áudio duas ordens de magnitude mais rápido que o AudioLM
Mantém alta consistência em voz e condições acústicas
Sintetiza segmentos de diálogo naturais com controle de locutor
Aceita tokens semânticos do AudioLM como entrada
Utiliza atenção bidirecional e decodificação paralela baseada em confiança
Escalável para sequências de áudio mais longas
Suporta síntese de diálogo com controle sobre conteúdo, voz e turnos de locutor
Pode gerar áudio a partir de modelos de texto para semântica
Demonstra alta consistência acústica e preservação de voz na geração com prompt
Produz áudio de maior qualidade em comparação com bases de decodificação gulosa
Primeiros passos com SoundStorm
Acessar modelo: Obtenha acesso ao modelo SoundStorm e seus componentes associados.
Configurar ambiente: Configure o ambiente de software e hardware necessário para executar o modelo.
Inserir tokens semânticos: Forneça os tokens semânticos gerados pelo AudioLM para o SoundStorm.
Integrar via API: Utilize a API do modelo para integração perfeita em pipelines de geração de áudio.
Fornecer informações de condicionamento: Forneça transcrições, anotações de turnos de locutor e prompts de voz para síntese controlada.
Gerar áudio: Execute o processo de geração para produzir representações de codec de áudio neural.
Decodificar áudio: Converta as representações geradas em som audível usando um codec de áudio neural.
Casos de uso de SoundStorm
- Síntese de Diálogo
- Clonagem de Voz
- Geração Rápida de Áudio
- Síntese de Fala
- Criação de Conteúdo de Áudio
- Ferramentas de Acessibilidade
- Aceleração de Pesquisa

