Descrição
Pesquisadores da Meta AI desenvolveram o Voicebox, um modelo inovador de IA generativa para fala que demonstra capacidades de generalização em tarefas para as quais não foi especificamente treinado, alcançando desempenho de ponta. Ao contrário de modelos anteriores de IA de fala que exigiam dados de treinamento específicos para cada tarefa, o Voicebox aprende com áudio bruto e transcrições associadas usando uma nova abordagem de Flow Matching, um avanço sobre os modelos de difusão.
O Voicebox se destaca na criação de clipes de áudio de alta qualidade, capaz de sintetizar fala em seis idiomas: inglês, francês, espanhol, alemão, polonês e português. Sua versatilidade se estende à realização de tarefas avançadas de edição de fala, como remoção de ruído, edição de conteúdo e conversão de estilo. Uma inovação fundamental é sua capacidade de modificar qualquer parte de uma amostra de áudio, não apenas o final, tornando-o mais flexível do que os modelos autorregressivos.
Em benchmarks de desempenho, o Voicebox supera significativamente os modelos existentes. Ele atinge inteligibilidade e similaridade de áudio superiores em comparação com o VALL-E em tarefas de texto para fala zero-shot, sendo até 20 vezes mais rápido. Para transferência de estilo multilíngue, o Voicebox reduz as taxas de erro de palavras e melhora a similaridade de áudio quando comparado ao YourTTS. Esses avanços estabelecem novos resultados de ponta em benchmarks em inglês e multilíngues para métricas de taxa de erro de palavras e similaridade de estilo de áudio.
As capacidades do Voicebox permitem vários casos de uso interessantes. Ele pode realizar síntese de texto para fala em contexto, combinando o estilo de uma pequena amostra de áudio para a geração de nova fala. A transferência de estilo multilíngue permite comunicação natural entre barreiras linguísticas. Além disso, seus recursos de redução de ruído e edição de fala podem reparar perfeitamente segmentos de áudio corrompidos ou substituir palavras mal pronunciadas, simplificando a pós-produção de áudio. O modelo também pode gerar amostras de fala diversas que representam padrões de fala do mundo real, que podem ser usadas para treinar modelos de assistente de fala mais robustos.
Reconhecendo o potencial de uso indevido, a Meta AI não está disponibilizando publicamente o modelo ou o código do Voicebox neste momento. Em vez disso, eles estão compartilhando amostras de áudio e um artigo de pesquisa detalhado que descreve a abordagem e os resultados. Isso inclui informações sobre um classificador altamente eficaz desenvolvido para distinguir entre áudio autêntico e gerado pelo Voicebox, visando mitigar riscos potenciais e promover o desenvolvimento responsável de IA.
Destaques de Voicebox
Modelo de IA generativa para fala
Generaliza em tarefas de fala
Desempenho de ponta
Sintetiza fala em seis idiomas
Realiza remoção de ruído
Permite edição de conteúdo
Suporta conversão de estilo
Gera amostras de fala diversas
Utiliza modelo Flow Matching
Modifica qualquer parte de uma amostra de áudio
Supera o VALL-E em TTS zero-shot
Supera o YourTTS em transferência de estilo multilíngue
Alcança novos resultados de ponta em benchmarks
Treinado com mais de 50.000 horas de dados de fala
Primeiros passos com Voicebox
Acesso ao modelo: Obtenha acesso ao modelo Voicebox através de publicações de pesquisa e amostras compartilhadas.
Entenda a abordagem: Estude o artigo de pesquisa detalhando o método Flow Matching e os dados de treinamento.
Avalie o desempenho: Analise as amostras de áudio fornecidas e os resultados de benchmark para inteligibilidade e similaridade.
Explore as capacidades: Revise casos de uso como TTS em contexto, transferência multilíngue e edição de áudio.
Avalie IA responsável: Entenda o classificador desenvolvido para distinguir áudio gerado.
Casos de uso de Voicebox
- Síntese de Fala
- Edição de Áudio
- Transferência de Estilo
- Comunicação Multilíngue
- Geração de Dados Sintéticos
- Ferramentas de Acessibilidade
- Assistentes Virtuais





