Descripción
Investigadores de Meta AI han desarrollado Voicebox, un innovador modelo de IA generativa para voz que demuestra capacidades de generalización en tareas para las que no fue entrenado específicamente, logrando un rendimiento de vanguardia. A diferencia de los modelos anteriores de IA de voz que requerían datos de entrenamiento específicos para cada tarea, Voicebox aprende de audio sin procesar y transcripciones asociadas utilizando un novedoso enfoque de Flow Matching, un avance sobre los modelos de difusión.
Voicebox se destaca en la creación de clips de audio de alta calidad, capaz de sintetizar voz en seis idiomas: inglés, francés, español, alemán, polaco y portugués. Su versatilidad se extiende a la realización de tareas avanzadas de edición de voz, como la eliminación de ruido, la edición de contenido y la conversión de estilos. Una innovación clave es su capacidad para modificar cualquier parte de una muestra de audio, no solo el final, lo que lo hace más flexible que los modelos autorregresivos.
En los puntos de referencia de rendimiento, Voicebox supera significativamente a los modelos existentes. Logra una inteligibilidad y similitud de audio superiores en comparación con VALL-E en tareas de texto a voz (TTS) de disparo cero, siendo hasta 20 veces más rápido. Para la transferencia de estilo multilingüe, Voicebox reduce las tasas de error de palabras y mejora la similitud de audio en comparación con YourTTS. Estos avances establecen nuevos resultados de vanguardia en puntos de referencia tanto en inglés como multilingües para las métricas de tasa de error de palabras y similitud de estilo de audio.
Las capacidades de Voicebox permiten varios casos de uso interesantes. Puede realizar síntesis de texto a voz en contexto, igualando el estilo de una muestra de audio corta para la generación de nueva voz. La transferencia de estilo multilingüe permite una comunicación natural a través de barreras lingüísticas. Además, sus funciones de eliminación de ruido y edición de voz pueden reparar sin problemas segmentos de audio corruptos o reemplazar palabras mal pronunciadas, simplificando la postproducción de audio. El modelo también puede generar muestras de voz diversas que representan patrones de voz del mundo real, que pueden usarse para entrenar modelos de asistentes de voz más robustos.
Reconociendo el potencial de uso indebido, Meta AI no está haciendo que el modelo o el código de Voicebox estén disponibles públicamente en este momento. En su lugar, están compartiendo muestras de audio y un artículo de investigación detallado que describe el enfoque y los resultados. Esto incluye información sobre un clasificador altamente efectivo desarrollado para distinguir entre audio auténtico y generado por Voicebox, con el objetivo de mitigar riesgos potenciales y promover el desarrollo responsable de la IA.
Aspectos destacados de Voicebox
Modelo de IA generativa para voz
Se generaliza en tareas de voz
Rendimiento de vanguardia
Sintetiza voz en seis idiomas
Realiza eliminación de ruido
Permite la edición de contenido
Soporta conversión de estilo
Genera muestras de voz diversas
Utiliza modelo Flow Matching
Modifica cualquier parte de una muestra de audio
Supera a VALL-E en TTS de disparo cero
Supera a YourTTS en transferencia de estilo multilingüe
Logra nuevos resultados de vanguardia en benchmarks
Entrenado con más de 50.000 horas de datos de voz
Primeros pasos con Voicebox
Acceso al modelo: Obtenga acceso al modelo Voicebox a través de publicaciones de investigación y muestras compartidas.
Comprender el enfoque: Estudie el artículo de investigación que detalla el método Flow Matching y los datos de entrenamiento.
Evaluar el rendimiento: Analice las muestras de audio proporcionadas y los resultados de los benchmarks de inteligibilidad y similitud.
Explorar capacidades: Revise los casos de uso como TTS en contexto, transferencia multilingüe y edición de audio.
Evaluar IA responsable: Comprenda el clasificador desarrollado para distinguir el audio generado.
Casos de uso de Voicebox
- Síntesis de Voz
- Edición de Audio
- Transferencia de Estilo
- Comunicación Multilingüe
- Generación de Datos Sintéticos
- Herramientas de Accesibilidad
- Asistentes Virtuales





