Descripción
SoundStorm es un modelo avanzado de IA diseñado para la generación de audio altamente eficiente y no autorregresiva. Toma tokens semánticos de AudioLM como entrada y utiliza atención bidireccional junto con decodificación paralela basada en confianza para generar los tokens para un códec de audio neuronal. Este enfoque acelera significativamente la producción de audio, logrando velocidades dos órdenes de magnitud más rápidas que la generación autorregresiva de AudioLM.
Este modelo se destaca en la producción de audio de calidad equivalente y consistencia superior en voz y condiciones acústicas en comparación con sus predecesores. Una capacidad clave es su habilidad para generar 30 segundos de audio en solo 0.5 segundos en una TPU-v4. SoundStorm demuestra escalabilidad para secuencias de audio más largas, permitiendo la síntesis de segmentos de diálogo naturales y de alta calidad. Esto se logra condicionando en una transcripción anotada con turnos de hablantes y una breve muestra de voz del hablante deseado.
Cuando se integra con etapas de modelado de texto a semántica como SPEAR-TTS, SoundStorm puede sintetizar diálogos de sonido natural. Los usuarios pueden controlar con precisión el contenido hablado a través de transcripciones, la voz del hablante mediante breves muestras y el flujo de la conversación a través de anotaciones de turnos de hablantes. Por ejemplo, sintetizar segmentos de diálogo de 30 segundos solo toma 2 segundos en una sola TPU-v4, incluso para texto y hablantes no vistos durante el entrenamiento.
SoundStorm también ofrece capacidades para la generación de audio tanto sin indicaciones como con indicaciones. En el escenario sin indicaciones, muestrea diferentes hablantes, mientras que en el caso con indicaciones, mantiene la voz del hablante con alta fidelidad. Esto lo convierte en una herramienta poderosa para diversas tareas de síntesis de audio. En comparación con métodos base como AudioLM y decodificación codiciosa, SoundStorm ofrece una consistencia acústica mejorada y una mejor preservación de la voz a partir de las indicaciones, junto con una mayor calidad de audio.
El pipeline de generación eficiente del modelo hace que la investigación en generación de audio sea más accesible. Si bien la capacidad de imitar voces genera preocupaciones sobre un posible uso indebido, como la suplantación de identidad, se están desarrollando salvaguardias. Se ha demostrado que el audio generado por SoundStorm es detectable por clasificadores dedicados, mitigando algunos riesgos. La investigación tiene como objetivo avanzar la tecnología de generación de audio de manera responsable.
Aspectos destacados de SoundStorm
Generación de audio eficiente y no autorregresiva
Genera audio dos órdenes de magnitud más rápido que AudioLM
Mantiene alta consistencia en voz y condiciones acústicas
Sintetiza segmentos de diálogo naturales con control de hablante
Acepta tokens semánticos de AudioLM como entrada
Utiliza atención bidireccional y decodificación paralela basada en confianza
Escalable a secuencias de audio más largas
Soporta la síntesis de diálogo con control sobre contenido, voz y turnos de hablantes
Puede generar audio a partir de modelos de texto a semántica
Demuestra alta consistencia acústica y preservación de voz en generación con indicaciones
Produce audio de mayor calidad en comparación con bases de decodificación codiciosa
Primeros pasos con SoundStorm
Acceder al modelo: Obtener acceso al modelo SoundStorm y sus componentes asociados.
Configurar entorno: Configurar el entorno de software y hardware necesario para ejecutar el modelo.
Introducir tokens semánticos: Proporcionar los tokens semánticos generados por AudioLM a SoundStorm.
Integrar vía API: Utilizar la API del modelo para una integración fluida en pipelines de generación de audio.
Proporcionar información de condicionamiento: Suministrar transcripciones, anotaciones de turnos de hablantes y muestras de voz para síntesis controlada.
Generar audio: Ejecutar el proceso de generación para producir representaciones de códec de audio neuronal.
Decodificar audio: Convertir las representaciones generadas en sonido audible utilizando un códec de audio neuronal.
Casos de uso de SoundStorm
- Síntesis de Diálogos
- Clonación de Voz
- Generación Rápida de Audio
- Síntesis de Voz
- Creación de Contenido de Audio
- Herramientas de Accesibilidad
- Aceleración de Investigación

