Description
AudioGen est un modèle autorégressif génératif innovant conçu pour la génération de texte vers audio. Il s'attaque à la tâche complexe de produire des échantillons audio conditionnés par des entrées textuelles descriptives. Le modèle fonctionne en générant de l'audio dans une représentation audio discrète apprise, ce qui lui permet de produire des paysages sonores haute fidélité.
Le développement d'AudioGen aborde plusieurs défis importants inhérents à la génération de texte vers audio. La différenciation entre diverses sources sonores, surtout lorsqu'il y en a plusieurs simultanément, est difficile en raison de la nature de la propagation audio. Cette complexité est encore amplifiée par les conditions d'enregistrement du monde réel, y compris le bruit de fond et la réverbération. Une autre contrainte est la rareté des annotations textuelles, qui limite la scalabilité des données d'entraînement. De plus, la modélisation audio haute fidélité nécessite un encodage à des taux d'échantillonnage élevés, ce qui entraîne des séquences extrêmement longues et coûteuses en calcul à traiter.
Pour surmonter ces obstacles, AudioGen intègre plusieurs techniques avancées. Une stratégie d'augmentation impliquant le mélange de différents échantillons audio encourage le modèle à apprendre en interne la séparation des sources. Pour lutter contre la rareté des données texte-audio, dix ensembles de données diversifiés avec des types audio et des annotations textuelles variés ont été sélectionnés. Pour améliorer la vitesse d'inférence, la modélisation multi-flux est explorée, permettant des séquences plus courtes tout en maintenant un débit binaire et une qualité perceptive comparables. Le guidage sans classifieur est employé pour améliorer l'adhérence du modèle aux invites textuelles fournies. Les évaluations comparatives par rapport aux bases de référence existantes démontrent qu'AudioGen les surpasse à la fois en termes de métriques objectives et subjectives.
Au-delà de la génération initiale, AudioGen explore également sa capacité de continuation audio, conditionnelle et inconditionnelle. Cette fonctionnalité permet d'étendre des extraits audio existants avec du nouveau contenu guidé par du texte ou généré librement. L'architecture et les performances du modèle sont présentées à travers diverses comparaisons d'échantillons, y compris différentes tailles de modèles et l'impact du mélange et du guidage sans classifieur. L'exploration de la modélisation multi-flux souligne davantage sa flexibilité dans la gestion de la longueur et de la qualité des séquences.
Points forts de AudioGen
Génère des échantillons audio conditionnés par des légendes textuelles
Opère sur une représentation audio discrète apprise
Inclut une technique d'augmentation pour la séparation des sources
Utilise des ensembles de données sélectionnés pour la rareté des données texte-audio
Emploie la modélisation multi-flux pour une inférence plus rapide
Applique le guidage sans classifieur pour l'adhérence au texte
Surpasse les bases de référence sur les métriques objectives et subjectives
Prend en charge la continuation audio (conditionnelle et inconditionnelle)
Explore différentes tailles de modèles (par exemple, AudioGen-large, AudioGen-base)
Démontre l'impact du mélange et de l'échelle de guidage
Gère les complexités audio du monde réel comme le bruit de fond
Premiers pas avec AudioGen
Accéder au modèle : Obtenir l'accès au modèle AudioGen.
Authentification : Si nécessaire, authentifiez votre accès.
Configurer l'environnement : Préparez votre environnement de développement pour l'intégration.
Intégrer via API : Utilisez les points d'accès API fournis pour envoyer des invites textuelles.
Générer de l'audio : Recevez des échantillons audio générés basés sur vos entrées textuelles.
Optimiser les paramètres : Ajustez l'échelle de guidage et les configurations du modèle pour le résultat souhaité.
Cas d'utilisation de AudioGen
- Génération d'effets sonores
- Création de contenu audio
- Prototypage audio
- Outils d'accessibilité
- Expériences audio interactives
- Musique et conception sonore
- Continuation audio



