الوصف
يقدم AudioLDM إطار عمل جديد لتوليد الصوت الموحد، قادر على إنتاج الكلام والموسيقى والمؤثرات الصوتية من مطالبات نصية. يكمن الابتكار الأساسي في تمثيل 'لغة الصوت' (LOA) الخاص به، والذي يسمح بترجمة أي نوع صوت إلى تنسيق مشترك. يتم تسهيل هذه الترجمة بواسطة AudioMAE، وهو نموذج مدرب مسبقًا ذاتيًا، ونموذج GPT-2 لترجمة الوسائط.
تستخدم عملية التوليد نموذج انتشار كامن مشروط بـ LOA. يجلب هذا الهيكل مزايا كبيرة، بما في ذلك قدرات التعلم في السياق وإعادة استخدام نماذج AudioMAE ونماذج الانتشار الكامنة المدربة مسبقًا. تم تصميم الإطار للتغلب على تحديات النماذج المتخصصة لأنواع الصوت المختلفة من خلال تقديم نهج موحد ومتنوع.
توضح التجارب التي أجريت على المعايير الرئيسية لتوليد الصوت من النص، والموسيقى من النص، والكلام من النص أن AudioLDM يحقق أداءً متطورًا أو تنافسيًا مقارنة بالطرق الحالية. AudioLDM 2، وهو تقدم في الإطار، يعزز هذه القدرات بشكل أكبر، ويحقق نتائج من الدرجة الأولى في توليد الصوت من النص والموسيقى من النص، مع تقديم أيضًا مخرجات كلام من النص تنافسية تضاهي النماذج الرائدة الحالية.
يتضمن هيكل النموذج ربط مرحلة نموذج اللغة الدلالية للصوت (GPT-2) بمرحلة إعادة البناء الدلالي (نموذج الانتشار الكامن) باستخدام ميزات AudioMAE. يتحكم مبدل احتمالي ديناميكي في شرط نموذج الانتشار، باستخدام إما ميزات AudioMAE الحقيقية أو الميزات التي تم إنشاؤها بواسطة GPT-2. تساهم هذه المرونة في أدائه القوي عبر مهام توليد الصوت المتنوعة.
أبرز ملامح AudioLDM
توليد الصوت من النص
توليد الموسيقى من النص
توليد الكلام من النص
إطار عمل موحد لتوليد الصوت
تمثيل لغة الصوت (LOA)
نماذج الانتشار الكامنة
التدريب المسبق ذاتيًا (AudioMAE)
قدرات التعلم في السياق
GPT-2 لترجمة الوسائط
توليد الصوت المشروط
أداء متطور
إنشاء صوت متنوع
البدء مع AudioLDM
الوصول إلى النموذج: استخدم مستودع GitHub المقدم أو عرض HuggingFace.
التكامل عبر API: اتبع التوثيق للوصول البرمجي.
إعداد البيئة: قم بتثبيت المكتبات والتبعيات اللازمة.
إدخال المطالبات: قدم أوصافًا نصية للصوت المطلوب.
توليد الصوت: قم بتشغيل النموذج باستخدام مطالباتك لإنشاء ملفات صوتية.
تقييم النتائج: قم بتقييم الصوت الذي تم إنشاؤه من حيث الجودة والملاءمة.
حالات استخدام AudioLDM
- توليد المؤثرات الصوتية
- تأليف الموسيقى
- توليف الكلام
- نماذج أولية للصوت
- استكشاف الصوت الإبداعي
- أدوات الوصول



