الوصف
يمثل Make-An-Audio تقدمًا كبيرًا في توليد الصوت من النص، حيث يستفيد من نماذج الانتشار المعززة بالمطالبات للتغلب على تحديات مثل محدودية مجموعات البيانات عالية الجودة وتعقيد نمذجة تسلسلات الصوت الطويلة. يقدم النظام تقنية جديدة لتعزيز المطالبات الزائفة، باستخدام نهج التقطير ثم إعادة البرمجة. تعالج هذه الطريقة بفعالية ندرة البيانات من خلال دمج البيانات ذات الإشراف الضعيف، بما في ذلك الأصوات الخالية من اللغة.
علاوة على ذلك، يستخدم Make-An-Audio مشفرًا تلقائيًا للطيف التنبؤي لتمثيلات الصوت ذاتية الإشراف بدلاً من الموجات الصوتية الخام. هذا الاختيار المعماري، جنبًا إلى جنب مع تمثيلات التدريب المسبق القوية للغة والصوت المتناقضة (CLAP)، يمكّن النموذج من تحقيق أداء حديث في كل من التقييمات الموضوعية والذاتية. يُظهر النظام قابلية تحكم ملحوظة من خلال التوجيه الخالي من المصنفات، مما يسمح للمستخدمين بضبط مخرجات الصوت المولدة بدقة.
بالإضافة إلى توليد الصوت الأساسي من النص، يعرض Make-An-Audio قدرات تعميم رائعة لمهام X-to-Audio، مجسدًا مبدأ "لا تترك أي وسيط خلف الركب". هذا يفتح القدرة على توليد صوت عالي الدقة وعالي الدقة بناءً على مدخلات الوسائط التي يحددها المستخدم. يدعم النظام توليد الصوت المخصص من النص، مما يتيح حقن كائنات فريدة في مشاهد جديدة والتحول عبر أنماط مختلفة. تشمل الأمثلة توليد "بكاء طفل" من صوت "رعد" أولي، مما ينتج عنه صوت واقعي ودقيق. كما أنه يدعم ترميم الصوت وتوليد الصوت من الصور، مما يوسع إمكاناته الإبداعية.
أبرز ملامح Make-An-Audio
نموذج انتشار معزز بالمطالبات لتوليد الصوت من النص
تعزيز المطالبات الزائفة باستخدام نهج التقطير ثم إعادة البرمجة
مشفر تلقائي للطيف للتنبؤ بتمثيل الصوت
تمثيلات التدريب المسبق للغة والصوت المتناقضة (CLAP)
توجيه خالٍ من المصنفات للتحكم
تعميم لمهام X-to-Audio (مثل، من صورة إلى صوت، من فيديو إلى صوت)
توليد صوت مخصص من النص مع حقن الكائنات وتحويل الأنماط
قدرات ترميم الصوت
يولد صوتًا عالي الدقة وعالي الدقة
يعالج ندرة البيانات في توليد الصوت
البدء مع Make-An-Audio
الوصول إلى النموذج: احصل على وصول إلى نموذج Make-An-Audio.
التكامل عبر API: اتصل بواجهة برمجة تطبيقات النموذج للاستخدام البرمجي.
تقديم مطالبة نصية: أدخل الأوصاف النصية المطلوبة لتوليد الصوت.
تحديد مدخلات الوسائط (اختياري): لمهام X-to-Audio، قدم مدخلات صور أو فيديو ذات صلة.
تكوين التوجيه: استخدم التوجيه الخالي من المصنفات لضبط خصائص الصوت بدقة.
توليد الصوت: ابدأ عملية توليد الصوت.
تحسين المخرجات: اضبط المعلمات لمهام الصوت المخصصة أو ترميم الصوت.
حالات استخدام Make-An-Audio
- توليف الكلام من النص
- توليد المؤثرات الصوتية
- ترميم الصوت
- من صورة إلى صوت
- من فيديو إلى صوت
- محتوى صوتي مخصص
- توليد الموسيقى
- أبحاث الذكاء الاصطناعي


