تخطَّ إلى المحتوى الرئيسي
ToolPotion

Make-An-Audio

Make-An-Audio هو نظام لتوليد الصوت من النص يستخدم نماذج الانتشار المعززة بالمطالبات. يعالج ندرة البيانات وتعقيد الصوت باستخدام تعزيز المطالبات الزائفة ومشفرات السيارات الطيفية. يحقق النظام أحدث النتائج ويوفر قابلية التحكم لتوليد صوت عالي الدقة وعالي الدقة من مدخلات متنوعة.

زيارة الرابط

الوصف

يمثل Make-An-Audio تقدمًا كبيرًا في توليد الصوت من النص، حيث يستفيد من نماذج الانتشار المعززة بالمطالبات للتغلب على تحديات مثل محدودية مجموعات البيانات عالية الجودة وتعقيد نمذجة تسلسلات الصوت الطويلة. يقدم النظام تقنية جديدة لتعزيز المطالبات الزائفة، باستخدام نهج التقطير ثم إعادة البرمجة. تعالج هذه الطريقة بفعالية ندرة البيانات من خلال دمج البيانات ذات الإشراف الضعيف، بما في ذلك الأصوات الخالية من اللغة.

علاوة على ذلك، يستخدم Make-An-Audio مشفرًا تلقائيًا للطيف التنبؤي لتمثيلات الصوت ذاتية الإشراف بدلاً من الموجات الصوتية الخام. هذا الاختيار المعماري، جنبًا إلى جنب مع تمثيلات التدريب المسبق القوية للغة والصوت المتناقضة (CLAP)، يمكّن النموذج من تحقيق أداء حديث في كل من التقييمات الموضوعية والذاتية. يُظهر النظام قابلية تحكم ملحوظة من خلال التوجيه الخالي من المصنفات، مما يسمح للمستخدمين بضبط مخرجات الصوت المولدة بدقة.

بالإضافة إلى توليد الصوت الأساسي من النص، يعرض Make-An-Audio قدرات تعميم رائعة لمهام X-to-Audio، مجسدًا مبدأ "لا تترك أي وسيط خلف الركب". هذا يفتح القدرة على توليد صوت عالي الدقة وعالي الدقة بناءً على مدخلات الوسائط التي يحددها المستخدم. يدعم النظام توليد الصوت المخصص من النص، مما يتيح حقن كائنات فريدة في مشاهد جديدة والتحول عبر أنماط مختلفة. تشمل الأمثلة توليد "بكاء طفل" من صوت "رعد" أولي، مما ينتج عنه صوت واقعي ودقيق. كما أنه يدعم ترميم الصوت وتوليد الصوت من الصور، مما يوسع إمكاناته الإبداعية.

أبرز ملامح Make-An-Audio

  • نموذج انتشار معزز بالمطالبات لتوليد الصوت من النص

  • تعزيز المطالبات الزائفة باستخدام نهج التقطير ثم إعادة البرمجة

  • مشفر تلقائي للطيف للتنبؤ بتمثيل الصوت

  • تمثيلات التدريب المسبق للغة والصوت المتناقضة (CLAP)

  • توجيه خالٍ من المصنفات للتحكم

  • تعميم لمهام X-to-Audio (مثل، من صورة إلى صوت، من فيديو إلى صوت)

  • توليد صوت مخصص من النص مع حقن الكائنات وتحويل الأنماط

  • قدرات ترميم الصوت

  • يولد صوتًا عالي الدقة وعالي الدقة

  • يعالج ندرة البيانات في توليد الصوت

البدء مع Make-An-Audio

  1. الوصول إلى النموذج: احصل على وصول إلى نموذج Make-An-Audio.

  2. التكامل عبر API: اتصل بواجهة برمجة تطبيقات النموذج للاستخدام البرمجي.

  3. تقديم مطالبة نصية: أدخل الأوصاف النصية المطلوبة لتوليد الصوت.

  4. تحديد مدخلات الوسائط (اختياري): لمهام X-to-Audio، قدم مدخلات صور أو فيديو ذات صلة.

  5. تكوين التوجيه: استخدم التوجيه الخالي من المصنفات لضبط خصائص الصوت بدقة.

  6. توليد الصوت: ابدأ عملية توليد الصوت.

  7. تحسين المخرجات: اضبط المعلمات لمهام الصوت المخصصة أو ترميم الصوت.

حالات استخدام Make-An-Audio

  • توليف الكلام من النص
  • توليد المؤثرات الصوتية
  • ترميم الصوت
  • من صورة إلى صوت
  • من فيديو إلى صوت
  • محتوى صوتي مخصص
  • توليد الموسيقى
  • أبحاث الذكاء الاصطناعي

الأسئلة الشائعة من Make-An-Audio

تقييمات Make-An-Audio

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Make-An-Audio

نماذج الذكاء الاصطناعي

AudioGen هو نموذج ذكاء اصطناعي توليدي ذاتي الانحدار ينشئ عينات صوتية بناءً على تسميات نصية وصفية. يعالج تحديات توليد الصوت، مثل فصل المصادر، والتعامل مع الضوضاء الواقعية،…

مولّدات الموسيقى بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

AudioLDM هو إطار عمل لتوليد الصوت من النص يستخدم نماذج الانتشار الكامنة. يقوم بترجمة الوسائط المختلفة إلى 'لغة صوتية' (LOA) موحدة لتوليد الكلام والموسيقى والمؤثرات الصوتية. يتيح…

مولّدات الموسيقى بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

SoundStorm هو نموذج ذكاء اصطناعي لتوليد الصوت بكفاءة وغير تصاعدية. ينتج صوتًا عالي الجودة أسرع بمرتين من الطرق السابقة، مع الحفاظ على الاتساق في الصوت والظروف الصوتية. يمكنه توليف…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MusicLM هو نموذج ذكاء اصطناعي يولد موسيقى عالية الدقة من وصف نصي. يمكنه إنتاج موسيقى تصل إلى 24 كيلو هرتز تظل متسقة لعدة دقائق، متفوقًا على الأنظمة السابقة في جودة الصوت والالتزام…

مولّدات الموسيقى بالذكاء الاصطناعي

مستودعات GitHub للذكاء الاصطناعي

Audiocraft هي مكتبة PyTorch لتوليد ومعالجة الصوت بالتعلم العميق. تقدم نماذج متطورة مثل MusicGen لتوليد الموسيقى القابلة للتحكم و AudioGen للصوت من النص. تتضمن المكتبة أيضًا ضاغط…

مولّدات الموسيقى بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

Voicebox هو نموذج ذكاء اصطناعي توليدي للكلام يعمم عبر مهام متعددة بأداء متطور. يمكنه توليف الكلام، وإزالة الضوضاء، وتحرير المحتوى، وتحويل الأساليب، وتوليد عينات متنوعة بست لغات،…

مولّدات الأصوات بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

Stable Audio هي أداة ذكاء اصطناعي توليدي لإنشاء موسيقى ومؤثرات صوتية أصلية. تسمح للمستخدمين بتحويل الأوامر النصية إلى صوت عالي الجودة يصل طوله إلى ست دقائق، ومناسب للاستخدام…

مميزةمولّدات الموسيقى بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

استكشف عروضًا توضيحية لتوليد الصوت مدعومة بـ DiffWave، وهو نموذج انتشار متعدد الاستخدامات. يعرض هذا المورد إمكانيات الترميز الصوتي العصبي، والتوليد المشروط بالفئة، وإنشاء الموجات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة