تخطَّ إلى المحتوى الرئيسي
ToolPotion

TokenFlow

TokenFlow هو تطبيق PyTorch لتحرير الفيديو المتسق باستخدام نماذج الانتشار المدربة مسبقًا من النص إلى صورة. يتيح تحرير الفيديو المدفوع بالنص دون تدريب إضافي، مع الحفاظ على التخطيط المكاني والديناميكيات من خلال فرض الاتساق في ميزات الانتشار عبر الارتباطات بين الإطارات. يحقق نتائج متطورة على مقاطع الفيديو الواقعية.

زيارة الرابط

الوصف

يقدم TokenFlow إطار عمل مبتكر لتحرير الفيديو المتسق، مستفيدًا من نماذج الانتشار المدربة مسبقًا من النص إلى صورة دون الحاجة إلى أي تدريب أو ضبط إضافي. امتدت التطورات السريعة في الذكاء الاصطناعي التوليدي إلى توليد الفيديو، ومع ذلك غالبًا ما تقصر نماذج الفيديو المتطورة الحالية عن نماذج الصور من حيث الجودة المرئية والتحكم في المستخدم. تقدم هذه الورقة طريقة تستفيد من قوة نماذج الانتشار من النص إلى صورة لتحرير الفيديو المدفوع بالنص.

بالنظر إلى فيديو المصدر وموجه نصي مستهدف، يقوم TokenFlow بإنشاء فيديو عالي الجودة يتماشى مع النص المستهدف مع الحفاظ بدقة على التخطيط المكاني وديناميكيات فيديو الإدخال الأصلي. يكمن الابتكار الأساسي في ملاحظة أنه يمكن تحقيق الاتساق في الفيديو المُحرر من خلال فرض الاتساق داخل مساحة ميزات الانتشار. يتم تحقيق ذلك عن طريق نشر ميزات الانتشار بشكل صريح بناءً على الارتباطات بين الإطارات المتاحة بسهولة داخل النموذج. وبالتالي، يعمل الإطار دون الحاجة إلى أي تدريب أو ضبط وهو متوافق مع أي تقنية تحرير من النص إلى صورة جاهزة للاستخدام.

التطبيق متوفر في PyTorch وهو المستودع الرسمي لورقة "TokenFlow: Consistent Diffusion Features for Consistent Video Editing"، المقدمة في ICLR 2024. يوضح المشروع نتائج تحرير متطورة عبر مجموعة متنوعة من مقاطع الفيديو الواقعية. يمكن للمستخدمين استكشاف النتائج النموذجية وتفاصيل المشروع والأبحاث الأساسية من خلال الروابط المقدمة. تم تصميم الإطار للتحريرات التي تحافظ على الهيكل ويبني على تقنيات تحرير الصور الحالية مثل Plug-and-Play و ControlNet و SDEdit. يُنصح المستخدمون بالتأكد من التوافق مع تقنية التحرير الأساسية التي يختارونها، حيث قد يؤدي فك تشفير LDM إلى ظهور اهتزازات طفيفة اعتمادًا على محتوى الفيديو الأصلي.

الميزات الأساسية لـ TokenFlow

  • تطبيق PyTorch رسمي لـ TokenFlow

  • يتيح تحرير الفيديو المتسق باستخدام نماذج الانتشار المدربة مسبقًا

  • لا يتطلب تدريبًا أو ضبطًا إضافيًا

  • يحافظ على التخطيط المكاني وديناميكيات مقاطع الفيديو المدخلة

  • يحقق تحرير الفيديو المدفوع بالنص

  • يفرض الاتساق في مساحة ميزات الانتشار

  • يستخدم الارتباطات بين الإطارات لنشر الميزات

  • متوافق مع طرق التحرير الجاهزة من النص إلى صورة

  • يعرض نتائج تحرير متطورة

  • يدعم التحريرات التي تحافظ على الهيكل

  • يعمل مع تقنيات Plug-and-Play و ControlNet و SDEdit

البدء مع TokenFlow

  1. استنساخ: استنسخ مستودع TokenFlow من GitHub.

  2. تثبيت التبعيات: أنشئ بيئة conda وقم بتثبيت الحزم المطلوبة باستخدام `pip install -r requirements.txt`.

  3. المعالجة المسبقة: قم بإعداد الفيديو الخاص بك عن طريق تشغيل `python preprocess.py` مع مسار البيانات المحدد وموجه الاستدعاء.

  4. التكوين: قم بإنشاء ملف تكوين YAML لطريقة التحرير التي اخترتها (على سبيل المثال، `configs/config_pnp.yaml`).

  5. التنفيذ: قم بتشغيل برنامج التحرير النصي، مثل `python run_tokenflow_pnp.py`، باستخدام التكوين الخاص بك.

حالات استخدام TokenFlow

  • تعديل الفيديو المدفوع بالنص
  • تحرير الفيديو الذي يحافظ على الهيكل
  • إنشاء محتوى فيديو مدعوم بالذكاء الاصطناعي
  • تحسين جودة الفيديو
  • البحث والتطوير في ذكاء الفيديو الاصطناعي

الأسئلة الشائعة من TokenFlow

تقييمات TokenFlow

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل TokenFlow

نماذج الذكاء الاصطناعي

Lumiere هو نموذج انتشار زمني مكاني من Google Research لتوليد مقاطع فيديو واقعية ومتنوعة ومتماسكة. يقوم بتصنيع مدة الفيديو بالكامل في تمريرة واحدة، مما يتيح مهام متقدمة من النص إلى…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

VideoAI هو مولد فيديو بالذكاء الاصطناعي يحول النصوص والصور إلى مقاطع فيديو باستخدام نماذج رائدة مثل Kling وWan وSeedance وVeo. كما يقدم أدوات للصور وتوليد موسيقى بالذكاء الاصطناعي…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

نماذج الذكاء الاصطناعي

Imagen Video هو نظام لتوليد الفيديو المشروط بالنص طورته Google Research. يستفيد من سلسلة من نماذج الانتشار للفيديو لإنشاء مقاطع فيديو عالية الدقة من مطالبات نصية، مما يوفر دقة…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

يحول Stable Video Diffusion Online الصور والنصوص إلى مقاطع فيديو قصيرة باستخدام نموذج ذكاء اصطناعي متقدم. هذه الأداة التجريبية البحثية توسع إمكانيات إنشاء المحتوى لوسائل الإعلام…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

يقدم محرر الفيديو بالذكاء الاصطناعي CapCut تحريرًا ذكيًا للفيديو عبر الإنترنت مع أدوات ذكاء اصطناعي متقدمة لإنشاء محتوى رائج. يتميز بتصميم الذكاء الاصطناعي، واستوديو الفيديو،…

مميزةمحرّرات الفيديو بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

VideoPoet هو نموذج لغوي كبير من Google Research قادر على توليد الفيديو بدون تدريب مسبق (zero-shot). يقوم بتحويل نماذج اللغة التنبؤية الذاتية إلى مولدات فيديو عالية الجودة، ويدعم…

مولّدات الفيديو بالذكاء الاصطناعي

مستودعات GitHub للذكاء الاصطناعي

Kandinsky 2 هو نموذج انتشار كامن متعدد اللغات من النص إلى الصورة. يوفر إمكانيات متقدمة لتوليد الصور، بما في ذلك التحويل من نص إلى صورة، ومن صورة إلى صورة، والتضمين (inpainting).…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

StoryDiffusion هي أداة ذكاء اصطناعي لتوليد صور وفيديوهات متسقة عبر تسلسلات طويلة. تستخدم آلية الانتباه الذاتي المتسق لضمان اتساق الشخصيات في توليد الصور، وتنبؤ الحركة لتوليد…

مولّدات الصور بالذكاء الاصطناعي