تخطَّ إلى المحتوى الرئيسي
ToolPotion

V-JEPA

V-JEPA هو تطبيق PyTorch للتعلم ذاتي الإشراف من الفيديو. يستخدم بنية تنبؤية مشتركة للتضمين لتعلم التمثيلات المرئية دون الحاجة إلى تعليقات بشرية أو إعادة بناء على مستوى البكسل. تم تصميم الكود والنماذج لمهام الفيديو والصور المتنوعة اللاحقة.

زيارة الرابط

الوصف

V-JEPA، أو بنية التنبؤ المشترك للتضمين للفيديو، هي قاعدة كود رسمية لـ PyTorch تم تطويرها بواسطة Meta AI Research (FAIR) للتعلم ذاتي الإشراف للتمثيلات المرئية من الفيديو. تركز هذه الطريقة على تعلم تمثيلات مرئية قوية من خلال المراقبة السلبية لبكسلات الفيديو من مجموعات بيانات مثل VideoMix2M. على عكس النماذج التوليدية التي تعتمد على إعادة بناء البكسل، يستخدم V-JEPA هدف تنبؤ الميزات غير المراقب. لا يتطلب هذا النموذج مشفرات صور مدربة مسبقًا، أو نصًا، أو أمثلة سلبية، أو تعليقات بشرية، أو إعادة بناء على مستوى البكسل، مما يجعله نهجًا غير مراقب بالكامل.

يتضمن جوهر منهجية V-JEPA مُتنبئًا يعمل في مساحة كامنة، بدلاً من مُفكك تشفير البكسل. يقوم هذا المُتنبئ بعمل تنبؤات للمناطق المفقودة في الفيديو بناءً على الأجزاء المرصودة. لتصور هذه التنبؤات، يتم استخدام نموذج انتشار شرطي لفك تشفير تنبؤات المساحة الكامنة إلى بكسلات قابلة للتفسير. بشكل حاسم، أثناء عملية فك التشفير هذه، تظل شبكات التشفير والمُتنبئ المدربة مسبقًا لـ V-JEPA مجمدة، مما يضمن الحفاظ على التمثيلات المتعلمة.

تم تنظيم قاعدة الكود لتسهيل كل من التدريب المسبق والتقييم. تحدد ملفات التكوين في دليل `configs` معلمات التجربة، مما يسمح للمستخدمين بتخصيص المسارات للسجلات، ونقاط الفحص، وبيانات التدريب. يحتوي دليل `app` على حلقات التدريب، مع `main.py` لتصحيح الأخطاء المحلي و `main_distributed.py` لتشغيل التدريب الموزع على المجموعات باستخدام أدوات مثل submitit و SLURM. يضم دليل `evals` نصوص التقييم للمهام مثل تصنيف الصور والفيديو، ويدعم أيضًا التنفيذ المحلي والموزع.

يتضمن إعداد البيانات إنشاء ملفات CSV لمجموعات بيانات الفيديو، حيث تحدد كل سطر المسار المطلق لملف الفيديو وتسمية فئة عددية (يتم تجاهلها أثناء التدريب المسبق غير المراقب ولكن يتم استخدامها للتقييمات المراقب). يتم إعداد مجموعات بيانات الصور باستخدام فئة PyTorch ImageFolder القياسية، وتتطلب بنية دليل محددة. يوفر المشروع نماذج مدربة مسبقًا، بما في ذلك متغيرات ViT-L و ViT-H، جنبًا إلى جنب مع مجسات انتباهية لمهام لاحقة مختلفة مثل K400، SSv2، ImageNet1K، Places205، و iNat21، مما يوضح تنوع التمثيلات المتعلمة.

الميزات الأساسية لـ V-JEPA

  • التعلم ذاتي الإشراف من الفيديو باستخدام بنية التنبؤ المشترك للتضمين (JEPA)

  • هدف تنبؤ الميزات غير المراقب في المساحة الكامنة

  • لا يعتمد على إعادة بناء البكسل أو التعليقات البشرية

  • تمثيلات مرئية متعددة الاستخدامات لمهام الفيديو والصور اللاحقة

  • قاعدة كود PyTorch رسمية مع نماذج وتكوينات مقدمة

  • يدعم التدريب والتقييم المحلي والموزع

  • يشمل نماذج مدربة مسبقًا (ViT-L، ViT-H) ومجسات انتباهية

  • إعداد بيانات مرن لمجموعات بيانات الفيديو والصور

  • قاعدة الكود تتضمن نصوص للتدريب المسبق والتقييم

  • تصورات عبر نماذج انتشار شرطي في المساحة الكامنة

البدء مع V-JEPA

  1. استنساخ المستودع: احصل على قاعدة كود V-JEPA من GitHub.

  2. تثبيت التبعيات: قم بإعداد بيئة Python (على سبيل المثال، باستخدام conda) وقم بتثبيت الحزم المطلوبة.

  3. تكوين التجارب: قم بتحديث المسارات في ملفات التكوين داخل دليل `configs` للبيانات والسجلات ونقاط الفحص.

  4. إعداد البيانات: قم بتنسيق مجموعات بيانات الفيديو والصور وفقًا لهيكل CSV أو ImageFolder المحدد.

  5. تشغيل التدريب المسبق: قم بتنفيذ التدريب المسبق المحلي أو الموزع باستخدام `app/main.py` أو `app/main_distributed.py`.

  6. تشغيل التقييمات: قم بتشغيل التقييمات المحلية أو الموزعة للمهام اللاحقة باستخدام `evals/main.py` أو `evals/main_distributed.py`.

  7. استخدام النماذج المدربة مسبقًا: قم بتنزيل ودمج نماذج V-JEPA المدربة مسبقًا المقدمة لتطبيقاتك.

حالات استخدام V-JEPA

  • تعلم تمثيلات الفيديو
  • تصنيف الصور
  • تصنيف الفيديو
  • التكيف مع المهام اللاحقة
  • البحث والتطوير
  • تنبؤ الميزات

الأسئلة الشائعة من V-JEPA

تقييمات V-JEPA

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل V-JEPA

نماذج الذكاء الاصطناعي

ViT-Adapter هو نموذج ذكاء اصطناعي يعزز أداء Vision Transformer (ViT) لمهام التنبؤ الكثيف مثل اكتشاف الكائنات والتجزئة. يقدم تحيزات استقرائية خاصة بالصور دون الحاجة إلى تدريب مسبق،…

أدوات الرؤية الحاسوبية

أطر عمل الذكاء الاصطناعي

GluonCV هو صندوق أدوات مفتوح المصدر للرؤية الحاسوبية يقدم أحدث خوارزميات التعلم العميق. يوفر مستودع نماذج واسعًا يضم أكثر من 170 نموذجًا مدربًا مسبقًا، وواجهات برمجة تطبيقات مرنة،…

أدوات الرؤية الحاسوبية

نموذج clip-vit-base-patch32 من OpenAI مصمم لمهام تصنيف الصور بدون تدريب مسبق. يستخدم بنية Vision Transformer لتعزيز القوة والقدرة على التعميم في رؤية الكمبيوتر، مما يجعله موردًا…

مميزةأدوات الرؤية الحاسوبية

مستودعات GitHub للذكاء الاصطناعي

كود مفتوح المصدر لـ MiniGPT-4 و MiniGPT-v2، نماذج لغوية كبيرة متقدمة تعزز فهم الرؤية واللغة. تتيح هذه النماذج التعلم متعدد المهام لمهام الرؤية واللغة، وتقدم قدرات لفهم الصور…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

LLaVA هو نموذج ضبط التعليمات المرئية يجمع بين قدرات اللغة والرؤية الكبيرة. يهدف إلى تحقيق أداء بمستوى GPT-4V، مما يتيح الفهم والتفاعل متعدد الوسائط. يوفر المشروع التعليمات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

LocalAI هو محرك ذكاء اصطناعي مفتوح المصدر يتيح للمستخدمين تشغيل نماذج متنوعة، بما في ذلك نماذج اللغة الكبيرة (LLMs)، والرؤية، والصوت، والصورة، والفيديو، على أي جهاز دون الحاجة إلى…

مميزةمنصّات تعلّم الآلة

مستودعات GitHub للذكاء الاصطناعي

Keras هي مكتبة مفتوحة المصدر للتعلم العميق مصممة للبشر. إنها تبسط عملية بناء الشبكات العصبية وتسمح للمطورين بالمساهمة في تطويرها على GitHub.

مميزةمنصّات تعلّم الآلة

نماذج الذكاء الاصطناعي

Oscar و VinVL هما نموذجان متقدمان للذكاء الاصطناعي لمهام الرؤية واللغة. يستخدم Oscar محاذاة الدلالات الكائنية للتدريب المسبق، محققًا أحدث النتائج. يعزز VinVL التمثيلات المرئية،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة