تخطَّ إلى المحتوى الرئيسي
ToolPotion

UNITER Research Code

UNITER هو مستودع أكواد بحثي لورقة ECCV 2020 بعنوان 'UNITER: UNiversal Image-TExt Representation Learning'. يوفر أكوادًا للضبط الدقيق والاستدلال عبر مهام متنوعة تجمع بين الرؤية واللغة، بما في ذلك VQA و VCR واسترجاع الصور والنصوص. تتوفر نقاط تحقق مدربة مسبقًا لـ UNITER-base و UNITER-large.

زيارة الرابط

الوصف

يقدم مستودع أكواد البحث UNITER، الذي تم تقديمه في ورقة ECCV 2020 بعنوان 'UNITER: UNiversal Image-TExt Representation Learning'، مجموعة شاملة من الأدوات لأبحاث الذكاء الاصطناعي متعدد الوسائط. يسهل هذا المستودع الضبط الدقيق والاستدلال لمجموعة من مهام الرؤية واللغة، بما في ذلك الإجابة على الأسئلة المرئية (VQA)، والاستدلال المنطقي البصري (VCR)، و SNLI-VE (الاستدلال البصري)، واسترجاع الصور والنصوص لمجموعات بيانات مثل COCO و Flickr30k، وفهم التعبيرات المرجعية (RefCOCO، RefCOCO+، RefCOCO-g).

يعتمد UNITER على إطار عمل عالمي لتعلم تمثيل الصور والنصوص. يدعم الكود نقاط التحقق المدربة مسبقًا لكل من UNITER-base و UNITER-large، مع خيارات للتدريب المسبق ضمن المجال. يتضمن المستودع نصوصًا برمجية لمعالجة البيانات المسبقة، وتدريب النموذج، والاستدلال. يستفيد من المكتبات الخارجية مثل PyTorch و HuggingFace Transformers و OpenNMT و Nvidia's DeepLearningExamples، مع استخراج ميزات الصور باستخدام BUTD.

لتسهيل إعادة الإنتاج، يتم توفير صورة Docker، والتي تتطلب إصدارات محددة من برامج تشغيل NVIDIA و Docker. يتضمن الإعداد تحميل مجلدات الكود المصدري والبيانات إلى الحاوة. يفصل المستودع أدلة البدء السريع لمهام مثل NLVR2، موضحًا تنزيل البيانات، وتشغيل حاوية Docker، والضبط الدقيق، وإجراءات الاستدلال/التقييم. يتم دعم التخصيص من خلال وسيطات سطر الأوامر وملفات تكوين JSON، مع خيارات للتدريب متعدد وحدات معالجة الرسومات باستخدام Horovod.

يحدد المشروع أيضًا خطوات للمهام اللاحقة مثل VQA، و VCR (بما في ذلك خيار تدريب مسبق للمرحلة الثانية)، والاستدلال البصري، واسترجاع الصور والنصوص (كل من التدريب الصفري والضبط الدقيق مع سلبيات صعبة لـ Flickr30k و COCO)، والتعبيرات المرجعية، والتدريب المسبق ضمن المجال. يتم توجيه المستخدمين لتنزيل مجموعات بيانات محددة وتشغيل نصوص التدريب والاستدلال الخاصة بها. المستودع مرخص بموجب ترخيص MIT.

أبرز ملامح UNITER Research Code

  • أكواد بحث رسمية لورقة ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'

  • يدعم الضبط الدقيق لـ NLVR2، VQA، VCR، SNLI-VE، استرجاع الصور والنصوص، والتعبيرات المرجعية

  • يوفر نقاط تحقق مدربة مسبقًا لنماذج UNITER-base و UNITER-large

  • يتضمن نصوصًا برمجية لمعالجة البيانات المسبقة، وتدريب النموذج، والاستدلال

  • يقدم صورة Docker لتبسيط إعادة الإنتاج وإعداد البيئة

  • يدعم التدريب متعدد وحدات معالجة الرسومات عبر Horovod

  • يتضمن أكوادًا للتدريب الصفري والضبط الدقيق لمهام استرجاع الصور والنصوص

  • يسهل التدريب المسبق ضمن المجال والتدريب المسبق للمرحلة الثانية لـ VCR

البدء مع UNITER Research Code

  1. قم بتنزيل نقاط التحقق المدربة مسبقًا وبيانات المهام المحددة باستخدام النصوص البرمجية Bash المقدمة.

  2. قم بتشغيل حاوية Docker لبيئة متسقة وقابلة للتكرار.

  3. قم بدمج تدريب النموذج عن طريق تشغيل نصوص الضبط الدقيق بتكوينات مخصصة.

  4. قم بإجراء الاستدلال على المهام اللاحقة باستخدام نصوص الاستدلال المخصصة.

  5. قم بتقييم أداء النموذج باستخدام نصوص التقييم المقدمة أو عن طريق إرسال النتائج إلى لوحات المتصدرين.

  6. قم بتخصيص خيارات التدريب عبر وسيطات سطر الأوامر أو ملفات تكوين JSON.

حالات استخدام UNITER Research Code

  • الإجابة على الأسئلة المرئية
  • الاستدلال المنطقي البصري
  • استرجاع الصور والنصوص
  • فهم التعبيرات المرجعية
  • الاستدلال البصري
  • التدريب المسبق متعدد الوسائط

الأسئلة الشائعة من UNITER Research Code

تقييمات UNITER Research Code

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل UNITER Research Code

Phi-4-reasoning-vision-15B هو نموذج ذكاء اصطناعي متعدد الوسائط تم تطويره بواسطة مايكروسوفت، مصمم للمهام التي تتطلب فهم اللغة البصرية وقدرات التفكير. يتفوق في التفكير العلمي ومهام…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Oscar و VinVL هما نموذجان متقدمان للذكاء الاصطناعي لمهام الرؤية واللغة. يستخدم Oscar محاذاة الدلالات الكائنية للتدريب المسبق، محققًا أحدث النتائج. يعزز VinVL التمثيلات المرئية،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

ALIGN هو نموذج ذكاء اصطناعي يوسع نطاق تعلم التمثيلات المرئية ولغة-الرؤية باستخدام إشراف نصي صاخب من أكثر من مليار زوج من الصور والنصوص البديلة. يحقق نتائج متطورة في الاسترجاع عبر…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LLaVA هو نموذج متعدد الوسائط كبير يجمع بين مشفر الرؤية ونموذج لغوي للفهم البصري واللغوي للأغراض العامة. يتفوق في قدرات الدردشة متعددة الوسائط، محاكياً GPT-4، ويحقق دقة متطورة في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

LLaVA هو نموذج ضبط التعليمات المرئية يجمع بين قدرات اللغة والرؤية الكبيرة. يهدف إلى تحقيق أداء بمستوى GPT-4V، مما يتيح الفهم والتفاعل متعدد الوسائط. يوفر المشروع التعليمات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلامنجو هو نموذج لغة مرئي (VLM) واحد من Google DeepMind يتفوق في التعلم بالقليل من الأمثلة عبر مهام متعددة الوسائط متنوعة. يقوم بمعالجة الصور ومقاطع الفيديو والنصوص المتداخلة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

جمني 3.1 برو هو نموذج متقدم للذكاء الاصطناعي مصمم للمهام المعقدة والتفكير العميق. يتفوق في الفهم متعدد الوسائط، مما يوفر استجابات ذكية وموجزة، مما يجعله مثالياً للتعلم والتخطيط…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة