الوصف
يقدم مستودع أكواد البحث UNITER، الذي تم تقديمه في ورقة ECCV 2020 بعنوان 'UNITER: UNiversal Image-TExt Representation Learning'، مجموعة شاملة من الأدوات لأبحاث الذكاء الاصطناعي متعدد الوسائط. يسهل هذا المستودع الضبط الدقيق والاستدلال لمجموعة من مهام الرؤية واللغة، بما في ذلك الإجابة على الأسئلة المرئية (VQA)، والاستدلال المنطقي البصري (VCR)، و SNLI-VE (الاستدلال البصري)، واسترجاع الصور والنصوص لمجموعات بيانات مثل COCO و Flickr30k، وفهم التعبيرات المرجعية (RefCOCO، RefCOCO+، RefCOCO-g).
يعتمد UNITER على إطار عمل عالمي لتعلم تمثيل الصور والنصوص. يدعم الكود نقاط التحقق المدربة مسبقًا لكل من UNITER-base و UNITER-large، مع خيارات للتدريب المسبق ضمن المجال. يتضمن المستودع نصوصًا برمجية لمعالجة البيانات المسبقة، وتدريب النموذج، والاستدلال. يستفيد من المكتبات الخارجية مثل PyTorch و HuggingFace Transformers و OpenNMT و Nvidia's DeepLearningExamples، مع استخراج ميزات الصور باستخدام BUTD.
لتسهيل إعادة الإنتاج، يتم توفير صورة Docker، والتي تتطلب إصدارات محددة من برامج تشغيل NVIDIA و Docker. يتضمن الإعداد تحميل مجلدات الكود المصدري والبيانات إلى الحاوة. يفصل المستودع أدلة البدء السريع لمهام مثل NLVR2، موضحًا تنزيل البيانات، وتشغيل حاوية Docker، والضبط الدقيق، وإجراءات الاستدلال/التقييم. يتم دعم التخصيص من خلال وسيطات سطر الأوامر وملفات تكوين JSON، مع خيارات للتدريب متعدد وحدات معالجة الرسومات باستخدام Horovod.
يحدد المشروع أيضًا خطوات للمهام اللاحقة مثل VQA، و VCR (بما في ذلك خيار تدريب مسبق للمرحلة الثانية)، والاستدلال البصري، واسترجاع الصور والنصوص (كل من التدريب الصفري والضبط الدقيق مع سلبيات صعبة لـ Flickr30k و COCO)، والتعبيرات المرجعية، والتدريب المسبق ضمن المجال. يتم توجيه المستخدمين لتنزيل مجموعات بيانات محددة وتشغيل نصوص التدريب والاستدلال الخاصة بها. المستودع مرخص بموجب ترخيص MIT.
أبرز ملامح UNITER Research Code
أكواد بحث رسمية لورقة ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'
يدعم الضبط الدقيق لـ NLVR2، VQA، VCR، SNLI-VE، استرجاع الصور والنصوص، والتعبيرات المرجعية
يوفر نقاط تحقق مدربة مسبقًا لنماذج UNITER-base و UNITER-large
يتضمن نصوصًا برمجية لمعالجة البيانات المسبقة، وتدريب النموذج، والاستدلال
يقدم صورة Docker لتبسيط إعادة الإنتاج وإعداد البيئة
يدعم التدريب متعدد وحدات معالجة الرسومات عبر Horovod
يتضمن أكوادًا للتدريب الصفري والضبط الدقيق لمهام استرجاع الصور والنصوص
يسهل التدريب المسبق ضمن المجال والتدريب المسبق للمرحلة الثانية لـ VCR
البدء مع UNITER Research Code
قم بتنزيل نقاط التحقق المدربة مسبقًا وبيانات المهام المحددة باستخدام النصوص البرمجية Bash المقدمة.
قم بتشغيل حاوية Docker لبيئة متسقة وقابلة للتكرار.
قم بدمج تدريب النموذج عن طريق تشغيل نصوص الضبط الدقيق بتكوينات مخصصة.
قم بإجراء الاستدلال على المهام اللاحقة باستخدام نصوص الاستدلال المخصصة.
قم بتقييم أداء النموذج باستخدام نصوص التقييم المقدمة أو عن طريق إرسال النتائج إلى لوحات المتصدرين.
قم بتخصيص خيارات التدريب عبر وسيطات سطر الأوامر أو ملفات تكوين JSON.
حالات استخدام UNITER Research Code
- الإجابة على الأسئلة المرئية
- الاستدلال المنطقي البصري
- استرجاع الصور والنصوص
- فهم التعبيرات المرجعية
- الاستدلال البصري
- التدريب المسبق متعدد الوسائط







