الوصف
IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention) هو نموذج لغة مرئي مفتوح الوصول تم تطويره لتعزيز الشفافية وإضفاء الطابع الديمقراطي على الذكاء الاصطناعي. إنه إعادة إنتاج مفتوحة لنموذج Flamingo من DeepMind، وهو نموذج لغة مرئي متطور لم يتم إصداره علنًا. على غرار نماذج مثل GPT-4، يمكن لـ IDEFICS معالجة تسلسلات عشوائية من الصور والنصوص، وتوليد مخرجات نصية متماسكة.
تم بناء IDEFICS حصريًا على بيانات ونماذج متاحة للجمهور، بما في ذلك LLaMA v1 و OpenCLIP، وهو متوفر في نسختين: نسخة أساسية ونسخة موجهة. كل نسخة تأتي بحجمين من المعلمات: 9 مليار و 80 مليار. يؤكد المشروع على الشفافية من خلال استخدام البيانات العامة فقط، وتوفير أدوات لاستكشاف مجموعات بيانات التدريب، ومشاركة الدروس التقنية المستفادة، وإجراء تقييمات أخلاقية داخلية من خلال الاستدراج (red teaming) قبل الإصدار.
يتفوق IDEFICS في مهام مثل الإجابة على الأسئلة المتعلقة بالصور، ووصف المحتوى المرئي، وإنشاء قصص مستندة إلى صور متعددة. أدائه قابل للمقارنة مع نموذج Flamingo الأصلي المغلق المصدر عبر معايير فهم الصور والنصوص المختلفة. تم تدريب النموذج على مزيج من مجموعات البيانات المتاحة علنًا مثل Wikipedia و Public Multimodal Dataset و LAION، بالإضافة إلى مجموعة بيانات جديدة بحجم 115 مليار رمز تسمى OBELICS، والتي تتكون من 141 مليون مستند ويب متداخل من الصور والنصوص.
يلتزم فريق التطوير بتعزيز البحث المفتوح في أنظمة الذكاء الاصطناعي متعددة الوسائط. يهدف IDEFICS إلى أن يكون أساسًا قويًا لمجتمع الذكاء الاصطناعي، ويكمل إعادة الإنتاج المفتوحة الأخرى مثل OpenFlamingo. وجه الميثاق الأخلاقي للمشروع القرارات، مع إعطاء الأولوية للنقد الذاتي والشفافية والإنصاف. يتم تشجيع المستخدمين على استكشاف العرض التوضيحي وبطاقات النماذج وبطاقة مجموعة البيانات، وتقديم ملاحظات للمساعدة في التحسين المستمر لهذه النماذج وإمكانية الوصول إلى الذكاء الاصطناعي متعدد الوسائط الكبير.
أبرز ملامح نموذج اللغة المرئي IDEFICS
نموذج لغة مرئي مفتوح الوصول
يعيد إنتاج قدرات متطورة
يقبل مدخلات متداخلة من الصور والنصوص
يولد مخرجات نصية
أداء قابل للمقارنة مع النماذج المملوكة
متوفر بأحجام معلمات 9 مليار و 80 مليار
يتم تقديم نسخ أساسية وموجهة
تم تدريبه على بيانات ونماذج متاحة للجمهور
يدعم أبحاث الذكاء الاصطناعي متعدد الوسائط
يشمل تقييمًا أخلاقيًا من خلال اختبار الاستدراج (red teaming)
تصور تفاعلي لمجموعة بيانات التدريب متاح
البدء مع نموذج اللغة المرئي IDEFICS
الوصول إلى النموذج: ابحث عن نماذج IDEFICS على Hugging Face Hub.
إعداد البيئة: تأكد من تثبيت أحدث إصدار من transformers.
تحميل النموذج والمعالج: استورد الفئات الضرورية وقم بتحميل نقطة فحص IDEFICS المطلوبة.
إعداد المدخلات: قم بإنشاء مطالبات بسلاسل نصية متداخلة وعناوين URL للصور أو صور PIL.
التكامل عبر API: استخدم طريقة `generate` مع المدخلات المعدة وحجج الإنشاء.
فك تشفير المخرجات: قم بمعالجة المعرفات المولدة للحصول على نص قابل للقراءة البشرية.
تشغيل الاستدلال: قم بتنفيذ الكود لتوليد نص بناءً على مدخلات متعددة الوسائط.
حالات استخدام نموذج اللغة المرئي IDEFICS
- الإجابة على أسئلة الصور
- وصف المحتوى المرئي
- سرد القصص متعدد الوسائط
- أساس البحث المفتوح
- شفافية الذكاء الاصطناعي
- إضفاء الطابع الديمقراطي على الذكاء الاصطناعي







