تخطَّ إلى المحتوى الرئيسي
ToolPotion

نموذج اللغة المرئي IDEFICS

IDEFICS هو نموذج لغة مرئي مفتوح الوصول يعيد إنتاج قدرات متطورة. يقبل مدخلات متداخلة من الصور والنصوص لتوليد مخرجات نصية، قابلة للمقارنة مع نماذج مملوكة مثل Flamingo. متوفر بأحجام معلمات 9 مليار و 80 مليار، ويدعم البحث والتطوير في الذكاء الاصطناعي متعدد الوسائط.

زيارة الرابط

الوصف

IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention) هو نموذج لغة مرئي مفتوح الوصول تم تطويره لتعزيز الشفافية وإضفاء الطابع الديمقراطي على الذكاء الاصطناعي. إنه إعادة إنتاج مفتوحة لنموذج Flamingo من DeepMind، وهو نموذج لغة مرئي متطور لم يتم إصداره علنًا. على غرار نماذج مثل GPT-4، يمكن لـ IDEFICS معالجة تسلسلات عشوائية من الصور والنصوص، وتوليد مخرجات نصية متماسكة.

تم بناء IDEFICS حصريًا على بيانات ونماذج متاحة للجمهور، بما في ذلك LLaMA v1 و OpenCLIP، وهو متوفر في نسختين: نسخة أساسية ونسخة موجهة. كل نسخة تأتي بحجمين من المعلمات: 9 مليار و 80 مليار. يؤكد المشروع على الشفافية من خلال استخدام البيانات العامة فقط، وتوفير أدوات لاستكشاف مجموعات بيانات التدريب، ومشاركة الدروس التقنية المستفادة، وإجراء تقييمات أخلاقية داخلية من خلال الاستدراج (red teaming) قبل الإصدار.

يتفوق IDEFICS في مهام مثل الإجابة على الأسئلة المتعلقة بالصور، ووصف المحتوى المرئي، وإنشاء قصص مستندة إلى صور متعددة. أدائه قابل للمقارنة مع نموذج Flamingo الأصلي المغلق المصدر عبر معايير فهم الصور والنصوص المختلفة. تم تدريب النموذج على مزيج من مجموعات البيانات المتاحة علنًا مثل Wikipedia و Public Multimodal Dataset و LAION، بالإضافة إلى مجموعة بيانات جديدة بحجم 115 مليار رمز تسمى OBELICS، والتي تتكون من 141 مليون مستند ويب متداخل من الصور والنصوص.

يلتزم فريق التطوير بتعزيز البحث المفتوح في أنظمة الذكاء الاصطناعي متعددة الوسائط. يهدف IDEFICS إلى أن يكون أساسًا قويًا لمجتمع الذكاء الاصطناعي، ويكمل إعادة الإنتاج المفتوحة الأخرى مثل OpenFlamingo. وجه الميثاق الأخلاقي للمشروع القرارات، مع إعطاء الأولوية للنقد الذاتي والشفافية والإنصاف. يتم تشجيع المستخدمين على استكشاف العرض التوضيحي وبطاقات النماذج وبطاقة مجموعة البيانات، وتقديم ملاحظات للمساعدة في التحسين المستمر لهذه النماذج وإمكانية الوصول إلى الذكاء الاصطناعي متعدد الوسائط الكبير.

أبرز ملامح نموذج اللغة المرئي IDEFICS

  • نموذج لغة مرئي مفتوح الوصول

  • يعيد إنتاج قدرات متطورة

  • يقبل مدخلات متداخلة من الصور والنصوص

  • يولد مخرجات نصية

  • أداء قابل للمقارنة مع النماذج المملوكة

  • متوفر بأحجام معلمات 9 مليار و 80 مليار

  • يتم تقديم نسخ أساسية وموجهة

  • تم تدريبه على بيانات ونماذج متاحة للجمهور

  • يدعم أبحاث الذكاء الاصطناعي متعدد الوسائط

  • يشمل تقييمًا أخلاقيًا من خلال اختبار الاستدراج (red teaming)

  • تصور تفاعلي لمجموعة بيانات التدريب متاح

البدء مع نموذج اللغة المرئي IDEFICS

  1. الوصول إلى النموذج: ابحث عن نماذج IDEFICS على Hugging Face Hub.

  2. إعداد البيئة: تأكد من تثبيت أحدث إصدار من transformers.

  3. تحميل النموذج والمعالج: استورد الفئات الضرورية وقم بتحميل نقطة فحص IDEFICS المطلوبة.

  4. إعداد المدخلات: قم بإنشاء مطالبات بسلاسل نصية متداخلة وعناوين URL للصور أو صور PIL.

  5. التكامل عبر API: استخدم طريقة `generate` مع المدخلات المعدة وحجج الإنشاء.

  6. فك تشفير المخرجات: قم بمعالجة المعرفات المولدة للحصول على نص قابل للقراءة البشرية.

  7. تشغيل الاستدلال: قم بتنفيذ الكود لتوليد نص بناءً على مدخلات متعددة الوسائط.

حالات استخدام نموذج اللغة المرئي IDEFICS

  • الإجابة على أسئلة الصور
  • وصف المحتوى المرئي
  • سرد القصص متعدد الوسائط
  • أساس البحث المفتوح
  • شفافية الذكاء الاصطناعي
  • إضفاء الطابع الديمقراطي على الذكاء الاصطناعي

الأسئلة الشائعة من نموذج اللغة المرئي IDEFICS

تقييمات نموذج اللغة المرئي IDEFICS

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل نموذج اللغة المرئي IDEFICS

نماذج الذكاء الاصطناعي

فلامنجو هو نموذج لغة مرئي (VLM) واحد من Google DeepMind يتفوق في التعلم بالقليل من الأمثلة عبر مهام متعددة الوسائط متنوعة. يقوم بمعالجة الصور ومقاطع الفيديو والنصوص المتداخلة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

إنكلينغ هو نموذج ذكاء اصطناعي متعدد الوسائط يحتوي على 975 مليار معلمة مصمم للمطورين. يقبل مدخلات نصية وصورية وصوتية، وينتج مخرجات نصية لتطبيقات متنوعة، بما في ذلك روبوتات الدردشة…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فالكون LLM هو نموذج لغوي كبير مولد مصمم لتعزيز التطبيقات وحالات الاستخدام، مما يجعل الذكاء الاصطناعي المتقدم متاحًا وذو تأثير عبر مختلف الصناعات والتخصصات.

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

OpenAI هي شركة رائدة في مجال أبحاث ونشر الذكاء الاصطناعي. تركز على تطوير نماذج ذكاء اصطناعي متقدمة وجعلها متاحة لمختلف التطبيقات. تهدف الشركة إلى ضمان أن الذكاء الاصطناعي العام…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

HunyuanImage 3.0 هو نموذج متعدد الوسائط قوي مصمم لتوليد الصور. يتفوق في مهام تحويل النص إلى صورة وتحويل الصورة إلى صورة، ويقدم قدرات متقدمة للتحرير الإبداعي وتعزيز المطالبات…

مميزةمولّدات الصور بالذكاء الاصطناعي

أطر عمل الذكاء الاصطناعي

تطبيق سطح مكتب مجاني ومفتوح المصدر لتشغيل وتدريب نماذج الذكاء الاصطناعي محليًا على أنظمة ماك وويندوز ولينكس، مع واجهة مستخدم بدون كود، واتصال بالوكلاء، وواجهة برمجة تطبيقات…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة