تخطَّ إلى المحتوى الرئيسي
ToolPotion

BEiT Image Transformer

BEiT هو نموذج تمثيل رؤية ذاتي الإشراف يستخدم نمذجة الصور المقنعة للتدريب المسبق لمُحولات الرؤية. يقوم بترميز الصور إلى رموز مرئية ويستعيد الرقع المقنعة، محققًا نتائج تنافسية في المهام اللاحقة مثل تصنيف الصور والتجزئة الدلالية.

زيارة الرابط

الوصف

BEiT، والذي يرمز إلى تمثيل المُحولات ثنائية الاتجاه من الصور (Bidirectional Encoder representation from Image Transformers)، هو نموذج تمثيل رؤية ذاتي الإشراف مبتكر طورته Microsoft Research. مستوحى من نجاح BERT في معالجة اللغة الطبيعية، يقوم BEiT بتكييف نموذج نمذجة اللغة المقنعة لمجال رؤية الكمبيوتر.

يكمن الابتكار الأساسي لـ BEiT في مهمة نمذجة الصور المقنعة. تتضمن عملية التدريب المسبق خطوتين رئيسيتين. أولاً، يتم تقسيم الصورة المدخلة إلى رقع ثم "ترميزها" إلى رموز مرئية منفصلة. ثانيًا، يتم إخفاء جزء من رقع الصور هذه عشوائيًا. ثم يتم تغذية رقع الصور التالفة هذه إلى نموذج مُحول أساسي. هدف النموذج أثناء التدريب المسبق هو استعادة الرموز المرئية الأصلية المقابلة لرقع الصور المقنعة بدقة.

بعد مرحلة التدريب المسبق، يمكن ضبط نموذج BEiT مباشرة للمهام اللاحقة المختلفة. تتضمن عملية الضبط هذه إلحاق طبقات خاصة بالمهمة بالمُحول المُدرب مسبقًا. أظهر النموذج أداءً قويًا في مهام مثل تصنيف الصور والتجزئة الدلالية، محققًا نتائج تنافسية عند مقارنتها بمنهجيات التدريب المسبق الحالية. يسمح هذا النهج بالتعلم الفعال للتمثيلات المرئية دون الحاجة إلى مجموعات بيانات موسومة بشكل مكثف للتدريب الأولي.

نموذج BEiT ذو أهمية خاصة للباحثين والمطورين الذين يعملون على مهام رؤية الكمبيوتر والذين يتطلعون إلى الاستفادة من النماذج القوية المدربة مسبقًا. طبيعته ذاتية الإشراف تقلل من الاعتماد على مجموعات البيانات الكبيرة التي تم تمييزها يدويًا، مما يجعله حلاً أكثر سهولة وكفاءة للعديد من التطبيقات. القدرة على ضبط النموذج على مهام محددة تعزز تنوعه وقابليته للتطبيق عبر مجموعة من تحديات التعرف المرئي.

أبرز ملامح BEiT Image Transformer

  • تعلم تمثيل الرؤية ذاتي الإشراف

  • مهمة التدريب المسبق لنمذجة الصور المقنعة

  • يستخدم مُحولات الرؤية

  • ترميز الصور إلى رموز مرئية منفصلة

  • يستعيد رقع الصور المقنعة

  • ضبط مباشر على المهام اللاحقة

  • أداء تنافسي في تصنيف الصور

  • أداء تنافسي في التجزئة الدلالية

  • نهج تدريب مسبق مستوحى من BERT

البدء مع BEiT Image Transformer

  1. الوصول إلى النموذج: احصل على إمكانية الوصول إلى نموذج BEiT المُدرب مسبقًا.

  2. إعداد البيئة: قم بتكوين بيئة التطوير الخاصة بك مع المكتبات اللازمة.

  3. التكامل عبر API: قم بتحميل النموذج وإعداد بيانات الصور الخاصة بك.

  4. الضبط: قم بإلحاق طبقات خاصة بالمهمة وقم بالتدريب على مجموعة بياناتك اللاحقة.

  5. التحسين: قم بتقييم الأداء وضبط المعلمات الفائقة للحصول على النتائج المرجوة.

حالات استخدام BEiT Image Transformer

  • تصنيف الصور
  • التجزئة الدلالية
  • تعلم تمثيل الرؤية
  • التعلم الانتقالي
  • أبحاث رؤية الكمبيوتر

الأسئلة الشائعة من BEiT Image Transformer

تقييمات BEiT Image Transformer

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل BEiT Image Transformer

نماذج الذكاء الاصطناعي

يوفر مستودع Vision Transformer (ViT) نماذج وأكواد لمهام التعرف على الصور. يتضمن تطبيقات لبنيات Vision Transformer و MLP-Mixer، مدربة مسبقًا على مجموعات بيانات ImageNet و…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Funnel-Transformer هو نموذج ذكاء اصطناعي يضغط الحالات المخفية لتقليل تكلفة الحساب. يسمح بنماذج أعمق أو أوسع بنفس عدد العمليات الحسابية (FLOPs) ويمكنه استعادة تمثيلات على مستوى…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Imagen هو نموذج انتشار نص إلى صورة طورته Google Research. يقوم بإنشاء صور واقعية للغاية مع فهم عميق للغة. يتفوق Imagen في محاذاة الصورة والنص ودقة العينات، متفوقًا على النماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

ViT-Adapter هو نموذج ذكاء اصطناعي يعزز أداء Vision Transformer (ViT) لمهام التنبؤ الكثيف مثل اكتشاف الكائنات والتجزئة. يقدم تحيزات استقرائية خاصة بالصور دون الحاجة إلى تدريب مسبق،…

أدوات الرؤية الحاسوبية

نماذج الذكاء الاصطناعي

SimCLR هو إطار عمل للتعلم الذاتي والتعلم شبه الذاتي للتمثيلات المرئية. يبسط الأساليب السابقة باستخدام التعلم التبايني لزيادة الاتفاق بين طرق عرض مختلفة لنفس الصورة، مما يؤدي إلى…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يوفر مستودع GitHub هذا تنفيذًا لـ ConvMixer، وهو بنية شبكة عصبية التفافية لمهام التعرف على الصور. يعتمد على الورقة البحثية "Patches Are All You Need? 🤷" ويوفر أوزان نماذج مدربة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة