تخطَّ إلى المحتوى الرئيسي
ToolPotion

SimCLR

SimCLR هو إطار عمل للتعلم الذاتي والتعلم شبه الذاتي للتمثيلات المرئية. يبسط الأساليب السابقة باستخدام التعلم التبايني لزيادة الاتفاق بين طرق عرض مختلفة لنفس الصورة، مما يؤدي إلى أداء متطور في مهام تصنيف الصور مع بيانات موسومة محدودة.

زيارة الرابط

الوصف

SimCLR، والذي يرمز إلى "إطار عمل بسيط للتعلم التبايني للتمثيلات المرئية"، هو طريقة رائدة طورتها Google Research للنهوض بالتعلم الذاتي والتعلم شبه الذاتي في رؤية الكمبيوتر. مستوحى من نجاح نماذج اللغة الكبيرة المدربة مسبقًا على نصوص غير موسومة، يهدف SimCLR إلى تحقيق مكاسب مماثلة لبيانات الصور.

يكمن جوهر SimCLR في نهجه للتعلم التبايني. يتعلم تمثيلات صور عامة عن طريق زيادة الاتفاق بين طرق عرض مختلفة لنفس الصورة مع تقليل الاتفاق بين طرق عرض صور مختلفة في نفس الوقت. هذه العملية تدرب شبكة عصبية بفعالية على "جذب" تمثيلات طرق عرض الصور المتشابهة و"صد" تمثيلات الصور غير المتشابهة.

يبدأ الإطار العمل بأخذ مجموعة بيانات غير موسومة وتطبيق سلسلة من التحسينات البسيطة على كل صورة، مثل الاقتصاص العشوائي، وتشوه الألوان، والتمويه الغاوسي، لإنشاء طريقتي عرض متقابلتين. يتم بعد ذلك تغذية طرق العرض هذه إلى شبكة عصبية التفافية (CNN) تعتمد على بنية ResNet لتوليد التمثيلات. يتم تطبيق رأس إسقاط غير خطي، عادةً ما يكون متعدد الطبقات (MLP)، على هذه التمثيلات لتضخيم الميزات الثابتة وتعزيز قدرة الشبكة على التمييز بين التحويلات لنفس الصورة. يتم تدريب CNN و MLP معًا باستخدام الانحدار التدرجي العشوائي لتقليل دالة خسارة تباينية.

بعد التدريب المسبق على البيانات غير الموسومة، يمكن استخدام التمثيلات المتعلمة مباشرة أو ضبطها بدقة باستخدام كمية صغيرة من البيانات الموسومة لمهام تصنيف محددة. أظهر SimCLR تحسينات كبيرة مقارنة بالطرق الذاتية السابقة، وحقق نتائج متطورة جديدة على ImageNet. على سبيل المثال، عند ضبطه بدقة على 1٪ فقط من الصور الموسومة، حقق SimCLR دقة عليا بنسبة 85.8٪، وهي قفزة كبيرة عن المعايير السابقة.

كشف تطوير SimCLR عن العديد من النتائج الرئيسية التي تساهم في فعاليته. يعد الجمع بين تحويلات الصور، وخاصة الاقتصاص العشوائي وتشوه الألوان العشوائي، أمرًا بالغ الأهمية لمنع الحلول التافهة وتشجيع تعلم الميزات القابلة للتعميم. رأس الإسقاط غير الخطي حيوي أيضًا، حيث يساعد في الاحتفاظ بمزيد من معلومات الصورة المفيدة قبل تطبيق الخسارة التباينية. علاوة على ذلك، فإن توسيع نطاق عملية التدريب - عن طريق زيادة حجم الدفعة، واستخدام شبكات أكبر، والتدريب لفترة أطول - يؤدي إلى مكاسب كبيرة في الأداء، وغالبًا ما تتجاوز تلك التي شوهدت في التعلم المراقب التقليدي.

لتعزيز البحث في هذا المجال، أصدرت Google Research الكود والنماذج المدربة مسبقًا لـ SimCLR، مما يجعل هذه التقنية القوية متاحة لمجتمع الأكاديميين والمطورين الأوسع. تهدف هذه المبادرة إلى تسريع التقدم في التعلم الذاتي والتعلم شبه الذاتي، مما يتيح نماذج ذكاء اصطناعي أكثر كفاءة وفعالية عبر تطبيقات رؤية الكمبيوتر المختلفة.

أبرز ملامح SimCLR

  • إطار عمل للتعلم الذاتي للتمثيلات المرئية

  • يستخدم التعلم التبايني للتعلم من البيانات غير الموسومة

  • يزيد من الاتفاق بين طرق العرض المحسنة لنفس الصورة

  • يقلل من الاتفاق بين طرق عرض الصور المختلفة

  • يستخدم مزيجًا من تحسينات الصور (الاقتصاص، تشوه الألوان، التمويه)

  • يستخدم شبكة CNN قائمة على ResNet لتعلم التمثيلات

  • يتضمن رأس إسقاط غير خطي (MLP) لتعزيز ثبات الميزات

  • يحقق أداءً متطورًا في تصنيف الصور مع بيانات موسومة محدودة

  • يمكّن الضبط الدقيق للمهام اللاحقة

  • يظهر مكاسب أداء كبيرة من خلال توسيع نطاق التدريب

  • الكود والنماذج المدربة مسبقًا متاحة للجمهور

البدء مع SimCLR

  1. الوصول إلى النموذج: احصل على كود SimCLR والنماذج المدربة مسبقًا من مستودع GitHub.

  2. إعداد البيئة: قم بتكوين بيئة التطوير الخاصة بك مع المكتبات والتبعيات اللازمة.

  3. التدريب المسبق على البيانات غير الموسومة: قم بتدريب إطار عمل SimCLR على مجموعة بيانات كبيرة من الصور غير الموسومة باستخدام التعلم التبايني.

  4. إنشاء طرق عرض محسنة: قم بتطبيق تحويلات مثل الاقتصاص، وتشوه الألوان، والتمويه لإنشاء أزواج صور متقابلة.

  5. حساب التمثيلات: استخدم شبكة CNN القائمة على ResNet لاستخراج تمثيلات الصور من طرق العرض المحسنة.

  6. تطبيق رأس الإسقاط: قم بتمرير التمثيلات عبر رأس الإسقاط MLP لتضخيم الميزات الثابتة.

  7. الضبط الدقيق للمهام اللاحقة: قم بتكييف النموذج المدرب مسبقًا لمهام تصنيف محددة باستخدام كمية صغيرة من البيانات الموسومة.

حالات استخدام SimCLR

  • تصنيف الصور
  • تعلم التمثيلات
  • التعلم شبه الذاتي
  • مهام رؤية الكمبيوتر
  • كفاءة البيانات

الأسئلة الشائعة من SimCLR

تقييمات SimCLR

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل SimCLR

ALIGN هو نموذج ذكاء اصطناعي يوسع نطاق تعلم التمثيلات المرئية ولغة-الرؤية باستخدام إشراف نصي صاخب من أكثر من مليار زوج من الصور والنصوص البديلة. يحقق نتائج متطورة في الاسترجاع عبر…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BEiT هو نموذج تمثيل رؤية ذاتي الإشراف يستخدم نمذجة الصور المقنعة للتدريب المسبق لمُحولات الرؤية. يقوم بترميز الصور إلى رموز مرئية ويستعيد الرقع المقنعة، محققًا نتائج تنافسية في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلامنجو هو نموذج لغة مرئي (VLM) واحد من Google DeepMind يتفوق في التعلم بالقليل من الأمثلة عبر مهام متعددة الوسائط متنوعة. يقوم بمعالجة الصور ومقاطع الفيديو والنصوص المتداخلة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UNITER هو مستودع أكواد بحثي لورقة ECCV 2020 بعنوان 'UNITER: UNiversal Image-TExt Representation Learning'. يوفر أكوادًا للضبط الدقيق والاستدلال عبر مهام متنوعة تجمع بين الرؤية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

ImageBind هو نموذج ذكاء اصطناعي متعدد الوسائط من Meta AI يربط البيانات من ست وسائط: الصور، الفيديو، الصوت، النص، العمق، والحراري. يتعلم مساحة تضمين واحدة بدون إشراف صريح، مما يتيح…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Imagen هو نموذج انتشار نص إلى صورة طورته Google Research. يقوم بإنشاء صور واقعية للغاية مع فهم عميق للغة. يتفوق Imagen في محاذاة الصورة والنص ودقة العينات، متفوقًا على النماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة