الوصف
تُصدر Adept نموذج Fuyu-8B، وهو نسخة مدمجة من نموذج الذكاء الاصطناعي متعدد الوسائط الذي يشغل منتجهم، وتجعله متاحًا على HuggingFace بموجب ترخيص CC-BY-NC. يشتهر هذا النموذج ببنيته وإجراءات تدريبه المبسطة بشكل كبير مقارنة بالنماذج متعددة الوسائط الأخرى، مما يعزز قابليته للفهم وقابليته للتوسع وقابليته للنشر.
تم تصميم Fuyu-8B من الألف إلى الياء للوكلاء الرقميين، مما يسمح له بمعالجة دقة صور عشوائية. هذه القدرة ضرورية لمهام مثل الإجابة على الأسئلة المتعلقة بالرسوم البيانية والمخططات، والاستجابة للاستعلامات المستندة إلى واجهة المستخدم، وإجراء تحديد دقيق للمواقع على صور الشاشة. تتمثل إحدى المزايا الرئيسية في سرعته، حيث يقدم استجابات للصور الكبيرة في أقل من 100 مللي ثانية. على الرغم من تحسينه لحالة استخدام Adept المحددة، إلا أن Fuyu-8B يُظهر أداءً قويًا على معايير فهم الصور القياسية مثل الإجابة المرئية على الأسئلة وتوصيف الصور الطبيعية.
تتجنب البنية مُشفّر صور منفصل، وبدلاً من ذلك تقوم بإسقاط رقع الصور خطيًا مباشرة في الطبقة الأولى للمحول. هذا يتجاوز الحاجة إلى البحث عن التضمينات ويبسط التدريب والاستدلال. يعامل النموذج رموز الصور بشكل مشابه لرموز النص، ويدعم أحجام الصور المتغيرة ويزيل الحاجة إلى مراحل تدريب منفصلة عالية ومنخفضة الدقة. يسمح هذا النهج المبسط بالانتباه السببي وعدم التجميع، ويعامل مُفكك المحولات كمحول صور.
بينما يُعد Fuyu-8B إصدارًا خامًا للنموذج يتطلب ضبطًا دقيقًا لتطبيقات محددة، فإن أدائه على معايير مثل VQAv2 و OKVQA و COCO Captions و AI2D تنافسي، حتى مقارنة بالنماذج الأكبر. تسلط Adept الضوء على أن نماذجها الداخلية، المبنية على بنية Fuyu، تمتلك قدرات متقدمة مثل التعرف الضوئي على الحروف (OCR) الموثوق به على الصور عالية الدقة، وتحديد دقيق للنص وعناصر واجهة المستخدم، والقدرة على الإجابة على الأسئلة المتعلقة بواجهات المستخدم، مما يقدم لمحة عن تطورات المنتجات المستقبلية.
يجعل تصميم Fuyu-8B مناسبًا بشكل خاص للعاملين المعرفيين والتطبيقات التي تتطلب فهمًا بصريًا عميقًا وتفاعلًا مع الواجهات الرقمية. يهدف فتح مصدر هذا النموذج إلى تعزيز الابتكار المجتمعي والتطوير في مجال وكلاء الذكاء الاصطناعي والذكاء الاصطناعي متعدد الوسائط.
أبرز ملامح بنية Fuyu-8B متعددة الوسائط
نموذج ذكاء اصطناعي متعدد الوسائط للوكلاء الرقميين
بنية مبسطة لسهولة الفهم والتوسع والنشر
يدعم دقة صور عشوائية
أوقات استجابة سريعة للصور الكبيرة (أقل من 100 مللي ثانية)
يؤدي أداءً جيدًا على معايير فهم الصور القياسية
مصمم لفهم الرسوم البيانية والمخططات وعناصر واجهة المستخدم
مفتوح المصدر بموجب ترخيص CC-BY-NC
متاح على HuggingFace
لا يوجد مُشفّر صور منفصل؛ يتم إسقاط رقع الصور مباشرة في المحول
يعامل رموز الصور مثل رموز النص لأحجام الصور المتغيرة
يتطلب ضبطًا دقيقًا لحالات الاستخدام المحددة
البدء مع بنية Fuyu-8B متعددة الوسائط
الوصول إلى النموذج: قم بتنزيل أوزان Fuyu-8B من HuggingFace.
إعداد البيئة: قم بإعداد بيئة Python الخاصة بك مع المكتبات اللازمة.
التكامل عبر API: قم بتحميل النموذج والمُرمّز للاستدلال.
معالجة الصور: قم بتحويل الصور إلى تسلسلات رموز متوافقة مع النموذج.
الاستعلام عن النموذج: أدخل رموز الصور ومطالبات النص للحصول على استجابات.
الضبط الدقيق: قم بتكييف النموذج مع متطلبات تطبيقك المحددة.
حالات استخدام بنية Fuyu-8B متعددة الوسائط
- تطوير وكلاء الذكاء الاصطناعي
- الإجابة المرئية على الأسئلة
- التفاعل مع واجهة المستخدم
- تحليل المستندات
- توصيف الصور
- تفسير الرسوم البيانية والمخططات





