تخطَّ إلى المحتوى الرئيسي
ToolPotion

Gato Generalist Agent

Gato هو وكيل ذكاء اصطناعي عام واحد طورته Google DeepMind. يمكنه أداء مجموعة واسعة من المهام، بما في ذلك لعب ألعاب Atari، ووصف الصور، والدردشة، والتحكم في ذراع روبوت حقيقي. يستخدم هذا الوكيل متعدد الوسائط شبكة عصبية محوّلة لمعالجة مدخلات البيانات المتنوعة وتوليد مخرجات مناسبة.

زيارة الرابط

الوصف

مستوحاة من التطورات في نمذجة اللغة واسعة النطاق، طورت Google DeepMind وكيل Gato العام، وهو وكيل عام واحد مصمم للعمل خارج نطاق المخرجات النصية. يعمل Gato كسياسة عامة متعددة الوسائط ومتعددة المهام ومتعددة التجسيدات. يمكن للشبكة العصبية نفسها، باستخدام أوزان متطابقة، المشاركة في أنشطة متنوعة مثل لعب ألعاب Atari، وإنشاء تسميات توضيحية للصور، والمشاركة في المحادثات، والتلاعب بالأشياء باستخدام ذراع روبوت حقيقي. تتكيف عملية اتخاذ القرار الخاصة به ديناميكيًا بناءً على السياق المقدم، وتحدد ما إذا كان سيتم إخراج نص أو عزم دوران مشترك أو ضغطات أزرار أو أشكال أخرى من الرموز.

خلال مرحلة التدريب، يعالج Gato البيانات من مهام ووسائط مختلفة عن طريق تسلسلها إلى تسلسل مسطح من الرموز. ثم يتم تجميع هذا التسلسل ومعالجته بواسطة شبكة عصبية محوّلة، على غرار تلك المستخدمة في نماذج اللغة الكبيرة. يتم إخفاء خسارة التدريب لضمان تركيز Gato على التنبؤ بأهداف الإجراء والنص. عند نشر Gato، يتم تشكيل تسلسل أولي عن طريق ترميز موجه، والذي يمكن أن يكون عرضًا توضيحيًا. ثم توفر البيئة الملاحظة الأولى، والتي يتم ترميزها أيضًا وإلحاقها بهذا التسلسل. يقوم Gato بأخذ عينات من متجه الإجراء بشكل تكراري، رمزًا واحدًا في كل مرة. بمجرد أخذ عينات من جميع الرموز التي تشكل متجه الإجراء، كما يمليه تحديد إجراء البيئة، يتم فك تشفير الإجراء وإرساله إلى البيئة. تتحرك البيئة، مما ينتج عنه ملاحظة جديدة، وتتكرر العملية. بشكل حاسم، يمتلك النموذج دائمًا إمكانية الوصول إلى جميع الملاحظات والإجراءات السابقة ضمن نافذة السياق الخاصة به المكونة من 1024 رمزًا.

Gato مدرب على مجموعة واسعة من مجموعات البيانات التي تشمل تجارب الوكيل من البيئات المحاكاة والعالم الحقيقي، إلى جانب مجموعة متنوعة من مجموعات بيانات اللغة الطبيعية والصور. يتم تصنيف أداء نموذج Gato المدرب مسبقًا، المقاس بقدرته على تجاوز نسبة مئوية من درجات الخبراء عبر العديد من المهام، حسب المجال. توضح التصورات قدرة Gato على أداء تسمية الصور، والمشاركة في الحوار التفاعلي، والتحكم في ذراع روبوت، من بين العديد من المهام الأخرى، كل ذلك بنفس مجموعة الأوزان.

أبرز ملامح Gato Generalist Agent

  • قدرات متعددة الوسائط

  • أداء متعدد المهام

  • تحكم متعدد التجسيدات

  • بنية شبكة عصبية محوّلة

  • أخذ عينات الإجراء بشكل تكراري

  • نافذة سياق بحجم 1024 رمزًا

  • مدرب على مجموعات بيانات متنوعة

  • وكيل سياسة عام

البدء مع Gato Generalist Agent

  1. الوصول إلى النموذج: الحصول على إمكانية الوصول إلى وكيل Gato العام.

  2. المصادقة: إعداد بيانات اعتماد المصادقة اللازمة.

  3. إعداد البيئة: تكوين البيئة المستهدفة للتفاعل.

  4. التكامل عبر API: استخدام نقاط نهاية API المقدمة لتنفيذ المهام.

  5. تقديم موجه: إدخال موجه مرمّز أو عرض توضيحي.

  6. استلام ملاحظة: معالجة ملاحظات البيئة.

  7. أخذ عينات الإجراء: أخذ عينات من رموز الإجراء بشكل تكراري.

  8. فك التشفير والتنفيذ: فك تشفير الرموز المأخوذة إلى إجراءات قابلة للتنفيذ.

حالات استخدام Gato Generalist Agent

  • التحكم في الروبوتات
  • تسمية الصور
  • الحوار التفاعلي
  • لعب الألعاب
  • الفهم متعدد الوسائط
  • بحث الذكاء الاصطناعي العام

الأسئلة الشائعة من Gato Generalist Agent

تقييمات Gato Generalist Agent

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Gato Generalist Agent

نماذج الذكاء الاصطناعي

فلامنجو هو نموذج لغة مرئي (VLM) واحد من Google DeepMind يتفوق في التعلم بالقليل من الأمثلة عبر مهام متعددة الوسائط متنوعة. يقوم بمعالجة الصور ومقاطع الفيديو والنصوص المتداخلة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

RoboCat هو وكيل ذكاء اصطناعي ذاتي التحسين للروبوتات يتعلم أداء مهام متنوعة عبر أذرع روبوتية مختلفة. يمكنه التكيف مع المهام الجديدة بأقل من 100 عرض توضيحي ويولد بيانات تدريب خاصة…

الروبوتات وعتاد الذكاء الاصطناعي

إنكلينغ هو نموذج ذكاء اصطناعي متعدد الوسائط يحتوي على 975 مليار معلمة مصمم للمطورين. يقبل مدخلات نصية وصورية وصوتية، وينتج مخرجات نصية لتطبيقات متنوعة، بما في ذلك روبوتات الدردشة…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج Command A+ هو نموذج مزيج من الخبراء يحتوي على 25 مليار معلمة نشطة و218 مليار معلمة إجمالية، مصمم للتفكير المعقد، والرؤية، والمهام متعددة اللغات عبر 48 لغة، مما يوفر حلولاً…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نموذج NVIDIA Nemotron 3 Ultra هو نموذج ذكاء اصطناعي قوي مصمم للمهام المعقدة متعددة اللغات. مع 550 مليار معلمة، يتفوق في تحليل السياقات الطويلة واستخدام الأدوات، مما يجعله مثالياً…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

IDEFICS هو نموذج لغة مرئي مفتوح الوصول يعيد إنتاج قدرات متطورة. يقبل مدخلات متداخلة من الصور والنصوص لتوليد مخرجات نصية، قابلة للمقارنة مع نماذج مملوكة مثل Flamingo. متوفر بأحجام…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LaMDA هو نموذج الذكاء الاصطناعي الحواري الرائد من جوجل، المصمم للمشاركة في حوارات متدفقة عبر مجموعة واسعة من المواضيع. يعتمد على بنية Transformer، وتم تدريبه خصيصًا على بيانات…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يعيد Decision Transformer صياغة التعلم المعزز كمشكلة نمذجة تسلسلية، مستفيدًا من معماريات Transformer مثل GPT-x و BERT. يقوم بتوليد إجراءات مثلى من خلال التكييف على العوائد…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة