الوصف
يمثل PaLM-E تقدمًا كبيرًا في الذكاء الاصطناعي من خلال تقديم نموذج لغوي متعدد الوسائط مجسد مصمم لسد الفجوة بين فهم اللغة المجرد والتفاعل المادي في العالم الحقيقي. تتفوق نماذج اللغة الكبيرة التقليدية في المهام النصية المعقدة ولكنها تواجه صعوبة في ربط معرفتها ببيانات المستشعرات المستمرة في العالم الحقيقي، وهو مطلب حاسم لتطبيقات مثل الروبوتات. يعالج PaLM-E هذا التحدي من خلال دمج الوسائط مثل المدخلات المرئية وتقديرات الحالة مباشرة في خط أنابيب معالجة نموذج اللغة.
يكمن الابتكار المعماري الأساسي لـ PaLM-E في طريقته لحقن الملاحظات المستمرة والمجسدة في مساحة تضمين اللغة لنموذج لغة مدرب مسبقًا. يتم تحقيق ذلك عن طريق ترميز بيانات المستشعرات في تسلسل من المتجهات التي تشترك في نفس الأبعاد مثل تضمينات الرموز المميزة لنموذج اللغة. هذا يسمح للنموذج بمعالجة المدخلات متعددة الوسائط والتفكير فيها، بما في ذلك النص والصور وتقديرات الحالة المستمرة، بطريقة موحدة. تم بناء PaLM-E على بنية نموذج لغة كبير يعتمد على المُفكك فقط، وتحديداً PaLM، ويوسع قدراته للتعامل مع المهام المجسدة.
أظهر PaLM-E أداءً ملحوظًا عبر مجموعة متنوعة من مهام التفكير المجسد. تُظهر التقييمات قدرته على إجراء تخطيط تسلسلي للتلاعب بالروبوتات، والإجابة على الأسئلة المرئية، وتوصيف الصور. يمكن لنموذج واحد كبير متعدد الوسائط مجسد، PaLM-E، معالجة تحديات تفكير متنوعة عبر وسائط ملاحظة مختلفة وتجسيدات روبوتية متعددة. بشكل ملحوظ، يُظهر نقلًا إيجابيًا، مما يعني أن أدائه يستفيد من التدريب المشترك عبر نطاق واسع من بيانات اللغة والرؤية واللغة المرئية على نطاق الإنترنت. لا يتفوق أكبر متغير، PaLM-E-562B، في الروبوتات فحسب، بل يعمل أيضًا كنموذج عام للرؤية واللغة، ويحقق نتائج متطورة على معايير مثل OK-VQA، مع الاحتفاظ بقدراته اللغوية العامة مع زيادة حجمه.
تتضح التطبيقات العملية للنموذج من خلال أمثلة لمهام الروبوتات طويلة الأفق. يمكن لـ PaLM-E تفسير تعليمات مثل "أحضر لي رقائق الأرز من الدرج" أو "أحضر لي نجمة خضراء"، مع دمج ردود الفعل المرئية من كاميرا الروبوت لتنفيذ خطط متعددة الخطوات. يمكنه أيضًا التحكم في الروبوتات لترتيب الكتل حسب اللون أو أداء مهام الدفع، وتسلسل الأوامر خطوة بخطوة إلى سياسات منخفضة المستوى. علاوة على ذلك، يُظهر PaLM-E قدرات تعميم رائعة، وينفذ بنجاح مهام مثل "ادفع الكتل الحمراء إلى كوب القهوة" أو "ادفع الكتل الخضراء إلى السلحفاة"، حتى عندما لم تكن هذه الكائنات أو السيناريوهات المحددة جزءًا من بيانات التدريب المباشر الخاصة به. يسلط هذا التكيف الضوء على فهمه القوي وقدراته على التفكير في المواقف الجديدة.
أبرز ملامح PaLM-E
نموذج لغوي متعدد الوسائط مجسد
يدمج وسائط المستشعرات المرئية والمستمرة للحالة
يربط اللغة بالإدراك في العالم الحقيقي
يمكّن تخطيط التلاعب بالروبوتات
يدعم الإجابة على الأسئلة المرئية
قادر على توصيف الصور
يُظهر تعلم النقل الإيجابي عبر المجالات
يتعامل مع تجسيدات روبوتية متنوعة
يحقق أداءً متطورًا على OK-VQA
يحتفظ بقدرات لغوية عامة
يعالج الجمل متعددة الوسائط
يولد إكمالات نصية بشكل متكرر
البدء مع PaLM-E
الوصول إلى النموذج: استخدم نموذج PaLM-E لمهام الذكاء الاصطناعي المجسدة.
إدخال البيانات: قدم جملًا متعددة الوسائط تتضمن ترميزات مرئية وتقدير الحالة ونصية.
تدريب النموذج: قم بتدريب الترميزات بشكل شامل مع نموذج لغة كبير مدرب مسبقًا.
تنفيذ المهام: انشر لتخطيط التلاعب بالروبوتات بشكل تسلسلي.
إجراء التفكير: طبق للإجابة على الأسئلة المرئية وتوصيف الصور.
تقييم الأداء: قم بتقييم القدرات على مهام التفكير المجسد المختلفة.
التكامل مع الروبوتات: استخدم للتحكم والتخطيط في الروبوتات في العالم الحقيقي.
حالات استخدام PaLM-E
- التلاعب بالروبوتات
- الإجابة على الأسئلة المرئية
- توصيف الصور
- التفكير المجسد
- الذكاء الاصطناعي العام
- تخطيط الروبوتات
- التعلم عبر المجالات








