تخطَّ إلى المحتوى الرئيسي
ToolPotion

Decision Transformer

يعيد Decision Transformer صياغة التعلم المعزز كمشكلة نمذجة تسلسلية، مستفيدًا من معماريات Transformer مثل GPT-x و BERT. يقوم بتوليد إجراءات مثلى من خلال التكييف على العوائد المرغوبة، والحالات السابقة، والإجراءات، محققًا أداءً متطورًا في مهام Atari و OpenAI Gym و Key-to-Door.

زيارة الرابط

الوصف

يقدم Decision Transformer نهجًا جديدًا للتعلم المعزز (RL) عن طريق تجريده كمشكلة نمذجة تسلسلية. هذا يسمح له بالاستفادة من قوة وقابلية التوسع لمعماريات Transformer، المستخدمة بشكل شائع في نمذجة اللغة، مثل GPT-x و BERT. يكمن الابتكار الأساسي في تحويل التعلم المعزز إلى نمذجة تسلسلية مشروطة، مبتعدًا عن ملاءمة دالة القيمة التقليدية أو حسابات تدرج السياسة.

يقوم هذا الإطار، المسمى Decision Transformer، بإخراج الإجراءات المثلى مباشرةً عن طريق استخدام Transformer مقنع سببيًا. من خلال تكييف نموذج توليدي ذاتي (autoregressive) على عائد مرغوب (مكافأة)، بالإضافة إلى الحالات والإجراءات السابقة، يمكن لـ Decision Transformer توليد إجراءات مستقبلية مصممة لتحقيق هذا العائد المحدد. هذه البساطة تسمح بالتنفيذ والتقييم المباشر.

عمليًا، يعامل Decision Transformer مسارات التعلم المعزز كتسلسلات. تتم معالجة كل نمط - العائد، الحالة، أو الإجراء - من خلال شبكة تضمين (embedding network). ثم يتم تغذية هذه التضمينات إلى نموذج Transformer توليدي ذاتي مدرب للتنبؤ بالإجراء التالي. يتضمن التقييم تهيئة النموذج بعائد مستهدف وحالة البداية، ثم فك تسلسل لتوليد إجراءات للتنفيذ في البيئة، على غرار التوليد الذاتي القياسي في نماذج اللغة.

إحدى القدرات الرئيسية التي تم توضيحها هي القدرة على 'لصق' تسلسلات فرعية من مسارات تدريب مختلفة لإنتاج مسارات مثلى في وقت الاختبار. على سبيل المثال، عند التدريب على مسارات عشوائية في مشكلة رسم بياني، يمكن لـ Decision Transformer توليد مسار أمثل عن طريق التكييف على عائد مرتفع، دون الحاجة إلى تعلم TD صريح أو تشاؤم القيمة. يعكس هذا السلوك خوارزميات التعلم Q خارج السياسة (off-policy Q-learning) ولكنه يتحقق من خلال نموذج نمذجة تسلسلية.

تم تقييم Decision Transformer على معايير التعلم المعزز غير المتصل (offline RL) القياسية، بما في ذلك بيئة تعلم Atari، و OpenAI Gym، ومهمة Minigrid Key-To-Door. عبر هذه المهام المتنوعة، التي تتضمن التحكم المنفصل والمستمر، بالإضافة إلى ملاحظات الصور والحالة، أظهر Decision Transformer أداءً يضاهي خوارزميات تعلم TD المتخصصة.

علاوة على ذلك، يعمل Decision Transformer كمتعلم متعدد المهام عن طريق إجراء توليد مشروط. لا ينتج سياسة واحدة بل ينمذج توزيعًا للسياسات. من خلال رسم متوسط العائد المحقق مقابل العائد المستهدف، يمكن ملاحظة سياسات مميزة. في بعض الحالات، أظهر Decision Transformer القدرة على الاستقراء خارج مجموعة بيانات التدريب ونمذجة سياسات بعوائد أعلى من تلك الموجودة في البيانات.

أبرز ملامح Decision Transformer

  • التعلم المعزز كنمذجة تسلسلية

  • دمج معمارية Transformer

  • نمذجة تسلسلية مشروطة

  • توليد إجراءات توليدية ذاتية

  • التكييف على العائد المرغوب

  • التعلم المعزز غير المتصل

  • نهج خالٍ من النماذج

  • أداء متطور

  • قابلية التطبيق عبر المهام (Atari، OpenAI Gym، Key-to-Door)

  • لصق التسلسلات الفرعية للمسارات المثلى

  • الاستقراء خارج بيانات التدريب

  • قدرة التعلم متعدد المهام

البدء مع Decision Transformer

  1. الوصول إلى النموذج: الحصول على الوصول إلى نموذج Decision Transformer.

  2. إعداد البيئة: تكوين بيئة التعلم المعزز للتفاعل.

  3. التكامل عبر API: دمج Decision Transformer ضمن خط أنابيب التعلم المعزز الخاص بك.

  4. تحديد العائد المستهدف: تحديد مستوى المكافأة المطلوب للسياسة.

  5. إدخال البيانات السابقة: توفير الحالات والإجراءات السابقة كمدخلات تكييف.

  6. توليد الإجراءات: يخرج النموذج تسلسلاً من الإجراءات للتنفيذ.

  7. تقييم الأداء: قياس العائد المحقق مقابل الهدف.

حالات استخدام Decision Transformer

  • تدريب التعلم المعزز غير المتصل
  • اتخاذ القرارات المستند إلى التسلسل
  • سياسات مشروطة بالهدف
  • تحسين المسار
  • التحكم الروبوتي
  • تطوير ذكاء اصطناعي للألعاب

الأسئلة الشائعة من Decision Transformer

تقييمات Decision Transformer

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Decision Transformer

نماذج الذكاء الاصطناعي

PlaNet هو خوارزمية تعلم معزز قائمة على النموذج تخطط من البكسلات عن طريق تعلم ديناميكيات كامنة. تتنبأ بكفاءة بالمكافآت المستقبلية في مساحة كامنة متعلمة، وتتنافس مع الأساليب الخالية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نماذج InstructGPT هي نماذج لغوية للذكاء الاصطناعي تم تدريبها على اتباع نوايا المستخدم بشكل أفضل من GPT-3. إنها أكثر صدقًا وأقل سمية وتتوافق مع أهداف المستخدم من خلال التعلم المعزز…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

تُعد طرق تدرج السياسة فئة من خوارزميات التعلم المعزز التي تتعلم دالة السياسة مباشرة. على عكس الطرق القائمة على القيمة، فإنها تُحسّن معلمات السياسة لزيادة المكافآت المتوقعة، مما…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Gato هو وكيل ذكاء اصطناعي عام واحد طورته Google DeepMind. يمكنه أداء مجموعة واسعة من المهام، بما في ذلك لعب ألعاب Atari، ووصف الصور، والدردشة، والتحكم في ذراع روبوت حقيقي. يستخدم…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

أطر عمل الذكاء الاصطناعي

TRL هي مكتبة شاملة مصممة لتدريب نماذج اللغة المتغيرة باستخدام طرق تعلم التعزيز المختلفة. تتكامل بسلاسة مع متغيرات Hugging Face، مما يوفر أدوات للتعديل الدقيق تحت الإشراف وتقنيات…

مميزةمنصّات تعلّم الآلة

نماذج الذكاء الاصطناعي

Q-learning هو خوارزمية تعلم معزز خالية من النماذج تدرب الوكيل على تعيين قيم للإجراءات بناءً على الحالات الحالية. إنها تحسن اتخاذ القرار عن طريق زيادة المكافآت المستقبلية المتوقعة،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

SARSA هو خوارزمية تعلم معزز لتعلم سياسات عملية اتخاذ القرار ماركوف. تقوم بتحديث قيم Q بناءً على الحالة الحالية للوكيل، والإجراء المتخذ، والمكافأة المستلمة، والحالة التالية،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يحتوي هذا المستودع على كود التجارب لـ "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يقوم بتطبيق خوارزمية PETS، التي تجمع بين نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة