الوصف
يقدم Decision Transformer نهجًا جديدًا للتعلم المعزز (RL) عن طريق تجريده كمشكلة نمذجة تسلسلية. هذا يسمح له بالاستفادة من قوة وقابلية التوسع لمعماريات Transformer، المستخدمة بشكل شائع في نمذجة اللغة، مثل GPT-x و BERT. يكمن الابتكار الأساسي في تحويل التعلم المعزز إلى نمذجة تسلسلية مشروطة، مبتعدًا عن ملاءمة دالة القيمة التقليدية أو حسابات تدرج السياسة.
يقوم هذا الإطار، المسمى Decision Transformer، بإخراج الإجراءات المثلى مباشرةً عن طريق استخدام Transformer مقنع سببيًا. من خلال تكييف نموذج توليدي ذاتي (autoregressive) على عائد مرغوب (مكافأة)، بالإضافة إلى الحالات والإجراءات السابقة، يمكن لـ Decision Transformer توليد إجراءات مستقبلية مصممة لتحقيق هذا العائد المحدد. هذه البساطة تسمح بالتنفيذ والتقييم المباشر.
عمليًا، يعامل Decision Transformer مسارات التعلم المعزز كتسلسلات. تتم معالجة كل نمط - العائد، الحالة، أو الإجراء - من خلال شبكة تضمين (embedding network). ثم يتم تغذية هذه التضمينات إلى نموذج Transformer توليدي ذاتي مدرب للتنبؤ بالإجراء التالي. يتضمن التقييم تهيئة النموذج بعائد مستهدف وحالة البداية، ثم فك تسلسل لتوليد إجراءات للتنفيذ في البيئة، على غرار التوليد الذاتي القياسي في نماذج اللغة.
إحدى القدرات الرئيسية التي تم توضيحها هي القدرة على 'لصق' تسلسلات فرعية من مسارات تدريب مختلفة لإنتاج مسارات مثلى في وقت الاختبار. على سبيل المثال، عند التدريب على مسارات عشوائية في مشكلة رسم بياني، يمكن لـ Decision Transformer توليد مسار أمثل عن طريق التكييف على عائد مرتفع، دون الحاجة إلى تعلم TD صريح أو تشاؤم القيمة. يعكس هذا السلوك خوارزميات التعلم Q خارج السياسة (off-policy Q-learning) ولكنه يتحقق من خلال نموذج نمذجة تسلسلية.
تم تقييم Decision Transformer على معايير التعلم المعزز غير المتصل (offline RL) القياسية، بما في ذلك بيئة تعلم Atari، و OpenAI Gym، ومهمة Minigrid Key-To-Door. عبر هذه المهام المتنوعة، التي تتضمن التحكم المنفصل والمستمر، بالإضافة إلى ملاحظات الصور والحالة، أظهر Decision Transformer أداءً يضاهي خوارزميات تعلم TD المتخصصة.
علاوة على ذلك، يعمل Decision Transformer كمتعلم متعدد المهام عن طريق إجراء توليد مشروط. لا ينتج سياسة واحدة بل ينمذج توزيعًا للسياسات. من خلال رسم متوسط العائد المحقق مقابل العائد المستهدف، يمكن ملاحظة سياسات مميزة. في بعض الحالات، أظهر Decision Transformer القدرة على الاستقراء خارج مجموعة بيانات التدريب ونمذجة سياسات بعوائد أعلى من تلك الموجودة في البيانات.
أبرز ملامح Decision Transformer
التعلم المعزز كنمذجة تسلسلية
دمج معمارية Transformer
نمذجة تسلسلية مشروطة
توليد إجراءات توليدية ذاتية
التكييف على العائد المرغوب
التعلم المعزز غير المتصل
نهج خالٍ من النماذج
أداء متطور
قابلية التطبيق عبر المهام (Atari، OpenAI Gym، Key-to-Door)
لصق التسلسلات الفرعية للمسارات المثلى
الاستقراء خارج بيانات التدريب
قدرة التعلم متعدد المهام
البدء مع Decision Transformer
الوصول إلى النموذج: الحصول على الوصول إلى نموذج Decision Transformer.
إعداد البيئة: تكوين بيئة التعلم المعزز للتفاعل.
التكامل عبر API: دمج Decision Transformer ضمن خط أنابيب التعلم المعزز الخاص بك.
تحديد العائد المستهدف: تحديد مستوى المكافأة المطلوب للسياسة.
إدخال البيانات السابقة: توفير الحالات والإجراءات السابقة كمدخلات تكييف.
توليد الإجراءات: يخرج النموذج تسلسلاً من الإجراءات للتنفيذ.
تقييم الأداء: قياس العائد المحقق مقابل الهدف.
حالات استخدام Decision Transformer
- تدريب التعلم المعزز غير المتصل
- اتخاذ القرارات المستند إلى التسلسل
- سياسات مشروطة بالهدف
- تحسين المسار
- التحكم الروبوتي
- تطوير ذكاء اصطناعي للألعاب








