الوصف
يعمل مستودع MBPO (تحسين السياسة المستند إلى النموذج) على GitHub كإصدار الكود الرسمي لورقة البحث بعنوان "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج". يقدم هذا المشروع تطبيقًا شاملاً لخوارزميات التعلم المعزز المستندة إلى النموذج، مع التركيز بشكل خاص على تحسين السياسات من خلال الاستفادة من النماذج المتعلمة للبيئة. يمكن للباحثين والممارسين استخدام قاعدة الكود هذه لتكرار النتائج التجريبية المقدمة في الورقة، مما يعزز الشفافية وقابلية التكرار في مجال الذكاء الاصطناعي والتعلم الآلي.
يتضمن المستودع تعليمات مفصلة للتثبيت، والتي تشمل إعداد MuJoCo، واستنساخ المستودع، وإنشاء بيئة conda مخصصة مع التبعيات اللازمة. يمكن للمستخدمين بعد ذلك تشغيل التجارب باستخدام ملفات التكوين المقدمة، مع دعم التنفيذ المحلي وتسريع وحدة معالجة الرسومات (GPU). تم تنظيم قاعدة الكود لتسهيل التعديل والتوسيع بسهولة، مما يسمح للمستخدمين بتكييفها مع بيئات جديدة أو اختلافات خوارزمية.
تشمل الوظائف الرئيسية القدرة على تعريف وتدريب نماذج البيئة، واستخدام هذه النماذج لتحسين السياسة، وتسجيل عمليات التشغيل التجريبية باستخدام أداة التصور Viskit المدمجة. تفصل الورقة أيضًا كيفية تكوين المعلمات الفائقة، مثل جدول طول التمرير (rollout length)، وتقدم خيارات لضبط تردد التدريب وأوقات انتهاء تدريب النموذج لتحسين الأداء. يقر المؤلفون بالمساهمات من قواعد الكود softlearning و PETS، مما يسلط الضوء على الطبيعة التعاونية لأبحاث الذكاء الاصطناعي.
هذا المورد قيم بشكل خاص للباحثين في مجال التعلم المعزز، ومهندسي التعلم الآلي، وطلاب الدراسات العليا الذين يسعون إلى تعميق فهمهم للمناهج المستندة إلى النموذج. من خلال توفير وصول مباشر إلى التطبيق، يمكّن مستودع MBPO المجتمع من تجربة تقنيات التعلم المعزز المتقدمة، واستكشاف اتجاهات بحثية جديدة، والمساهمة في تقدم الأنظمة الذكية.
أبرز ملامح مستودع MBPO على GitHub
كود ورقة البحث "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج"
تطبيق خوارزميات تحسين السياسة المستندة إلى النموذج (MBPO)
قدرات تعلم نماذج البيئة وتحسين السياسة
قابلية تكرار التجارب البحثية
دعم بيئات MuJoCo
التكامل مع Viskit للتسجيل والتصور
جداول طول التمرير قابلة للتكوين
خيارات لتردد تدريب النموذج وأوقات الانتهاء
قاعدة كود قابلة للتوسيع للبيئات والتعديلات الجديدة
التبعيات مُدارة عبر ملف بيئة conda
ملفات تكوين أمثلة لتشغيل التجارب
تعليمات واضحة للتثبيت والاستخدام
البدء مع مستودع MBPO على GitHub
تثبيت MuJoCo: قم بإعداد MuJoCo 1.50 في ~/.mujoco/mjpro150 وضع مفتاح الترخيص الخاص بك في ~/.mujoco/mjkey.txt.
استنساخ المستودع: احصل على الكود عن طريق تشغيل 'git clone --recursive https://github.com/jannerm/mbpo.git'.
إنشاء بيئة: قم بإعداد بيئة conda باستخدام 'environment/gpu-env.yml' وقم بتنشيطها.
تثبيت التبعيات: قم بتثبيت المشروع وتبعياته باستخدام 'pip install -e viskit' و 'pip install -e .'.
تكوين التجارب: قم بتعديل أو تحديد ملفات التكوين من 'examples/config/' للإعدادات المطلوبة.
تشغيل التجارب: قم بتنفيذ التجارب محليًا باستخدام أوامر مثل 'mbpo run_local examples.development --config=examples.config.halfcheetah.0 --gpus=1 --trial-gpus=1'.
تصور النتائج: اعرض عمليات التشغيل المحفوظة باستخدام Viskit عن طريق تشغيل 'viskit ~/ray_mbpo --port 6008' (اضبط log_dir إذا لزم الأمر).
حالات استخدام مستودع MBPO على GitHub
- أبحاث التعلم المعزز
- تطوير الخوارزميات
- محاكاة الروبوتات
- الأنظمة المستقلة
- ضبط المعلمات الفائقة
- نمذجة البيئة








