تخطَّ إلى المحتوى الرئيسي
ToolPotion

مستودع MBPO على GitHub

يحتوي مستودع GitHub هذا على الكود الخاص بورقة البحث "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج". يوفر تطبيقات لخوارزميات تحسين السياسة المستندة إلى النموذج، مما يمكّن الباحثين والمطورين من إعادة إنتاج التجارب والبناء على الأبحاث في مجال التعلم المعزز.

زيارة الرابط

الوصف

يعمل مستودع MBPO (تحسين السياسة المستند إلى النموذج) على GitHub كإصدار الكود الرسمي لورقة البحث بعنوان "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج". يقدم هذا المشروع تطبيقًا شاملاً لخوارزميات التعلم المعزز المستندة إلى النموذج، مع التركيز بشكل خاص على تحسين السياسات من خلال الاستفادة من النماذج المتعلمة للبيئة. يمكن للباحثين والممارسين استخدام قاعدة الكود هذه لتكرار النتائج التجريبية المقدمة في الورقة، مما يعزز الشفافية وقابلية التكرار في مجال الذكاء الاصطناعي والتعلم الآلي.

يتضمن المستودع تعليمات مفصلة للتثبيت، والتي تشمل إعداد MuJoCo، واستنساخ المستودع، وإنشاء بيئة conda مخصصة مع التبعيات اللازمة. يمكن للمستخدمين بعد ذلك تشغيل التجارب باستخدام ملفات التكوين المقدمة، مع دعم التنفيذ المحلي وتسريع وحدة معالجة الرسومات (GPU). تم تنظيم قاعدة الكود لتسهيل التعديل والتوسيع بسهولة، مما يسمح للمستخدمين بتكييفها مع بيئات جديدة أو اختلافات خوارزمية.

تشمل الوظائف الرئيسية القدرة على تعريف وتدريب نماذج البيئة، واستخدام هذه النماذج لتحسين السياسة، وتسجيل عمليات التشغيل التجريبية باستخدام أداة التصور Viskit المدمجة. تفصل الورقة أيضًا كيفية تكوين المعلمات الفائقة، مثل جدول طول التمرير (rollout length)، وتقدم خيارات لضبط تردد التدريب وأوقات انتهاء تدريب النموذج لتحسين الأداء. يقر المؤلفون بالمساهمات من قواعد الكود softlearning و PETS، مما يسلط الضوء على الطبيعة التعاونية لأبحاث الذكاء الاصطناعي.

هذا المورد قيم بشكل خاص للباحثين في مجال التعلم المعزز، ومهندسي التعلم الآلي، وطلاب الدراسات العليا الذين يسعون إلى تعميق فهمهم للمناهج المستندة إلى النموذج. من خلال توفير وصول مباشر إلى التطبيق، يمكّن مستودع MBPO المجتمع من تجربة تقنيات التعلم المعزز المتقدمة، واستكشاف اتجاهات بحثية جديدة، والمساهمة في تقدم الأنظمة الذكية.

أبرز ملامح مستودع MBPO على GitHub

  • كود ورقة البحث "متى تثق بنموذجك: تحسين السياسة المستند إلى النموذج"

  • تطبيق خوارزميات تحسين السياسة المستندة إلى النموذج (MBPO)

  • قدرات تعلم نماذج البيئة وتحسين السياسة

  • قابلية تكرار التجارب البحثية

  • دعم بيئات MuJoCo

  • التكامل مع Viskit للتسجيل والتصور

  • جداول طول التمرير قابلة للتكوين

  • خيارات لتردد تدريب النموذج وأوقات الانتهاء

  • قاعدة كود قابلة للتوسيع للبيئات والتعديلات الجديدة

  • التبعيات مُدارة عبر ملف بيئة conda

  • ملفات تكوين أمثلة لتشغيل التجارب

  • تعليمات واضحة للتثبيت والاستخدام

البدء مع مستودع MBPO على GitHub

  1. تثبيت MuJoCo: قم بإعداد MuJoCo 1.50 في ~/.mujoco/mjpro150 وضع مفتاح الترخيص الخاص بك في ~/.mujoco/mjkey.txt.

  2. استنساخ المستودع: احصل على الكود عن طريق تشغيل 'git clone --recursive https://github.com/jannerm/mbpo.git'.

  3. إنشاء بيئة: قم بإعداد بيئة conda باستخدام 'environment/gpu-env.yml' وقم بتنشيطها.

  4. تثبيت التبعيات: قم بتثبيت المشروع وتبعياته باستخدام 'pip install -e viskit' و 'pip install -e .'.

  5. تكوين التجارب: قم بتعديل أو تحديد ملفات التكوين من 'examples/config/' للإعدادات المطلوبة.

  6. تشغيل التجارب: قم بتنفيذ التجارب محليًا باستخدام أوامر مثل 'mbpo run_local examples.development --config=examples.config.halfcheetah.0 --gpus=1 --trial-gpus=1'.

  7. تصور النتائج: اعرض عمليات التشغيل المحفوظة باستخدام Viskit عن طريق تشغيل 'viskit ~/ray_mbpo --port 6008' (اضبط log_dir إذا لزم الأمر).

حالات استخدام مستودع MBPO على GitHub

  • أبحاث التعلم المعزز
  • تطوير الخوارزميات
  • محاكاة الروبوتات
  • الأنظمة المستقلة
  • ضبط المعلمات الفائقة
  • نمذجة البيئة

الأسئلة الشائعة من مستودع MBPO على GitHub

تقييمات مستودع MBPO على GitHub

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل مستودع MBPO على GitHub

نماذج الذكاء الاصطناعي

يحتوي مستودع GitHub هذا على الكود الخاص بالورقة البحثية "التعلم بالتقليد التوليدي التنافسي". يقوم بتطبيق تحسين سياسة منطقة الثقة ويوفر نصوصًا برمجية لتدريب وتقييم سياسات التعلم…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يوفر هذا المستودع الكود الخاص بتجارب التعلم المعزز المفصلة في ورقة "التعلم التكيفي النموذجي (Model-Agnostic Meta-Learning) للتكيف السريع للشبكات العميقة". يمكّن الباحثين والمطورين…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يحتوي هذا المستودع على كود التجارب لـ "التعلم المعزز العميق في عدد قليل من التجارب باستخدام نماذج الديناميكيات الاحتمالية". يقوم بتطبيق خوارزمية PETS، التي تجمع بين نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

PlaNet هو خوارزمية تعلم معزز قائمة على النموذج تخطط من البكسلات عن طريق تعلم ديناميكيات كامنة. تتنبأ بكفاءة بالمكافآت المستقبلية في مساحة كامنة متعلمة، وتتنافس مع الأساليب الخالية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نماذج العالم (World Models) هو مشروع بحثي يستكشف نماذج الشبكات العصبية التوليدية لبيئات التعلم المعزز. يمكّن الوكلاء من التعلم داخل 'أحلام' محاكاة تم إنشاؤها بواسطة نماذج عالمهم…

أدوات ذكاء اصطناعي أخرى

نماذج الذكاء الاصطناعي

يوفر مستودع GitHub هذا التنفيذ الرسمي لخوارزمية Twin Delayed Deep Deterministic Policy Gradients (TD3) باستخدام PyTorch. وهو مصمم لمهام التحكم المستمر ضمن بيئات OpenAI Gym، ويقدم…

أدوات ذكاء اصطناعي أخرى

نماذج الذكاء الاصطناعي

تُعد طرق تدرج السياسة فئة من خوارزميات التعلم المعزز التي تتعلم دالة السياسة مباشرة. على عكس الطرق القائمة على القيمة، فإنها تُحسّن معلمات السياسة لزيادة المكافآت المتوقعة، مما…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نماذج TensorFlow هو مستودع GitHub يقدم مجموعة من النماذج والأمثلة المبنية باستخدام TensorFlow. إنه بمثابة مركز مركزي للمطورين للوصول إلى نماذج التعلم الآلي المعدة مسبقًا لمختلف…

منصّات تعلّم الآلة