Deskripsi
Agen pembelajaran penguatan (RL) sering menghadapi tantangan dengan pembelajaran spesifik tugas dan efisiensi sampel. Plan2Explore mengatasi keterbatasan ini dengan memperkenalkan pendekatan pembelajaran penguatan yang diawasi sendiri yang baru. Agen ini direkayasa untuk unggul dalam eksplorasi dan beradaptasi dengan cepat ke tugas-tugas baru yang belum pernah dilihat sebelumnya tanpa pengetahuan sebelumnya.
Selama fase eksplorasinya, Plan2Explore membedakan dirinya dari metode sebelumnya dengan secara proaktif menggunakan perencanaan untuk menemukan keadaan baru. Alih-alih menilai kebaruan observasi secara retrospektif setelah mencapainya, agen secara strategis mencari kebaruan masa depan yang diharapkan. Eksplorasi yang didorong oleh perencanaan ini memungkinkan pengumpulan data yang lebih efisien dan pemahaman lingkungan yang lebih kaya.
Setelah fase eksplorasi, Plan2Explore menunjukkan kemampuan adaptasi yang luar biasa. Agen ini dapat disesuaikan dengan cepat untuk berbagai tugas hilir, seperti berdiri, berjalan, atau berlari, hanya dengan menggunakan nol atau beberapa interaksi spesifik tugas. Kemampuan ini secara signifikan mengurangi kebutuhan akan data pelatihan dan interaksi spesifik tugas yang ekstensif, menjadikannya sangat serbaguna.
Agen ini telah dievaluasi secara ketat pada tugas kontrol kompleks yang melibatkan input gambar berdimensi tinggi. Dalam evaluasi ini, Plan2Explore mencapai kinerja yang unggul dibandingkan dengan metode eksplorasi yang diawasi sendiri yang ada, bahkan ketika beroperasi tanpa pengawasan pelatihan atau imbalan spesifik tugas. Kinerjanya mendekati kinerja agen oracle yang memiliki akses ke imbalan, menyoroti efektivitasnya.
Arsitektur Plan2Explore memungkinkannya untuk pertama-tama mempelajari model dunia global melalui eksplorasi yang diawasi sendiri, terlepas dari imbalan spesifik tugas apa pun. Setelah model dasar ini ditetapkan, agen kemudian dapat beradaptasi dengan berbagai fungsi imbalan untuk tugas yang berbeda, menunjukkan pemisahan pembelajaran eksplorasi dan eksploitasi yang kuat.
Proyek ini menyediakan implementasi open-source Plan2Explore dalam Tensorflow, tersedia di GitHub, mendorong penelitian dan pengembangan lebih lanjut di bidang pembelajaran penguatan yang diawasi sendiri. Rilis ini memfasilitasi akses mudah bagi para peneliti dan praktisi untuk bereksperimen dan membangun kerangka kerja Plan2Explore.
Sorotan Plan2Explore
Agen pembelajaran penguatan yang diawasi sendiri
Memanfaatkan perencanaan untuk eksplorasi yang efisien
Mencari kebaruan masa depan yang diharapkan
Memungkinkan adaptasi zero atau few-shot ke tugas-tugas baru
Mempelajari model dunia global selama eksplorasi
Menangani input gambar berdimensi tinggi
Mengungguli metode eksplorasi yang diawasi sendiri sebelumnya
Mendekati kinerja oracle dengan akses ke imbalan
Implementasi open-source tersedia dalam Tensorflow
Memulai dengan Plan2Explore
Akses model: Dapatkan implementasi agen Plan2Explore.
Siapkan lingkungan: Konfigurasikan perangkat lunak dan perangkat keras yang diperlukan untuk eksekusi.
Jelajahi: Jalankan agen secara mandiri untuk mempelajari model dunia.
Adaptasi ke tugas: Sediakan fungsi imbalan untuk menyempurnakan agen untuk tugas hilir tertentu.
Integrasikan melalui API: Gunakan kode yang disediakan untuk integrasi ke dalam lingkungan RL kustom.
Optimalkan: Bereksperimen dengan parameter untuk peningkatan kinerja pada tugas target.
Kasus Penggunaan Plan2Explore
- Kontrol Robotika
- AI Game
- Sistem Otonom
- Penelitian Pembelajaran Penguatan
- Lingkungan Simulasi








