Deskripsi
OpenManus-RL adalah inisiatif sumber terbuka kolaboratif oleh Ulab-UIUC dan MetaGPT, yang memperluas proyek OpenManus asli. Terinspirasi oleh penyetelan RL yang sukses untuk LLM penalaran seperti Deepseek-R1 dan QwQ-32B, proyek ini mengeksplorasi paradigma baru untuk penyetelan agen LLM berbasis RL. Kemajuan, termasuk pengujian ketat pada benchmark seperti GAIA, AgentBench, WebShop, dan OSWorld, bersama dengan model yang disetel, dibagikan secara dinamis melalui live streaming.
Proyek ini mengintegrasikan teknik reinforcement learning (RL) canggih untuk meningkatkan kemampuan penalaran dan pengambilan keputusan LLM. Proyek ini mengambil inspirasi dari kerangka kerja yang ada dan mengeksplorasi struktur algoritmik baru, paradigma penalaran yang beragam, strategi imbalan yang canggih, dan lingkungan benchmark yang ekstensif. Komponen utama meliputi eksplorasi berbagai model penalaran (GPT-O1, Deepseek-R1, QwQ-32B), eksperimen dengan strategi rollout alternatif seperti Tree-of-Thoughts (ToT) dan Monte Carlo Tree Search (MCTS), dan analisis berbagai format output penalaran seperti ReAct dan Outcome-based Reasoning.
Strategi pasca-pelatihan yang diselidiki meliputi Supervised Fine-Tuning (SFT), Generalized Reward-based Policy Optimization (GRPO), Proximal Policy Optimization (PPO), Direct Preference Optimization (DPO), dan Preference-based Reward Modeling (PRM). Proyek ini juga berfokus pada pelatihan model imbalan agen khusus dan implementasi penskalaan lintasan saat pengujian untuk adaptabilitas. Integrasi dengan kerangka kerja penyetelan RL terkemuka, terutama submodul 'verl', menyediakan kemampuan pelatihan canggih untuk optimasi agen.
Dataset OpenManus-RL menggabungkan lintasan agen dari AgentInstruct, Agent-FLAN, dan AgentTraj-L, menampilkan kerangka kerja ReAct, pelatihan terstruktur, teknik anti-halusinasi, dan cakupan di enam domain. Proyek ini menyediakan pustaka yang disederhanakan untuk penyetelan SFT dan GRPO, dibangun di atas kerangka kerja 'verl'. Kontribusi komunitas sangat didorong untuk menyempurnakan codebase, dataset, pengaturan lingkungan, dan sumber daya komputasi, dengan kontributor penting berpotensi terdaftar sebagai rekan penulis untuk makalah di masa mendatang.
OpenManus-RL bertujuan untuk mendorong batas-batas penalaran agen dan integrasi alat, membina ekosistem agen sumber terbuka yang berkembang pesat. Proyek ini berkomitmen untuk pembaruan berkelanjutan dan menyambut kolaborasi dari pengembang yang tertarik untuk memajukan kemampuan agen LLM.
Fitur Inti OpenManus-RL
Pengembangan live-stream penyetelan RL untuk agen LLM
Eksplorasi paradigma penyetelan agen LLM berbasis RL yang baru
Pengujian ketat pada benchmark agen (GAIA, AgentBench, WebShop, OSWorld)
Berbagi kemajuan, hasil, dan model yang disetel secara terbuka
Integrasi algoritma dan kerangka kerja RL canggih (misalnya, Verl)
Dukungan untuk berbagai model penalaran dan strategi rollout (ToT, MCTS)
Implementasi berbagai strategi pasca-pelatihan (SFT, GRPO, PPO, DPO)
Dataset komprehensif yang menggabungkan lintasan agen dari berbagai sumber
Kontribusi komunitas disambut untuk kode, data, dan sumber daya
Memulai dengan OpenManus-RL
Kloning Repositori: Kloning repositori OpenManus-RL, pastikan submodule diinisialisasi dan diperbarui.
Pengaturan Lingkungan: Buat dan aktifkan lingkungan conda, lalu instal dependensi yang diperlukan termasuk PyTorch dan vllm.
Persiapan Dataset: Unduh dataset OpenManus-RL dari Hugging Face.
Konfigurasi Lingkungan: Siapkan lingkungan agen tertentu seperti WebShop atau ALFWorld sesuai dokumentasi.
Eksekusi Pelatihan: Gunakan skrip yang disediakan untuk melatih model agen, misalnya, Pelatihan RL ALFWorld (PPO).
Optimasi: Sempurnakan parameter dan jelajahi strategi yang berbeda untuk kinerja agen yang optimal.
Kasus Penggunaan OpenManus-RL
- Penyetelan Agen LLM
- Penelitian Reinforcement Learning
- Evaluasi Benchmark
- Kolaborasi Sumber Terbuka
- Integrasi Alat
- Peningkatan Kemampuan Penalaran







