Описание
Агенты обучения с подкреплением (RL) часто сталкиваются с трудностями в обучении, специфичном для конкретной задачи, и в эффективности использования выборок. Plan2Explore решает эти проблемы, предлагая новый подход к самообучению с подкреплением. Этот агент разработан для превосходного исследования и быстрой адаптации к новым, невиданным ранее задачам без предварительных знаний.
На этапе исследования Plan2Explore отличается от предыдущих методов проактивным использованием планирования для обнаружения новых состояний. Вместо ретроспективной оценки новизны наблюдений после их достижения, агент стратегически ищет ожидаемую будущую новизну. Такое исследование, управляемое планированием, позволяет более эффективно собирать данные и глубже понимать среду.
После этапа исследования Plan2Explore демонстрирует замечательную адаптивность. Он может быть быстро дообучен для различных последующих задач, таких как стояние, ходьба или бег, используя всего ноль или несколько взаимодействий, специфичных для задачи. Эта возможность значительно снижает потребность в обширных данных и взаимодействиях, специфичных для задачи, делая его очень универсальным.
Агент был тщательно протестирован на сложных задачах управления, включающих высокоразмерные входные изображения. В этих оценках Plan2Explore достиг превосходной производительности по сравнению с существующими методами самообучащегося исследования, даже при работе без какого-либо надзора за обучением или вознаграждений, специфичных для задачи. Его производительность приблизилась к производительности оракула, имевшего доступ к вознаграждениям, что подчеркивает его эффективность.
Архитектура Plan2Explore позволяет ему сначала изучить глобальную модель мира посредством самообучащегося исследования, независимо от каких-либо вознаграждений, специфичных для задачи. После создания этой базовой модели агент может адаптироваться к различным функциям вознаграждения для различных задач, демонстрируя мощное разделение обучения исследованию и эксплуатации.
Проект предоставляет открытую реализацию Plan2Explore на Tensorflow, доступную на GitHub, что способствует дальнейшим исследованиям и разработкам в области самообуча с подкреплением. Этот релиз облегчает исследователям и практикам доступ для экспериментов и развития на основе фреймворка Plan2Explore.
Главное о Plan2Explore
Агент самообуча с подкреплением
Использует планирование для эффективного исследования
Ищет ожидаемую будущую новизну
Обеспечивает адаптацию к новым задачам с нулевым или минимальным количеством примеров
Изучает глобальную модель мира во время исследования
Обрабатывает высокоразмерные входные изображения
Превосходит предыдущие методы самообучащегося исследования
Приближается к производительности оракула с доступом к вознаграждениям
Реализация с открытым исходным кодом доступна на Tensorflow
Начало работы с Plan2Explore
Доступ к модели: Получите реализацию агента Plan2Explore.
Настройка среды: Настройте необходимое программное и аппаратное обеспечение для выполнения.
Исследование: Запустите агента в режиме самообучения для изучения модели мира.
Адаптация к задачам: Предоставьте функции вознаграждения для дообучения агента для конкретных последующих задач.
Интеграция через API: Используйте предоставленный код для интеграции в пользовательские RL-среды.
Оптимизация: Экспериментируйте с параметрами для улучшения производительности на целевых задачах.
Варианты использования Plan2Explore
- Управление робототехникой
- Игровой ИИ
- Автономные системы
- Исследования в области обучения с подкреплением
- Симуляционные среды








