Descripción
Decision Transformer presenta un enfoque novedoso para el aprendizaje por refuerzo (RL) al abstraerlo como un problema de modelado de secuencias. Esto le permite aprovechar la potencia y escalabilidad de las arquitecturas Transformer, comúnmente utilizadas en el modelado de lenguaje, como GPT-x y BERT. La innovación central radica en plantear el RL como modelado de secuencias condicional, alejándose de los ajustes tradicionales de funciones de valor o los cálculos de gradiente de políticas.
Este marco, denominado Decision Transformer, genera directamente acciones óptimas empleando un Transformer con enmascaramiento causal. Al condicionar un modelo autorregresivo en un retorno (recompensa) deseado, junto con estados y acciones pasadas, el Decision Transformer puede generar acciones futuras diseñadas para lograr ese retorno específico. Esta simplicidad permite una implementación y evaluación sencillas.
En la práctica, Decision Transformer trata las trayectorias de RL como secuencias. Cada modalidad (retorno, estado o acción) se procesa a través de una red de incrustación (embedding). Estas incrustaciones se introducen en un modelo Transformer autorregresivo entrenado para predecir la acción subsiguiente. La evaluación implica inicializar el modelo con un retorno objetivo y el estado de inicio, y luego desplegar la secuencia para generar acciones para su ejecución en el entorno, similar a la generación autorregresiva estándar en modelos de lenguaje.
Una de las capacidades clave demostradas es la habilidad de 'coser' sub-secuencias de diferentes trayectorias de entrenamiento para producir caminos óptimos en tiempo de prueba. Por ejemplo, cuando se entrena con caminatas aleatorias en un problema de grafos, Decision Transformer puede generar un camino óptimo condicionando en un alto retorno, sin aprendizaje TD explícito o pesimismo de valor. Este comportamiento refleja el de los algoritmos de Q-learning fuera de política, pero logrado a través de un paradigma de modelado de secuencias.
El Decision Transformer ha sido evaluado en benchmarks estándar de RL offline, incluyendo el Atari Learning Environment, OpenAI Gym y una tarea Minigrid Key-To-Door. En estas diversas tareas, que involucran control discreto y continuo, así como observaciones de imágenes y estados, Decision Transformer ha mostrado un rendimiento comparable a los algoritmos especializados de aprendizaje TD.
Además, Decision Transformer actúa como un aprendiz multitarea al realizar generación condicional. No produce una única política, sino que modela una distribución de políticas. Al graficar el retorno promedio alcanzado frente al retorno objetivo, se pueden observar políticas distintas. En algunos casos, Decision Transformer ha demostrado la capacidad de extrapolar más allá del conjunto de datos de entrenamiento y modelar políticas con retornos más altos que los presentes en los datos.
Aspectos destacados de Decision Transformer
Aprendizaje por Refuerzo como Modelado de Secuencias
Integración de Arquitectura Transformer
Modelado de Secuencias Condicional
Generación Autorregresiva de Acciones
Condicionamiento por Retorno Deseado
Aprendizaje por Refuerzo Offline
Enfoque sin Modelo (Model-Free)
Rendimiento de Vanguardia
Aplicabilidad Inter-Tareas (Atari, OpenAI Gym, Key-to-Door)
Cosechado de Sub-secuencias para Trayectorias Óptimas
Extrapolación Más Allá de los Datos de Entrenamiento
Capacidad de Aprendizaje Multitarea
Primeros pasos con Decision Transformer
Acceder al Modelo: Obtener acceso al modelo Decision Transformer.
Configurar Entorno: Configurar el entorno de RL para la interacción.
Integrar vía API: Implementar Decision Transformer dentro de su pipeline de RL.
Definir Retorno Objetivo: Especificar el nivel de recompensa deseado para la política.
Ingresar Datos Pasados: Proporcionar estados y acciones pasadas como entradas de condicionamiento.
Generar Acciones: El modelo genera una secuencia de acciones a ejecutar.
Evaluar Rendimiento: Medir el retorno alcanzado frente al objetivo.
Casos de uso de Decision Transformer
- Entrenamiento de RL Offline
- Toma de Decisiones Basada en Secuencias
- Políticas Condicionadas por Objetivos
- Optimización de Trayectorias
- Control Robótico
- Desarrollo de IA para Juegos








