Descrição
O Decision Transformer apresenta uma abordagem inovadora para o aprendizado por reforço (RL) ao abstraí-lo como um problema de modelagem de sequências. Isso permite que ele aproveite o poder e a escalabilidade das arquiteturas Transformer, comumente usadas na modelagem de linguagem, como GPT-x e BERT. A inovação central reside em tratar o RL como modelagem de sequência condicional, afastando-se do ajuste tradicional de funções de valor ou cálculos de gradiente de política.
Este framework, chamado Decision Transformer, gera diretamente ações ótimas empregando um Transformer com máscara causal. Ao condicionar um modelo autorregressivo em um retorno (recompensa) desejado, juntamente com estados e ações passadas, o Decision Transformer pode gerar ações futuras projetadas para atingir esse retorno específico. Essa simplicidade permite implementação e avaliação diretas.
Na prática, o Decision Transformer trata trajetórias de RL como sequências. Cada modalidade — retorno, estado ou ação — é processada através de uma rede de embedding. Esses embeddings são então alimentados em um modelo Transformer autorregressivo treinado para prever a ação subsequente. A avaliação envolve inicializar o modelo com um retorno alvo e o estado inicial, e então desenrolar a sequência para gerar ações para execução no ambiente, semelhante à geração autorregressiva padrão em modelos de linguagem.
Uma das principais capacidades demonstradas é a habilidade de 'costurar' sub-sequências de diferentes trajetórias de treinamento para produzir caminhos ótimos no tempo de teste. Por exemplo, quando treinado em caminhadas aleatórias em um problema de grafo, o Decision Transformer pode gerar um caminho ótimo condicionando em um retorno alto, sem aprendizado TD explícito ou pessimismo de valor. Esse comportamento espelha o de algoritmos de Q-learning off-policy, mas alcançado através de um paradigma de modelagem de sequência.
O Decision Transformer foi avaliado em benchmarks padrão de RL offline, incluindo o Atari Learning Environment, OpenAI Gym e uma tarefa Minigrid Key-To-Door. Em todas essas tarefas diversas, que envolvem controle discreto e contínuo, bem como observações de imagem e estado, o Decision Transformer mostrou desempenho comparável a algoritmos especializados de aprendizado TD.
Além disso, o Decision Transformer atua como um aprendiz multitarefa realizando geração condicional. Ele não produz uma única política, mas sim modela uma distribuição de políticas. Ao plotar o retorno médio alcançado contra o retorno alvo, políticas distintas podem ser observadas. Em alguns casos, o Decision Transformer demonstrou a capacidade de extrapolar além do conjunto de dados de treinamento e modelar políticas com retornos mais altos do que os presentes nos dados.
Destaques de Decision Transformer
Aprendizado por Reforço como Modelagem de Sequências
Integração de Arquitetura Transformer
Modelagem de Sequência Condicional
Geração de Ações Autorregressiva
Condicionamento por Retorno Desejado
Aprendizado por Reforço Offline
Abordagem Model-Free
Desempenho de Ponta
Aplicabilidade Inter-Tarefas (Atari, OpenAI Gym, Key-to-Door)
Costura de Sub-sequências para Trajetórias Ótimas
Extrapolação Além dos Dados de Treinamento
Capacidade de Aprendizado Multitarefa
Primeiros passos com Decision Transformer
Acessar Modelo: Obtenha acesso ao modelo Decision Transformer.
Configurar Ambiente: Configure o ambiente de RL para interação.
Integrar via API: Implemente o Decision Transformer em seu pipeline de RL.
Definir Retorno Alvo: Especifique o nível de recompensa desejado para a política.
Inserir Dados Passados: Forneça estados e ações passadas como entradas de condicionamento.
Gerar Ações: O modelo gera uma sequência de ações para execução.
Avaliar Desempenho: Meça o retorno alcançado em relação ao alvo.
Casos de uso de Decision Transformer
- Treinamento de RL Offline
- Tomada de Decisão Baseada em Sequências
- Políticas Condicionadas por Objetivo
- Otimização de Trajetórias
- Controle Robótico
- Desenvolvimento de IA para Jogos








