説明
Decision Transformer は、強化学習(RL)をシーケンスモデリング問題として抽象化することで、そのための新しいアプローチを提示します。これにより、GPT-x や BERT のような、言語モデリングで一般的に使用される Transformer アーキテクチャのパワーとスケーラビリティを活用できます。中核となるイノベーションは、従来の価値関数フィッティングや方策勾配計算から離れ、RL を条件付きシーケンスモデリングとして捉えることにあります。
Decision Transformer と名付けられたこのフレームワークは、因果マスク付き Transformer を使用して、最適な行動を直接出力します。自己回帰モデルを望ましいリターン(報酬)、過去の状態、および行動を条件付けることで、Decision Transformer はその特定のリターンを達成するように設計された将来の行動を生成できます。このシンプルさにより、実装と評価が容易になります。
実際には、Decision Transformer は RL の軌跡をシーケンスとして扱います。リターン、状態、または行動の各モダリティは、埋め込みネットワークを通じて処理されます。これらの埋め込みは、後続のアクションを予測するように訓練された自己回帰 Transformer モデルに供給されます。評価では、ターゲットリターンと開始状態を初期化し、シーケンスを展開して環境で実行するアクションを生成します。これは、言語モデルにおける標準的な自己回帰生成に似ています。
実証された主要な機能の 1 つは、テスト時に最適なパスを生成するために、異なるトレーニング軌跡からのサブシーケンスを「ステッチ」する能力です。たとえば、グラフ問題でランダムウォークでトレーニングされた場合、Decision Transformer は明示的な TD 学習や価値の悲観論なしに、高リターンを条件付けることで最適なパスを生成できます。この動作は、オフポリシー Q 学習アルゴリズムの動作を模倣していますが、シーケンスモデリングパラダイムを通じて達成されています。
Decision Transformer は、Atari Learning Environment、OpenAI Gym、および Minigrid Key-To-Door タスクを含む標準的なオフライン RL ベンチマークで評価されています。離散および連続制御、画像および状態観測を含むこれらの多様なタスク全体で、Decision Transformer は、専門の TD 学習アルゴリズムに匹敵するパフォーマンスを示しています。
さらに、Decision Transformer は条件付き生成を実行することでマルチタスク学習者として機能します。単一の方策を生成するのではなく、方策の分布をモデル化します。平均達成リターンとターゲットリターンのグラフを作成することで、異なる方策を観察できます。場合によっては、Decision Transformer はトレーニングデータセットを超えて外挿し、データに存在するよりも高いリターンを持つ方策をモデル化する能力を示しています。
Decision Transformerのハイライト
強化学習をシーケンスモデリングとして
Transformer アーキテクチャの統合
条件付きシーケンスモデリング
自己回帰型アクション生成
望ましいリターンによる条件付け
オフライン強化学習
モデルフリーアプローチ
最先端のパフォーマンス
タスク横断的な適用性 (Atari, OpenAI Gym, Key-to-Door)
最適な軌跡のためのサブシーケンスのステッチ
トレーニングデータを超えた外挿
マルチタスク学習能力
Decision Transformerをはじめる
モデルへのアクセス: Decision Transformer モデルへのアクセスを取得します。
環境のセットアップ: インタラクションのための RL 環境を構成します。
API 経由での統合: RL パイプライン内に Decision Transformer を実装します。
ターゲットリターンの定義: 方策の望ましい報酬レベルを指定します。
過去データの入力: 過去の状態と行動を条件付け入力として提供します。
アクションの生成: モデルは実行するアクションのシーケンスを出力します。
パフォーマンスの評価: 達成されたリターンをターゲットと比較して測定します。
Decision Transformerの使用例
- オフライン RL トレーニング
- シーケンスベースの意思決定
- 目標条件付き方策
- 軌跡最適化
- ロボット制御
- ゲーム AI 開発








