日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2106.01345

Decision Transformer: Reinforcement Learning via Sequence Modeling

Decision Transformer: Reinforcement Learning via Sequence Modeling

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文強化学習・制御・世界モデル
本論文は、強化学習を従来のベルマン方程式に基づく価値反復や方策勾配法ではなく、教師あり学習の一種である系列モデリングとして再定式化するDecision Transformerを提案した。具体的には、状態、行動、報酬の履歴をトークン列として扱い、Transformerアーキテクチャを用いて、所望のリターン(累積報酬)を条件として行動を自己回帰的に生成する。これにより、強化学習特有の不安定な目標関数やブートストラップを避け、単純なクロスエントロピー損失で訓練できる点が新しい。 仕組みの核は、過去の軌跡を「リターン・トゥ・ゴー(return-to-go)」と呼ばれる、その時点から将来得られる累積報酬の残りと、状態、行動の3要素をトークンとして並べ、Transformerのアテンション機構で文脈を捉えることにある。推論時には、目標とするリターンを与え、現在の状態から行動を逐次予測する。この設計により、方策は条件付き分布として表現され、報酬が疎な環境でも、目標リターンを変えることで多様な行動を生成できる。 画期的だった点は、強化学習の主要な課題である「探索と活用のトレードオフ」や「遅延報酬の伝播」を、明示的な価値関数や方策勾配なしに扱えるようにしたことである。従来の手法は、ブートストラップによる過大評価や、ハイパーパラメータへの敏感さ、非定常性に悩まされたが、Decision Transformerは教師あり学習の安定性を享受し、オフライン強化学習(固定データセットからの学習)において特に強力であることを示した。また、Transformerのスケーラビリティを活かし、大規模なデータとモデルサイズに対して自然に拡張できる。 フィジカルAI、特にロボット制御の文脈では、この手法は「データ駆動型の行動生成」の新しいパラダイムを提供した。ロボットは実環境での試行錯誤が高コストであるため、オフラインで収集されたデモンストレーションや過去の経験から直接方策を学習できる点が実用的である。さらに、目標リターンを指定することで、タスクの成功率や効率を調整できるため、マルチタスクやメタ学習への応用が期待される。その後、Decision Transformerは多くの変種(例えば、オンライン適応や階層化、モデルベースとの融合)を生み出し、強化学習と大規模言語モデルの橋渡しとしても注目された。ロボットの長期的なタスク計画や、言語指示に基づく行動生成など、身体性を伴う知能の実現に向けた基盤技術の一つとなっている。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

分類: landmark

関連論文強化学習・制御・世界モデル