日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:1509.02971

Continuous control with deep reinforcement learning

Continuous control with deep reinforcement learning

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文被引用 15,864強化学習・制御・世界モデル
この論文は、深層強化学習を連続的な行動空間を持つ制御問題に適用するための手法を提案した。従来のDeep Q-Learningは離散的な行動選択に限定されていたが、本論文は決定論的方策勾配法に基づくアクター・クリティック型のモデルフリーアルゴリズムを導入し、連続値の行動を直接出力できるようにした。提案手法はDeep Deterministic Policy Gradient(DDPG)と呼ばれ、アクターが状態から行動を決定し、クリティックがその行動の価値を評価する。アクターは方策勾配を用いて更新され、クリティックはQ学習の考え方で更新される。また、経験再生とターゲットネットワークを採用し、学習の安定性を高めている。 この手法の画期的な点は、連続行動空間を扱えることと、同じアルゴリズムとハイパーパラメータで多様なタスクを解けることである。従来のDQNは離散行動にしか適用できず、連続制御には行動を離散化する必要があったが、次元が増えると計算量が爆発する問題があった。DDPGは決定論的方策を直接学習するため、この問題を回避し、カートポールの振り上げ、器用な操作、脚式移動、車の運転など20以上のシミュレーション物理タスクを解くことができた。さらに、完全なダイナミクス情報を持つプランニングアルゴリズムと同等の性能を達成し、一部のタスクでは生のピクセル入力から直接方策を学習することも示した。 この研究はフィジカルAI、特にロボット制御に大きな影響を与えた。ロボットの動作生成は連続的な関節角度やトルクを扱う必要があり、DDPGはそのような問題に直接適用できる強化学習の基盤となった。その後、DDPGはロボット基盤モデルや視覚言語行動モデル(VLA)の構成要素として発展し、例えば、画像と言語からロボットの行動を生成するモデルでは、連続行動出力のためのアクター・クリティック構造が利用されている。また、DDPGの考え方は、モデル予測制御や模倣学習と組み合わせられ、実ロボットへの適用も進んだ。さらに、この論文で示されたエンドツーエンド学習は、センサ情報から直接制御信号を生成するアプローチの先駆けとなり、現在のロボット学習における重要なパラダイムの一つとなっている。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

分類: landmark

原文アブストラクト

We adapt the ideas underlying the success of Deep Q-Learning to the continuous action domain. We present an actor-critic, model-free algorithm based on the deterministic policy gradient that can operate over continuous action spaces. Using the same learning algorithm, network architecture and hyper-parameters, our algorithm robustly solves more than 20 simulated physics tasks, including classic problems such as cartpole swing-up, dexterous manipulation, legged locomotion and car driving. Our algorithm is able to find policies whose performance is competitive with those found by a planning algorithm with full access to the dynamics of the domain and its derivatives. We further demonstrate that for many of the tasks the algorithm can learn policies end-to-end: directly from raw pixel inputs.

関連論文強化学習・制御・世界モデル