日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:1801.01290

Soft Actor-Critic

Soft Actor-Critic

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文強化学習・制御・世界モデル
本論文は、オフポリシー型の最大エントロピー強化学習アルゴリズムであるSoft Actor-Critic(SAC)を提案した。従来の強化学習アルゴリズムが報酬の総和のみを最大化するのに対し、SACは報酬に加えて方策のエントロピー(ランダム性)を最大化する目的関数を導入した。これにより、探索と活用のバランスを自動的に調整し、サンプル効率と学習の安定性を両立させた。提案手法は、連続行動空間の制御タスクにおいて、当時の最先端手法を上回る性能を示した。 SACの核心は、最大エントロピー強化学習の枠組みをオフポリシー学習に適用した点にある。具体的には、方策を確率的(ガウス分布など)にモデル化し、目的関数にエントロピー項を加える。このエントロピー項により、方策は報酬が高い行動を選びつつも、不確実性を保つように学習する。また、ソフトQ関数を学習し、これを用いて方策を更新する。さらに、自動温度調整機構を導入し、エントロピー項の重み(温度パラメータ)を目標エントロピーに合わせて適応的に調整する。これにより、タスクに応じて探索の度合いを自動的に決定できる。学習には、経験再生バッファを用いたオフポリシー更新を採用し、サンプル効率を高めた。 画期的だった点は、従来のオフポリシー手法(DDPGなど)が抱えるハイパーパラメータ敏感性や学習の不安定性を、エントロピー正則化と確率的方策によって大幅に緩和したことである。また、オンライン手法(PPOなど)に比べてサンプル効率が高く、実ロボットへの適用可能性を大きく高めた。さらに、温度パラメータの自動調整により、タスクごとの手動調整が不要となり、実用性が向上した。 フィジカルAIへの影響は極めて大きい。SACは、ロボットの連続制御(関節トルク指令など)の標準的なベースラインとして広く採用され、その後のロボット基盤モデルや視覚言語行動モデル(VLA)の学習にも応用されている。特に、実ロボットでの強化学習では、サンプル効率の高さと安定性が重要であり、SACはその基盤を提供した。また、確率的方策は、不確実性を考慮したロバストな制御や、模倣学習との組み合わせにも有用である。さらに、最大エントロピー原理は、探索と活用のトレードオフを理論的に扱う枠組みとして、後のアルゴリズム(例えば、SACの拡張やオフライン強化学習)にも影響を与えた。現在のロボット学習において、SACは単なるアルゴリズムを超え、連続制御における強化学習の標準的な考え方として定着している。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

分類: landmark

関連論文強化学習・制御・世界モデル