日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ヒューマノイド制御arXiv:2609.15988

ResSafe: 残差強化学習によるヒューマノイドの安全フィルタリング

ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids

シェア:XThreadsFacebookLINEはてブBluesky

ヒューマノイド制御において、タスク遂行ポリシーと安全補正ポリシーを分離し、残差強化学習で安全フィルタを学習する手法を提案。

詳しい要約

1. どんなもの?

- 本研究は、ヒューマノイドロボットの安全制御のための新しいフレームワーク「ResSafe」を提案する。 - 高次元ダイナミクス、接触の多い相互作用、外乱への敏感さから、安全な制御は依然として困難である。 - 強化学習は locomotion や motion tracking を可能にしたが、学習されたポリシーは不安定化や転倒につながる不安全な行動を生成する可能性がある。 - 提案手法では、residual reinforcement learning を暗黙的な safety filtering メカニズムとして用いる。 - 性能と安全性を分離し、nominal policy はタスク性能のみに集中し、residual policy が安全修正を学習する。

2. 先行研究と比べてどこがすごい?

- 従来の単一の nominal policy では、性能、安全性、ロバスト性を同時にバランスさせる必要があり、複数の競合する報酬項の慎重なチューニングが求められた。 - 提案手法は性能と安全性を分離することで、性能と安全性のパレートトレードオフを改善し、単一ポリシー訓練内での複数報酬項のチューニングを不要にする。 - residual policy が暗黙的な safety filter として機能することを示した点が新しい。

3. 技術・手法の肝は?

- residual reinforcement learning を暗黙的な safety filtering メカニズムとして使用する。 - nominal policy はタスク性能のみを追求し、residual policy は安全修正を学習する。 - この分離により、性能と安全性のトレードオフをより良く管理できる。 - 具体的なアルゴリズムやネットワーク構造は要旨からは不明。

4. どうやって有効だと検証した?

- 要旨からは不明。実験設定や評価指標、シミュレーション/実機検証の詳細は記述されていない。

5. 議論はある?

- 要旨からは不明。限界や課題、今後の展望についての議論は記述されていない。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、residual reinforcement learning、safety filtering、humanoid control の分野の定番論文(例:residual policy learning、safe reinforcement learning、humanoid locomotion with RL)を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Gechen Qu, Tong Zhang, Bike Zhang, Yen-Jen Wang, Koushil Sreenath, Claire Tomlin, Jason Jangho Choi

分類: cs.RO

原文アブストラクト

Safe control of humanoid robots remains challenging due to their high-dimensional dynamics, contact-rich interactions, and sensitivity to disturbances. Although reinforcement learning has enabled effective locomotion and motion tracking, learned policies can still generate unsafe actions that lead to instability or falls. In this work, we propose residual reinforcement learning as an implicit safety-filtering mechanism for safe humanoid control. Instead of relying on a single nominal policy to simultaneously balance performance, safety, and robustness, we decouple performance and safety. The nominal policy focuses solely on task performance, while a residual policy learns safety corrections. This decoupling leads to a better performance--safety Pareto trade-off and avoids the need for careful tuning of multiple competing reward terms within a single policy training. We show that the residual policy can act as an implicit safety filter.

関連論文