日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
安全強化学習arXiv:2609.27312

安全性を競技力へ:安全フィルタ付き強化学習による搾取されにくいロボット方策

Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

競技タスク向けに、安全フィルタを敵対的RLで学習してからタスク方策を訓練する2段階フレームワークS2Cを提案し、安全性と競技性能・非搾取性を両立させた。

詳しい要約

1. どんなもの?

- 競争的タスクに展開するロボットのための安全強化学習フレームワーク「Safety to Competence (S2C)」を提案。 - 安全合成と競争タスク学習を分離する2段階のRL。 - 競争的相互作用を安全クリティカルなMarkovゲームとして定式化。 - 安全フィルタを敵対的RLで学習し、タスクポリシー訓練時に環境に埋め込み、展開時も同じフィルタを保持。 - シミュレーションのtouchdownゲームで8つの安全RLベースラインを上回る勝率、Eloレーティング、最低のexploitabilityを達成。 - 人間対戦相手とのハードウェアストレステストで能力を確認。

2. 先行研究と比べてどこがすごい?

- 既存の安全RLは単一ポリシーでタスク成功と失敗回避を同時に学習するため、訓練が複雑化し、意図的な攻撃に対してexploitableになる可能性がある。 - S2Cは安全合成と競争タスク学習を分離することで、この結合問題を回避。 - 全てのプレイヤーが安全な行動を取る場合、完全なフィルタリングがポリシーの非exploitabilityを保持することを証明。 - シミュレーションで8つの安全RLベースラインを上回る性能を達成。

3. 技術・手法の肝は?

- 競争的相互作用を安全クリティカルなMarkovゲームとして定式化。 - 敵対的RLを用いて堅牢な安全フィルタを学習。 - タスクポリシー訓練時に学習した安全フィルタを環境に埋め込む。 - 展開時にも同じ安全フィルタを保持。 - 2段階のRLフレームワーク:第1段階で安全フィルタを学習、第2段階でタスクポリシーを学習。

4. どうやって有効だと検証した?

- シミュレーションのtouchdownゲームで評価。 - 8つの安全RLベースラインと比較し、最高の勝率とEloレーティング、最低のexploitabilityを達成。 - 人間対戦相手とのハードウェアストレステストを実施し、S2Cの能力を確認。

5. 議論はある?

- 完全なフィルタリングが非exploitabilityを保持する条件(全プレイヤーが安全な行動を取る場合)を理論的に証明。 - 実環境でのハードウェアストレステストで有効性を確認。 - その他の議論や限界については要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:safe reinforcement learning (RL) のベースライン(8つ)。 - 関連手法:adversarial RL、Markov games、safety-critical Markov games。 - 同分野の定番:safe RL、competitive RL、multi-agent RL。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ruihan Wu, Rui Yang, Donggeon David Oh, Duy Nguyen, Haimin Hu

分類: cs.RO, cs.AI, cs.LG, eess.SY

原文アブストラクト

Robots deployed for competitive tasks must outmaneuver their opponents without sacrificing safety. Existing approaches, including safe reinforcement learning (RL), train a single policy to achieve task success and avoid failures simultaneously. This coupling can complicate training and leave the learned policy exploitable by deliberate attacks. We propose Safety to Competence (S2C), a two-stage RL framework that separates safety synthesis from competitive task learning. We formulate competitive interactions as safety-critical Markov games and prove that perfect filtering preserves policy non-exploitability when all players commit to safe maneuvers. S2C learns a robust safety filter via adversarial RL, embeds it in the environment during task policy training, and retains the same filter at deployment. In simulated touchdown games, S2C outperforms eight safe RL baselines, achieving the highest win rate and Elo rating, and the lowest exploitability. Hardware stress tests against a human opponent confirm S2C's competence.

関連論文

PR本紙発行元 EmplifAI