Matthijs T. J. Spaan
収録論文 2本 ・ フィジカルAI/ロボット学習
安全強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- COP-Q: コレスキー順序射影による安全最優先ロボット制御強化学習安全強化学習2026/6/3
報酬と安全性のQ値の相関を考慮し、コレスキー分解で安全を優先しつつ報酬の過度な保守性を抑える新しい安全強化学習手法を提案した。ロボットの移動やナビゲーション実験で安全性とサンプル効率の向上を確認した。
- 制約付き楽観的探索を用いたオフポリシー安全強化学習安全強化学習2026/3/1
安全制約を満たすオフポリシー強化学習アルゴリズムCOX-Qを提案し、コスト制約付き探索と分布価値学習により、サンプル効率と安全性を両立させた。