Guopeng Li
収録論文 5本 ・ フィジカルAI/ロボット学習
強化学習安全強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 到達して生き残る:1ビットの失敗信号からの安全な目標条件付きポリシー学習のスケーリング強化学習2026/8/27
失敗終了型マルコフ決定過程における対比強化学習の理論的欠陥を指摘し、質量重み付きInfoNCEと対数生存質量スコアによる修正を加えたSafe-CRLを提案。12のロボットナビゲーション・歩行タスクで生存率と目標到達性能を向上させた。
- COP-Q: コレスキー順序射影による安全最優先ロボット制御強化学習安全強化学習2026/6/3
報酬と安全性のQ値の相関を考慮し、コレスキー分解で安全を優先しつつ報酬の過度な保守性を抑える新しい安全強化学習手法を提案した。ロボットの移動やナビゲーション実験で安全性とサンプル効率の向上を確認した。
- 制約付き楽観的探索を用いたオフポリシー安全強化学習安全強化学習2026/3/1
安全制約を満たすオフポリシー強化学習アルゴリズムCOX-Qを提案し、コスト制約付き探索と分布価値学習により、サンプル効率と安全性を両立させた。
- A Conflict Resolution Dataset Derived from Argoverse-2: Analysis of the Safety and Efficiency Impacts of Autonomous Vehicles at Intersections2023/8/1
- Large Car-following Data Based on Lyft level-5 Open Dataset: Following Autonomous Vehicles vs. Human-driven Vehicles2023/5/1