Pan Xu
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- オフダイナミクス強化学習のためのクロスドメインエネルギー誘導拡散生成強化学習2026/5/1
遷移ダイナミクスが異なる環境間で、ソースデータセットからターゲット領域のポリシーを学習する際に、エネルギー誘導を用いて軌道レベルの拡散生成を行い、ターゲット領域に適応した合成データを生成する手法CEDGEを提案した。
- 局所ダイナミクス適応によるオフダイナミクスオフライン強化学習オフライン強化学習2026/2/1
ソースとターゲットの遷移をクラスタリングし、クラスタ単位でダイナミクス不一致を評価してソースデータを選択する手法を提案し、オフダイナミクスオフラインRLの性能を向上させた。
- オンライン相互作用を用いた分布ロバストなオフダイナミクス強化学習のサンプル複雑度強化学習2025/11/1
訓練環境と展開環境の動学が異なる状況で、オンライン相互作用のみを用いたロバスト強化学習のサンプル複雑度を解析し、最適な後悔界を達成する効率的アルゴリズムを提案した。
- MOBODY: モデルベースの動特性ずれオフライン強化学習オフライン強化学習2025/6/1
動特性が異なるオフライン源データと限られた目標データから、学習した目標動特性モデルで方策を最適化し、高報酬状態を探索する手法を提案。
- RCSLの性能を理論的に改善する方法オフライン強化学習2025/6/1
リターン条件付き教師あり学習(RCSL)の性能限界を克服するため、データ内最適リターンを用いるReinforced RCSLを提案し、理論的・実験的に改善を示した。
- 線形混合分布ロバストマルコフ決定過程ロバスト強化学習2025/5/1
遷移が線形混合モデルで表される場合に、混合重みの不確かさを考慮した新しい分布ロバストMDPを提案し、方策学習のサンプル複雑度を理論的に解析した。
- ドメイン適応と報酬拡張模倣による動力学シフト下の強化学習sim2real2024/11/1
動力学が異なる環境間で方策を転移するため、報酬修正によるドメイン適応と模倣学習を組み合わせたDARAILを提案し、ベンチマークで性能向上を示した。
- 線形構造を持つfダイバージェンス正則化によるロバストオフライン強化学習オフライン強化学習2024/11/1
遷移ダイナミクスと正則化に潜在的な線形構造を導入したd-矩形線形RRMDPを提案し、fダイバージェンス正則化付きのロバスト正則化悲観的価値反復法(R2PVI)を開発して、理論的な性能保証と実験的な有効性を示した。
- オフダイナミクス強化学習のためのリターン拡張Decision Transformerオフライン強化学習2024/10/1
データが豊富なソースドメインから、データが少ないターゲットドメインへの方策学習を改善するため、Decision Transformer系フレームワークにおいてリターン分布をターゲットに合わせて拡張するREAG手法を提案し、理論的保証とD4RLでの性能向上を示した。