Rohan Paleja
Purdue University
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 非同期分散アライメントによるリアクティブなリアルタイムフローポリシーVLA2026/9/29
VLAの非同期実行で生じる行動分布のずれを、フローフィールド蒸留と提案・解決機構で補正し、リアルタイム性と反応性を両立させる手法を提案。
- hint$^2$: 推論時時間論理ガイダンスのための階層的世界モデル操作/時間論理/世界モデル2026/8/13
ロボットの操作ポリシーを線形時間論理(LTL)で表される複雑な指示に従わせるため、階層的世界モデルを用いて推論時に高レベルと低レベルの2つのガイダンスを生成する手法を提案した。
- 複合ロボットチームの通信と協調のための異種ポリシーネットワーク群制御2026/6/1
異なる状態・行動・観測空間を持つエージェントからなる異種ロボットチームの協調と通信を学習するため、異種グラフアテンションネットワークに基づくHetNetを拡張し、スケーラビリティとバイナリメッセージの効率的な学習を実現した。
- 時相論理によるアクションのみの拡散ポリシーへのガイダンス:ワールドモデルを用いた手法拡散ポリシー/時相論理/ワールドモデル2026/6/1
アクションのみを生成する拡散ポリシーに対し、学習済みワールドモデルを用いてSTLロバストネスを微分可能に評価し、その勾配を拡散過程に注入することで、再学習なしに制約充足を改善する手法を提案。Robomimicのタスクで成功率100%を維持しつつ制約違反を大幅削減した。
- 微分可能な信念に基づく対戦相手形成マルチエージェント強化学習2026/5/27
対戦相手の信念を状態として捉え、その信念更新を微分可能な形でモデル化することで、報酬構造から最適な戦略を自動的に学習する新しい対戦相手形成手法を提案した。
- イベント基盤のスパースオートエンコーダによる視覚言語行動ポリシーの解釈VLA解釈可能性2026/5/1
視覚言語行動(VLA)ポリシーの隠れ表現を、行動イベントに基づいてスパースオートエンコーダ(SAE)で分析し、閉ループ行動への因果効果を評価する解釈可能性パイプラインを提案した。
- 部分観測環境における混合役割人間チームの非同期訓練人間ロボット協調2024/12/1
人間の代わりに自律エージェントと協調訓練を行う非同期訓練パラダイムを提案し、部分観測協力ゲームで人間被験者実験により有効性を検証した。
- 自己教師あり初期化学習による高速モデル予測制御モデル予測制御2024/8/1
MPCの初期解を生成するポリシーを強化学習で学習し、最適化時間を短縮しつつ制御性能を向上させるフレームワークを提案。
- 人間と機械の協調を可能にする対話的・説明可能システムの設計人間機械協調2024/6/1
料理ゲーム環境で人間とAIの協調を検証し、対話的に再プログラム可能な説明可能AIがチーム性能を向上させる一方、学習ベース手法は単純な協調ヒューリスティックに劣ることを示した。
- Interpretable Reinforcement Learning for Robotics and Continuous Control2023/11/1
- Adversarial Search and Tracking with Multiagent Reinforcement Learning in Sparsely Observable Environment2023/6/1
- The Effect of Robot Skill Level and Communication in Rapid, Proximate Human-Robot Collaboration2023/4/1
- Utilizing Human Feedback for Primitive Optimization in Wheelchair Tennis2022/12/1
- Athletic Mobile Manipulator System for Robotic Wheelchair Tennis2022/10/1
- Fast Lifelong Adaptive Inverse Reinforcement Learning from Demonstrations2022/9/1
- Learning Interpretable, High-Performing Policies for Autonomous Driving2022/2/1
- Towards Sample-efficient Apprenticeship Learning from Suboptimal Demonstration2021/10/1
- Learning from Suboptimal Demonstration via Self-Supervised Reward Regression2020/10/1
- Joint Goal and Strategy Inference across Heterogeneous Demonstrators via Reward Network Distillation2020/1/1