Peter Stone
The University of Texas at Austin
収録論文 109本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SimEX: シミュレーション統合型ロボティクス自動研究フレームワークsim2real2026/9/30
LLMコーディングエージェントがシミュレーション内で試行錯誤してロボットツールボックスを構築し、少数の実機試行でシミュレータを校正しながら実ロボットの操作スキルを効率的に獲得する自動研究フレームワーク。
- STARS: 時空間ダイナミクスから人間-ロボット相互作用における社会的表現へVLA2026/9/30
社会的ロボットナビゲーションの場面理解を評価するVQAベンチマークSocialNav-SUBを提案し、最先端VLMが人間やルールベース手法に及ばないことを示した。
- LIBERO-MAX:世界が変化したときロボット政策は適応するか?VLA2026/9/29
タスク実行中に環境変化が起きた際のロボット政策の頑健性を評価する8,000ペアのベンチマークLIBERO-MAXを提案し、14のVLA政策が11.0〜25.7ポイントの成功率低下を示すことを明らかにした。
- LEACL: LLM強化による長期的操作タスクの強化学習のための自動カリキュラム学習強化学習/カリキュラム学習/LLM2026/7/1
大規模言語モデル(LLM)を用いて複雑なタスクをサブタスクに分解し、各サブタスクの仕様を自動生成することで、スパース報酬のみで強化学習を効率的に行う自動カリキュラム学習フレームワークを提案した。
- インタラクティブなゲームプレイのためのコーチ可能なエージェント強化学習2026/7/1
強化学習エージェントに、実行時にスタイル(タスクの解き方の変更)を指示できるフレームワークを提案し、複数の複雑なドメインで有効性を示した論文。
- VOFA: ヒューマノイドのための力適応制御を用いた視覚目標物体押し操作ロコマニピュレーション2026/5/1
ヒューマノイドロボットが未知の物理特性を持つ物体を目標位置まで押し動かすための、視覚目標条件付きの階層的制御システムを提案した。高レベルの視覚運動ポリシーと低レベルの力適応全身制御を組み合わせ、シミュレーションと実機で高い成功率を達成した。
- ExpertGen: 不完全な行動事前分布からのスケーラブルなSim-to-Realエキスパート方策学習sim2real2026/3/1
不完全なデモから拡散方策を事前分布として学習し、その初期ノイズを強化学習で最適化することで、報酬設計なしに高品質なエキスパート方策をシミュレーションで自動生成し、実機転移を可能にするフレームワーク。
- 大規模言語モデルによる部分観測タスク・動作計画の状態推定ガイドタスク・動作計画2026/3/1
ロボットが部分観測環境で計画を実行中に予期しない物体を観測した際、LLMの常識知識を用いてタスク関連物体の信念を形成し、計画・実行時間を大幅に短縮するフレームワークCoCo-TAMPを提案した。
- シンプルな手法で十分:VLAモデルは強化学習による自然な継続学習者であるVLA2026/3/1
大規模事前学習済みVLAモデルの継続強化学習を体系的に検証し、LoRAを用いた単純な逐次ファインチューニングが破滅的忘却をほとんど起こさず、複雑な継続学習手法を上回ることを示した。
- 因子分解型潜在行動ワールドモデルワールドモデル2026/2/18
動画から潜在行動を学習する際、シーンを複数の独立因子に分解し、各因子が独自の潜在行動を推論・予測するフレームワークFLAMを提案。複数エンティティが同時に動く複雑な環境での予測精度と表現品質を向上させ、下流の政策学習を容易にする。
- ノイズを含むセンサ入力からヒューマノイドサッカーロボットの俊敏なキック技能を学習強化学習2025/12/1
ノイズの多いセンサ入力下でも、ヒューマノイドロボットが連続してボールを蹴り、多様な配置でゴールを決められる強化学習システムを開発した。
- スケール選好条件付けによる地形コストマップ生成ナビゲーション2025/11/1
合成データを活用して未知地形に汎化しつつ、テスト時にユーザー指定のスケール選好で相対コストを迅速に適応できる地形コストマップ生成手法SPACERを提案。
- LLM-GROP: 大規模言語モデルによる視覚に基づくロボットのタスク・動作計画タスク・動作計画2025/11/1
大規模言語モデルの常識知識と視覚情報を活用し、複数物体の移動を伴うモバイルマニピュレーションのタスク・動作計画を統合するフレームワークを提案。実環境とシミュレーションで成功率と効率を評価した。
- SocialNav-SUB: ソーシャルロボットナビゲーションにおけるシーン理解のためのVLMベンチマークVLA2025/9/1
ソーシャルロボットナビゲーションの実世界シーン理解を評価するVQAデータセットとベンチマークを提案し、最先端VLMが人間やルールベース手法に及ばないことを示した。
- ComposableNav: 合成可能な拡散モデルによる動的環境での指示追従ナビゲーションナビゲーション2025/9/1
拡散モデルで各動作プリミティブを個別に学習し、展開時に並列合成することで、訓練で見ていない指示の組み合わせにも対応できるナビゲーション手法を提案。
- RoboSSM: 状態空間モデルによるスケーラブルな文脈内模倣学習模倣学習2025/9/1
Transformerの代わりに状態空間モデル(Longhorn)を用いた文脈内模倣学習手法を提案し、長い文脈のプロンプトでも効率的に推論できることを示した。
- L3M+P:大規模言語モデルを用いた生涯プランニングタスクプランニング2025/8/1
知識グラフを世界状態の表現として用い、LLMと古典的プランナを組み合わせて、家庭用ロボットが長期運用で環境の動的記憶を維持しつつ自然言語タスクを計画できるフレームワークを提案。
- GACL: 接地型適応カリキュラム学習と能動的タスク・性能モニタリングカリキュラム学習2025/8/1
ロボットタスク向けに、複雑なタスク空間を扱いながら目標分布への関連性を保つ適応的カリキュラム学習フレームワークを提案し、車輪ナビと四足歩行で成功率を向上させた。
- ロボティクス向け大規模並列マルチタスク強化学習のベンチマークマルチタスク強化学習2025/7/1
GPU加速シミュレータIsaacGym上で50の操作タスクと20の歩行タスクからなるマルチタスク強化学習ベンチマークMTBenchを構築し、複数のアルゴリズムを統一的に評価した。
- SLAC: 教師なしシミュレーション事前学習による安全で効率的な実機ロボット強化学習sim2real2025/6/1
低忠実度シミュレータでタスク非依存の潜在行動空間を事前学習し、実機でのオフポリシー強化学習を安全かつ高効率化する手法を提案。双腕移動マニピュレーションで1時間以内に全身接触タスクを学習。
- CoopReflect: マルチエージェント学習による自然言語コミュニケーションで協調自動運転を実現V2V協調/マルチエージェント学習2025/5/1
自動運転車同士が自然言語で意思疎通し協調運転できるよう、LLMベースのエージェントとマルチエージェント学習フレームワークCoopReflectを開発し、衝突回避や交通効率化を実現した。
- RLZero: ドメイン内教師なしで言語から直接方策を推論VLA2024/12/1
言語指示から動画生成モデルで想像した観測を対象環境に投影し、教師なし強化学習で事前学習したエージェントが即座に模倣することで、追加学習なしに言語から行動を生成する手法を提案。
- 古典的ロボティクススタックへの強化学習統合:ロボットサッカーにおけるケーススタディ強化学習/sim2real2024/12/1
ロボカップSPL向けに、古典的ロボティクススタック内に強化学習を統合し、マルチフィデリティsim2realとサブ行動分解・ヒューリスティック選択を組み合わせたアーキテクチャを開発し、2024年大会で優勝した。
- デモンストレーションから記憶メカニズムを学習する意思決定模倣学習2024/11/1
専門家の記憶依存関係をペアで示すことで、Transformerの注意機構を調整し、部分観測環境下での長期記憶を要する意思決定を改善する手法を提案。
- PACER: 選好条件付き全地形コストマップ生成ナビゲーション2024/10/1
鳥瞰図画像とユーザーの選好コンテキストを入力として、その選好に沿ったコストマップを生成する機械学習手法を提案し、新しい地形への適応と汎化性能を示した。
- 見ることを学ぶ:方策分解による意思決定のための情報探索マニピュレーション2024/10/1
ロボットが操作に必要な情報を能動的に探し出す「情報探索方策」と、得た情報を使って操作を行う「情報受容方策」に分解して別々に学習する手法DISaMを提案し、実機を含む5つの操作タスクで有効性を示した。
- SkiLD: 因子間相互作用に導かれた教師なしスキル発見教師なし強化学習2024/10/1
状態を因子に分解し、因子間の多様な相互作用を引き起こすスキルを教師なしで学習する手法を提案。家庭環境ロボットなど長期的な疎報酬タスクで既存手法を上回る。
- 効率的な階層強化学習のための分離された教師なしスキル発見階層強化学習2024/10/1
教師なしで分離されたスキルを学習し、階層強化学習で効率的に再利用する手法DUSDiを提案。
- 締切を考慮したタスク・動作計画のための努力配分:メタ推論アプローチタスク・動作計画2024/10/1
不確実な計画・実行時間のもとで締切内に実行可能な計画を見つけるため、計算資源を各選択肢に配分する問題をMDPとして定式化し、MCTSやヒューリスティック手法DP_Rerunで解く。
- 実世界に根ざしたカリキュラム学習sim2real2024/9/1
ロボット強化学習のカリキュラム学習において、シミュレーションのタスク分布を実世界のタスク分布に合わせることで、学習効率とナビゲーション性能を向上させる手法を提案した。
- FLaRe: 大規模強化学習ファインチューニングによる熟達した適応型ロボットポリシーVLA2024/9/1
事前学習済みロボットポリシーを大規模強化学習でファインチューニングし、未見環境での長期的移動操作タスクの成功率を大幅に向上させ、新しい身体や行動への迅速な適応を実現した。
- PRESTO: キー配置環境表現に基づく拡散モデルを用いた高速動作計画動作計画2024/9/1
作業空間を少数のキー配置で表現し、それを条件に拡散モデルで初期軌道を生成して軌道最適化で衝突を修正する、学習ベースの動作計画手法を提案した論文。
- ロボティクスにおける深層強化学習:実世界での成功に関するサーベイ強化学習2024/8/1
深層強化学習をロボットに応用した実世界での成功事例を調査し、成功要因や未開拓領域、今後の研究方向を整理したサーベイ論文。
- 狭所における自律地上ナビゲーション:ICRA 2024第3回BARNチャレンジからの教訓ナビゲーション2024/7/1
ICRA 2024で開催された第3回BARNチャレンジを通じて、狭く制約の厳しい環境での自律地上ナビゲーション技術の現状を評価し、上位チームの手法と今後の課題を分析した。
- MEReQ: 人間の介入からサンプル効率よく方針を整合させる最大エントロピー残差Q逆強化学習模倣学習/逆強化学習2024/6/1
人間の介入フィードバックから、事前方針と人間の報酬の差分を残差報酬として推定し、残差Q学習でサンプル効率よくロボットの方針を人間の好みに整合させる手法を提案。
- Gran Turismoにおける視覚ベースの超人自動運転強化学習エージェント自動運転2024/6/1
Gran Turismo 7で、車載カメラの映像と車両センサーのみを入力とし、訓練時のみグローバル情報を活用することで、タイムトライアルで人間のトップドライバーを上回る視覚ベースの強化学習エージェントを開発した。
- 実世界の非構造歩行者群衆におけるマルチエージェント逆強化学習逆強化学習2024/5/1
混雑した歩行者群衆の中で複数エージェントの報酬関数を同時に学習するため、扱いやすさと合理性のトレードオフトリックを用いた新しいマルチエージェント最大エントロピー逆強化学習を提案し、複数のデータセットで有効性を示した。
- ロボットエアホッケー:強化学習のためのマニピュレーションテストベッドsim2real2024/5/1
ロボットエアホッケーを題材に、到達からブロック押し出しまで多様なタスクと2つのシミュレータ・実機を含む強化学習テストベッドを構築し、模倣学習・オフラインRL・スクラッチRLで評価した。
- 単一の人間動画とオープンワールド物体グラフからの視覚ベースマニピュレーション模倣学習2024/5/1
1本の人間のRGB/RGB-D動画から物体中心の操作計画を抽出し、それを条件とする方策を学習することで、未知物体や背景・視点の変化に対応できる模倣学習手法ORIONを提案した。
- 強化学習による狭所3D空間での器用な脚式移動歩行2024/3/1
狭いトンネルや不規則な空隙など全方向の制約がある3D空間を移動するため、古典的プランナと強化学習を組み合わせた階層型制御器を提案し、遠方の目標までの長期ナビゲーションを可能にした。
- Dyna-LfLH: 学習された幻覚による動的環境での俊敏なナビゲーション学習ナビゲーション2024/3/1
過去の成功体験から動的障害物を潜在分布で生成する自己教師あり学習により、動的環境での安全な経路計画を実現し、成功率を最大25%向上させた。
- TeleMoMa: モバイルマニピュレーションのためのモジュール式で汎用的な遠隔操作システム遠隔操作2024/3/1
RGB-DカメラやVRコントローラなど複数の入力インターフェースを統合し、移動マニピュレータの全身遠隔操作を可能にするモジュール式システムを開発。模倣学習用の実演データ収集を容易にし、その有効性を実機とシミュレーションで示した。
- Building Minimal and Reusable Causal State Abstractions for Reinforcement Learning2024/1/1
- Exploring the Cost of Interruptions in Human-Robot Teaming2023/11/1
- ICRA Roboethics Challenge 2023: Intelligent Disobedience in an Elderly Care Home2023/11/1
- ELDEN: Exploration via Local Dependencies2023/10/1
- Learning Generalizable Manipulation Policies with Object-Centric 3D Representations2023/10/1
- $f$-Policy Gradients: A General Framework for Goal Conditioned RL using $f$-Divergences2023/10/1
- Dobby: A Conversational Service Robot Driven by GPT-42023/10/1
- STERLING: Self-Supervised Terrain Representation Learning from Unconstrained Robot Experience2023/9/1
- Rethinking Social Robot Navigation: Leveraging the Best of Two Worlds2023/9/1
- Asynchronous Task Plan Refinement for Multi-Robot Task and Motion Planning2023/9/1
- Wait, That Feels Familiar: Learning to Extrapolate Human Preferences for Preference Aligned Path Planning2023/9/1
- Deadlock-free, Safe, and Decentralized Multi-Robot Navigation in Social Mini-Games via Discrete-Time Control Barrier Functions2023/8/1
- Autonomous Ground Navigation in Highly Constrained Spaces: Lessons learned from The 2nd BARN Challenge at ICRA 20232023/8/1
- Symbolic State Space Optimization for Long Horizon Mobile Manipulation Planning2023/7/1
- Principles and Guidelines for Evaluating Social Robot Navigation Algorithms2023/6/1
- Motion Planning (In)feasibility Detection using a Prior Roadmap via Path and Cut Search2023/5/1
- Causal Policy Gradient for Whole-Body Mobile Manipulation2023/5/1
- LLM+P: Empowering Large Language Models with Optimal Planning Proficiency2023/4/1
- A Domain-Agnostic Approach for Characterization of Lifelong Learning Systems2023/1/1
- Learning to Correct Mistakes: Backjumping in Long-Horizon Task and Motion Planning2022/11/1
- D-Shape: Demonstration-Shaped Reinforcement Learning via Goal Conditioning2022/10/1
- Benchmarking Reinforcement Learning Techniques for Autonomous Navigation2022/10/1
- VIOLA: Imitation Learning for Vision-Based Manipulation with Object Proposal Priors2022/10/1
- Learning Real-world Autonomous Navigation by Self-Supervised Environment Synthesis2022/10/1
- Learning Perceptual Hallucination for Multi-Robot Navigation in Narrow Hallways2022/9/1
- Autonomous Ground Navigation in Highly Constrained Spaces: Lessons learned from The BARN Challenge at ICRA 20222022/8/1
- Metric Residual Networks for Sample Efficient Goal-Conditioned Reinforcement Learning2022/8/1
- DM$^2$: Decentralized Multi-Agent Reinforcement Learning for Distribution Matching2022/6/1
- COOPERNAUT: End-to-End Driving with Cooperative Perception for Networked Vehicles2022/5/1
- VI-IKD: High-Speed Accurate Off-Road Navigation using Learned Visual-Inertial Inverse Kinodynamics2022/3/1
- Socially Compliant Navigation Dataset (SCAND): A Large-Scale Dataset of Demonstrations for Social Navigation2022/3/1
- Adversarial Imitation Learning from Video using a State Observer2022/2/1
- Visually Grounded Task and Motion Planning for Mobile Manipulation2022/2/1
- Bottom-Up Skill Discovery from Unsegmented Demonstrations for Long-Horizon Robot Manipulation2021/9/1
- APPLE: Adaptive Planner Parameter Learning from Evaluative Feedback2021/8/1
- From Agile Ground to Aerial Navigation: Learning from Learned Hallucination2021/8/1
- Incorporating Gaze into Social Navigation2021/7/1
- Conflict Avoidance in Social Navigation -- a Survey2021/6/1
- VOILA: Visual-Observation-Only Imitation Learning for Autonomous Navigation2021/5/1
- APPL: Adaptive Planner Parameter Learning2021/5/1
- Team Orienteering Coverage Planning with Uncertain Reward2021/5/1
- Skeletal Feature Compensation for Imitation Learning with Embodiment Mismatch2021/4/1
- A Scavenger Hunt for Service Robots2021/3/1
- Learning Inverse Kinodynamics for Accurate High-Speed Off-Road Navigation on Unstructured Terrain2021/2/1
- Motion Planning and Control for Mobile Robot Navigation Using Machine Learning: a Survey2020/11/1
- APPLI: Adaptive Planner Parameter Learning From Interventions2020/11/1
- APPLR: Adaptive Planner Parameter Learning from Reinforcement2020/11/1
- Extended Abstract: Motion Planners Learned from Geometric Hallucination2020/10/1
- Agile Robot Navigation through Hallucinated Learning and Sober Deployment2020/10/1
- The EMPATHIC Framework for Task Learning from Implicit Human Feedback2020/9/1
- Reinforced Grounded Action Transformation for Sim-to-Real Transfer2020/8/1
- Benchmarking Metric Ground Navigation2020/8/1
- Stochastic Grounded Action Transformation for Robot Learning in Simulation2020/8/1
- Toward Agile Maneuvers in Highly Constrained Spaces: Learning from Hallucination2020/7/1
- A Lifelong Learning Approach to Mobile Robot Navigation2020/7/1
- Deep R-Learning for Continual Area Sweeping2020/6/1
- APPLD: Adaptive Planner Parameter Learning from Demonstration2020/4/1
- Solving Service Robot Tasks: UT Austin Villa@Home 2019 Team Report2019/9/1
- Unclogging Our Arteries: Using Human-Inspired Signals to Disambiguate Navigational Intentions2019/9/1
- Desiderata for Planning Systems in General-Purpose Service Robots2019/7/1
- RIDM: Reinforced Inverse Dynamics Modeling for Learning from a Single Observed Demonstration2019/6/1
- Recent Advances in Imitation Learning from Observation2019/5/1
- LAAIR: A Layered Architecture for Autonomous Interactive Robots2018/11/1
- Integrating Task-Motion Planning with Reinforcement Learning for Robust Decision Making in Mobile Robots2018/11/1
- Interaction and Autonomy in RoboCup@Home and Building-Wide Intelligence2018/10/1
- An Architecture for Person-Following using Active Target Search2018/9/1
- A Real-Time Model-Based Reinforcement Learning Architecture for Robot Control2011/5/1