Peng Xu
Harbin Institute of Technology
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PredActor: 予測的行動拡散による操縦可能なオンボードヒューマノイド制御ヒューマノイド制御2026/9/21
固有感覚のみを用いて行動と将来状態軌道を同時生成し、テスト時にも目標へ操縦できるヒューマノイド制御ポリシーを提案。
- PanoFuse: パノラマ強化型視覚-言語-行動学習と分離型意味-幾何ルーティングVLA2026/9/21
全方向パノラマ知覚をVLAに統合し、意味情報と幾何情報を分離して経路選択するDSGRにより、遮蔽や未知環境下でのマニピュレーション成功率を向上させた。
- PSR: 接触の多いマニピュレーションのための予測的感覚運動表現学習マニピュレーション2026/9/18
マルチモーダルな感覚運動信号から将来の接触ダイナミクスを予測する表現を事前学習し、VLAモデルの行動生成に組み込むことで、力覚を要する接触の多い操作タスクの成功率を大幅に向上させた研究。
- AeroDPO: 高忠実度知覚と自動選好最適化による軽量UAVナビゲーションの実現ナビゲーション2026/8/1
UAVの視覚言語ナビゲーションにおいて、軽量な2Bモデルでも高品質な視覚入力があれば巨大な7Bモデルと同等の成功率を達成できることを示し、純粋な行動クローニングの衝突リスクを、物理シミュレーションの状態ロールバックを用いた自動選好最適化(AeroDPO)で克服する手法を提案した。
- CLIFT: 非侵襲的な閉ループ反復ファインチューニングによるGemini Roboticsオンデバイスの人型ロボット専門家化人型ロボット適応2026/7/1
クローズドウェイトのロボット基盤モデルを管理API経由で適応させる際、純粋な模倣学習に限定される問題を解決するため、非侵襲的な閉ループ反復ファインチューニング手法を提案し、実人型ロボットでの有効性を実証した。
- AerialVLA: 最小限のエンドツーエンド制御によるUAVナビゲーションのための視覚言語行動モデルVLA/UAVナビゲーション2026/3/1
UAVナビゲーションのための視覚言語行動モデルを提案し、生の視覚情報と言語指示を直接連続的な物理制御信号にマッピングする。オラクルガイダンスや外部物体検出器に依存せず、ファジーな方向指示と統合制御空間により、未見環境での汎化性能を大幅に向上させた。
- KCFRC: 脚式移動のための運動学的衝突を考慮した足場到達可能性基準歩行2026/2/1
脚式ロボットが足場を選ぶ際に、衝突しない脚の振り軌道が存在するかを高速に判定する手法KCFRCを提案し、900候補を平均2msで検証できることを示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- PegasusFlow:ロボット拡散プランナー向け並列ローリング・デノイジングスコアサンプリング拡散プランニング2025/9/1
専門家データを使わず環境との相互作用から軌道スコア勾配を並列サンプリングする階層的フレームワークを提案し、MPPIより高効率なWBFOアルゴリズムで複雑地形のナビゲーションを実現した。
- 階層最適化による脚式移動の全身制約学習歩行2025/6/1
強化学習にハード・ソフト制約を組み込んだ階層最適化ベースの全身追従制御を提案し、六脚ロボットの屋外環境での安全性と走破性を実証した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- 人間レベルの競技卓球を実現するロボットエージェントsim2real2024/8/1
階層型ポリシーとsim-to-real技術により、アマチュア人間レベルの競技卓球を実現したロボットを開発し、人間との試合で45%の勝率を達成した。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- 言語モデル予測制御による人間フィードバックからの高速学習VLA2024/2/1
人間との対話履歴を遷移モデルとしてLLMに微調整し、モデル予測制御と組み合わせることで、ロボットの教示効率と成功率を向上させるフレームワークLMPCを提案。
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- RoboVQA: Multimodal Long-Horizon Reasoning for Robotics2023/11/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Robotic Table Tennis: A Case Study into a High Speed Learning System2023/9/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners2023/7/1
- Principles and Guidelines for Evaluating Social Robot Navigation Algorithms2023/6/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- Robotic Table Wiping via Reinforcement Learning and Whole-body Trajectory Optimization2022/10/1
- Extrinsic Manipulation on a Support Plane by Learning Regrasping2022/10/1
- Learning Model Predictive Controllers with Real-Time Attention for Real-World Navigation2022/9/1
- Code as Policies: Language Model Programs for Embodied Control2022/9/1
- Conformal Navigation Transformations with Application to Robot Navigation in Complex Workspaces2022/8/1
- VG-Swarm: A Vision-based Gene Regulation Network for UAVs Swarm Behavior Emergence2022/6/1
- Learning to Reorient Objects with Stable Placements Afforded by Extrinsic Supports2022/5/1
- BiAIT*: Symmetrical Bidirectional Optimal Path Planning with Adaptive Heuristic2022/5/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning2021/11/1
- Zero-Shot Terrain Generalization for Visual Locomotion Policies2020/11/1
- Fault Tolerant Free Gait and Footstep Planning for Hexapod Robot Based on Monte-Carlo Tree2020/6/1
- Learning to Walk in the Real World with Minimal Human Effort2020/2/1