Jianming Ma
Shanghai Jiao Tong University
収録論文 6本 ・ フィジカルAI/ロボット学習
歩行VLA強化学習生成モデル/制約付き生成移動操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DWMP:双対世界モデルによるヒューマノイドの障害物踏破歩行2026/9/11
固有感覚と視覚の特性の違いに着目し、Koopmanベースの動力学世界モデルとRSSMベースの視覚世界モデルを組み合わせてヒューマノイドの障害物踏破を実現する手法を提案した。
- ActSafeGuard:フローマッチング方策のための微分可能で訓練整合型の制約強制VLA2026/9/10
フローマッチングベースの方策に微分可能な安全層を組み込み、学習段階から硬い物理制約を満たす行動を生成させる手法を提案。複数タスクで100%のステップ安全性を保ちつつ成功率も維持・向上させた。
- P3: VAEベースロボット学習のための確率的方策伝播強化学習2026/7/1
VAEベースの方策とPPOの理論的不整合を指摘し、分布を考慮した最適化フレームワークP^3を提案。データ効率と収束速度を大幅に改善した。
- PolyFlow: 制約埋め込みと射影不要更新による安全かつ効率的な多面体制約フローマッチング生成モデル/制約付き生成2026/6/1
フローベース生成モデルを安全重視の物理システムに適用するため、多面体制約を直接モデルに組み込み、射影不要の離散時間フローで厳密な制約充足を実現するフレームワークを提案した。
- HiWET: 長期的なヒューマノイド移動操作のための階層型ワールドフレームエンドエフェクタ追従移動操作2026/2/1
ヒューマノイドの移動操作をワールド座標系でのエンドエフェクタ追従問題として再定式化し、高レベル方策がサブゴールを生成、低レベル方策が安定性制約下で実行する階層型強化学習フレームワークを提案。運動学的マニフォールド事前分布により探索を効率化し、実機へのゼロショット転移も実証した。
- FocusNav: ウェイポイント誘導による空間選択的注意を用いたヒューマノイドのローカルナビゲーション歩行2026/1/1
ヒューマノイドロボットのローカルナビゲーションにおいて、ウェイポイント誘導の空間クロスアテンションと安定性に応じた選択的ゲーティングで知覚を適応制御し、動的環境での衝突回避と安定歩行を実現した。