Mingyu Liu
Zhejiang University
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AdvDex: 関節整合アクションと敵対的学習による人間のデモからの巧みな操作学習巧みな操作/VLA/身体間転移2026/8/14
人間とロボットのデモを統合したVLAフレームワークを提案し、関節整合アクション空間と敵対的学習により異なる身体間の汎化を実現した。
- 完璧なデモは悪い教師:重要な動作セグメントからのロバストな位置合わせ学習模倣学習2026/6/1
熟練者の滑らかなデモは、精密な位置合わせ動作の重要な瞬間が短時間に圧縮されるため、模倣学習の教師として不十分であることを示し、動作認識を強化する時空間特徴STAIRを提案して性能を向上させた。
- 何を無視し、何に反応するか:VLAモデルの視覚的に頑健なRLファインチューニングVLA/RLファインチューニング2026/5/1
VLAモデルのRLファインチューニングにおいて、視覚変化がタスクに無関係か挙動変更を要するかを区別する補助目的を追加し、視覚的頑健性を向上させるPAIR-VLAを提案した。
- World Guidance: 行動生成のための条件空間における世界モデリングVLA2026/2/1
未来の観測をコンパクトな条件に圧縮して行動推論に注入し、VLAモデルが未来の行動と条件を同時に予測することで、精密な行動生成と高い汎化性能を実現するフレームワークを提案した。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。
- NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応VLA2025/10/1
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
- StaMo: コンパクトな状態表現による汎化可能なロボット動作の教師なし学習VLA2025/10/1
軽量エンコーダと事前学習済みDiTデコーダで2トークンの圧縮状態表現を教師なし学習し、その差分が潜在行動として機能することを発見。VLAモデルに統合してLIBEROで14.3%、実世界で30%の性能向上を達成。
- Affordance-R1: マルチモーダル大規模言語モデルにおける汎化可能なアフォーダンス推論のための強化学習VLA2025/8/1
強化学習(GRPO)と認知Chain-of-Thoughtを統合し、ロボットが物体の操作可能領域を推論するアフォーダンス・グラウンディングをゼロショットで汎化可能にした初の統一フレームワーク。
- ODYSSEY: 四足歩行ロボットによるオープンワールドでの長期的移動マニピュレーション移動マニピュレーション2025/8/1
視覚言語モデルによる階層的プランナと全身制御ポリシーを統合し、マニピュレータ搭載四足ロボットが言語指示に基づく長期的な移動操作タスクを遂行できるフレームワークを提案した。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- VQ-VLA:ベクトル量子化アクショントークナイザのスケーリングによる視覚-言語-行動モデルの改善VLA2025/7/1
大規模な行動軌跡データセットで学習したベクトル量子化アクショントークナイザを提案し、ゼロショットで多様なロボットタスクに適応可能で、長期的タスクの成功率を最大30%向上させた。
- CoMo: インターネット動画から連続潜在運動を学習するスケーラブルなロボット学習VLA2025/5/1
インターネット動画から連続的な潜在運動表現を教師なしで学習し、未知動画へのゼロショット汎化と擬似行動ラベル生成を可能にする手法CoMoを提案。