Shangke Lyu
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界-価値-行動モデル:視覚言語行動システムのための暗黙的プランニングVLA2026/4/1
視覚言語行動(VLA)モデルに、将来の軌跡の潜在表現を学習し、価値関数で評価することで暗黙的プランニングを可能にする統一フレームワークを提案した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- VORL-EXPLORE: 動的環境におけるマルチロボット探索のためのハイブリッド学習計画アプローチ群制御2026/3/1
実行忠実度を共有し、フロンティア割り当てと局所ナビゲーションを結合することで、動的環境でのマルチロボット探索の堅牢性を向上させるハイブリッド学習・計画フレームワークを提案した。
- CMR: 収縮写像埋め込みによる不整地でのロバストなヒューマノイド歩行歩行2026/2/1
観測ノイズに強い潜在表現を学習する収縮写像埋め込み(CMR)を提案し、不整地でのヒューマノイド歩行をロバスト化した研究。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- 深層強化学習によるヒューマノイドロボットの自己保護転倒ポリシーの発見強化学習2025/12/1
深層強化学習とカリキュラム学習を用いて、ヒューマノイドロボットが転倒時に自己保護するためのポリシーを学習させ、三角形の姿勢を形成することで損傷を大幅に低減できることを発見し、実機に転移した。
- Koopmanガイド付き動力学モデリングによるロバストなオンライン残差修正模倣学習2025/9/1
模倣学習の残差方策にKoopman作用素で学習した潜在空間の大域的動力学を組み込み、長期タスクや未知環境でも安定して高精度に修正できるKORRを提案した。
- 反力制御と歩容制御の分離による動的適応型脚式ロコモーション方策歩行2025/9/1
強化学習による脚式ロコモーションにおいて、支持脚制御と遊脚制御を分離する枠組みを提案し、未知環境へのオンライン適応とsim-to-realギャップの低減を実現した。
- 軌道最適化と強化学習を統合した不整地適応着地を伴う四脚ロボットの跳躍歩行2025/9/1
軌道最適化で生成した参照動作を強化学習で追従させ、不整地でも安全に着地できる四脚ロボットの跳躍フレームワークを提案した。
- オフライン事前学習済み方策のみを用いた効率的なオンラインRLファインチューニング強化学習2025/5/1
事前学習済みQ関数に頼らず、オフラインで学習した方策だけを使ってオンライン強化学習でファインチューニングする手法PORLを提案し、BC方策の直接改善も可能にした。
- 想像上の遷移を用いたロボット政策学習:ロバスト性と最適性のトレードオフの緩和歩行2025/3/1
理想環境で得た最適政策とダイナミクスモデルから想像上の遷移を生成し、それを実演入力として強化学習に組み込む二段階フレームワークを提案。四足歩行の学習において、ドメインランダム化による保守性を抑えつつ、訓練加速・追従誤差低減・分布外ロバスト性向上を実現した。
- GEVRM: 目標表現型ビデオ生成モデルによるロバストな視覚マニピュレーションVLA2025/2/1
内部モデル制御の原理を取り入れ、テキスト誘導のビデオ生成で将来の視覚的目標を生成しつつ、摂動を内部埋め込みとして推定することで、外乱に強い閉ループVLAを実現した研究。
- TDMPBC:自己模倣強化学習によるヒューマノイドロボット制御強化学習2025/2/1
強化学習において、タスクに関連する可能性のある軌道を自己模倣することで、ヒューマノイドロボットの制御性能を大幅に向上させるフレームワークSIRLを提案した。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- GeRM: 四足歩行ロボットのためのMixture-of-Expertsを用いた汎用ロボットモデルVLA2024/3/1
オフライン強化学習とTransformerベースのVLAネットワーク、Mixture-of-Experts構造を組み合わせ、四足歩行ロボットのマルチタスク学習を効率化する汎用モデルGeRMを提案。自動収集データセットQUARD-Autoも公開。
- Unlock Reliable Skill Inference for Quadruped Adaptive Behavior by Skill Graph2023/11/1