Yanjiang Guo
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GALA: 幾何情報を考慮した潜在行動モデリングによるマルチ身体VLA事前学習VLA2026/9/18
エンドエフェクタの3D幾何運動を統合した潜在行動表現を提案し、多様な身体のデータから細粒度の動作を捉えるVLAモデル事前学習を実現した。
- HEFT: 特権的動作ガイダンスとウィンドウ型ペイロードカリキュラムによる重量物対応フルサイズ人型ロボットの遠隔操作遠隔操作/人型ロボット2026/7/1
重量物を持ったフルサイズ人型ロボットの遠隔操作を実現するフレームワークを提案。ノイズの多いVRトラッカー参照から物理的に妥当な動作を学習し、段階的に重量を増やすカリキュラムで最大24kgのペイロード追従を達成した。
- UAM: VLA訓練における忘却問題への二経路視点からのアプローチVLA2026/5/15
VLAモデルがVLMのマルチモーダル能力を失う「身体化税」問題を、生物学的視覚の二経路構造に着想を得て、並列な背側経路(Dorsal Expert)を追加するUAMを提案し、忘却を抑えつつ操作性能を向上させた。
- Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化VLA/ポストトレーニング2026/4/1
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
- ロックインの打破:低データVLA後訓練における操縦性の維持VLA2026/4/1
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
- Veo-Act: 最先端ビデオモデルはどこまで汎用ロボット操作を前進させられるか?操作2026/4/1
ビデオ生成モデルVeo-3を高次プランナーとして使い、低次実行にはVLAポリシーを用いる階層的フレームワークVeo-Actを提案し、操作性能を向上させた。
- BagelVLA: 視覚・言語・行動の交互生成による長期的マニピュレーションの強化VLA2026/2/1
言語計画と視覚予測を行動生成ループに交互に組み込み、長期的なロボット操作タスクの性能を高める統合モデルを提案した。
- VLAW:視覚-言語-行動ポリシーと世界モデルの反復的相互改善VLA2026/2/1
実ロボットのロールアウトデータで世界モデルの精度を高め、その世界モデルが生成する合成データでVLAモデルを改善する反復手法を提案し、実タスクで成功率を39.2%向上させた。
- UniJEPA:連続・離散表現の統合学習によるロボットポリシーの強化VLA2025/10/1
100万件超の操作動画で視覚表現を事前学習し、ロボット実機データで微調整することで、予測表現から行動トークンへのマッピングを学習する汎用ロボットポリシー手法を提案。
- Ctrl-World: ロボットマニピュレーションのための制御可能な生成ワールドモデルワールドモデル2025/10/1
多視点予測と細かい行動制御、長期一貫性を備えた制御可能なワールドモデルを提案し、汎用ロボット政策の評価と改善を可能にした。
- villa-X:Vision-Language-Actionモデルにおける潜在行動モデリングの強化VLA2025/7/1
VLA事前学習に潜在行動(2フレーム間の動きの抽象表現)を組み込み、その学習方法と統合方法を改善したViLLAフレームワークvilla-Xを提案。未見の身体でもゼロショットで潜在行動計画を生成でき、シミュレーションと実機のグリッパー・多指ハンド操作で高性能を示した。
- オンライン強化学習による視覚言語行動モデルの改善VLA2025/1/1
大規模視覚言語行動モデルをオンライン強化学習で改善する際の不安定性と計算負荷に対処するため、強化学習と教師あり学習を交互に繰り返すiRe-VLAフレームワークを提案し、シミュレーションと実機で有効性を検証した。
- 動画予測ポリシー:予測的視覚表現を持つ汎用ロボットポリシーVLA2024/12/1
動画拡散モデルが持つ未来予測的な視覚表現を活用し、ロボット操作のための汎用ポリシーを学習する手法を提案。Calvinベンチマークと実世界の巧緻操作で大幅な性能向上を達成した。
- 行動予測と画像予測の統合拡散過程による視覚ポリシー学習VLA2024/11/1
画像予測とロボット行動生成を同一の拡散過程で統合し、将来画像と行動を同時に予測する視覚ポリシー学習フレームワークPADを提案。Metaworldベンチマークで26.3%の相対改善を達成。
- HiRT: 階層型ロボットトランスフォーマーによるロボット制御の強化VLA2024/10/1
大規模VLAモデルの計算コストと遅延を抑えるため、低頻度のVLMと高頻度の視覚ポリシーを組み合わせた階層型トランスフォーマーを提案し、動的タスクの成功率を向上させた。
- ノイズ除去世界モデル学習によるヒューマノイドの難地形歩行の実現歩行2024/8/1
ノイズ除去世界モデル学習(DWL)という強化学習フレームワークを提案し、ヒューマノイドが雪上や傾斜地、階段、極度の凹凸地形をゼロショットのsim-to-real転移で歩行できることを示した。
- DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment2023/7/1
- Decentralized Motor Skill Learning for Complex Robotic Systems2023/6/1
- Reinforcement learning with Demonstrations from Mismatched Task under Sparse Reward2022/12/1
- Zero-Shot Policy Transfer with Disentangled Task Representation of Meta-Reinforcement Learning2022/10/1