Yuying Ge
XPENG Robotics
収録論文 9本 ・ フィジカルAI/ロボット学習
VLAヒューマノイド操作/VLA/強化学習ヒューマノイド/模倣学習/世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- XPACE: 異種経験からの世界モデルと行動モデルの統合学習VLA2026/9/15
人間とロボットの多様な経験を動画予測で結びつけ、行動予測と世界シミュレーションを同時に行う統合モデルを提案し、ヒューマノイドロボットで人間の技能をロボット未経験タスクへ転移できることを示した。
- ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用ヒューマノイド操作/VLA/強化学習2026/6/15
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
- 予測を行動に変える:世界行動モデルにおける表現整合の再利用VLA2026/6/10
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
- UniT: 人間からヒューマノイドへのポリシー学習と世界モデリングのための統一物理言語に向けてヒューマノイド/模倣学習/世界モデル2026/4/1
人間の映像データを活用してヒューマノイドロボットの学習を行うため、視覚的アンカリングに基づく統一潜在アクショントークナイザー(UniT)を提案し、異なる身体構造間のギャップを埋める。
- DIAL: 潜在世界モデリングによる意図と行動の分離を用いたエンドツーエンドVLAVLA2026/3/1
VLAモデルにおいて、高次意思決定と低次運動実行を潜在意図ボトルネックで橋渡しし、VLMの潜在空間で未来予測を行い、軽量ポリシーで行動を生成する枠組みを提案した。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1
- GNFactor: Multi-Task Real Robot Learning with Generalizable Neural Feature Fields2023/8/1
- Policy Adaptation from Foundation Model Feedback2022/12/1