Yixiao Ge
XPENG Robotics
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- XPACE: 異種経験からの世界モデルと行動モデルの統合学習VLA2026/9/15
人間とロボットの多様な経験を動画予測で結びつけ、行動予測と世界シミュレーションを同時に行う統合モデルを提案し、ヒューマノイドロボットで人間の技能をロボット未経験タスクへ転移できることを示した。
- AnyWorld: 因子分解された自己中心的世界モデルによるクロス身体汎化世界モデル/操作2026/8/29
人間の単一インタラクション動画を、ロボット固有の多様なロールアウトに拡張する世界モデルフレームワークを提案。行動・カメラ・身体の因子に分解し、身体・視点・シーンの再構成を可能にする。
- イベントカメラを用いた高性能画像追跡のための等変フィルタイベントカメラ/画像追跡2026/7/10
イベントカメラの出力から特徴位置を抽出し、等変フィルタを用いてアフィン変換(並進と回転)を高精度に推定する画像追跡手法を提案した。
- ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用ヒューマノイド操作/VLA/強化学習2026/6/15
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
- 予測を行動に変える:世界行動モデルにおける表現整合の再利用VLA2026/6/10
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
- 未知の時間遅延を伴う慣性航法システムのためのガリレイ状態推定状態推定2026/5/1
GNSS測定の未知の時間遅延を明示的にモデル化し、ガリレイ対称性に基づく等変フィルタ(EqF)を用いて航法状態と時間遅延を同時推定する新しい手法を提案した。実機UAV実験とシミュレーションで有効性を示した。
- UniT: 人間からヒューマノイドへのポリシー学習と世界モデリングのための統一物理言語に向けてヒューマノイド/模倣学習/世界モデル2026/4/1
人間の映像データを活用してヒューマノイドロボットの学習を行うため、視覚的アンカリングに基づく統一潜在アクショントークナイザー(UniT)を提案し、異なる身体構造間のギャップを埋める。
- DIAL: 潜在世界モデリングによる意図と行動の分離を用いたエンドツーエンドVLAVLA2026/3/1
VLAモデルにおいて、高次意思決定と低次運動実行を潜在意図ボトルネックで橋渡しし、VLMの潜在空間で未来予測を行い、軽量ポリシーで行動を生成する枠組みを提案した。
- 左不変と右不変拡張カルマンフィルタの違い状態推定2025/7/1
左不変と右不変の拡張カルマンフィルタ(IEKF)がリセットステップを含めば同一であることを示し、リセットステップが性能を向上させることをシミュレーションで実証した。
- 距離のみSLAMのための同変フィルタ設計SLAM2025/3/1
IMUと距離センサのみを用いた距離のみSLAMに対し、距離計測と整合する対称リー群に基づく同変フィルタを導出し、ランドマーク位置の初期化不要で実データにおいて既存EKFより高精度・高ロバストであることを示した。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1
- Equivariant Symmetries for Inertial Navigation Systems2023/9/1
- Progressive Correspondence Pruning by Consensus Learning2021/1/1