Xiaoyang Guo
XPENG Robotics
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA世界モデル/操作3Dセグメンテーション自動運転/強化学習自動運転3D意味占有予測
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- IronMind: カメラ空間自己中心事前学習によるヒューマノイド巧みな操作のスケーリングVLA2026/9/30
自己中心的な人間動画と異種ロボットデータを用いて、カメラ空間行動表現で身体ギャップを埋め、ヒューマノイドの巧みな操作のためのVLAモデルを事前学習する手法を提案。
- XPACE: 異種経験からの世界モデルと行動モデルの統合学習VLA2026/9/15
人間とロボットの多様な経験を動画予測で結びつけ、行動予測と世界シミュレーションを同時に行う統合モデルを提案し、ヒューマノイドロボットで人間の技能をロボット未経験タスクへ転移できることを示した。
- AnyWorld: 因子分解された自己中心的世界モデルによるクロス身体汎化世界モデル/操作2026/8/29
人間の単一インタラクション動画を、ロボット固有の多様なロールアウトに拡張する世界モデルフレームワークを提案。行動・カメラ・身体の因子に分解し、身体・視点・シーンの再構成を可能にする。
- EPS3D: エンドツーエンドのフィードフォワード型3Dパノプティックセグメンテーション3Dセグメンテーション2026/6/8
多視点画像から3Dセマンティック特徴とインスタンス特徴を直接予測するエンドツーエンドのフレームワークを提案し、相互強化モジュールでセマンティクスとインスタンスの一貫性を高めた。
- RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習自動運転/強化学習2025/2/1
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
- ComDrive: 快適性重視のエンドツーエンド自動運転自動運転2024/10/1
拡散モデルで時間的に一貫した軌道を生成し、快適性を考慮したスコアラで選択するエンドツーエンド自動運転システムを提案。
- OccRWKV: 線形計算量で効率的な3D意味占有予測の再考3D意味占有予測2024/9/1
RWKVアーキテクチャを応用し、意味・占有・特徴融合を分岐させた効率的な3D意味占有予測ネットワークを提案。BEV空間での特徴強化により22.2FPSのリアルタイム推論を実現し、SemanticKITTIで最高精度を達成。