Xiaopeng Zhang
Xpeng Inc.
収録論文 8本 ・ フィジカルAI/ロボット学習
視覚基盤モデルマニピュレーション動画編集VLA模倣学習歩行
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- IronViT: 効率的な汎用視覚表現学習に向けて視覚基盤モデル2026/9/24
複数の専門家モデルの能力をソフトマックス注意で統合してからハイブリッド線形注意エンコーダへ蒸留し、高解像度でも効率的な汎用視覚エンコーダを実現した。
- エージェント型強化学習によるロボット操作の堅牢な実行学習マニピュレーション2026/7/1
実行品質を評価する指標と、高レベル意思決定で実行を回復するエージェント型強化学習フレームワークを提案し、LIBEROベンチマークで成功率を大幅に向上させた。
- オクルージョンを考慮した物理・意味的キーフレーム選択によるロバストな動画編集動画編集2026/5/22
動画編集において、オクルージョンや視点変化に強い編集を実現するため、物理的・意味的に信頼できるキーフレームを自動選択し、それを基に編集を行うフレームワークを提案した。
- Pelican-Unify 1.0: 理解・推論・想像・行動を統合した身体化基盤モデルVLA2026/5/1
単一のVLMと統一未来生成器を用いて、理解・推論・想像・行動を一つのモデルで統合的に学習・実行する身体化基盤モデルを提案し、各能力のベンチマークで高い性能を達成した。
- HMR-1: 視覚言語モデルを用いた階層型マッサージロボットによる身体性ヘルスケアVLA2026/3/1
マッサージ用のマルチモーダルデータセットMedMassage-12Kを構築し、視覚言語モデルでツボを認識する高レベルモジュールと軌道計画を行う低レベル制御モジュールからなる階層型マッサージロボットを提案した論文。
- 行動チャンキングのための時間的行動選択模倣学習2025/11/1
複数時刻の予測行動チャンクをキャッシュし、軽量セレクタで最適行動を動的に選ぶことで、反応性と決定一貫性を両立させる手法TASを提案。
- MASH: 単一人型ロボットの歩行のための協調的異種マルチエージェント強化学習歩行2025/8/1
単一人型ロボットの各肢を独立エージェントとして扱い、全体批評器を共有する協調的異種マルチエージェント強化学習により、歩行制御の学習効率と全身協調を改善する手法を提案。
- マルチモーダル融合と視覚言語モデル:ロボットビジョンのサーベイVLA2025/4/1
ロボットビジョンにおけるマルチモーダル融合手法と視覚言語モデルの応用をタスク指向で体系的にレビューし、課題と将来方向を整理したサーベイ。