Xueyan Zou
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- トレース条件付きVLA計画による長期的操作マニピュレーション2026/4/1
長期的な操作タスクを、タスク管理VLMが現在の観察から残りの計画を予測し、視覚的トレースを実行VLAに提供することで、短期的なVLA実行を長期的な指示追従に拡張するフレームワークを提案。
- 視覚言語行動モデルのためのクロスハンド潜在表現VLA/器用操作2026/3/1
多様な器用なロボットハンド間で共有可能な統一潜在行動空間を導入し、標準的なVLAアーキテクチャに組み込むことで、クロスエンボディメント学習を可能にするXL-VLAを提案した。
- パワーから精密へ:多指ロボットハンドのための微細な器用さの学習マニピュレーション2025/11/1
多指ハンドの指先形状を軽量に変更し、制御と形状を同時最適化することで、パワーグラスプと精密把持の両立を実現し、sim-to-realで高い成功率を示した。
- GSWorld:ロボットマニピュレーションのための閉ループ写実的シミュレーションスイートsim2real2025/10/1
3Dガウシアンスプラッティングと物理エンジンを組み合わせ、実機データからの方策評価やsim2real学習を閉ループで行える写実的マニピュレーションシミュレータを提案。
- EgoVLA:自己中心視点の人間動画から視覚-言語-行動モデルを学習VLA2025/7/1
一人称視点の人間動画でVLAモデルを訓練し、逆運動学とリターゲティングで人間の手の動きをロボット動作に変換、少数のロボット実演で微調整してロボットポリシーを獲得する手法を提案。
- Dex1B: 10億件のデモンストレーションによる巧みな手の操作学習マニピュレーション2025/6/1
生成モデルを用いて把持と関節操作の10億件のデモンストレーションを生成し、シミュレーションと実機で従来手法を上回る性能を示した。
- M3: 3D空間マルチモーダルメモリ3D表現/マルチモーダル2025/3/1
3Dガウシアンスプラッティングと基盤モデルを統合し、動画から静的な屋内シーンのマルチモーダルな特徴表現を効率的に保持・描画するメモリシステムを提案。四足歩行ロボットへの実装も行った。
- LMMプランナと3Dスキルポリシーの統合による汎用マニピュレーションマニピュレーション2025/1/1
大規模マルチモーダルモデルによる高レベル計画と3D特徴場を用いた低レベル制御を統合し、実環境のキッチンで長期的タスクの成功率を向上させたフレームワークLMM-3DPを提案。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- WildLMa: 実環境における長期的な移動マニピュレーション移動マニピュレーション2024/11/1
四足歩行ロボットにマニピュレータを搭載し、VR遠隔操作と模倣学習による汎用スキル、LLMプランナを組み合わせて、実世界での長期的な移動マニピュレーションを実現した研究。
- GraspSplats: 3D特徴スプラッティングによる効率的なマニピュレーションマニピュレーション2024/9/1
ガウススプラッティングと深度教師あり学習を用いて60秒未満で高品質な3Dシーン表現を構築し、VLMと組み合わせてロボットのゼロショット把持や動的物体操作を実現する手法を提案。