Zhaoye Fei
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAVLA/自律エージェントVLA/世界モデル/サーベイ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HiMe: 長期的視覚言語行動制御のための階層的具現化メモリVLA2026/7/1
長期的なタスクで苦戦するVLAモデルに対し、実行・作業記憶・計画を分離した階層メモリフレームワークを提案し、成功率を向上させた。
- 孤立したスキルから日常の物理的自律性へ:オムニモーダル具現化エージェントの前進VLA/自律エージェント2026/6/1
サイバー空間と物理空間を統合した行動空間、階層的記憶、非同期の視覚的割り込み検証を備えたフレームワークOmniActを提案し、実世界の長期タスクで性能とトークン効率を向上させた。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析VLA2025/10/1
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
- 世界認識型プランニング物語による大規模視覚言語モデルプランナーの強化VLA2025/6/1
環境理解を4つの認知能力でLVLMに注入し、生の視覚観察のみで訓練するWAPを提案。EB-ALFREDで成功率が大幅に向上し、GPT-4oやClaude-3.5-Sonnetを凌駕した。
- 世界モデリングでより良いプランナーへ:身体性タスク計画のための二重選好最適化VLA2025/3/1
視覚言語モデルによる身体性タスク計画において、状態予測と行動選択を選好学習で同時に最適化するD²POを提案し、人間の注釈なしで選好データを収集する木探索機構を導入した。
- VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマークVLA2024/12/1
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。