Fuhao Li
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA移動操作3D視覚グラウンディングデータセット/ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメントVLA2025/10/1
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
- DSM: 3D視覚グラウンディングのための多様なセマンティックマップの構築3D視覚グラウンディング2025/4/1
VLM由来の外観・物理特性・アフォーダンスを統合したセマンティックマップDSMを構築し、構造化推論で3D視覚グラウンディングの精度と解釈性を向上させた。
- THUD++: 移動ロボット向け大規模動的屋内シーンデータセットとベンチマークデータセット/ナビゲーション2024/12/1
実世界とシミュレーションの両方からなる大規模な動的屋内RGB-Dデータセットを構築し、3D物体検出や歩行者軌道予測、ナビゲーションなどのタスクで既存手法を評価した。