Xihui Liu
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VCN-Bench:事前視覚経験に基づく空間推論のためのビデオ文脈化ナビゲーションベンチマークナビゲーション2026/9/28
事前に撮影された動画を手がかりに、指示された目的地を推論してナビゲーションする新ベンチマークVCN-Benchを提案し、MLLMの閉ループ空間推論能力を評価した。
- 予測を行動に変える:世界行動モデルにおける表現整合の再利用VLA2026/6/10
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
- 橋渡し動作としての翻訳:人間からロボットへの操作スキル転移マニピュレーション2026/6/1
人間の動作データから双腕ロボットへの操作スキル転移を改善するため、頭部カメラ座標系での相対手首並進を橋渡し動作表現として用いる手法を提案し、ノイズの多い6DoF人間動作よりも効果的であることを示した。
- PhysForge: 物理に基づくインタラクティブな仮想世界向け3Dアセット生成3Dアセット生成2026/5/6
物理的に正しい3Dアセットを生成するための2段階フレームワークを提案。VLMが物理設計図を作成し、拡散モデルが形状と運動学パラメータを生成する。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- ComSim: 構成シミュレーションによるスケーラブルな実世界ロボットデータ生成sim2real2026/4/1
古典的シミュレーションとニューラルシミュレーションを組み合わせ、少量の実データから多様な実世界データを生成するハイブリッド手法を提案。sim2realギャップを低減し、実世界でのポリシー学習成功率を向上させる。
- DIAL: 潜在世界モデリングによる意図と行動の分離を用いたエンドツーエンドVLAVLA2026/3/1
VLAモデルにおいて、高次意思決定と低次運動実行を潜在意図ボトルネックで橋渡しし、VLMの潜在空間で未来予測を行い、軽量ポリシーで行動を生成する枠組みを提案した。
- World Guidance: 行動生成のための条件空間における世界モデリングVLA2026/2/1
未来の観測をコンパクトな条件に圧縮して行動推論に注入し、VLAモデルが未来の行動と条件を同時に予測することで、精密な行動生成と高い汎化性能を実現するフレームワークを提案した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- VL-LN Bench:能動的対話による長期的目標指向ナビゲーションに向けてナビゲーション2025/12/1
対話を通じて曖昧な指示を解決しながら特定物体を探索する新しいナビゲーションタスクIIGNと、そのための大規模ベンチマークVL-LN Benchを提案した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- DSPv2: 全身移動マニピュレーションのための効果的で汎化可能な高密度ポリシーの改良移動マニピュレーション2025/9/1
3D空間特徴と多視点2D意味特徴を融合する新たなエンコーディングとDense Policyの拡張により、全身移動マニピュレーションの模倣学習における汎化性能と動作生成精度を向上させた。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- RoboFactory:構成制約を用いた身体性マルチエージェント協調の探求マルチエージェント協調2025/3/1
身体性マルチエージェント系のための構成制約の概念を提案し、自動データ収集フレームワークとマルチエージェント操作の初のベンチマークRoboFactoryを構築した。模倣学習の適用と性能分析も行う。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1