Sifei Liu
NVIDIA
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Recova: 自律ロボットマニピュレーションのためのエージェント誘導型失敗回復マニピュレーション2026/10/1
デジタルツイン上でエージェントが失敗を診断し回復行動を学習、実機での検証と人間デモを組み合わせて回復能力を拡張する枠組みを提案し、成功率と人間介入の削減を実証した。
- ASENA: 自己進化型エージェントによる身体性ナビゲーションナビゲーション2026/9/30
コーディングエージェントがプログラムを書いて実行・修正・経験を蓄積しながらロボットをナビゲーションさせるシステムを提案し、4Bの単眼ナビゲーション方策と組み合わせてR2RやRxRで高性能を達成した。
- SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考空間推論2026/6/11
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- トレース条件付きVLA計画による長期的操作マニピュレーション2026/4/1
長期的な操作タスクを、タスク管理VLMが現在の観察から残りの計画を予測し、視覚的トレースを実行VLAに提供することで、短期的なVLA実行を長期的な指示追従に拡張するフレームワークを提案。
- EgoVLA:自己中心視点の人間動画から視覚-言語-行動モデルを学習VLA2025/7/1
一人称視点の人間動画でVLAモデルを訓練し、逆運動学とリターゲティングで人間の手の動きをロボット動作に変換、少数のロボット実演で微調整してロボットポリシーを獲得する手法を提案。
- M3: 3D空間マルチモーダルメモリ3D表現/マルチモーダル2025/3/1
3Dガウシアンスプラッティングと基盤モデルを統合し、動画から静的な屋内シーンのマルチモーダルな特徴表現を効率的に保持・描画するメモリシステムを提案。四足歩行ロボットへの実装も行った。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- Affordance Diffusion: Synthesizing Hand-Object Interactions2023/3/1