Ziming Xu
収録論文 5本 ・ フィジカルAI/ロボット学習
世界モデルナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CausalWM:身体性世界モデルのための因果連鎖推論世界モデル2026/9/19
未来の映像予測の前に明示的な因果連鎖推論を行う16Bの身体性世界モデルを提案し、大規模動画事前学習・因果CoT中間学習・多目的RL事後学習の3段階で訓練して複数のベンチマークで最高性能を達成した。
- 因果的にバイアス除去された潜在行動モデルによる身体的行動条件付き世界モデル世界モデル2026/7/1
未ラベル動画から潜在行動を推定する既存モデルは、背景など行動と無関係な要素を混入させる問題を抱える。本論文では、因果的バイアス除去フレームワークCD-LAMを提案し、身体中心の再構成・行動中心の対比学習・潜在空間較正により、制御可能で堅牢な潜在行動表現を実現した。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。
- MRHER: Model-based Relay Hindsight Experience Replay for Sequential Object Manipulation Tasks with Sparse Rewards2023/6/1