Xiaowei Chi
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求VLA2026/9/7
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
- 多段階視覚推論のための階層的デノイジングビデオ生成/推論2026/7/16
因果的ビデオ生成に階層的潜在変数を統合し、粗い推論から細かい推論へと段階的に進めることで、複雑な多段階視覚推論タスクを効率的に解決するフレームワークを提案した。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル触覚/操作2026/6/1
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
- WAM-RL: 再構成報酬とオンラインビデオSFTを用いたワールド・アクションモデル強化学習強化学習2026/6/1
ワールドモデルとアクションモデルをオンライン環境相互作用で共同最適化する強化学習フレームワークを提案し、長期的タスクでの性能向上を実証した。
- SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習安全強化学習/VLA2026/6/1
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
- Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデルVLA2026/6/1
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- ProDrive: 自己と環境の共進化による自動運転のためのプロアクティブ計画自動運転2026/4/1
現在の観測のみに依存する反応的な自動運転計画の問題を解決するため、自己と環境の共進化を可能にするワールドモデルベースのプロアクティブ計画フレームワークを提案した。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地VLA2026/1/1
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
- Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシーVLA2025/12/1
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
- WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成VLA2025/10/1
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- ManipDreamer3D:占有マップを考慮した3D軌道によるロボットマニピュレーション動画の生成マニピュレーション2025/9/1
入力画像から3D占有マップを再構成し、衝突を避けた3Dエンドエフェクタ軌道を計画して、その軌道を条件に拡散モデルでロボットのピックアンドプレース動画を生成する手法を提案した。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
- ManipDreamer: 行動木と視覚ガイダンスによるロボットマニピュレーション世界モデルの強化マニピュレーション2025/4/1
指示を行動木として表現し、深度と意味の視覚ガイダンスを組み合わせることで、ロボット操作の動画生成における指示追従性と視覚品質を向上させた世界モデルを提案。
- MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデルVLA2025/3/1
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
- EVA: 未来映像予測のための身体性世界モデル世界モデル2024/10/1
視覚言語モデルと映像生成モデルを組み合わせ、身体性シナリオでの多段階未来予測を可能にする世界モデルEVAとその評価ベンチマークEVA-Benchを提案した。
- DOZE: 動的環境におけるオープン語彙ゼロショット物体ナビゲーションのためのデータセットナビゲーション2024/2/1
動く障害物や多様な物体、テキスト手がかりを含む高忠実度3Dシーンと18k以上のタスクからなるゼロショット物体ナビゲーション用データセットを提案し、既存手法の課題を明らかにした。