Wenzhe Cai
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- X-NavDP: グループQスコア再重み付けマッチングによる新規行動と異種エンボディメントへのナビゲーション拡散ポリシーの一般化ナビゲーション2026/7/1
ナビゲーション拡散ポリシーを強化学習で事後訓練し、多様なロボット形態や困難なシナリオへの一般化を向上させるフレームワークGQRMを提案。シミュレーションと実世界で成功率を大幅に改善した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- LoGoPlanner: メートル法に基づく視覚幾何と自己位置推定を統合したナビゲーション方策ナビゲーション2025/12/1
絶対スケールの視覚幾何バックボーンを微調整し、周囲形状の再構成と暗黙的状態推定を組み合わせることで、外部キャリブレーション不要のエンドツーエンド移動ロボットナビゲーションを実現した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- ImagineNav++: シーン想像を通じて視覚言語モデルを身体化ナビゲータとして促すナビゲーション2025/12/1
RGB/RGB-D画像のみを用い、視覚言語モデルが将来の視点画像を想像して最適な視点を選ぶことで、地図なしで物体探索などの視覚ナビゲーションを実現するフレームワーク。
- NavSpace:ナビゲーションエージェントの空間知能指示追従ベンチマークナビゲーション2025/10/1
ナビゲーションエージェントの空間知能を評価する6カテゴリ・1228ペアのベンチマークNavSpaceを提案し、22モデルを評価するとともに、新モデルSNavを提案して実機でも優位性を示した。
- InternScenes: 現実的なレイアウトを持つ大規模シミュレーション可能屋内シーンデータセットsim2real2025/9/1
実世界スキャン・手続き生成・デザイナー作成の3ソースを統合し、約4万シーン・196万物体を含む大規模でシミュレーション可能な屋内3Dシーンデータセットを構築した。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- ImagineNav: 視覚言語モデルをシーン想像で身体化ナビゲータとして促すナビゲーション2024/10/1
VLMに将来の視界画像を想像させ、最適な視点選択問題として解くことで、地図なしで物体探索ナビゲーションを実現するフレームワークを提案。
- MO-DDN: 多物体要求駆動ナビゲーションのための粗から細への属性ベース探索エージェントナビゲーション2024/10/1
複数の物体と個人の好みを考慮した要求駆動ナビゲーションのベンチマークMO-DDNを提案し、属性を活用した粗から細への探索エージェントで高性能を実現した。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- InstructNav: 未探索環境における汎用指示ナビゲーションのゼロショットシステムナビゲーション2024/6/1
未探索環境で多様な言語指示に従ってロボットをナビゲートさせるため、動的ナビゲーションチェーンとマルチソースバリューマップを用いたゼロショットの汎用指示ナビゲーションシステムを提案した。
- DGMem: Learning Visual Navigation Policy without Any Labels by Dynamic Graph Memory2023/11/1
- Robust Navigation with Cross-Modal Fusion and Knowledge Transfer2023/9/1
- Bridging Zero-shot Object Navigation and Foundation Models through Pixel-Guided Navigation Skill2023/9/1
- Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions2023/9/1