Wenbo Chen
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーションVLAナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MVG-WAM: ロボットマニピュレーションのための多視点幾何認識型ワールドアクションモデルマニピュレーション2026/9/29
多視点カメラの幾何学的関係を明示的に組み込んだワールドアクションモデルを提案し、LIBEROやRoboTwin 2.0で高い成功率を達成した。
- SLIP-VLA: 視覚言語行動モデルのための単一ステップ潜在想像による方策学習VLA2026/9/27
VLAモデルに1回のデノイズ更新で未来の潜在表現を生成する「単一ステップ潜在想像」を導入し、幾何・意味特徴との整合と行動条件付き世界モデルで未来を考慮した行動予測を効率化した手法。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- P$^{3}$Nav: 視覚と言語によるナビゲーションのためのエンドツーエンドの知覚・予測・計画ナビゲーション2026/3/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、知覚・予測・計画を統合したエンドツーエンドのフレームワークを提案し、シーン理解を強化してナビゲーション成功率を向上させた。
- 実世界の屋内ツアー動画から得たマルチモーダルイベント知識による視覚言語ナビゲーションの強化VLA2026/2/1
実世界の屋内動画からマルチモーダル時空間知識グラフを構築し、粗い指示や長期的推論を要する視覚言語ナビゲーションにイベント知識を統合する手法を提案した論文。
- SemanticVoxels: Sequential Fusion for 3D Pedestrian Detection using LiDAR Point Cloud and Semantic Segmentation2020/9/1