Wenshan Wang
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Map2Route: 意味地図上の構成的言語指示に基づく経路計画ベンチマーク経路計画2026/9/15
意味地図上で複雑な言語指示から経路を計画するベンチマークMap2Routeと、コード実行と検証を組み合わせた手法Grounding2Routeを提案した。
- MAC-I²:ロバストな視覚慣性融合のための学習によるメトリクス対応共分散状態推定2026/9/7
視覚とIMUの融合において、事前定義された不確かさではなく、学習により各モダリティのノイズを反映した共分散を推定し、初期化とキャリブレーションのロバスト性を向上させる手法を提案した。
- スーパーオドメトリ2.0:階層的適応による頑健なオドメトリオドメトリ2026/8/26
環境劣化に応じてセンサ融合を動的に適応させる頑健なオドメトリフレームワークを提案。IMUをカメラやLiDARと同等に扱い、劣化時でも信頼性を確保する。
- SuperMap: 視覚言語ナビゲーションのための時空間SLAMシステムSLAM/ナビゲーション2026/8/24
高頻度の幾何SLAMと非同期のオープンボキャブラリ知覚を統合し、物体の同一性維持と古い地図情報の整理を行う4D時空間マッピングフレームワークを提案。
- オフロード環境における画像ベースのアフォーダンス予測のためのグローバル走行可能性事前知識の蒸留ナビゲーション2026/7/1
衛星画像から得た長距離の走行可能経路を教師として、第一人称視点画像から走行可能性フロンティアを予測するネットワークを学習し、長距離オフロードナビゲーションの性能を向上させた。
- Goal2Pixel: ナビゲーション目標をピクセルに接地する視覚言語ナビゲーションVLMナビゲーション2026/6/1
視覚言語ナビゲーションを、行動予測ではなく画像平面上のナビゲーション可能なピクセル接地として再定式化し、VLMの推論回数を大幅に削減しつつ高性能を達成した。
- IntentNav: 人間のデモから空間視覚オブジェクトナビゲーションを学習するナビゲーション2026/6/1
人間のデモから探索意図を学習し、空間記憶と視覚的手がかりを統合してオブジェクトナビゲーションを行うフレームワークを提案。複数ベンチマークで最高性能を達成し、異なるロボットへのゼロショット転移も可能。
- SysNav: マルチレベル系統的協調による実世界・クロスエンボディ物体ナビゲーションの実現ナビゲーション2026/3/1
実世界の物体ナビゲーションをシステムレベルで捉え、セマンティック推論・ナビゲーション計画・運動制御を分離した3層システムSysNavを提案し、車輪型ロボット、四足、人型の3つの異なるエンボディで実証した。
- AnyThermal:熱知覚のための汎用表現学習に向けて熱知覚2026/2/1
RGB-Thermalデータセットと収集プラットフォームを構築し、視覚基盤モデルから蒸留することで、多様な環境とタスクに適用可能な熱画像バックボーンを学習した。
- RAVEN: オープンセット意味記憶と行動適応による堅牢な空中ナビゲーション空中ナビゲーション2025/9/1
屋外の大規模環境で対象物を探す空中ロボット向けに、3D意味ボクセルマップを記憶として使い、ビヘイビアツリーで探索行動を切り替えるナビゲーション手法を提案。
- LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディングVLA2025/9/1
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
- ThermalDiffusion: 自律ナビゲーションのための視覚画像から熱画像への変換画像変換2025/6/1
条件付き拡散モデルを用いてRGB画像を熱画像に変換し、熱カメラ向けデータ不足を補う手法を提案。
- UFM: フローとマッチングを統合するシンプルな密対応モデル密対応2025/6/1
広基線マッチングとオプティカルフローを単一のTransformerで統合学習し、両タスクで専門手法を上回る精度と速度を実現した。
- TartanGround: 地上ロボットの知覚とナビゲーションのための大規模データセットデータセット/知覚・ナビゲーション2025/5/1
多様な環境で動く地上ロボット向けに、360度ステレオカメラやLiDAR、占有マップなどを含む大規模マルチモーダルデータセットを構築し、知覚・SLAMタスクの汎化性能評価を可能にした。
- STRIVE: VLM推論を統合した構造的表現による効率的物体ナビゲーション物体ナビゲーション2025/5/1
VLMを物体ナビゲーションに活用するため、環境を視点・物体・部屋の階層で表現し、VLM推論による高レベル計画と低レベル探索を組み合わせる二段階方策を提案。シミュレーションと実機で成功率と効率を向上させた。
- SORT3D: 大規模言語モデルを用いたゼロショット3Dグラウンディングのための空間オブジェクト中心推論ツールボックス3Dグラウンディング2025/4/1
2Dの物体属性とヒューリスティックな空間推論ツールボックスをLLMの逐次推論能力と組み合わせ、テキスト-3Dデータなしで未知環境にゼロショット適用できる3Dグラウンディング手法を提案。
- RayFronts: オンラインシーン理解と探索のためのオープンセット意味論的レイフロンティア意味論的マッピング2025/4/1
距離内のボクセルと距離外のレイにオープンセット意味論を統合し、効率的な意味論的マッピングと探索を可能にする表現を提案。
- IRef-VLA: 不完全な言語指示を用いた3Dシーンにおける対話的参照グラウンディングのベンチマークVLA2025/3/1
不完全・曖昧な自然言語指示で3D屋内をナビゲートするタスク向けに、11.5Kの3Dスキャン部屋と470万件の参照文を含む大規模ベンチマークデータセットを構築し、既存モデルの性能評価基盤を提供した。
- SALON: オフロード走行のための自己教師あり適応学習ナビゲーション2024/12/1
人間の入力なしにオンラインで経験から素早く適応し、リスクを考慮した走行可能性マップを生成する知覚・行動フレームワークを提案。100〜1000倍のデータで学習した手法に匹敵する性能を実現した。
- VLA-3D: 3D意味理解とナビゲーションのための大規模データセットナビゲーション2024/11/1
屋内3Dシーンにおける言語指示ナビゲーション向けに、11.5K以上のスキャン済み部屋、2350万の物体間意味関係、970万の参照文を含む最大規模の実世界データセットを構築し、最先端モデルのベースライン性能を評価した。
- MAC-VO: メトリクス対応共分散を用いた学習ベースステレオ視覚オドメトリ視覚オドメトリ2024/9/1
学習したマッチング不確かさをキーポイント選択とポーズグラフ最適化の重み付けに活用し、空間誤差と軸間相関を捉える共分散モデルを導入したステレオ視覚オドメトリ手法を提案。
- BEVRender: GNSS不感オフロード環境における視覚ベースのクロスビュー車両位置推定位置推定/クロスビュー2024/5/1
GNSSが使えないオフロード環境で、車両周辺の地形をBEV画像として生成し、地理参照済みの航空地図とテンプレートマッチングすることで高精度なクロスビュー位置推定を実現した研究。
- Interactive-FAR: 複雑未知環境における可動障害物を考慮した対話的・高速・適応的経路計画ナビゲーション2024/4/1
未知環境で可動障害物を押しのけながらナビゲーションするリアルタイム経路計画アルゴリズムを提案し、従来手法より33%の移動時間短縮と49%の経路効率向上を実現した。
- 自己教師あり高解像度オフロードマッピングのための深層ベイズ未来融合オフロードマッピング2024/3/1
スパースなステレオ・LiDAR深度データからベイズフィルタリングと知覚損失を組み合わせ、30m先まで2cm解像度の高精細オフロード地図を生成する手法を提案。
- TartanDrive 2.0: More Modalities and Better Infrastructure to Further Self-Supervised Learning Research in Off-Road Driving Tasks2024/2/1
- PIAug -- Physics Informed Augmentation for Learning Vehicle Dynamics for Off-Road Navigation2023/11/1
- SubT-MRS Dataset: Pushing SLAM Towards All-weather Environments2023/7/1
- Learning Risk-Aware Costmaps via Inverse Reinforcement Learning for Off-Road Navigation2023/2/1
- How Does It Feel? Self-Supervised Costmap Learning for Off-Road Vehicle Traversability2022/9/1
- PyPose: A Library for Robot Learning with Physics-based Optimization2022/9/1
- DytanVO: Joint Refinement of Visual Odometry and Motion Segmentation in Dynamic Environments2022/9/1
- TartanDrive: A Large-Scale Dataset for Learning Off-Road Dynamics Models2022/5/1
- COMPASS: Contrastive Multimodal Pretraining for Autonomous Systems2022/3/1
- Unsupervised Online Learning for Robotic Interestingness with Visual Memory2021/11/1
- AirDOS: Dynamic SLAM benefits from Articulated Objects2021/9/1
- VDB-EDT: An Efficient Euclidean Distance Transform Algorithm Based on VDB Data Structure2021/5/1
- ORStereo: Occlusion-Aware Recurrent Stereo Matching for 4K-Resolution Images2021/3/1
- TartanVO: A Generalizable Learning-based VO2020/11/1
- Visual Memorability for Robotic Interestingness via Unsupervised Online Learning2020/5/1
- TartanAir: A Dataset to Push the Limits of Visual SLAM2020/3/1
- Autonomous Aerial Cinematography In Unstructured Environments With Learned Artistic Decision-Making2019/10/1
- Towards a Robust Aerial Cinematography Platform: Localizing and Tracking Moving Targets in Unstructured Environments2019/4/1
- Can a Robot Become a Movie Director? Learning Artistic Principles for Aerial Cinematography2019/4/1
- Improved Generalization of Heading Direction Estimation for Aerial Filming Using Semi-supervised Regression2019/3/1
- Integrating kinematics and environment context into deep inverse reinforcement learning for predicting off-road vehicle trajectories2018/10/1
- Autonomous drone cinematographer: Using artistic principles to create smooth, safe, occlusion-free trajectories for aerial filming2018/8/1