Sen Wang
Xi'an Jiaotong University
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- CogWAM: イベント駆動型インターフェースによる意味認知と世界行動モデリングの整合VLA2026/9/29
タスク推論と世界行動学習の間に持続的な意味状態を介した明示的なインターフェースを設け、進捗条件付きクエリで未来予測と行動生成を整合させる認知誘導型世界行動モデルを提案。
- VGM-VS: 高精度ビジュアルサーボのための視覚幾何モデルの再考ビジュアルサーボ2026/9/23
大規模事前学習済みの視覚幾何モデルを活用し、目標画像との相対カメラ姿勢を推定して閉ループ型ビジュアルサーボを行う手法。シーン固有のメトリック適応によりスケール曖昧性を解消し、USB-CやRAM挿入などの高精度組立タスクでサブミリ精度を達成。
- RACO: 点検指向UAV視覚言語ナビゲーションのための信頼性を考慮した粗目標最適化UAVナビゲーション2026/8/24
UAVの視覚言語ナビゲーションにおいて、点検用途では目標領域内で停止し、類似する偽目標を避ける必要があるが、既存の粗密ナビゲーションは粗目標の信頼性を考慮せず失敗する。本論文では、この問題を評価するベンチマークLG-UVIを導入し、粗目標を実行時仮説として扱い、物体レベルのアンカーで補正するRACOフレームワークを提案する。
- τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデルVLA2026/8/17
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
- ニューラルLiDARバンドル調整3Dマッピング2026/7/1
LiDAR NeRFにおけるボリュームサンプリング密度の重要性を理論・実証的に示し、効率的なサンプリングに基づくLiDAR地図と姿勢の同時最適化アルゴリズムを提案した。
- WorldDiT: 世界モデルと行動生成を統合する拡散アーキテクチャVLA2026/7/1
大規模な事前学習済みVLMを使わずに、単一の拡散トランスフォーマーが行動生成と未来フレームの視覚予測を同時に行うロボットポリシーを提案し、LIBEROベンチマークでパラメータ数と成功率のトレードオフが良好であることを示した。
- WSA$_1$: 3D中心の世界・空間・行動モデルによる汎用ロボット制御ロボット基盤モデル2026/7/1
ロボット基盤モデルに3D世界の物理ダイナミクスと行動の因果関係を学習させる新しいパラダイムを提案し、少ない実データで高い汎化性能を実現した。
- ロボットポリシー学習における視点汎化のための効率的なカメラポーズ拡張VLA2026/3/1
3Dガウススプラッティングを用いて、少数の非校正画像から高品質な3Dシーンを再構成し、多様な合成視点を生成することで、視覚運動ポリシーの未知視点への汎化性能を向上させる手法を提案した。
- XIT: 未知環境における能動的ガス分布マッピングのための探索・活用統合木探索ガス分布マッピング/情報経路計画2026/2/1
未知環境でガス分布を能動的にマッピングするため、探索と活用を両立させるサンプリングベースの経路計画手法XITを提案し、ガスフロンティア検出と組み合わせてシミュレーションと実機で有効性を示した。
- NAS-GS: ノイズ対応ソナーガウシアンスプラッティング3D再構成/ソナー2026/1/1
ソナー画像特有のノイズや高さ情報の欠如に対処するため、二方向スプラッティングとガウス混合モデルによるノイズモデルを導入し、ソナー画像からの3D再構成と新規視点合成を高精度化したフレームワーク。
- SING3R-SLAM: 3D再構成事前分布を用いたサブマップベース屋内単眼ガウシアンSLAMSLAM2025/11/1
単眼カメラの屋内SLAMにおいて、グローバルなガウシアンマップとサブマップ単位の位置合わせを組み合わせ、ドリフトやスケール不整合を抑えつつ高精度な姿勢推定と3D再構成を実現した手法。
- DynaRend: マスク付き未来レンダリングによるロボットマニピュレーションのための3Dダイナミクス学習マニピュレーション2025/10/1
多視点RGB-D動画からマスク再構成と未来予測を微分可能ボリュームレンダリングで行い、3D形状・意味・ダイナミクスを統合したトライプレーン表現を自己教師あり学習するフレームワーク。RLBenchやColosseum、実機実験でマニピュレーション性能と汎化性を向上。
- SAMPO: 運動プロンプトを用いたスケールワイズ自己回帰による生成的世界モデル世界モデル2025/9/1
フレーム内生成に視覚自己回帰、次フレーム生成に因果モデリングを組み合わせ、運動プロンプトで時空間的手がかりを注入する世界モデルを提案。
- FlowRAM: 領域認識Mambaフレームワークによるフローマッチング方策のロボットマニピュレーションへの基盤化マニピュレーション2025/6/1
拡散方策の推論効率と3D知覚の課題に対し、動的半径スケジュールと状態空間モデル、条件付きフローマッチングを組み合わせ、高精度マニピュレーションで成功率を12%向上させた。
- CURL-SLAM: 連続的でコンパクトなLiDARマッピングSLAM2025/6/1
球面調和関数による連続・超コンパクト表現CURLを用いて、更新可能でループ閉じ込み後の整合性を保つLiDAR SLAMを実現し、CPUで10Hzのリアルタイム動作を達成した。
- AQUA-SLAM: センサキャリブレーションを統合した密結合型水中音響・視覚・慣性SLAM水中SLAM2025/3/1
DVL・ステレオカメラ・IMUをグラフ最適化で密結合し、リアルタイムなセンサキャリブレーションも同時に行う水中SLAMを提案。水槽と北海での実験で既存手法を上回る精度と頑健性を示した。
- デジタルビームフォーミングによるレーダオドメトリの高精度化レーダオドメトリ2025/3/1
単一チップミリ波レーダの信号処理に空間ビームフォーミングを導入し、到来方向推定を3Dに拡張することで、従来のFFTベース処理より高精度なレーダオドメトリを実現した。
- PanoGen++: 視覚と言語によるナビゲーションのためのドメイン適応型テキスト誘導パノラマ環境生成VLA2025/3/1
拡散モデルをドメイン適応微調整してテキストから多様なパノラマ環境を生成し、VLNタスクの訓練データ不足を解消して性能を向上させた。
- オンライン時間キャリブレーションを備えたEKFベースのレーダー慣性オドメトリレーダー慣性オドメトリ/時間同期2025/2/1
レーダーと慣性センサ間の時間オフセットを拡張カルマンフィルタでオンライン推定しながら自己速度を統合するレーダー慣性オドメトリを提案し、シミュレーションと実データで有効性を示した。
- 指示を超えてナビゲート:障害物環境における視覚と言語によるナビゲーションナビゲーション2024/7/1
視覚と言語によるナビゲーション(VLN)において、予期せぬ障害物による指示と現実の不一致に対応するため、R2R-UNOデータセットを構築し、適応的にナビゲートするObVLN手法を提案した。
- VoxNeRF: Bridging Voxel Representation and Neural Radiance Fields for Enhanced Indoor View Synthesis2023/11/1
- HI-SLAM: Monocular Real-time Dense Mapping with Hybrid Implicit Fields2023/10/1
- Enhancing AUV Autonomy With Model Predictive Path Integral Control2023/8/1
- BAMF-SLAM: Bundle Adjusted Multi-Fisheye Visual-Inertial SLAM Using Recurrent Field Transforms2023/6/1
- Reachability Verification Based Reliability Assessment for Deep Reinforcement Learning Controlled Robotics and Autonomous Systems2022/10/1
- CURL: Continuous, Ultra-compact Representation for LiDAR2022/5/1
- Reliability Assessment and Safety Arguments for Machine Learning Components in System Assurance2021/12/1
- From market-ready ROVs to low-cost AUVs2021/8/1
- Radar SLAM: A Robust SLAM System for All Weather Conditions2021/4/1
- RADIATE: A Radar Dataset for Automotive Perception in Bad Weather2020/10/1
- Multi-Task Reinforcement Learning based Mobile Manipulation Control for Dynamic Object Tracking and Grasping2020/6/1
- RadarSLAM: Radar based Large-Scale SLAM in All Weathers2020/5/1
- Robot Calligraphy using Pseudospectral Optimal Control in Conjunction with a Novel Dynamic Brush Model2020/3/1
- Robot Calligraphy using Pseudospectral Optimal Control in Conjunction with a Novel Dynamic Brush Model2019/11/1
- Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds2019/6/1
- Learning Monocular Visual Odometry through Geometry-Aware Curriculum Learning2019/3/1
- Learning with Training Wheels: Speeding up Training with a Simple Controller for Deep Reinforcement Learning2018/12/1
- Learning with Stochastic Guidance for Navigation2018/11/1
- Deep Reinforcement Learning for Autonomous Driving2018/11/1
- Robust Attentional Aggregation of Deep Feature Sets for Multi-view 3D Reconstruction2018/8/1
- Defo-Net: Learning Body Deformation using Generative Adversarial Networks2018/4/1
- DeepVO: Towards End-to-End Visual Odometry with Deep Recurrent Convolutional Neural Networks2017/9/1
- 3D Object Reconstruction from a Single Depth View with Adversarial Learning2017/8/1
- Towards Monocular Vision based Obstacle Avoidance through Deep Reinforcement Learning2017/6/1
- Increasing the Efficiency of 6-DoF Visual Localization Using Multi-Modal Sensory Data2016/12/1