Bing Wang
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 検索関連性を超えて:視覚言語運転のためのシーン接地型リスク含意VLA2026/9/28
運転シーンの知覚事実から知識グラフとSWRL推論でリスク関係を導出し、VLMと拡散プランナーの判断を条件付けることで、検索ベースの安全知識より計画安全性を向上させた。
- 効果的かつ効率的な身体性探索のための能動的空间検査身体性探索2026/9/18
身体性探索において、空間的に明示的な検査に基づく知覚と移動を組み合わせたACEフレームワークを提案し、早期終了と過剰継続のトレードオフを緩和してナビゲーション成功率と探索効率を向上させた。
- GPOcc++: 視覚幾何学事前情報を用いた統合スパースガウス占有予測3Dシーン理解2026/7/15
視覚幾何学の事前情報を占有予測に適したスパースガウス表現に変換し、多視点・時系列を統一的に扱う3Dシーン理解手法GPOcc++を提案した。屋内・屋外のベンチマークで高い性能と効率性を示した。
- 深層学習によるマルチラベル画像分類の再考:分類体系、課題、展望画像分類2026/7/1
深層学習を用いたマルチラベル画像分類(MLIC)の包括的なサーベイ論文であり、手法を6つのグループに分類し、課題と将来の研究方向をまとめている。
- 空間認識型ワールドアクションモデルによる身体化ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための世界モデルベースのプランナーを改良し、開始と目標のRGB観測から中間のRGB-Dシーケンスと行動軌跡を同時生成するSWAMを提案。単眼RGB入力のみで高精度なナビゲーションを実現した。
- R$^3$L: 相対空間関係からの3Dレイアウト推論3Dレイアウト生成2026/5/1
3Dレイアウト生成における相対空間推論の信頼性と一貫性を向上させるフレームワークを提案。多段階推論での誤差蓄積を防ぐため、不変空間分解と一貫性のある空間想像を導入し、物理的に実現可能で意味的に一貫したレイアウトを生成する。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- PhysInOne: 一つのスイートで実現する視覚物理の学習と推論データセット/物理推論2026/4/1
物理現象を捉えた大規模合成動画データセットPhysInOneを構築し、物理に基づく映像生成や将来予測、物理特性推定などの性能向上を示した。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデルVLA2025/12/1
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- HANDO: 階層型自律ナビゲーションと器用な全身移動操作移動操作2025/10/1
脚式ロボットが自律探索で目標物体まで移動し、全身制御で飲み物を渡すなどの操作を行う2層フレームワークを提案した。
- DriveMRP: 合成モーションデータによる視覚言語モデルのモーションリスク予測強化自動運転2025/7/1
BEVベースのシミュレーションで高リスクな運転モーションデータを合成し、視覚言語モデルのリスク予測性能を大幅に向上させるフレームワークを提案した。
- 運動整合したRGBとイベント手がかりによるラベル不要の長期的3次元UAV軌道予測UAV軌道予測2025/7/1
LiDAR点群から教師なしで抽出した軌道をカメラ画像と運動整合させて疑似ラベルを生成し、視覚Mambaネットワークと運動学的推定を自己教師ありで組み合わせてドローンの将来3D軌道を予測する手法を提案。手動ラベルなしで5秒先の3D誤差を約40%削減した。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- Uni-Gaussians: ガウス表現による動的運転シーン向けカメラ・LiDAR統合シミュレーションsim2real2025/3/1
ガウスプリミティブを用いて、画像はラスタライズ、LiDARはガウスレイトレーシングで描画することで、動的運転シーンのカメラとLiDARデータを統一的かつ高速にシミュレーションする手法を提案した論文。
- NeuV-SLAM: Fast Neural Multiresolution Voxel Optimization for RGBD Dense SLAM2024/2/1
- Drone-NeRF: Efficient NeRF Based 3D Scene Reconstruction for Large-Scale Drone Survey2023/8/1
- GrowSP: Unsupervised Semantic Segmentation of 3D Point Clouds2023/5/1
- Decoupling Skill Learning from Robotic Control for Generalizable Object Manipulation2023/3/1
- Robotic Assembly Control Reconfiguration Based on Transfer Reinforcement Learning for Objects with Different Geometric Features2022/11/1
- DM-NeRF: 3D Scene Geometry Decomposition and Manipulation from 2D Images2022/8/1
- RangeUDF: Semantic Surface Reconstruction from 3D Point Clouds2022/4/1
- AutoPlace: Robust Place Recognition with Single-chip Automotive Radar2021/9/1
- Graph-based Thermal-Inertial SLAM with Probabilistic Neural Networks2021/4/1
- 3-D Motion Capture of an Unmodified Drone with Single-chip Millimeter Wave Radar2020/11/1
- A Survey on Deep Learning for Localization and Mapping: Towards the Age of Spatial Machine Intelligence2020/6/1
- PointLoc: Deep Pose Regressor for LiDAR Point Cloud Localization2020/3/1
- Learning Selective Sensor Fusion for States Estimation2019/12/1
- DynaNet: Neural Kalman Dynamical Model for Motion Estimation and Prediction2019/8/1