Xinggang Wang
Huazhong University of Science and Technology
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- Bridge3D:Vision-Language-Actionモデルに3D空間での知覚と行動を可能にするVLA2026/9/21
2D中心のVLAモデルに3D基盤モデルの特徴と3Dセマンティックフィールドを組み込み、3D空間での精密なマニピュレーションを実現した。
- 適応的視覚言語把持:構成可能な基盤事前知識と汎化可能な把持合成による実現マニピュレーション2026/9/3
本論文は、ロボットハンドの種類に依存せず汎用的に把持を合成できるAdaRoboVLGフレームワークを提案し、物理的把持合成とタスク依存の理解を分離することで、基盤モデルの進歩を直接把持能力の向上に結び付ける手法を示した。
- Faster-WAM: ロバストな世界行動モデルのための効率的な推論時未来条件付けロボット操作2026/8/5
世界行動モデル(WAM)の推論時における未来条件付けの重要性を示し、計算コストを抑えつつ未来表現を活用する効率的なフレームワークFaster-WAMを提案した。
- DreamWAM: RGBを超えた未来予測による世界行動モデルVLA2026/8/1
世界行動モデル(WAM)の未来予測をRGBだけでなく、外観・動き・幾何・意味の構造化表現で行うことで、ロバストな行動学習を実現した。
- MotionVLA: 幾何学的な動きを視覚言語行動モデルに注入するVLA2026/6/1
過去のフレームを記憶する代わりに、連続的な軌跡フィールドトークンとして動きを表現し、ロボットの長期的な操作タスクの性能と滑らかさを向上させる手法を提案した。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- OmniTrack: 物理的に整合した参照動作による汎用モーショントラッキングモーショントラッキング2026/2/1
人間の動作データをロボットで追従させる際、体格差やノイズによる物理的に不可能な参照動作を、シミュレーション上の特権方策で実行可能な動作に変換してから追従方策を学習する枠組みを提案。実機で長時間安定した追従やアクロバティック動作を実現。
- Phys-Liquid: 透明変形液体の3D形状と体積を推定するための物理情報データセット液体知覚/3D再構成2025/11/1
容器の動きで変形する透明液体の3D形状・体積を推定するため、97,200枚の物理シミュレーション画像と3Dメッシュからなるデータセットを構築し、4段階の再構成パイプラインで有効性を検証した。
- ResAD: 正規化残差軌道モデリングによるエンドツーエンド自動運転自動運転2025/10/1
慣性参照からの残差を予測し、点ごとの正規化で最適化の偏りを抑えることで、エンドツーエンド自動運転の軌道予測精度を向上させた研究。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- AlphaDrive:強化学習と推論で自動運転におけるVLMの能力を引き出す自動運転VLA2025/3/1
自動運転向けにGRPOベースの強化学習報酬と2段階の計画推論訓練を組み合わせたVLMフレームワークを提案し、計画性能と訓練効率を改善した。
- RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習自動運転/強化学習2025/2/1
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
- DiffusionDrive:切り詰め拡散モデルによるエンドツーエンド自動運転自動運転2024/11/1
拡散モデルのノイズ除去ステップを切り詰め、マルチモードアンカーを導入することで、自動運転の行動生成を2ステップで多様かつ高品質にし、リアルタイム速度を実現した。
- M3Bench:3Dシーンにおけるモバイルマニピュレーションの全身動作生成ベンチマークモバイルマニピュレーション2024/10/1
3Dシーンで物体を並べ替える全身動作軌道を生成するモバイルマニピュレーションの新ベンチマークM3Benchを提案し、自動データ生成ツールと物理シミュレーション評価を提供する。
- Senna: 大規模視覚言語モデルとEnd-to-End自動運転の橋渡し自動運転/VLA2024/10/1
LVLMが自然言語で高レベル計画を立て、End-to-Endモデルが精密な軌道を予測する自動運転システムSennaを提案。DriveX事前学習とnuScenes微調整で計画誤差と衝突率を大幅削減した。
- M2Diffuser: 3Dシーンにおけるモバイルマニピュレーションのための拡散ベース軌道最適化モバイルマニピュレーション2024/10/1
ロボット中心の3Dスキャンから移動と操作を統合した全身軌道を拡散モデルで生成し、推論時に物理制約とタスク目的を最適化する手法を提案。20以上のシーンで既存手法を上回り、実機転移も成功。
- 占有を点集合として表現する3D占有予測3D占有予測2024/7/1
多視点画像から3D占有を予測するため、関心点(PoI)の集合でシーンを表現する点ベースの新手法OSPを提案し、従来のボリュームベース手法を上回る性能と柔軟性を示した。
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning2024/2/1
- MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction2023/8/1
- Symphonize 3D Semantic Scene Completion with Contextual Instance Queries2023/6/1
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving2023/3/1
- Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph Construction2023/3/1
- Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction2022/12/1
- MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction2022/8/1
- Deep Online Correction for Monocular Visual Odometry2021/3/1