Wenyu Liu
Huazhong University of Science and Technology
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- 適応的視覚言語把持:構成可能な基盤事前知識と汎化可能な把持合成による実現マニピュレーション2026/9/3
本論文は、ロボットハンドの種類に依存せず汎用的に把持を合成できるAdaRoboVLGフレームワークを提案し、物理的把持合成とタスク依存の理解を分離することで、基盤モデルの進歩を直接把持能力の向上に結び付ける手法を示した。
- DreamWAM: RGBを超えた未来予測による世界行動モデルVLA2026/8/1
世界行動モデル(WAM)の未来予測をRGBだけでなく、外観・動き・幾何・意味の構造化表現で行うことで、ロバストな行動学習を実現した。
- 四足ロボットのための行動基盤:ABot-C0 テクニカルレポート四足歩行2026/7/1
四足ロボット向けの汎用動作制御システムABot-C0を提案し、大規模データパイプラインとフローマッチングポリシーにより、動作追跡のスケーリング則を初めて実証した。
- MotionVLA: 幾何学的な動きを視覚言語行動モデルに注入するVLA2026/6/1
過去のフレームを記憶する代わりに、連続的な軌跡フィールドトークンとして動きを表現し、ロボットの長期的な操作タスクの性能と滑らかさを向上させる手法を提案した。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- OmniTrack: 物理的に整合した参照動作による汎用モーショントラッキングモーショントラッキング2026/2/1
人間の動作データをロボットで追従させる際、体格差やノイズによる物理的に不可能な参照動作を、シミュレーション上の特権方策で実行可能な動作に変換してから追従方策を学習する枠組みを提案。実機で長時間安定した追従やアクロバティック動作を実現。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- AlphaDrive:強化学習と推論で自動運転におけるVLMの能力を引き出す自動運転VLA2025/3/1
自動運転向けにGRPOベースの強化学習報酬と2段階の計画推論訓練を組み合わせたVLMフレームワークを提案し、計画性能と訓練効率を改善した。
- RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習自動運転/強化学習2025/2/1
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
- Senna: 大規模視覚言語モデルとEnd-to-End自動運転の橋渡し自動運転/VLA2024/10/1
LVLMが自然言語で高レベル計画を立て、End-to-Endモデルが精密な軌道を予測する自動運転システムSennaを提案。DriveX事前学習とnuScenes微調整で計画誤差と衝突率を大幅削減した。
- 占有を点集合として表現する3D占有予測3D占有予測2024/7/1
多視点画像から3D占有を予測するため、関心点(PoI)の集合でシーンを表現する点ベースの新手法OSPを提案し、従来のボリュームベース手法を上回る性能と柔軟性を示した。
- すべてのボクセルは平等ではない:自己蒸留を用いた難易度認識型セマンティックシーン補完セマンティックシーン補完2024/4/1
3D空間のボクセルごとに難易度を考慮し、学習が難しい領域を重点的に学習する自己蒸留ベースのセマンティックシーン補完手法を提案。
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning2024/2/1
- MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction2023/8/1
- Symphonize 3D Semantic Scene Completion with Contextual Instance Queries2023/6/1
- LiDAR2Map: In Defense of LiDAR-Based Semantic Map Construction Using Online Camera Distillation2023/4/1
- Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph Construction2023/3/1
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving2023/3/1
- Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction2022/12/1
- MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction2022/8/1