Shihao Wang
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA自動運転
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- Hydra-NeXt: 開ループ学習による堅牢な閉ループ自動運転自動運転2025/3/1
軌道予測・制御予測・軌道精緻化を1つのモデルに統合したマルチブランチ計画フレームワークを提案し、開ループ学習と閉ループ運転のギャップを埋めてBench2Driveで大幅な性能向上を達成した。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
- Unified Multi-Contact Fall Mitigation Planning for Humanoids via Contact Transition Tree Optimization2018/7/1