Hongwei Xie
収録論文 6本 ・ フィジカルAI/ロボット学習
ナビゲーション自動運転/世界モデル自動運転/VLA自動運転VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 空間認識型ワールドアクションモデルによる身体化ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための世界モデルベースのプランナーを改良し、開始と目標のRGB観測から中間のRGB-Dシーケンスと行動軌跡を同時生成するSWAMを提案。単眼RGB入力のみで高精度なナビゲーションを実現した。
- Discrete-WAM: 世界モデルとポリシー学習のための統一離散ビジョン・アクショントークン編集自動運転/世界モデル2026/6/1
自動運転向けに、視覚観測・未来状態・高次決定・自車行動を共通の離散トークン空間で表現し、世界モデルとポリシーを統合学習するフレームワークを提案した。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- DriveVA: ビデオ行動モデルはゼロショット運転者である自動運転2026/4/1
自動運転のための世界モデルDriveVAを提案し、将来の映像と行動系列を共有の生成過程で同時に予測することで、ゼロショットでの汎化性能を向上させた。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデルVLA2025/12/1
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。