Haitong Wang
収録論文 7本 ・ フィジカルAI/ロボット学習
モバイルマニピュレーション/HRIナビゲーション人物探索VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ExpressMM: 人間とロボットのインタラクションにおける表現豊かなモバイル操作行動モバイルマニピュレーション/HRI2026/4/1
本論文では、モバイルマニピュレータが人間と協調作業中に意図を表現するためのフレームワークExpressMMを提案し、視覚言語モデルと視覚言語行動ポリシーを統合して、中断可能な対話を実現した。
- SplatSearch: 3Dガウシアンスプラッティングと拡散モデルを用いた移動ロボットのインスタンス画像ゴールナビゲーションナビゲーション2025/11/1
未知環境で1枚の参照画像から対象物体を探す移動ロボットのナビゲーション手法。スパースビューの3DGS再構成と拡散モデルで候補物体の多視点画像を生成し、目標画像と照合しながら探索する。
- X-Nav: 移動ロボットのためのエンドツーエンド異形態ナビゲーション学習ナビゲーション2025/7/1
車輪型・四脚型など異なるロボット形態に単一のポリシーで対応するナビゲーション手法を提案し、未見の形態や実環境へのゼロショット転移を実現した。
- 手描き地図による移動ロボットナビゲーション:視覚言語モデルを用いたアプローチナビゲーション2025/2/1
手描き地図の不正確さ(縮尺の歪みや欠落地標)に対応するため、視覚言語モデルを活用したHAM-Navを提案し、シミュレーションと実環境で有効性を示した。
- MLLM-Search: マルチモーダル大規模言語モデルによるゼロショット人物探索人物探索2024/12/1
マルチモーダル大規模言語モデルを活用し、事前知識なしで人間中心環境における人物を探索するゼロショット型ロボット探索手法を提案。視覚的プロンプティングと空間的思考連鎖により、動的なスケジュール変更にも対応する。
- すべてを見つけ出せ:マルチオブジェクト探索のための汎用視覚言語モデル手法VLA2024/10/1
視覚言語モデルを活用し、複数物体を効率的に探索する手法Finderを提案。マルチチャネルスコアマップで複数物体を同時追跡し、実世界・シミュレーションで既存手法を上回る性能を示した。
- NavFormer:未知で動的な環境におけるロボットの目標駆動型ナビゲーションのためのTransformerアーキテクチャナビゲーション2024/2/1
未知の動的環境で目標画像のみを頼りにナビゲーションするため、静的・動的の二重視覚エンコーダと自己教師あり学習を組み合わせたTransformerベースのエンドツーエンド手法を提案し、探索と衝突回避のサブタスクでクロスタスク訓練を行った。