Shaoan Wang
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LightNav-0: 汎用身体性ナビゲーションのためのVLM空間知能の引き出しナビゲーション2026/8/31
事前学習済み視覚言語モデルの空間知能をナビゲーション制御に直接活用する、タスク非依存の汎用ナビゲーションモデルLightNav-0を提案。統一トークンインターフェースと残差VQアクショントークナイザにより、指示追従・物体探索・視覚追跡を単一モデルで実現する。
- ReferTrack: 参照してから追跡する身体化視覚追跡手法視覚追跡2026/7/1
身体化視覚追跡において、自然言語で指定された対象をまず画像中のバウンディングボックスから選択し、その選択に基づいて追跡経路を生成する「参照→追跡」パラダイムを提案。時間的な対象情報を保持する工夫と参照QA学習により、単眼カメラで高い追跡成功率を達成し、実ロボットでも有効性を確認した。
- NavGSim: 大規模ナビゲーションのための高忠実度ガウススプラッティングシミュレータシミュレーション2026/3/1
3Dガウススプラッティングに基づく大規模ナビゲーション向けの高忠実度シミュレータを提案し、実環境でのVLAモデルのナビゲーション性能を向上させる。
- Hydra-Nav: 適応的二重プロセス推論による物体ナビゲーション物体ナビゲーション2026/2/1
VLMを用いた物体探索ナビゲーションにおいて、熟考型の遅い推論と反応型の速い実行を状況に応じて切り替える統合アーキテクチャを提案し、探索成功率と効率を大幅に改善した。
- VLingNav: 適応的推論と視覚支援言語記憶による身体性ナビゲーションVLA2026/1/1
人間の二重過程理論に着想を得た適応的Chain-of-Thoughtと視覚支援言語記憶を備えたVLAナビゲーションモデルを提案し、長期的タスクにおける推論と記憶を強化した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- TrackVLA: 実環境における身体性視覚追跡VLA2025/5/1
視覚と言語と行動を統合したVLAモデルで、対象認識と軌道計画を同時に学習し、遮蔽や動きの激しい実環境でも10FPSで頑健に目標を追跡する。
- Uni-NaVid:身体性ナビゲーションタスクを統合する動画ベースの視覚-言語-行動モデルナビゲーション2024/12/1
指示追従・物体探索・質疑応答・人物追跡など多様なナビゲーションタスクを単一モデルで統合し、未知の実環境での長期的な混合タスクを可能にする動画ベースのVLAモデルを提案。
- EF-Calib: 連続時間軌道を用いたイベントカメラとフレームカメラの時空間キャリブレーションキャリブレーション2024/5/1
イベントカメラと通常カメラを組み合わせたステレオシステムのための、連続時間Bスプライン軌道を用いた時空間キャリブレーション手法を提案し、内部・外部パラメータと時間オフセットを高精度に推定できることを示した。
- CylinderTag: An Accurate and Flexible Marker for Cylinder-Shape Objects Pose Estimation Based on Projective Invariants2023/10/1