Hanbing Li
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーションVLA/ナビゲーション2026/4/30
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
- OpenGo: リアルタイムスキル切り替えを備えたOpenClawベースのロボット犬ロボット犬/スキル切り替え2026/4/1
OpenClawを搭載したロボット犬が、タスクや指示に応じてスキルをリアルタイムに切り替えられるシステムを提案。スキルライブラリ、ディスパッチャー、自己学習フレームワークを備え、Unitree Go2で実証した。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- NEUSIS: 複雑なUAV探索ミッションにおける自律知覚・推論・計画のための構成可能なニューロシンボリックフレームワークニューロシンボリック/UAV探索2024/9/1
危険地帯や立入禁止区域を含む大規模環境で、限られた不確実な情報から対象物を探索するUAV向けに、ニューロシンボリックな知覚・推論・計画を組み合わせた解釈可能なシステムを提案し、シミュレーションで既存手法を上回る性能を示した。