Minghan Li
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ホモトピーを考慮した参照経路不要のコリドー生成モーションプランニング2026/7/1
事前の参照経路に依存せず、凸集合のグラフ上でコリドーを直接生成するフレームワークを提案し、ホモトピー類の探索を改善した。
- ChordEdit再考:再現・簡素化・新たな洞察による一段階画像編集の再定義画像編集2026/6/12
一段階画像編集手法ChordEditを再現・解析し、その動作メカニズムを解明して簡素化した論文。
- AllDayNav: 実世界強化学習による生涯ナビゲーションナビゲーション2026/6/1
動的環境での生涯ナビゲーションのために、明示的な地図やシーングラフを使わず、大規模モデルに強化学習でシーン動態を暗黙的に符号化し、自己進化するマルチモーダルメモリで長期動作を実現するフレームワークを提案した。
- NavGSim: 大規模ナビゲーションのための高忠実度ガウススプラッティングシミュレータシミュレーション2026/3/1
3Dガウススプラッティングに基づく大規模ナビゲーション向けの高忠実度シミュレータを提案し、実環境でのVLAモデルのナビゲーション性能を向上させる。
- SPAN-Nav: 多様な視覚言語ナビゲーションのための汎用空間認識VLA2026/3/1
RGB動画から占有予測で空間事前知識を学習し、単一トークンで空間手がかりを行動推論に注入する視覚言語ナビゲーション基盤モデルを提案。
- UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデルVLA2025/10/1
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
- MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーションVLA2025/10/1
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- TrackVLA: 実環境における身体性視覚追跡VLA2025/5/1
視覚と言語と行動を統合したVLAモデルで、対象認識と軌道計画を同時に学習し、遮蔽や動きの激しい実環境でも10FPSで頑健に目標を追跡する。
- HA-VLN 2.0:動的な複数人環境における人間認識ナビゲーションのためのオープンベンチマークとリーダーボードVLA2025/3/1
離散・連続空間での人間認識型視覚言語ナビゲーションを統一評価するベンチマークを提案し、社会的制約を考慮したデータセット・シミュレータ・実機検証・リーダーボードを公開した。
- Uni-NaVid:身体性ナビゲーションタスクを統合する動画ベースの視覚-言語-行動モデルナビゲーション2024/12/1
指示追従・物体探索・質疑応答・人物追跡など多様なナビゲーションタスクを単一モデルで統合し、未知の実環境での長期的な混合タスクを可能にする動画ベースのVLAモデルを提案。
- 人間を考慮した視覚言語ナビゲーション:動的な人間活動を組み込んだシミュレーションから現実への橋渡しVLA2024/6/1
動的な人間活動を取り入れたHA-VLNタスクを提案し、HA3DシミュレータとHA-R2Rデータセット、および2種類のエージェントを構築して、人間がいる環境でのナビゲーション性能を評価した。