Mingfei Han
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 見て、計画して、巻き戻す:進捗認識型視覚言語行動モデルによる堅牢なロボット操作マニピュレーション2026/3/1
ロボット操作のタスク進捗を明示的なマイルストーンで測定し、失敗時に回復可能な状態へ巻き戻すことで堅牢性を高める、進捗認識型の視覚言語行動フレームワークSPRを提案した。
- LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーションナビゲーション2026/3/1
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
- 構造化プランナーとしてのワールドモデル:ロボット操作のための疎な未来予測マニピュレーション2026/3/1
密な未来予測の冗長性と誤差蓄積を避けるため、キネマティクスに基づく疎な構造化フレームを予測するワールドモデルを提案し、視覚プランニングと運動制御を橋渡しする。
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- BLAZER: ゼロショットデータ生成によるLLMベース操作エージェントのブートストラップマニピュレーション2025/10/1
LLMプランナーでシミュレーション内の操作デモを自動生成し、成功例でLLMを微調整することで、人手なしに操作スキルを獲得・転移させるフレームワークを提案。
- PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマークベンチマーク/VLA2025/6/1
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。
- MALMM: ゼロショットロボットマニピュレーションのためのマルチエージェント大規模言語モデルマニピュレーション2024/11/1
複数のLLMエージェントに高レベル計画と低レベル制御コード生成を分担させ、環境観察に基づく動的な再計画を行うことで、事前学習済みスキルや例示なしにロボット操作タスクをゼロショットで解くフレームワークを提案。