Gengze Zhou
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavHarness: 生涯身体性ナビゲーションに向けてナビゲーション2026/9/28
記憶処理をナビゲーションループに組み込み、地図や過去の探索記録を観測と照合しながら訂正・蓄積する訓練不要の身体性ナビゲーション手法を提案。GOAT-Benchなどで大幅な性能向上を達成。
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- 具現化エージェントが制御を握る:視覚言語ナビゲーションにおける最小インターフェースのゼロショットエージェントが産業規模ポリシーに匹敵ナビゲーション2026/7/1
汎用エージェントが単眼RGBカメラと離散行動のみでゼロショットナビゲーションを実行し、訓練済みポリシーなしで高い成功率を達成できることを示した。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- 報酬が見合うときだけ質問する:コストを考慮したオープンエンド対話によるインスタンス目標ナビゲーションナビゲーション2026/6/2
インスタンス目標ナビゲーションにおいて、曖昧な指示を解決するためのオラクルへの質問コストを考慮し、情報利得に基づいて質問タイプと重みを学習し、効率的な対話ナビゲーションを実現する手法を提案した論文。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- 具現化エージェントアーキテクチャ設計の自動化エージェントアーキテクチャ探索2026/6/1
具現化エージェントのアーキテクチャ設計を自動化する手法を提案し、視覚言語ナビゲーションや操作タスクで有効性を検証した。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- VLNVerse:多様・身体性・リアルなシミュレーションと評価を備えた視覚言語ナビゲーションのベンチマークVLN2025/12/1
視覚言語ナビゲーション(VLN)の既存ベンチマークの限界を克服するため、多様なタスクを統合し、物理エンジンによる身体性とリアルなシミュレーションを実現した大規模ベンチマークVLNVerseを提案し、既存手法の評価と統合マルチタスクモデルを提示した。
- VLN-MME:言語誘導視覚ナビゲーションエージェントとしてのMLLMの診断VLA2025/12/1
視覚と言語によるナビゲーション(VLN)タスクでMLLMをゼロショットエージェントとして評価する統一ベンチマークVLN-MMEを提案し、CoT推論や自己反省を加えると性能が低下するなど、 embodiedナビゲーションにおけるMLLMの空間推論の弱さを明らかにした。
- 分離型アクションエキスパート:タスク知識を条件付け経路に閉じ込めるVLA2025/11/1
拡散ポリシーの行動生成バックボーンはタスク非依存にできることを示し、条件付け経路のみを学習させる分離型学習法を提案。244MのU-Netを5MのMLPに置き換えても同等以上の性能を達成した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- 連続環境における地上視点の視覚と言語によるナビゲーションVLA2025/2/1
低視点の四足ロボット向けに、重み付き履歴観測と接続グラフ転移を用いて視覚と言語によるナビゲーションの汎化性能を高めるGVNavを提案した論文。
- SAME: 状態適応型エキスパート混合による汎用言語誘導視覚ナビゲーションの学習ナビゲーション2024/12/1
異なる粒度の言語指示による7つのナビゲーションタスクを統一的に扱うため、状態に応じて専門家を切り替えるMixture of ExpertsモデルSAMEを提案し、タスク特化型エージェントに匹敵する性能を実現した。
- NavGPT-2:大規模視覚言語モデルのナビゲーション推論能力を引き出すVLA2024/7/1
凍結した大規模言語モデルに視覚情報を整合させ、ナビゲーション方策ネットワークと組み合わせることで、視覚言語ナビゲーションタスクにおける推論能力と行動予測性能を向上させた研究。
- NaVid: ビデオベースVLMが視覚言語ナビゲーションの次の一歩を計画するVLA2024/2/1
単眼RGBカメラの動画ストリームのみから次の行動を出力するビデオベース大規模視覚言語モデルNaVidを提案し、地図・オドメトリ・深度なしでシミュレーションと実世界の両方で最先端のナビゲーション性能を達成した。
- NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models2023/5/1