日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2609.03906v1

連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考

Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment

シェア:XThreadsFacebookLINEはてブBluesky

VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。

詳しい要約

1. どんなもの?

本論文は、連続環境におけるVision-Language Navigation (VLN-CE) タスクを、階層的マルコフ決定過程 (MDP) として再定式化し、トポロジカルグラフ上のマクロアクションを用いた閉ループ強化学習 (RL) 手法を提案する。エージェントは自然言語の指示に従い、未知環境をナビゲーションする。提案手法は、高レベルのプランニングと低レベルの制御を分離し、高レベルポリシーはフロンティアノードのマクロアクション空間で動作し、低レベルコントローラは学習不要で状態遷移を担う。これにより、決定の地平線を圧縮し、閉ループRLを実現可能にする。

2. 先行研究と比べてどこがすごい?

既存の模倣学習 (IL) パイプラインは、閉ループ設定において分布シフトや軌道逸脱時の専門家行動の曖昧さに悩まされる。RLは自然な解決策だが、マイクロアクション空間への直接適用は報酬が疎であるためサンプル非効率である。本手法は、VLN-CEを階層的MDPとして捉え、マクロアクション空間でRLを適用することで、これらの問題を克服し、サンプル効率を向上させる点が新しい。

3. 技術・手法の肝は?

技術の核心は、環境をトポロジカルグラフに抽象化し、高レベルポリシーがフロンティアノードのマクロアクション空間で動作することである。低レベルコントローラは学習不要で、高レベルアクションの状態遷移を実行する。RL最適化のために、動的なフロンティアアクション空間を考慮したaction-aware value headを提案し、グラフベースのPPOを実装する。

4. どうやって有効だと検証した?

R2R-CEおよびRxR-CEベンチマークで広範な実験を行い、提案アーキテクチャの有効性を示し、最先端の性能を達成した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な欠点についての議論は不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、VLN-CEの既存のILパイプライン(behavior cloning, DAgger)や、RLをマイクロアクション空間に直接適用する手法、階層的RL、トポロジカルグラフを用いたナビゲーション手法などが挙げられる。具体的には、VLN-CEのベースラインや、階層的RLの一般的な手法(option frameworkなど)を読むとよい。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shuhao Ye, Sitong Mao, Yuxiang Cui, Yufei Wei, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

分類: cs.RO

原文アブストラクト

Vision-Language Navigation in Continuous Environments (VLN-CE) requires an agent to follow natural language instructions through unseen environments. Existing imitation learning (IL) pipelines struggle in this closed-loop setting: behavior cloning suffers from distribution shift, and DAgger's expert actions become ambiguous upon trajectory deviation. While Reinforcement Learning (RL) offers a natural paradigm to address this, directly applying RL to micro action spaces is sample-inefficient due to reward sparsity. To overcome this bottleneck, we reformulate VLN-CE as a Hierarchical Markov Decision Process (MDP), explicitly decoupling high-level planning from low-level control. By abstracting the environment into a topological graph, our high-level policy operates on a macro action space of frontier nodes, with a training-free low-level controller acting as its state transition, which significantly compresses the decision horizon and makes closed-loop RL tractable. To support RL optimization on the macro MDP, we propose an action-aware value head to effectively evaluate state values under the dynamic frontier action space, powering a graph-based PPO. Extensive experiments demonstrate the effectiveness of our architecture. Finally, our model achieves state-of-the-art performance on the R2R-CE and RxR-CE benchmarks.

関連論文