日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2610.05087

方向条件付き方策によるオンライン目標条件付き強化学習

Direction-Conditioned Policies for Online Goal-Conditioned Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

コントラスティブ強化学習の批評家が持つ表現空間の幾何学を直接活用するため、方策を方向と距離で条件付ける手法を提案し、ナビゲーションとマニピュレーションで成功率を向上させた。

詳しい要約

1. どんなもの?

- オンラインのGoal-Conditioned Reinforcement Learning (GCRL) における新しいポリシー学習手法。 - Contrastive Reinforcement Learning (CRL) を基盤とし、ポリシーを生のゴールではなく、表現空間における方向と距離で条件付ける。 - 訓練中は訪問済み状態をwaypointとして選択し、その方向と距離をポリシーの条件とする。 - 展開時は最終ゴールに同じインターフェースを直接適用し、waypoint選択やプランニングを必要としない。

2. 先行研究と比べてどこがすごい?

- CRLはゴール到達可能性を推定する表現を学習するが、ポリシーは生のゴールに条件付けられ、criticがエンコードした幾何を直接活用していなかった。 - DCPはCRLに小さな変更を加えるだけで、表現空間の方向と距離をポリシー条件に利用する。 - 9つのナビゲーションとマニピュレーションタスクで、DCPは7タスクでCRLより高い最終成功率、7タスクでより長くゴール近くに滞在することを示した。 - 制御された迷路実験では、DCPが最短経路幾何をより正確に捉え、与えられた方向がactorの行動に因果的に影響することを示した。

3. 技術・手法の肝は?

- CRLのcriticが学習する表現空間を利用し、ポリシーをゴールそのものではなく、waypointへの方向と距離で条件付ける。 - オンライン訓練中に訪問済み状態からwaypointを選択し、その表現空間での方向と距離をポリシー入力とする。 - 展開時は最終ゴールに対して同じ方向・距離インターフェースを適用し、追加のプランニングを不要にする。 - waypointのカバレッジとランキングが探索の制限要因であることを特定し、学習された候補生成が2つの制御迷路でゴール到達を改善することを示す。

4. どうやって有効だと検証した?

- 9つのナビゲーションとマニピュレーションタスクでCRLと比較し、7タスクで最終成功率が高く、7タスクでゴール近くに滞在する時間が長いことを示した。 - 制御された迷路実験で、DCPが最短経路幾何をより正確に捉えること、供給された方向がactorの行動に因果的に影響することを検証した。 - waypointのカバレッジとランキングが探索の限界であることを特定し、学習された候補生成が2つの制御迷路でゴール到達を改善することを示した。

5. 議論はある?

- waypointのカバレッジとランキングが探索の制限要因であると指摘。 - 学習された候補生成が2つの制御迷路でゴール到達を改善することを示し、この制限に対処できる可能性を示唆。 - その他の議論や限界については要旨からは不明。

6. 次に読むべき論文は?

- Contrastive Reinforcement Learning (CRL) - Goal-Conditioned Reinforcement Learning (GCRL) の関連手法 - 要旨で参照されている具体的な論文は不明だが、CRLとGCRLの定番手法が次に読むべき候補。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: S K Swaminathan, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan, Aritra Hazra

分類: cs.LG, cs.AI, cs.RO

原文アブストラクト

Contrastive Reinforcement Learning (CRL) learns representations that estimate goal reachability, yet its policy remains conditioned on raw goals and therefore does not directly exploit the geometry encoded by its critic. We introduce Direction-Conditioned Policies (DCP), a method built around a small modification to CRL: DCP selects previously visited states as waypoints during online training and conditions the policy on their direction and distance in representation space. At deployment, DCP applies the same interface directly to the final goal, requiring neither waypoint selection nor planning. Across nine navigation and manipulation tasks, DCP attains higher final success rates than CRL on seven tasks and spends more time near the goal on seven. Controlled maze experiments further show that DCP captures shortest-path geometry more accurately and that the supplied direction causally influences the actor's behavior. We identify waypoint coverage and ranking as limits to exploration, and show that learned candidate generation improves goal reaching in two controlled mazes.

関連論文

PR本紙発行元 EmplifAI