日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2608.19684v1

階層的スキルポリシーの学習:オフライン品質多様性強化学習によるアプローチ

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

事前収集データから多様で高品質なスキルを抽出し、オンライン学習を強化する統合パイプラインQDOSを提案。アドバンテージ重み付き品質多様性事前学習とデータ再利用戦略により、操作タスクで優れた性能を達成。

詳しい要約

1. どんなもの?

QDOS (Quality-Diversity Offline Skill learning) は、オフラインデータから多様で高品質なスキルを抽出し、オフラインからオンラインへの強化学習を堅牢にする統一パイプラインを提案する。2段階戦略(低レベルポリシーとしてのスキル抽出と、高レベルポリシーの訓練)を採用し、オフラインデータの質に依存しないスキル学習を目指す。

2. 先行研究と比べてどこがすごい?

従来のスキル抽出は、軌跡VAEなどの教師なし学習に依存し、データセットの質に強く影響される。QDOSは、Advantage-Weighted Quality-Diversity事前学習目的を導入し、各軌跡セグメントの推定アドバンテージでスキル抽出と多様性の目的を重み付けすることで、データセットの質に頑健で、多様かつ高価値なスキルを抽出できる点が優れている。

3. 技術・手法の肝は?

QDOSの核心は、Advantage-Weighted Quality-Diversity事前学習目的である。これは、軌跡セグメントの推定アドバンテージを用いて、スキル抽出の目的と多様性の目的を重み付けする。さらに、デュアルデータセット再利用戦略を統合し、オフラインデータをスキル事前学習とオンラインリプレイバッファへの疑似ラベル付けの両方に使用する。

4. どうやって有効だと検証した?

構造化操作タスクと非構造化移動タスクの両方で実験を行い、強力なベースラインと比較してQDOSが有意に優れていることを示した。特に、スパース報酬領域での探索加速と最終リターンの向上を確認した。

5. 議論はある?

要旨からは、QDOSの限界や潜在的な欠点についての議論は不明。ただし、データセットの質への依存を軽減する一方で、アドバンテージ推定の正確性が性能に影響する可能性が考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、軌跡VAEを用いた教師なしスキル抽出、オフラインRL、Quality-Diversityアルゴリズム、オフラインからオンラインへの転移学習に関する論文が挙げられる。具体的には、DIAYN、DADS、CQL、IQLなどが関連するが、要旨に明示されていないため、一般名で示す。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tanachai Anakewat, Takayuki Osa, Tatsuya Harada

分類: cs.AI, cs.LG, cs.RO

原文アブストラクト

Recent studies investigate how to leverage pre-collected datasets to improve the policy performance and sample efficiency of RL. One promising approach to achieve this goal is to employ a two-stage strategy: In the first stage, diverse skills are extracted as a low-level policy from a given dataset, and a high-level policy is trained to solve a specific task in the second stage. Typically, extraction of the low-level policy is performed based on unsupervised learning such as trajectory VAE. However, a limitation of this approach is that the quality of the low-level policy highly depends on the quality of the dataset. To address this issue, we introduce QDOS (Quality-Diversity Offline Skill learning), a unified pipeline for robust offline-to-online learning. Our approach incorporates an Advantage-Weighted Quality-Diversity pretraining objective, which weights the skill extraction and diversity objectives by the estimated advantage of each trajectory segment. This approach allows the model to extract diverse and high-value skills. By providing robust and task-relevant skill representations, QDOS significantly improves the quality of the embedded skill space used by the low-level policy. We further integrate this with a dual dataset reuse strategy, where offline data is used both for skill pretraining and for populating the online replay buffer via pseudo-labeling. Experiments demonstrate that QDOS significantly outperforms strong baselines in structured manipulation tasks and unstructured locomotion tasks, confirming its ability to accelerate exploration and improve final returns in challenging sparse-reward domains.

関連論文