日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2609.35615

品質多様性のための行動基盤モデル

Behavioral Foundation Models for Quality Diversity

シェア:XThreadsFacebookLINEはてブBluesky

行動基盤モデル(BFM)の潜在行動空間を探索空間として品質多様性(QD)探索を行うBFM-QDを提案し、密な移動・疎なナビゲーション・接触の多い操作で従来のパラメータ空間ベース手法を上回ることを示した。

詳しい要約

1. どんなもの?

- Behavioral Foundation Models (BFMs) の潜在行動空間を Quality-Diversity (QD) の探索空間として用いる枠組み BFM-QD を提案する研究。 - BFM は強化学習における大規模言語モデルに相当する新興パラダイムで、潜在空間の構造を活用し zero-shot 性能や高速模倣、オンライン適応を可能にする。 - 本研究は BFM の潜在行動空間が、行動的に多様で高性能なポリシー群を QD で発見するための有効な探索空間になるかを検証する。

2. 先行研究と比べてどこがすごい?

- 従来の QD 手法は高次元のポリシーパラメータ空間を直接探索するのに対し、BFM-QD は BFM のコンパクトな潜在空間で探索する。 - パラメータ空間ベースラインと比較して、dense locomotion、sparse navigation、contact-rich manipulation の連続制御ベンチマークで一貫して優位。 - 特に sparse および deceptive な設定では、テストした全てのパラメータ空間 QD 手法がほぼゼロ性能に崩壊する一方、BFM-QD は顕著な性能向上を示す。

3. 技術・手法の肝は?

- BFM が誘導する潜在行動空間を QD の探索空間として利用する BFM-QD フレームワークを提示。 - BFM-QD は、critic の訓練も backpropagation も不要で、ポリシー勾配更新を近似する閉形式の勾配フリーなポリシー改善演算子を提供する。 - 探索空間の次元削減と、多様な行動データからのオフライン事前学習の相乗効果を活用する。

4. どうやって有効だと検証した?

- dense locomotion、sparse navigation、contact-rich manipulation を含む連続制御ベンチマークで評価。 - BFM-QD はパラメータ空間ベースラインを一貫して上回り、特に sparse および deceptive 設定で大きな利得を示した。 - パラメータ空間 QD 手法はこれらの設定でほぼゼロ性能に崩壊したことが報告されている。

5. 議論はある?

- 結果は BFM-QD の有効性を示し、探索空間の次元削減と多様な行動データからのオフライン事前学習の相乗効果によるものと論じている。 - BFM を QD 最適化の汎用バックボーンとして位置づけ、zero-shot タスク解決を超えて多様な行動レパートリーの発見へとその有用性を拡張する。 - 具体的な限界や今後の課題については要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照・比較されている研究: Quality-Diversity (QD) 手法、Behavioral Foundation Models (BFMs)。 - 関連手法: パラメータ空間 QD ベースライン、ポリシー勾配更新、critic 訓練、backpropagation。 - 同分野の定番: 強化学習における foundation models、zero-shot ポリシー、模倣学習、オンライン適応に関する研究。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Nazim Bendib, Nicolas Perrin-Gilbert, Olivier Sigaud

分類: cs.LG, cs.AI

原文アブストラクト

Behavioral Foundation Models (BFMs) are an emerging paradigm in reinforcement learning, playing a role analogous to large language models in natural language processing: they have shown remarkable versatility, enabling zero-shot performance, fast imitation, and online adaptation, all by exploiting the structure of a latent space. In this work, we investigate whether the latent behavioral space induced by BFMs can serve as an effective search space to discover large repertoires of behaviorally diverse and high-performing policies through Quality-Diversity (QD) methods. While QD methods generally search directly in high-dimensional policy parameter space, in this paper, we present BFM-QD, a framework that performs QD search in the compact latent space of a BFM. We further show that the BFM-QD framework provides a closed-form, gradient-free policy improvement operator that approximates a policy gradient update, but requires no critic training and no backpropagation. Across continuous-control benchmarks spanning dense locomotion, sparse navigation, and contact-rich manipulation, BFM-QD consistently outperforms parameter-space baselines, with particularly stark gains in sparse and deceptive settings, where all tested parameter-space QD methods collapse to near-zero performance. These results show the effectiveness of the BFM-QD framework, benefiting from the synergy between dimensionality reduction of the search space and offline pretraining from diverse behavioral data. This positions BFMs as a general-purpose backbone for QD optimization, extending their utility beyond zero-shot task solving to the discovery of diverse behavioral repertoires.

関連論文

PR本紙発行元 EmplifAI