何が起きたか
2025年10月7日にarXivで公開された論文(識別番号2510.06203v3)において、Reference-Grounded Skill Discovery (RGSD)と呼ばれる新しい教師なしスキル発見アルゴリズムが提案された。RGSDは、参照データを用いて意味的に意味のある潜在空間にスキル発見を接地する手法で、359次元の観測と69次元の行動を持つシミュレーション上のSMPLヒューマノイドで、歩行、走行、パンチ、サイドステップなどのスキルの模倣と、それらの行動のバリエーションの発見に成功したと報告されている。
詳細
高次元エージェントへの教師なしスキル発見アルゴリズムのスケーリングは困難であり、次元が増加すると探索空間は指数関数的に成長する一方、意味のあるスキルの多様体は限られている。そのため、高次元空間での探索を効果的に導くには意味的な有意性が不可欠とされる。RGSDは、まず対照事前学習を用いて動作を単位超球面上に埋め込み、各参照軌跡を異なる方向にクラスタリングする。この接地により、スキル発見は参照行動の模倣と、意味的に関連する多様な行動の発見を同時に行うことができる。 下流の移動タスクでは、RGSDは発見したスキルを活用してユーザー指定のスタイルコマンドを忠実に満たし、スタイルの維持に失敗することが多い模倣学習ベースラインを上回る性能を示したとされる。
Key Facts
| RGSDは参照データを用いて意味的に意味のある潜在空間にスキル発見を接地する新しいアルゴリズムである。 | [1] |
| RGSDは対照事前学習を用いて動作を単位超球面上に埋め込み、各参照軌跡を異なる方向にクラスタリングする。 | [1] |
| シミュレーション上のSMPLヒューマノイドは359次元の観測と69次元の行動を持つ。 | [1] |
| RGSDは歩行、走行、パンチ、サイドステップなどのスキルの模倣に成功した。 | [1] |
| RGSDは参照行動の模倣と意味的に関連する多様な行動の発見を同時に行う。 | [1] |
| 下流の移動タスクで、RGSDはユーザー指定のスタイルコマンドを忠実に満たし、模倣学習ベースラインを上回る性能を示した。 | [1] |
| 模倣学習ベースラインはスタイルの維持に失敗することが多いとされる。 | [1] |
なぜ重要か
高次元エージェントにおける教師なしスキル発見の課題に対し、参照データを活用した接地という新しいアプローチを示した点で意義がある。模倣と多様な行動発見を両立させることで、ロボットの移動タスクなどでの応用が期待される。