何が起きたか
2026年7月15日にarXivで公開された論文(識別番号2607.13498v1)において、強化学習のための新しい表現学習手法FaStRが提案された。FaStRは遷移カーネルを状態・行動・次状態の3モードテンソルと捉え、CP分解をノイズ対比目的関数で当てはめることで、状態・行動・次状態の各エンコーダを学習する。
詳細
FaStRは、遷移カーネルを3モードのテンソルとみなし、CP分解により各モードの特徴写像を得る。ノイズ対比目的関数を用いて分解を当てはめ、状態・行動・次状態のエンコーダを生成する。分解形式により仮説クラスが小さくなり、表現学習に必要なサンプルサイズが状態次元と行動次元の小さい方に応じて縮小するとされる。実験では、分解構造に整合する高次元の移動タスクで最大の性能向上が見られ、学習した状態エンコーダはアクチュエータの変更に対してそのまま転移し、行動エンコーダのみ再学習される。
Key Facts
| FaStRは遷移カーネルを3モードテンソルとみなし、CP分解をノイズ対比目的関数で当てはめる。 | [1] |
| 分解形式により仮説クラスが小さくなり、表現学習に必要なサンプルサイズが状態次元と行動次元の小さい方に応じて縮小する。 | [1] |
| 高次元の移動タスクで最大の性能向上が見られた。 | [1] |
| 学習した状態エンコーダはアクチュエータの変更に対してそのまま転移し、行動エンコーダのみ再学習される。 | [1] |
なぜ重要か
FaStRは強化学習の表現学習におけるサンプル効率を向上させる可能性があり、特に高次元の連続制御タスクでの性能向上が期待される。また、状態エンコーダの転移可能性は、実世界のロボットなどで環境変化への適応コストを下げる可能性がある。ただし、研究段階の成果であり、実用化にはさらなる検証が必要である。