何が起きたか
2025年10月1日にarXivで公開された論文『TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning』において、研究者らはTD-JEPAを発表した。TD-JEPAは、TD学習に基づく潜在予測表現を教師なし強化学習に活用する手法で、明示的な状態エンコーダとタスクエンコーダ、ポリシー条件付き多段予測器、潜在空間で直接パラメータ化されたポリシー群を訓練する。これにより、テスト時に任意の報酬関数をゼロショットで最適化できるとしている。
詳細
強化学習における潜在予測(エージェントが自身の潜在表現を予測することで学習する手法)は、報酬ベースおよび教師なしRL、行動クローニング、世界モデルなど様々な設定で補助損失として研究されてきた。しかし既存手法は単一タスク学習、一段予測、またはオンポリシーの軌跡データに限定されることが多かった。 TD-JEPAは、TD学習を用いることで、オフラインの報酬なし遷移データから複数ポリシーにわたる長期的な潜在ダイナミクスを予測する表現を学習できることを示す。理論的には、理想化されたTD-JEPAは適切な初期化で崩壊を回避し、長期的なポリシーダイナミクスの低ランク因子分解を捉えるエンコーダを学習し、予測器は潜在空間で後続特徴を回復するとしている。 実験では、ExoRLとOGBenchの13のデータセットにおける移動、ナビゲーション、操作タスクで、TD-JEPAは最先端のベースラインに匹敵またはそれを上回る性能を示し、特にピクセルからのゼロショットRLという困難な設定で優れていると報告されている。
Key Facts
| 論文『TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning』がarXivで2025年10月1日に公開された。 | [1] |
| TD-JEPAはTD学習に基づく潜在予測表現を教師なし強化学習に活用する。 | [1] |
| TD-JEPAは明示的な状態エンコーダとタスクエンコーダ、ポリシー条件付き多段予測器、潜在空間で直接パラメータ化されたポリシー群を訓練する。 | [1] |
| TD-JEPAはテスト時に任意の報酬関数をゼロショットで最適化できるとしている。 | [1] |
| 理論的に、理想化されたTD-JEPAは適切な初期化で崩壊を回避し、長期的なポリシーダイナミクスの低ランク因子分解を捉えるエンコーダを学習する。 | [1] |
| 予測器は潜在空間で後続特徴を回復するとしている。 | [1] |
| 実験では、ExoRLとOGBenchの13のデータセットにおける移動、ナビゲーション、操作タスクで、TD-JEPAは最先端のベースラインに匹敵またはそれを上回る性能を示した。 | [1] |
| 特にピクセルからのゼロショットRLという困難な設定で優れていると報告されている。 | [1] |
なぜ重要か
TD-JEPAは、オフラインの報酬なしデータから複数ポリシーにわたる長期的な潜在ダイナミクスを学習できることを示し、ゼロショットRLの可能性を広げる。既存手法の限界を克服し、理論的裏付けと実験的検証を伴う点で、強化学習の表現学習に新たな方向性を提示する。