何が起きたか

arXivで2026-09-30に公開された論文「JEPA-TTT」は、事前学習済みの行動条件付きJoint-Embedding Predictive Architecture世界モデルの潜在動力学予測器を、テスト時を通じて適応させる手法を報告した。論文によると、自己教師あり更新はエピソードをまたいで蓄積され、視覚エンコーダーと報酬ヘッドは固定されたままである。計画に必要なのは目標画像でもオンライン報酬でもなく、8つの動力学シフト、4つの連続制御環境で性能を評価した。

詳細

JEPA-TTTは、密なリプレイを使って各時間オフセットに予測窓を形成し、それを拡大するバッファに保持したうえで、そこからミニバッチをサンプルして予測器を更新する方式である。論文は、500回のテスト時エピソード後に、自己回帰的な潜在予測誤差を平均83%削減し、凍結したJEPA世界モデル比で計画性能を153%改善したとしている。

Key Facts

論文名は「JEPA-TTT: Persistent Test-Time Training of Latent World Models for Planning under Dynamics Shifts」である。[1]
arXiv掲載日は2026-09-30である。[1]
JEPA-TTTは、事前学習済みの行動条件付きJoint-Embedding Predictive Architecture世界モデルの潜在動力学予測器をテスト時に適応させる。[1]
視覚エンコーダーと報酬ヘッドは固定し、自己教師あり更新はエピソードをまたいで蓄積される。[1]
8つの動力学シフト、4つの連続制御環境で評価し、500回のテスト時エピソード後に予測誤差を83%削減、計画性能を153%改善した。[1]

本紙の見方

この論文の新しさは、世界モデルを一度学習して終わりにせず、テスト時にも潜在動力学予測器だけを継続更新する点にある。視覚エンコーダーと報酬ヘッドを固定したまま、予測器の側だけを自己教師ありで追従させる設計は、表現と報酬の目的を保ちつつ、環境側の変化に適応するための分離構造だと読める。目標画像やオンライン報酬を要しない点も、計画に必要な入力条件を絞り込んでいる。 本紙の関連記事はないため、過去報道との連続性は置けないが、公開情報から見ると論点は「学習済みモデルをどう維持するか」ではなく「運用中にどこまで再適応させるか」に移っている。密なリプレイで時間オフセットごとの予測窓をため込み、拡大するバッファからミニバッチを取る方式は、単発の再学習よりも、エピソードをまたぐ履歴の扱いが中心であることを示す。ここでは、モデル更新の対象を予測器に限定することで、既存表現の崩れを抑えながらズレだけを補正する構造が見える。 業界構造への含意としては、連続制御環境での計画性能が、固定済みの視覚表現よりも、動力学予測の追従性に強く依存する可能性が示された点が大きい。8つの動力学シフトすべてで改善したという結果は、変化の種類が一様でなくても、同じ更新機構で吸収できる余地を示す一方、適応の上限は予測器の更新頻度、バッファの大きさ、そして500エピソードという観測期間に左右されるはずだ。今後確認すべき論点は、より少ないエピソード数で同様の改善が出るか、バッファ設計を変えた場合に誤差削減率がどう変わるか、そして離散的なタスクや実機系の制御でも同じ分離設計が通用するかである。

なぜ重要か

動力学が変わる環境では、事前学習済みの世界モデルをそのまま使うと予測が崩れやすいが、JEPA-TTTは予測器だけをテスト時に更新することで、その弱点への対処法を示した。論文では、8つの動力学シフトで計画性能を改善し、500回のエピソード後に予測誤差を83%削減したとしており、固定表現を残しつつ適応する条件が具体的に示されている。