何が起きたか
arXiv掲載の論文「H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning」は、階層型のaction-conditioned JEPAを端から端まで学習する手法を示した。上位層が目標への進捗を最適化し、各層の予測を下位層のサブゴールとして使うトップダウン型の計画を採る。論文は2026-10-05に公開された。
詳細
論文は、既存のtask-agnostic JEPA world modelsが単一の時間尺度、または共有潜在空間内の複数ホライズンで予測・計画していたのに対し、H-JEPAでは各層がそれぞれ別の学習済み潜在空間でより遠い未来を予測すると説明している。データ内の要因が異なる時間尺度で変化する場合、上位層は速く予測困難な細部を捨て、より遅く変化するタスク関連状態を保持するとしている。 評価は4つのシミュレーション環境で行われ、階層型計画はフラットなJEPAを上回った。Visual AntMazeでは3層階層により成功率が18%から73%に上昇し、プランナー計算量はより少なくて済んだ。さらに、inverse-dynamics supervisionを用いることで、DROIDの多様な実ロボット動画に拡張し、階層化によりオフライン計画の忠実度が高まり、プランナー計算量も下がった。
Key Facts
| H-JEPAは階層化したaction-conditioned JEPAをエンドツーエンドで学習する手法である。 | [1] |
| 計画はトップダウンで進み、上位層が目標への進捗を最適化し、その予測が下位層のサブゴールになる。 | [1] |
| 論文は2026-10-05にarXivで公開された。 | [1] |
| Visual AntMazeでは3層階層の成功率が18%から73%に上昇した。 | [1] |
| DROIDの実ロボット動画では、inverse-dynamics supervisionを用いて階層的手法を拡張し、オフライン計画の忠実度が向上した。 | [1] |
本紙の見方
H-JEPAの新規性は、JEPA系の世界モデルを単に長い予測に使うのではなく、時間尺度ごとに役割を分けた階層へ分解し、そのまま計画までつなげた点にある。既存の単層型、あるいは共有潜在空間で複数ホライズンを扱う設計に対し、本論文は上位層が遅い状態だけを残し、下位層が細部を補う構造を明示した。ここで重要なのは、性能向上が単なるモデル容量の増加ではなく、時間分解と目標表現の分離に帰されていることである。 本紙の見方では、この論文は「予測精度の改善」よりも「計画計算の配分」を前面に出している。Visual AntMazeで成功率が18%から73%に上がったことは大きいが、同時に「less planner compute」と明記されている点が構造的だ。つまり、上位で粗い目標を決め、下位で実行可能性を詰める分業が、探索の無駄を減らす設計として働いていると読める。DROIDでinverse-dynamics supervisionを使って実ロボット動画へ広げた点も、単なるシミュレーション専用の手法ではなく、行動と映像の整合を学習に取り込む方向を示す。 一方で、論文が示したのは4つのシミュレーション環境とDROIDの動画ベース評価であり、実機での長期タスク成功率、学習データ量、階層数の一般化条件までは確定していない。特に、3層がVisual AntMazeで有効だったことは分かるが、層を増やせば常に良いのか、あるいは環境ごとに最適な深さが変わるのかは未確定である。今後は、実世界でのタスク長、計算量削減の実測、inverse-dynamics supervisionが必要な条件、そしてサブゴールがどの程度人間可読かが焦点になる。
なぜ重要か
Visual AntMazeで成功率が18%から73%に上がったという結果は、長い地平の視覚計画で階層分解が効く可能性を示す。DROIDの実ロボット動画にも広がるため、単なるシミュレーション内の改善ではなく、映像から行動をつなぐ学習設計として意味がある。