JEPAとは JEPA(Joint Embedding Predictive Architecture)は、Yann LeCunらが提唱する自己教師あり学習の枠組みです。入力データ(画像や動画)の一部をマスクし、その周辺情報から欠落部分の表現を予測するように学習します。

何が重要か JEPAは、ピクセル単位の再構成ではなく、抽象的な表現空間での予測を行うため、ノイズに強く、高次な特徴を捉えられます。これにより、ロボットが環境を理解し、行動を計画するための基盤となる世界モデルの構築に貢献します。