何が起きたか

2026年5月31日にarXivで公開された論文「BRo-JEPA: Learning Modular Transformations in Latent Space」において、研究チームはJEPA(Joint Embedding Predictive Architecture)型世界モデルにブロック回転予測器を導入し、モジュラー演算を潜在空間の回転として学習する手法を提案した。MNISTで99.44%、EMNISTで94.35%のゼロショット精度を達成し、未学習の演算への汎化を示した。

詳細

論文では、MNIST(またはEMNISTの文字)を状態、モジュラー演算をアクションとする世界モデルを構築。標準的な教師あり学習とJEPAベースラインは、学習済みの演算では高い精度を示すが、未学習の演算への外挿に失敗する。提案手法BRo-JEPAは、演算を回転として表現し、潜在空間にモジュラー構造を埋め込むことで、ゼロショットの演算汎化を可能にする。最良のブロック回転教師ありベースラインはMNISTで54.54%、EMNISTで25.13%のゼロショット精度だったのに対し、BRo-JEPAはResNet-18エンコーダを用いてそれぞれ99.44%、94.35%を達成。訓練は基本演算±1のみで行われる。コードはGitHubで公開されている。

Key Facts

BRo-JEPAはMNISTで99.44%、EMNISTで94.35%のゼロショット精度を達成した。[1]
最良のブロック回転教師ありベースラインはMNISTで54.54%、EMNISTで25.13%のゼロショット精度だった。[1]
BRo-JEPAはResNet-18エンコーダを使用し、基本演算±1のみで訓練された。[1]
論文は2026年5月31日にarXivで公開された。[1]
コードはGitHubで公開されている。[1]

本紙の見方

今回の研究は、世界モデルが代数規則を学習できる可能性を示す点で新規性が高い。従来のJEPAは視覚入力の予測に焦点を当ててきたが、BRo-JEPAはアクションを潜在空間の回転として表現することで、モジュラー演算の巡回構造を学習し、未学習の演算へのゼロショット汎化を実現した。これは、世界モデルが単なるパターン適合ではなく、抽象的な規則を潜在表現に埋め込む能力を持つことを示唆する。 本紙の過去報道との接続はないが、この結果は世界モデルの設計原理に一石を投じる。従来の教師あり学習では演算の埋め込みを学習しても外挿が困難だったのに対し、回転という幾何学的構造を導入することで汎化が劇的に向上した。これは、潜在空間の構造がモデルの汎化性能に決定的な影響を与えることを示しており、世界モデルの設計における重要な指針となる。 業界構造への含意としては、ロボティクスやシミュレーション環境での世界モデル活用が進む中、アクションの表現方法がモデルの能力を左右する可能性がある。特に、物理的な操作を回転や並進などの幾何学的変換として捉えることで、未経験の状況への適応が向上するかもしれない。ただし、本研究はMNISTという単純な画像データに限定されており、実世界の複雑な環境での有効性は未検証である。 未確定の論点として、まず、より複雑なデータセットや実世界のセンサーデータでの性能が挙げられる。また、回転表現が他の代数構造(群や環など)に一般化できるかも焦点となる。さらに、訓練に使用する基本演算の種類や数がゼロショット精度に与える影響も検討が必要だ。

なぜ重要か

この研究は、世界モデルが潜在空間の構造を通じて抽象的な規則を学習できることを示し、AIの汎化能力向上に寄与する可能性がある。特に、ロボティクスや自動運転など、環境のダイナミクスを予測する必要がある分野での応用が期待される。