何が起きたか

arXivに2026年10月5日に掲載された論文「Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object」は、V-JEPA 2の凍結した予測器が、見えない物体について何を保持するかを検証した。著者らは隠した物体を含む2つの世界を比べ、予測器の出力とエンコーダー表現の差を測定した。結果として、予測器は静止物体の一部は保つが、容器に入った物体は保持せず、移動物体は0.3秒で失う傾向が確認された。

詳細

論文では、予測器の保持はV-JEPA自身のtube mask条件では0.5秒に延びるが、ViT-Hは事前学習の90%マスキング比率で1.1秒まで持ちこたえたとされる。投影上の痕跡は、最後の視界をコピーするベースラインが保つ量の14〜60%で、中間値を下回った。 一方、エンコーダー側は物体の存在を1.00で読み取り、閉じた容器の内容を3.5秒読み出せた。予測器の出力をエンコーダー自身のプローブで読んだ場合、箱が閉じてから0.5秒後の場面ではボールが2%のシーンにしか現れなかった。合成容器に対して予測器のみで3,000ステップ学習すると、永続性の信念は0.05から1.00へ変化したが、同じくIntPhys-2019の精度は84.2%から93.3%に上昇した。論文は、コンテナなしのカリキュラムでも同程度の改善が起きたとして、評価規則によってベンチマークがどの学習習慣に報いるかが変わると述べている。

Key Facts

論文タイトルは「Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object」である。[1]
掲載日は2026-10-05である。[1]
著者らは、凍結したV-JEPA 2予測器を用いて、隠した物体のある2つの世界の予測を比較した。[1]
予測器は静止物体の一部を保持する一方、容器内の物体は保持せず、移動物体は0.3秒で失う傾向を示した。[1]
エンコーダーは物体の存在を1.00で読み取り、閉じた容器の内容を3.5秒読み出せた。[1]

本紙の見方

この論文の新しさは、動画世界モデルが「見えている対象を追う」ことと「見えていない対象の永続性を保つ」ことを分けて測った点にある。単なる認識精度ではなく、隠れた物体、容器、移動物体という条件を分け、予測器とエンコーダーで役割が違うことを示している。一方で、予測器のみの3,000ステップ学習で永続性の振る舞いが0.05から1.00まで変わったという記述は、欠陥が構造的に固定されているのではなく、学習の置き方で後から付与されうることを示す。 本紙の過去記事はないため直接の連続報道はないが、論文内の比較はV-JEPA 2、ViT-H、VideoMAE、Cosmosという複数系統に及ぶ。ここから読めるのは、モデル間の優劣というより、予測器・エンコーダー・マスキング条件・訓練カリキュラム・評価指標の組み合わせで、同じ「保持」の見え方が大きく変わる構造である。特に、V-JEPA自身のtube maskでは0.5秒まで伸びる一方、ViT-Hは1.1秒、さらに継続学習で1.1〜1.6秒の持続が出るため、保持性能を単一の数字で語るのは危うい。 業界構造への含意は、動画世界モデルの評価が「隠れた物体をどれだけ内部表現に残すか」という記憶の問題と、「予測結果として外にどう出るか」という出力の問題に分かれる点にある。容器内の内容がエンコーダーでは3.5秒読めるのに、予測器側の出力を読むと0.5秒後に2%しか残らないのであれば、学習済み表現の有無だけでは実運用上の挙動を判断しにくい。さらに、IntPhys-2019の84.2%から93.3%への改善が容器あり・なしのどちらの学習習慣でも起きるとされる以上、ベンチマークのスコアがどの能力を測っているのかを再点検する必要がある。 未確定の論点は、予測器のみの学習で得られた永続性が、どのデータセットや動画条件まで一般化するかである。また、0.3秒、0.5秒、1.1秒、1.1〜1.6秒という持続時間が、どの評価設定で再現されるか、そしてIntPhys-2019の改善が実使用上の理解や操作にどうつながるかは、この論文だけではなお限定的である。

なぜ重要か

この論文は、動画世界モデルの性能を「見える物体の追跡」と「見えない物体の保持」に分けて見ないと、モデルの実力を取り違える可能性があることを示している。V-JEPA 2、ViT-H、VideoMAE、Cosmosの比較が示すのは、同じモデル系でもマスキングや学習継続の条件で結果が変わることであり、評価設計そのものが重要になるという点である。