何が起きたか

arXivは2026-10-06、物理的整合性を測る評価基準「World Models' Last Exam in Physics」を公開した。対象は動画世界モデルで、40の統制課題を通じて、力学、光学、流体、熱・相変化、電磁気、表面張力の物理関係を測る。実験では8つの動画生成モデルを1,280本の動画で評価し、最高モデルの総合スコアは100点中57.76点だった。

詳細

このベンチマークは、各課題について初期画像と生成プロンプトを組み合わせ、あらかじめ定めた物理基準に照らして評価する方式である。参照動画に依存せず、観測可能な物理関係を解釈可能に検査できる点を特徴としている。 評価器は、課題の観測可能性をふるい分ける段階と、課題ごとの定量的な物理測定を組み合わせる。著者らは、既知の物理関係を持つ合成動画でも評価し、測定モジュールの妥当性を確かめたとしている。また、評価器は、タスク内順位付けとペア比較の双方で、直接の視覚言語モデル基準より人間判断との一致が高かったとしている。

Key Facts

arXiv論文「World Models' Last Exam in Physics」は2026-10-06に公開された。[1]
ベンチマークは40の統制課題を含み、力学、光学、流体、熱・相変化、電磁気、表面張力を対象とする。[1]
評価対象は8つの動画生成モデル、1,280本の動画である。[1]
最高モデルの総合スコアは100点中57.76点だった。[1]
評価器は課題の観測可能性の確認と、課題別の定量的物理測定を組み合わせる。[1]

本紙の見方

この論文の新しさは、動画世界モデルを「見た目の自然さ」ではなく、観測可能な物理量で測ろうとした点にある。40課題という広さも重要だが、主眼は課題数そのものより、力学や流体だけでなく、光学、熱・相変化、電磁気、表面張力まで含めて、単一の印象評価ではなく測定ベースの診断枠組みを作ったことにある。一方で、1,280本の動画を使っても最高スコアが57.76点にとどまっており、現在の動画生成モデルが物理一貫性を安定して保てていないことを示す材料になっている。 本紙の過去報道はないため連続性の確認はできないが、今回の論文は、世界モデルの評価が「参照動画ありき」か「モデルの主観評価」に寄りがちだった流れに対して、測定可能な物理関係へ寄せ直す提案だと読める。ここでの変化は、生成結果の美しさや説得力ではなく、初期画像と生成結果のあいだにある物理法則の保持を、課題ごとの数値で切り分ける点にある。これは、動画生成モデルをエンボディドAIの予測・計画に使う際、どの物理領域で破綻しやすいかを特定する設計に直結する。 業界構造への含意としては、モデルの優劣が単一スコアではなく、物理領域ごとの弱点で見えるようになる可能性がある。すると、開発側は学習データの追加だけでなく、どの現象を重点的に補強するかを判断しやすくなる一方、評価側には参照動画に頼らない検証手法が求められる。合成動画で測定モジュールの妥当性を確認した点は、実世界データが取りにくい領域でも評価設計を組める可能性を示すが、現時点では合成条件での有効性がそのまま実世界の複雑な動画に通用するかは未確定である。 未確定の論点は、各40課題の配点や重み付けが実運用上どのように効くか、8モデル間の差がどの物理領域で大きかったか、そしてこのベンチマークが今後の動画世界モデルの学習や選別にどこまで使われるかである。人間判断との一致が高いとされる評価器も、どの条件で崩れるかは追加検証が必要だとみられる。

なぜ重要か

動画世界モデルをエンボディドAIの予測や計画に使う場合、見た目の整合性だけでは不十分であることを、arXiv論文は40課題・1,280本の評価結果として示した。物理領域ごとの不整合が残る以上、開発側は「どの現象をどの精度で通すか」を明示しないと、応用範囲を判断しにくい。 評価器が参照動画に依存せず、観測可能な物理関係を測る設計になっているため、今後は動画生成モデルの比較軸が主観評価から測定評価へ移る可能性がある。