何が起きたか

2026年8月17日にarXivに公開された論文(ID: 2608.16829v1)で、CaliBenchと呼ばれる新しいベンチマークが提案された。CaliBenchは、ビデオワールドモデルが生成する物理的結果の確率分布が、既知の参照分布とどれだけ一致しているかを、物理的に解釈可能な離散空間(ビンのインデックス、サイコロの目、スート、色など)で直接測定する。評価では、9つのシーンと6つの画像-to-ビデオモデル(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super)を対象に、各モデル32世代ずつ生成して較正をテストした。

詳細

CaliBenchは、既存のベンチマークが個々の生成をスコアリングするか、データセット全体で分布を粗く比較するのに対し、特定の現象の細かいアレータリック不確実性をテストする。参照分布が閉形式で既知の結果空間(二項ガルトンボード、ベルヌーイ分岐、一様なサイコロ/カード/宝くじ、歪んだヨーロピアンルーレットの色)を厳選し、正確な較正テストを可能にしている。性能は、スコアリング可能性(スコアリング可能な結果を生成する割合)と較正(参照分布からの全変動距離)の2つの直交軸に分解される。カイ二乗検定で有意性を評価するが、較正が帰無仮説であるため、誤較正のみを立証でき、セルあたりN=32では大きな偏差のみを検出する。結果として、モデルは参照分布を再現するよりも、少数の結果に確率質量を集中させることが一貫して観察された。多くのシーン-モデル組み合わせで有意な誤較正が見られ、極端な場合にはVeo 3.1がサイコロで単一の結果に崩壊した。ルーレットでは、生成された映像でボールの位置が曖昧なまま残ることが多く、複数のモデルでスコアリング可能性が低くなった。性能はシーンによって異なり、9つのシーンすべてで優位なモデルはなかった。

Key Facts

CaliBenchは、ビデオワールドモデルの生成する物理的結果の確率分布を、物理的に解釈可能な離散空間(ビンのインデックス、サイコロの目、スート、色など)で評価するベンチマークである。[1]
CaliBenchは、参照分布が閉形式で既知の結果空間(二項ガルトンボード、ベルヌーイ分岐、一様なサイコロ/カード/宝くじ、歪んだヨーロピアンルーレットの色)を使用する。[1]
性能は、スコアリング可能性(スコアリング可能な結果を生成する割合)と較正(参照分布からの全変動距離)の2つの軸に分解される。[1]
カイ二乗検定で有意性を評価し、較正が帰無仮説であるため、誤較正のみを立証できる。[1]
評価は9つのシーンと6つの画像-to-ビデオモデル(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super)を対象に、各モデル32世代ずつ行われた。[1]
モデルは一貫して、参照分布を再現するよりも少数の結果に確率質量を集中させた。[1]
多くのシーン-モデル組み合わせで有意な誤較正が見られ、極端な場合にはVeo 3.1がサイコロで単一の結果に崩壊した。[1]
ルーレットでは、生成された映像でボールの位置が曖昧なまま残ることが多く、複数のモデルでスコアリング可能性が低くなった。[1]
性能はシーンによって異なり、9つのシーンすべてで優位なモデルはなかった。[1]
CaliBenchは、新しいモデルを比較するためのプロトコルとメトリック(平均正規化全変動、mnTV)を公開している。[1]

なぜ重要か

CaliBenchは、ビデオワールドモデルの物理的較正を評価する新しい手法を提供し、既存のベンチマークでは捉えられない細かい不確実性をテストする。この結果は、物理シミュレーションやロボティクスなどの応用において、モデルの信頼性を評価する上で重要である。