何が起きたか
2026年8月17日にarXivに公開された論文(ID: 2608.16829v1)で、CaliBenchと呼ばれる新しいベンチマークが提案された。CaliBenchは、ビデオワールドモデルが生成する物理的結果の確率分布が、既知の参照分布とどれだけ一致しているかを、物理的に解釈可能な離散空間(ビンのインデックス、サイコロの目、スート、色など)で直接測定する。評価では、9つのシーンと6つの画像-to-ビデオモデル(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super)を対象に、各モデル32世代ずつ生成して較正をテストした。
詳細
CaliBenchは、既存のベンチマークが個々の生成をスコアリングするか、データセット全体で分布を粗く比較するのに対し、特定の現象の細かいアレータリック不確実性をテストする。参照分布が閉形式で既知の結果空間(二項ガルトンボード、ベルヌーイ分岐、一様なサイコロ/カード/宝くじ、歪んだヨーロピアンルーレットの色)を厳選し、正確な較正テストを可能にしている。性能は、スコアリング可能性(スコアリング可能な結果を生成する割合)と較正(参照分布からの全変動距離)の2つの直交軸に分解される。カイ二乗検定で有意性を評価するが、較正が帰無仮説であるため、誤較正のみを立証でき、セルあたりN=32では大きな偏差のみを検出する。結果として、モデルは参照分布を再現するよりも、少数の結果に確率質量を集中させることが一貫して観察された。多くのシーン-モデル組み合わせで有意な誤較正が見られ、極端な場合にはVeo 3.1がサイコロで単一の結果に崩壊した。ルーレットでは、生成された映像でボールの位置が曖昧なまま残ることが多く、複数のモデルでスコアリング可能性が低くなった。性能はシーンによって異なり、9つのシーンすべてで優位なモデルはなかった。
Key Facts
| CaliBenchは、ビデオワールドモデルの生成する物理的結果の確率分布を、物理的に解釈可能な離散空間(ビンのインデックス、サイコロの目、スート、色など)で評価するベンチマークである。 | [1] |
| CaliBenchは、参照分布が閉形式で既知の結果空間(二項ガルトンボード、ベルヌーイ分岐、一様なサイコロ/カード/宝くじ、歪んだヨーロピアンルーレットの色)を使用する。 | [1] |
| 性能は、スコアリング可能性(スコアリング可能な結果を生成する割合)と較正(参照分布からの全変動距離)の2つの軸に分解される。 | [1] |
| カイ二乗検定で有意性を評価し、較正が帰無仮説であるため、誤較正のみを立証できる。 | [1] |
| 評価は9つのシーンと6つの画像-to-ビデオモデル(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super)を対象に、各モデル32世代ずつ行われた。 | [1] |
| モデルは一貫して、参照分布を再現するよりも少数の結果に確率質量を集中させた。 | [1] |
| 多くのシーン-モデル組み合わせで有意な誤較正が見られ、極端な場合にはVeo 3.1がサイコロで単一の結果に崩壊した。 | [1] |
| ルーレットでは、生成された映像でボールの位置が曖昧なまま残ることが多く、複数のモデルでスコアリング可能性が低くなった。 | [1] |
| 性能はシーンによって異なり、9つのシーンすべてで優位なモデルはなかった。 | [1] |
| CaliBenchは、新しいモデルを比較するためのプロトコルとメトリック(平均正規化全変動、mnTV)を公開している。 | [1] |
なぜ重要か
CaliBenchは、ビデオワールドモデルの物理的較正を評価する新しい手法を提供し、既存のベンチマークでは捉えられない細かい不確実性をテストする。この結果は、物理シミュレーションやロボティクスなどの応用において、モデルの信頼性を評価する上で重要である。