日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
評価ベンチマークarXiv:2608.16829

CaliBench: ビデオ世界モデルの確率的ダイナミクスは物理的に較正されているか?

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

シェア:XThreadsFacebookLINEはてブBluesky

ビデオ世界モデルの生成結果が物理現象の不確実性を正しく再現しているかを評価するベンチマークCaliBenchを提案し、複数のモデルで較正のずれを検出した。

詳しい要約

1. どんなもの?

CaliBenchは、ビデオワールドモデルの生成する確率的ダイナミクスが物理的に較正されているかを評価するベンチマークである。既存の評価指標は個々の生成結果をスコア化するか、データセット全体で分布を粗く比較するが、特定の現象の細かいアレータリック不確実性をテストしていない。CaliBenchは、ビンインデックス、ダイスの面、スート、色などの物理的に解釈可能な離散空間で結果をスコア化し、既知の参照分布からの距離を直接測定する。閉形式で参照が既知の結果空間(二項ガルトンボード、ベルヌーイ分岐、一様なダイス/カード/宝くじ、歪んだヨーロピアンルーレットの色)をキュレーションし、正確な較正テストを可能にする。

2. 先行研究と比べてどこがすごい?

既存のベンチマークは、FIDのような学習された特徴空間で分布を比較するため、物理的意味が不明瞭で、特定の現象の不確実性を評価できない。CaliBenchは、物理的に解釈可能な離散空間で結果をスコア化し、既知の参照分布との距離を直接測定するため、較正を正確にテストできる。また、単一の精度指標が混同するスコア可能性と較正を直交する2軸に分解する点が新しい。

3. 技術・手法の肝は?

CaliBenchは、結果を物理的に解釈可能な離散空間(例:ビンインデックス、ダイスの面)でスコア化する。参照分布が閉形式で既知の結果空間をキュレーションする。性能を2つの直交軸に分解する:スコア可能性(スコア可能な結果を生成する割合)と較正(参照分布からの総変動距離)。カイ二乗検定で有意性を評価する。較正が帰無仮説であるため、誤較正のみを検出でき、N=32では大きな偏差のみを検出する。

4. どうやって有効だと検証した?

9つのシーンと6つの画像からビデオへのモデル(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super)を各32世代で評価した。モデルは参照分布を再現するのではなく、少数の結果に確率質量を集中させることが一貫して観察された。ほとんどのシーンとモデルの組み合わせで有意な誤較正が検出され、極端な場合にはVeo 3.1がダイスで1つの結果に崩壊した。ルーレットでは、生成がボールを曖昧に配置することが多く、いくつかのモデルでスコア可能性が低かった。シーンによって性能は異なり、全9シーンで支配的なモデルはなかった。

5. 議論はある?

要旨からは、CaliBenchの限界として、カイ二乗検定が較正を帰無仮説とするため誤較正のみを検出でき、N=32では大きな偏差しか検出できないことが挙げられる。また、スコア可能性が低い場合、較正の評価が困難になる可能性がある。モデルが少数の結果に集中する傾向は、物理的較正の欠如を示すが、その原因(モデルアーキテクチャ、学習データなど)については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、ビデオワールドモデルの評価に関する既存のベンチマーク(例:FIDを用いた分布比較)や、確率モデルの較正に関する研究(例:予測区間の較正)が関連する。具体的には、FIDを導入した論文や、生成モデルの不確実性評価に関する論文が次に読むべき候補である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke

分類: cs.LG, cs.AI

原文アブストラクト

Video world models approximate the stochastic distribution of physical outcomes through generative sampling, but existing benchmarks score individual generations or compare distributions coarsely over a whole dataset, leaving the fine-grained aleatoric uncertainty of specific phenomena untested. We introduce CaliBench, which scores outcomes in a physically interpretable discrete space - a bin index, a die face, a suit, a colour - rather than a learned feature space such as in FID, so the distance from a known reference distribution is measured directly. We curate outcome spaces whose reference is known in closed form (binomial Galton boards, Bernoulli forks, uniform dice/cards/lottery, a skewed European-roulette colour), enabling an exact calibration test. We decompose performance into two orthogonal axes that a single accuracy metric conflates: scorability, the fraction of generations yielding a scoreable outcome, and calibration, the total variation distance from the reference on that sample. A chi-squared test assesses significance; as calibration is its null hypothesis it can evidence only miscalibration, and at N=32 per cell detects only large deviations. We apply it to nine scenes and six image-to-video models (WAN-2.7, SeeDance-2.0, HappyHorse-1.0, Veo 3.1, Runway Gen-4.5, Cosmos3-Super), 32 generations each. Models consistently concentrate probability mass on a few outcomes rather than reproducing the reference. Most scene-model combinations are significantly miscalibrated, in the extreme collapsing to one outcome, as Veo 3.1 does on dice. On roulette, generations often leave the ball ambiguously placed, giving several models low scorability. Performance varies by scene: no model dominates all nine. We release the protocol and a metric (mean normalised total variation, mnTV) for comparing new models against our results.

関連論文