日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデル評価arXiv:2609.24308

HappyWorld-Bench:世界モデルの信頼性を評価する総合ベンチマーク

HappyWorld-Bench

シェア:XThreadsFacebookLINEはてブBluesky

生成世界モデルがエージェントの相互作用下でどれだけ信頼できるかを、動画・空間・身体性の3トラックで評価するベンチマークを提案し、14の動画モデル、9の空間システム、8の身体性モデルを評価した。

詳しい要約

1. どんなもの?

- 世界モデルを評価するためのベンチマーク「HappyWorld-Bench」を提案。 - 生成された世界の品質だけでなく、エージェントの探索・相互作用・修正に対する一貫性と応答性を評価。 - 6つの世界能力(W1-W6)からなる階層的フレームワークに基づき、video world models、spatial world models、embodied world modelsの3トラックで構成。 - 1,138のvideo prompts、300のspatial scenes、254のembodied test casesを含む。 - 人間によるA/B比較を行うHappyWorld-Arenaを構築し、モデルレベルのEloレーティングを導出。 - 新たに設計した自動メトリクスで行動的正しさを捕捉。 - 14のvideo world models、9のspatial systems、8のembodied candidatesを評価。

2. 先行研究と比べてどこがすごい?

- 従来の世界モデル評価は視覚的品質に偏りがちだったが、本ベンチマークは状態の一貫性や行動・介入への応答の正しさを重視。 - 階層的能力フレームワーク(W1-W6)と3つの独立した評価トラックを統合し、包括的に評価。 - 人間によるA/B比較と自動メトリクスを組み合わせ、モデルレベルのEloレーティングを算出する点が新しい。 - 大規模なデータセット(1,138 video prompts、300 spatial scenes、254 embodied test cases)を構築。

3. 技術・手法の肝は?

- 6つの世界能力(W1-W6)からなる階層的フレームワークを設計。 - 3つの評価トラック:video world models、spatial world models、embodied world models。 - HappyWorld-Arenaを構築し、人間のA/B比較を組織化してEloレーティングを導出。 - 行動的正しさを捉える新規自動メトリクスを設計。 - 14のvideo world models、9のspatial systems、8のembodied candidatesを統一フレームワークで評価。

4. どうやって有効だと検証した?

- HappyWorld-Benchを用いて14のvideo world models、9のspatial systems、8のembodied candidatesを評価。 - 結果、video modelsは拡張ロールアウトや再訪時に一貫性が低下。 - spatial modelsは最大70.14%の配置精度と73.33%の編集実行率。 - embodied modelsは多段階行動での状態保持や、変更された行動条件・物理規則への正確な応答に苦戦。 - これらの結果から、視覚的品質だけでなく状態一貫性と行動・介入への応答の正しさを評価する必要性を強調。

5. 議論はある?

- 3トラックすべてで信頼性のギャップが残ることを明示。 - video modelsの一貫性低下、spatial modelsの配置・編集精度の限界、embodied modelsの状態保持と応答精度の問題を指摘。 - 世界モデル評価において、視覚的品質だけでなく状態一貫性と行動・介入への応答の正しさを評価することの重要性を議論。

6. 次に読むべき論文は?

- 要旨からは不明(参照・比較されている研究が明記されていないため)。 - 同分野の定番として、world models、video prediction、spatial reasoning、embodied AIに関する既存ベンチマーク(例:World Models, Dreamer, Habitat, AI2-THORなど)が関連する可能性がある。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu

分類: cs.CV

原文アブストラクト

Evaluating world models requires assessing both the quality of the worlds they generate and their consistency and responsiveness under exploration, interaction, and modification. We introduce HappyWorld-Bench, a comprehensive benchmark that evaluates whether generated worlds remain reliable as agents interact with them. Our design is built on a hierarchical capability framework of six world capabilities (W1-W6), from generative construction to unified world modeling, instantiated across three independent evaluation tracks: video world models, spatial world models, and embodied world models. HappyWorld-Bench comprises 1,138 video prompts, 300 spatial scenes, and 254 embodied test cases. Across all three tracks, we build and operate HappyWorld-Arena to organize human A/B comparisons and derive model-level Elo ratings, which complement newly designed automated metrics that capture behavioral correctness. We evaluate 14 video world models, 9 spatial systems, and 8 embodied candidates under this unified framework. Results reveal remaining reliability gaps across all three tracks: video models exhibit reduced consistency during extended rollouts and revisits, spatial models achieve at best 70.14% placement accuracy and 73.33% edit execution, and embodied models struggle to preserve state across multi-step actions and respond precisely to altered action conditions and physical rules. These findings highlight the need to evaluate world models not only by visual quality, but also by state consistency and the correctness of their responses to actions and interventions.

関連論文

PR本紙発行元 EmplifAI