何が起きたか
arXiv上で2026年9月21日、世界モデル向けベンチマーク「HappyWorld-Bench」が公開された。構成は動画世界モデル、空間世界モデル、身体性世界モデルの3軌道で、計1,692件の評価タスクを含む。論文は、生成された世界の見た目だけでなく、探索・相互作用・改変に対して一貫性を保てるかを測ることを狙いとしている。
詳細
HappyWorld-Benchは、6段階の世界能力フレームワーク「W1-W6」に基づいて設計されている。内訳は、動画プロンプト1,138件、空間シーン300件、身体性テスト254件で、さらに人手のA/B比較を行うHappyWorld-Arenaを運用し、モデル単位のElo評価を導出する仕組みを組み込んだ。 評価対象は、動画モデル14件、空間システム9件、身体性候補8件である。結果として、動画モデルは長いロールアウトや再訪で一貫性が低下し、空間モデルは配置精度が最大70.14%、編集実行が73.33%にとどまり、身体性モデルは複数ステップの行動で状態保持や条件変更への応答に課題が残った。
Key Facts
| HappyWorld-Benchは、世界モデルの評価用ベンチマークである。 | [1] |
| 評価軌道は、video world models、spatial world models、embodied world modelsの3つである。 | [1] |
| 構成は、1,138 video prompts、300 spatial scenes、254 embodied test casesである。 | [1] |
| HappyWorld-Arenaを運用し、人手のA/B比較とモデルレベルのElo ratingsを導出する。 | [1] |
| 評価対象は、14 video world models、9 spatial systems、8 embodied candidatesである。 | [1] |
本紙の見方
HappyWorld-Benchの新しさは、世界モデルを「どれだけ見栄えよく生成できるか」ではなく、探索・相互作用・改変の後でも状態を保てるかまで含めて、3軌道で同時に測ろうとしている点にある。動画、空間、身体性を同一の枠組みで扱い、さらに人手比較のHappyWorld-Arenaと自動指標を組み合わせているため、単一の見た目評価に寄った従来型の指標とは目的が異なる。一方で、論文が示した数値は、世界モデルがまだ「生成」と「維持」を同じ水準で満たせていないことを示す。空間モデルの配置精度70.14%、編集実行73.33%という結果は、空間的な更新が伴うタスクで余地が残ることを示唆する。 本紙の見方として重要なのは、これは新しい応用先の発表ではなく、評価の軸を再定義する提案だという点である。動画モデル14件、空間システム9件、身体性候補8件を横断して比べたことで、各分野で別々に論じられがちだった弱点を、状態一貫性と応答正確性という共通言語に寄せている。これは、モデル開発側にとっては生成品質の改善だけでは足りず、長いロールアウト、再訪、複数ステップ行動、条件変更といった「壊れやすい場面」をどこまで維持できるかが焦点になることを意味する。特に身体性モデルについては、物理ルールや行動条件の変更に対する応答まで評価対象に入れているため、単純な模倣精度よりも、状態管理と介入耐性が問われる設計である。 業界構造への含意としては、世界モデルの競争軸が画像・動画の自然さから、相互作用後の整合性検証へ移っていく可能性がある。HappyWorld-Arenaのような人手A/B比較を残しつつ、自動指標も併用する設計は、評価コストと再現性の両立を狙うものだが、逆に言えば、今後はデータ収集・評価設計・行動定義の質がモデル性能の見え方を左右しやすい。未確定の論点は、各トラックでどのモデルがどの失敗パターンに弱かったか、Elo評価と自動指標の相関、そしてこのベンチマークが今後の学習データ設計や訓練手法の変更につながるかである。
なぜ重要か
世界モデルを開発する側にとっては、静止画や短い生成結果の品質だけでなく、長いロールアウトや編集後の状態保持まで確認する必要があることを、論文の結果が具体的に示している。空間モデルの配置精度70.14%、編集実行73.33%という値は、評価の焦点が「見た目」から「状態の正確さ」へ移る条件を示す指標といえる。