何が起きたか

arXivに2026年7月6日付で公開された論文(識別番号2607.05352v2)において、研究チームは複雑な物理的相互作用を伴う高ダイナミクス環境向けの初のマルチプレイヤー世界モデルを提案した。このモデルは、Rocket Leagueのゲームプレイ10,000時間分で訓練された50億パラメータの潜在拡散モデルであり、単一のNvidia B200 GPU上で毎秒20フレームの4人対戦マッチをリアルタイム生成する。

詳細

従来のシングルプレイヤー世界モデルは他のエージェントを環境の一部として扱うのに対し、本研究のモデルは複数エージェントのアクションストリームに条件付けし、シーンの変化を正しいプレイヤーに帰属させ、任意のアクションの組み合わせ下でも一貫性を保つことを学習する。Rocket Leagueは、高速で緊密に結合されたダイナミクスの中でプレイヤーが競争・協力するゲームであり、この問題の研究に適している。 モデルは短いクリップのみで訓練されたが、ロールアウトは訓練期間をはるかに超えて安定しており、分布品質は測定した最長の5分間維持され、実際には数時間にわたって崩壊の兆候なく継続することが観察された。研究チームは、ビデオコーデック、生成的目標、マルチプレイヤー条件付けスキームなどの中心的な設計選択を体系的に調査し、モデルとデータの規模に応じた行動の変化、出現する能力、持続する失敗モードを特徴付けた。さらに、視覚的な外観だけでなく物理的理解を探るための評価を開発した。

Key Facts

論文はarXivで2026年7月6日に公開された(識別番号2607.05352v2)。[1]
研究チームは、複雑な物理的相互作用を伴う高ダイナミクス環境向けの初のマルチプレイヤー世界モデルを導入した。[1]
モデルはRocket Leagueのゲームプレイ10,000時間分で訓練された。[1]
モデルは50億パラメータの潜在拡散モデルである。[1]
モデルは単一のNvidia B200 GPU上で毎秒20フレームの4人対戦マッチを生成する。[1]
モデルは短いクリップのみで訓練されたが、ロールアウトは訓練期間を超えて安定しており、分布品質は5分間維持された。[1]
実際には、ロールアウトは数時間にわたって崩壊の兆候なく継続することが観察された。[1]
研究チームは、ビデオコーデック、生成的目標、マルチプレイヤー条件付けスキームなどの設計選択を体系的に調査した。[1]
研究チームは、モデルの物理的理解を探るための評価を開発した。[1]
研究チームは、データセット、トレーニングおよび推論コードベース全体、ライブデモを公開した。[1]

なぜ重要か

この研究は、複数エージェントの相互作用をモデル化する世界モデルの新たな方向性を示すものであり、ゲームAIやロボティクスなど、動的環境での意思決定に応用が期待される。また、長時間の安定性と物理的理解の評価は、世界モデルの実用性を高める上で重要な進展である。