何が起きたか

研究チームは2026年7月20日、インタラクティブな長時間ビデオ世界モデル「AlayaWorld」の技術報告書をarXivで公開した。同モデルは15Bパラメータのビデオ拡散トランスフォーマーを基盤とし、540pおよび720pの24fps動画を生成する。

詳細

AlayaWorldは、カメラ軌道と切り替え可能なテキストプロンプトの下で、短い潜在チャンクを自己回帰的に生成する。視覚的文脈は、永続的なシンクフレーム、圧縮された時間履歴、幾何学的に整合した空間メモリ、最近のフレーム条件付けで構成される。長期的なドリフトを減らすため、破損した履歴と自己ロールアウトから収集した予測残差で訓練される。さらに、分布マッチング蒸留、self-forcing++、整合性蒸留を組み合わせた離散自己回帰蒸留を導入し、推論をチャンクあたり約30ステップから4ステップに削減する。iWorld-Benchで長時間生成の最高性能を達成した。

Key Facts

AlayaWorldは15Bパラメータのビデオ拡散トランスフォーマーを基盤とし、540pおよび720pの24fps動画を生成する。[1]
推論ステップを約30ステップから4ステップに削減する蒸留手法を導入した。[1]
iWorld-Benchで長時間生成の最高性能を達成した。[1]
破損した履歴と予測残差を用いた訓練により長期的ドリフトを低減する。[1]
オープンソースのフルスタックプロジェクトとして構想されている。[1]

本紙の見方

AlayaWorldの技術報告書は、ビデオ世界モデル分野における重要な進展を示している。従来のビデオゲーム開発が資産制作、アニメーション、物理、プログラミングに多大な労力を要するのに対し、AlayaWorldはテキストや画像から即座にインタラクティブな環境を生成する。このアプローチは、ゲーム開発の民主化や仮想環境の動的生成に寄与する可能性がある。 本報告書の核心は、長時間の一貫性を維持するための技術的工夫にある。永続的なシンクフレーム、圧縮された時間履歴、幾何学的に整合した空間メモリを組み合わせた視覚的文脈は、従来のビデオ生成モデルが直面するドリフト問題への対処として注目される。さらに、自己ロールアウトから収集した予測残差を用いた訓練は、モデル自身の誤差を学習に活用する点で斬新である。 推論効率の改善も見逃せない。約30ステップから4ステップへの削減は、実時間応答が求められるインタラクティブな用途において実用性を高める。この蒸留手法は、他の拡散モデルにも応用可能な汎用性を持つとみられる。 一方で、AlayaWorldはオープンソースのフルスタックプロジェクトとして構想されており、研究コミュニティへの貢献が期待される。しかし、実際のコードやデータが公開されるかは未確認であり、再現性やベンチマークの詳細は今後の検証が必要である。 今後確認すべき点として、第一に、iWorld-Benchでの評価が他のベンチマークや実環境でどの程度汎化するか、第二に、15Bパラメータのモデルを動作させるための計算資源要件と推論速度の実測値、第三に、オープンソース化の具体的なスケジュールとライセンス形態が挙げられる。

なぜ重要か

AlayaWorldは、ビデオ世界モデルを実用的なインタラクティブ用途に近づける技術的基盤を提供する。長時間の一貫性と効率的な推論を両立した点は、ゲームやシミュレーション分野での応用可能性を広げる。