何が起きたか

arXivに2026年7月27日付で公開された論文(識別番号2607.23909v2)において、WorldDiTと名付けられた統一拡散アーキテクチャが提案された。このアーキテクチャは、行動生成と視覚世界モデリングを結合し、大規模な事前学習済み視覚言語モデル(VLM)を行動バックボーンとして用いずに高い性能を達成する。訓練では、単一の拡散トランスフォーマーが連続的な行動チャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。4つのLIBEROシミュレーションスイートにおいて、全4スイートを報告する手法の中で、総モデルパラメータ数と平均成功率のパレートフロンティア上に位置する。

詳細

近年の多くのロボットポリシーは、大規模な事前学習済み視覚言語モデル(VLM)を行動バックボーンとして用いることで、より強力な制御を目指している。WorldDiTは、そのような大規模なVLM行動バックボーンに依存せずに、行動生成と視覚世界モデリングを結合する統一拡散トランスフォーマーアーキテクチャを導入する。 WorldDiTの訓練プロセスでは、単一の拡散トランスフォーマーが連続的な行動チャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。これにより、行動生成と視覚予測を同時に学習する。 評価は4つのLIBEROシミュレーションスイートで行われ、全4スイートを報告する手法の中で、総モデルパラメータ数と平均成功率のパレートフロンティア上に位置することが示された。この結果は、将来のスケーリング研究のための強力なサブビリオンパラメータベースラインを提供する。

Key Facts

WorldDiTは、行動生成と視覚世界モデリングを結合する統一拡散トランスフォーマーアーキテクチャである。[1]
WorldDiTは、大規模な事前学習済み視覚言語モデル(VLM)を行動バックボーンとして用いずに高い性能を達成する。[1]
訓練中、単一の拡散トランスフォーマーが連続的な行動チャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。[1]
4つのLIBEROシミュレーションスイートで評価され、全4スイートを報告する手法の中で、総モデルパラメータ数と平均成功率のパレートフロンティア上に位置する。[1]
WorldDiTは、将来のスケーリング研究のための強力なサブビリオンパラメータベースラインを提供する。[1]

なぜ重要か

WorldDiTは、大規模なVLMに依存しないロボットポリシーの設計を示すものであり、計算資源の制約がある環境での展開可能性を示唆する。また、行動生成と視覚世界モデリングを統合することで、ロボットの環境理解と行動計画の効率的な学習に寄与する可能性がある。