日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
sim2realarXiv:2610.04301

EnvDreamer: 大規模マルチモーダルから環境生成による身体性AIの実現

EnvDreamer: Large-Scale Multimodal-to-Environment Generation for Embodied AI

シェア:XThreadsFacebookLINEはてブBluesky

大規模言語・視覚言語モデルを用いてUnreal Engine 5の多様な仮想環境を自動生成し、ナビゲーションや操作タスクの学習・評価を可能にするフレームワークを提案。2万環境のデータセットも公開。

詳しい要約

1. どんなもの?

EnvDreamerは、大規模言語モデルと視覚言語モデルを用いてUnreal Engine 5の仮想環境を生成するフレームワーク。embodied AIとロボット訓練向けに、多様でインタラクティブ、カスタマイズ可能、かつvalidator通過済みの環境を大量にサンプリングできる。ナビゲーション、インタラクション、マニピュレーションの訓練・評価に使える。EnvDreamer-20kとして20,000のvalidator通過環境とタスクプログラム、シーングラフ、軌道、メタデータを公開。

2. 先行研究と比べてどこがすごい?

視覚と言語分野の大規模データ・大容量モデルの進展をembodied learning、world models、ロボティクスにもたらすことを狙う。従来のembodied AI環境生成と比べ、LLMとVLMでUnreal Engine 5環境を生成し、大規模・多様・インタラクティブ・カスタマイズ可能・validator通過済みの環境を提供する点が特徴。明示的なマッピングや人間のタスク監督なしで訓練したポリシーが複数のembodiedベンチマークで競争力のある結果を得る。

3. 技術・手法の肝は?

大規模言語モデルと視覚言語モデルを活用し、Unreal Engine 5の環境を生成する。生成環境はナビゲーション、インタラクション、マニピュレーションに対応。validatorを通した環境のみを採用。画像条件付き再構成によりreal-to-sim研究も支援。EnvDreamer-20kにはタスクプログラム、シーングラフ、軌道、メタデータを含む。

4. どうやって有効だと検証した?

生成した多数のシーンと簡単なベースラインを示す。EnvDreamer生成環境で訓練したポリシーが、明示的なマッピングや人間のタスク監督なしに、ナビゲーション、再配置、マニピュレーションにわたる複数のembodiedベンチマークで競争力のある結果を達成。EnvDreamer-20kとして20,000のvalidator通過環境を公開し、再現可能なベンチマークを支援。

5. 議論はある?

要旨からは不明。

6. 次に読むべき論文は?

要旨で参照・比較されている研究は明示されていない。同分野の関連手法として、Unreal Engine 5を用いたembodied AI環境生成、大規模言語モデル・視覚言語モデルによる環境生成、real-to-sim、ナビゲーション・再配置・マニピュレーションのembodiedベンチマークが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kabir Swain, Sijie Han, Antonio Torralba

分類: cs.AI

原文アブストラクト

Large datasets and high capacity models have accelerated progress in vision and language. This work introduces a platform aimed at bringing comparable gains to embodied learning, world models, and robotics. We present EnvDreamer, a framework that uses large language and vision language models to generate Unreal Engine 5 environments for embodied AI and robot training. EnvDreamer enables sampling of large, diverse, interactive, customizable, and validator passed virtual environments for training and evaluation across navigation, interaction, and manipulation. We illustrate the platform with a large set of generated scenes and simple baselines. Policies trained on EnvDreamer generated environments, without explicit mapping or human task supervision, achieve competitive results on multiple embodied benchmarks spanning navigation, rearrangement, and manipulation. EnvDreamer also supports image-conditioned reconstruction for real-to-sim studies. Finally, we release EnvDreamer-20k, a dataset of 20,000 validator passed environments with task programs, scene graphs, trajectories, and metadata to support reproducible benchmarking.

関連論文

PR本紙発行元 EmplifAI