何が起きたか
研究チームは2026年8月25日、単眼画像から対話型3Dシーンを生成するフレームワーク「NeoWorld-Pro」を発表した。本手法は、MLLMのゼロショット推論とコード合成能力を活用し、単一のRGB画像をオブジェクトの形状、関節、物理特性を指定する実行可能なプログラムに変換する。物理エンジンでの実行検証を繰り返す「physics-in-the-loop」機構により、物理的に妥当な関節、オブジェクト構成、相互作用、空間関係を実現する。実験では、従来のオープンループ手法や単眼再構成手法を上回る性能を示し、安定積み上げや細かい操作などの複雑な下流タスクを可能にした。
詳細
NeoWorld-Proは、単眼画像を入力とし、MLLM(マルチモーダル大規模言語モデル)のゼロショット推論とコード合成能力を用いて、オブジェクトの形状、関節、物理特性を指定する実行可能なプログラムを生成する。生成されたプログラムは、物理エンジン内で実行され、その結果に基づいて反復的に改良される。この「physics-in-the-loop」機構により、物理的に妥当な関節、オブジェクト構成、相互作用、空間関係が保証される。実験では、オープンループ手法や従来の単眼再構成手法と比較して優れた性能を示し、安定積み上げや細かい操作などの複雑な下流タスクを可能にした。
Key Facts
| NeoWorld-Proは、単眼RGB画像を対話型3D環境の手続き的プログラミングとして再構成するフレームワークである。 | [1] |
| MLLMのゼロショット推論とコード合成能力を活用し、単一のRGB画像をオブジェクトの形状、関節、物理特性を指定する実行可能なプログラムに変換する。 | [1] |
| physics-in-the-loop機構により、物理エンジンでの実行検証を繰り返し、物理的に妥当な関節、オブジェクト構成、相互作用、空間関係を実現する。 | [1] |
| 実験では、オープンループ手法や従来の単眼再構成手法を上回る性能を示した。 | [1] |
| 安定積み上げや細かい操作などの複雑な下流タスクを可能にする。 | [1] |
本紙の見方
NeoWorld-Proは、Embodied AIのためのシミュレーション資産生成において、画像から直接物理的インタラクションを考慮したシーンを構築する点で新規性が高い。従来の画像-to-URDF法は物理的接地やシーンレベルのインタラクティブ性に欠けるという課題があったが、本手法はMLLMによるコード生成と物理エンジンによる検証を組み合わせることで、この課題を解決しようとしている。 本手法の核心は、物理エンジンでの実行検証を反復する「physics-in-the-loop」機構にある。これにより、生成されたプログラムが物理的に妥当であることが保証され、単なる見た目の再構成ではなく、実際に操作可能なシーンが生成される。これは、シミュレーション環境の品質を向上させるだけでなく、ロボット学習などの下流タスクの性能向上に直結する。 業界構造への含意として、このようなフレームワークは、シミュレーション環境の構築コストを大幅に削減する可能性がある。従来は手動で3Dモデルを作成し、物理特性を設定する必要があったが、NeoWorld-Proは単眼画像から自動で生成できるため、データ生成の効率化が期待される。また、物理的整合性を保証することで、シミュレーションから実環境への転移(sim-to-real)のギャップを縮小する可能性もある。 未確定の論点としては、実際のロボット学習タスクでの有効性や、複雑なシーンでのスケーラビリティが挙げられる。また、MLLMのコード生成能力に依存するため、モデルの性能や汎化性が結果に大きく影響する可能性がある。今後の研究では、より多様なシーンでの評価や、実ロボットへの適用が期待される。
なぜ重要か
NeoWorld-Proは、単眼画像から物理的に整合性のある対話型3Dシーンを自動生成することを可能にし、Embodied AIのシミュレーション環境構築のコストと時間を大幅に削減する可能性がある。これにより、ロボット学習や自律エージェントの開発が加速し、実世界での応用に近づくことが期待される。