日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデルarXiv:2609.24313

NeuIDO: 物理情報に基づく4D世界モデルのためのニューラル内在ダイナミクス演算子

NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models

シェア:XThreadsFacebookLINEはてブBluesky

視覚観測から統一的な内在ダイナミクス表現を学習し、物理情報に基づく4D生成を世界モデルへと発展させるフレームワークを提案。

詳しい要約

1. どんなもの?

- 世界モデルは環境のダイナミクスを捉え未来の軌道を予測することを目指す。 - 物理情報を組み込んだ4D生成は物理シミュレーションを統合し3D物体の相互作用を予測するが、手動の力学仮定に依存している。 - 本研究ではNeuIDOを提案する。これは視覚観測から統一的な内在ダイナミクス表現を学習する世界ダイナミクスモデリングフレームワークである。 - 物理情報を組み込んだ4D生成を世界モデルへと前進させる。

2. 先行研究と比べてどこがすごい?

- 従来の物理情報4D生成は手動で与えられた力学仮定に依存し、世界のダイナミクスを内部化していなかった。 - NeuIDOは視覚観測から内在ダイナミクスを学習し、そのギャップを埋める。 - 世界モデリングをニューラルオペレータ学習問題として定式化し、観測分布から内在ダイナミクス分布への汎化可能な写像を学習する。 - これによりゼロショットのダイナミクス推論や少数ショット適応が可能になる。

3. 技術・手法の肝は?

- 世界モデリングをニューラルオペレータ学習問題として定式化する。 - 視覚観測分布から内在ダイナミクス分布への汎化可能な写像を学習するために、2段階の訓練戦略を導入する。 - この観測-ダイナミクス写像に基づき、ビデオからのゼロショットダイナミクス推論を可能にする。 - さらに少数ショット適応により複雑な実世界のダイナミクスに整合させることができる。

4. どうやって有効だと検証した?

- 広範な実験により、NeuIDOが多様な視覚観測に内在するダイナミクスを共有表現に統合し、新しいシーンで迅速にダイナミクスを推論することを実証した。 - 具体的なデータセットや評価指標は要旨からは不明。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 同分野の定番として、Physics-informed neural networks (PINNs)、Neural operators (e.g., DeepONet, Fourier Neural Operator)、World models (e.g., Dreamer, PlaNet) などが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiajing Lin, Xin Zhang, Jianhua Sun

分類: cs.CV

原文アブストラクト

World models aim to capture environmental dynamics and predict future trajectories, showing growing potential for embodied intelligence. Physics-informed 4D generation integrates physical simulation to predict 3D object interactions, offering a promising pathway toward world models. However, this paradigm relies on manually imposed dynamical assumptions rather than internalizing world dynamics, and thus still leaves a gap toward a true world model. To bridge this gap, we propose NeuIDO, a novel world dynamics modeling framework that learns a unified intrinsic dynamics representation from visual observations, advancing physics-informed 4D generation toward a world model. Specifically, we formulate world modeling as a neural operator learning problem and introduce a two-stage training strategy to learn a generalizable mapping from the visual observation distribution to the intrinsic dynamics distribution. Building on this observation-dynamics mapping, NeuIDO enables zero-shot dynamics inference directly from videos and can be further aligned with complex real-world dynamics via few-shot adaptation. Extensive experiments demonstrate that NeuIDO effectively unifies the intrinsic dynamics underlying diverse visual observations into a shared representation and rapidly infers dynamics in novel scenes.

関連論文

PR本紙発行元 EmplifAI