何が起きたか
物体中心世界モデルの新手法「MOSH-WM」が、2026年8月24日にarXivで公開された。同手法は、マスク接地型ソフトハミルトン力学を導入し、位置状の状態をスロット所有の画像サポートに明示的に依存させる。OBJ3Dでは、6フレーム観測後の30フレーム予測でLPIPSを25.0%、空間MSEを33.7%削減。CLEVRERでは、6フレーム観測後の10フレーム予測でLPIPSを14.5%、空間MSEを18.7%削減した。
詳細
MOSH-WMは、凍結されたビデオスロットエンコーダがスロットとマスクを生成し、マスク所有サポートの空間モーメントから正準状態Qを形成、時間差分からPを形成する。学習されたエネルギーが有界な学習増分にソフトな方向バイアスを与える。デコーダ関連の外観と同一性は因果的視覚コンテキストに別途保存され、ゲート付きコンポーザと有界残差がこのコンテキストと伝播された位相状態を組み合わせてデコーダ互換スロットを再構成する。評価では、OBJ3Dで6フレーム観測後の30フレーム予測、CLEVRERで6フレーム観測後の10フレーム予測を実施。完全なモデルは30フレームの閉ループロールアウト全体で誤差の蓄積が遅いことが、地平線分解された視覚および物体状態測定で示された。
Key Facts
| MOSH-WMはマスク接地型ソフトハミルトン世界モデルであり、位置状の状態をスロット所有の画像サポートに明示的に依存させる。 | [1] |
| OBJ3Dで、6フレーム観測後の30フレーム予測において、LPIPSを25.0%、空間MSEを33.7%削減した。 | [1] |
| CLEVRERで、6フレーム観測後の10フレーム予測において、LPIPSを14.5%、空間MSEを18.7%削減した。 | [1] |
| 凍結されたビデオスロットエンコーダがスロットとマスクを生成し、マスク所有サポートの空間モーメントから正準状態Qを形成する。 | [1] |
| 完全なモデルは30フレームの閉ループロールアウト全体で誤差の蓄積が遅いことが、地平線分解された測定で示された。 | [1] |
本紙の見方
今回の提案は、物体中心世界モデルにおけるダイナミクス監視の対象を、制約のない視覚特徴から、マスク接地型の位置状状態へと明確に切り替えた点が新しい。従来の物体中心モデルでは、エンティティスロットの時間発展を予測する際、ダイナミクス監視を受ける変数が視覚特徴そのものであることが多く、物理的な位置や運動との対応が曖昧だった。MOSH-WMは、スロット所有の画像サポートの空間モーメントから正準状態Qを構成し、時間差分からPを形成することで、状態を物理的な位置・運動量に近い形で表現する。これにより、ダイナミクスの学習が安定し、長期的な予測誤差の蓄積が抑えられる。 本稿の関連記事は存在しないが、物体中心表現の研究動向を踏まえると、本手法はスロットベースの表現とハミルトン力学を組み合わせた点で、物理的帰納バイアスの導入を進める流れの一つと位置づけられる。特に、マスク接地によりスロットと画像領域の対応を明示的にすることで、状態の解釈性が向上し、将来の映像予測だけでなく、制御や計画への応用が期待される。 業界構造への含意としては、物体中心世界モデルの性能指標として、LPIPSや空間MSEといった視覚的品質指標が用いられているが、本手法はこれらの指標で既存の最強ベースラインを上回る。これは、シミュレーション環境での物体操作やロボット制御における予測モデルの精度向上に寄与する可能性がある。一方で、実世界の複雑なシーンへの適用には、スロットの数やマスクの品質、計算コストなどの課題が残る。 未確定の論点としては、本手法が実世界のビデオデータでどの程度機能するか、また、スロット数やマスクの品質が性能に与える影響が挙げられる。さらに、ハミルトン力学の仮定が物体の非剛体変形や複雑な相互作用にどの程度適合するかも検証が必要である。
なぜ重要か
物体中心世界モデルは、ロボットの環境理解や映像予測の基盤技術として重要であり、MOSH-WMの精度向上は、より長期的で正確な予測を可能にする。これにより、物理的インタラクションを伴うタスクでの意思決定や計画の質が向上する可能性がある。