何が起きたか

世界行動モデル(WAM)は、観測された世界がどう進化するかを予測することで行動関連の表現を学習する。既存のWAMの多くはRGB空間で未来を定義しており、タスク関連の状態遷移がテクスチャや照明、背景、視点などの無関係な変動と絡み合っていた。これに対し、DreamWAMは未来予測をRGB予測に頼らず、外観・動き・幾何・意味の補完的視点で構造化された世界モデリングとして再構成する。トレーニング中はRGBと動きの共同潜在デノイジングに、幾何と意味の軽量ゲート付き残差ブランチを組み合わせる。VideoDiTとActionDiT間の共有アテンションにより、行動ブランチはこれらの未来状態予測から学習するが、推論時にはRGB以外の監視ブランチは無効化され、デプロイはRGBのみで行われる。実験では、LIBEROでRGBのみのベースラインを上回り、ノーロールアウトで97.30%から98.40%、ジョイントビデオ行動推論で98.00%から98.90%に改善。未見のLIBERO-Plus摂動下では51.36%から63.44%、69.16%から75.47%とさらに大きな改善が見られた。実世界操作でも、照明・背景・物体配置の未見の変化に対して平均成功率74.4%を達成し、Fast-WAM-Jointの55.6%を上回った。

Key Facts

DreamWAMはRGB予測に加えて、外観・動き・幾何・意味の補完的視点で未来状態を予測する世界行動モデルである。[0]
トレーニングではRGBと動きの共同潜在デノイジングに、幾何と意味の軽量ゲート付き残差ブランチを組み合わせる。[0]
推論時にはRGB以外の監視ブランチは無効化され、デプロイはRGBのみで行われる。[0]
LIBEROで、ノーロールアウトで97.30%から98.40%、ジョイントビデオ行動推論で98.00%から98.90%に改善した。[0]
未見のLIBERO-Plus摂動下では、51.36%から63.44%、69.16%から75.47%に改善した。[0]
実世界操作では、照明・背景・物体配置の未見の変化に対して平均成功率74.4%を達成し、Fast-WAM-Jointの55.6%を上回った。[0]
コードとモデルはhttps://github.com/hustvl/DreamWAMで公開されている。[0]

なぜ重要か

この研究は、世界行動モデルにおける未来予測の表現方法がロバスト性に決定的に重要であることを示している。RGB予測だけではタスク関連の状態遷移が無関係な変動に埋もれてしまうが、構造化された補完的視点で予測することで、未見の環境変化に対する汎化が大幅に向上する。これはロボット操作や自動運転など、実世界での行動学習の信頼性向上につながる可能性がある。