何が起きたか
研究チームは、動画世界モデルに対する任意アクションのフレームレベル制御を実現する新手法「ShadowDancer」を発表した。論文は2026年7月30日にarXivに公開された。ShadowDancerは、シャドウペアとクロスシャドウ予測という2つの革新により、デモ動画からアクションを学習し、ラベルなしで新しい環境で再生できる。実験では、強力な潜在アクションモデルやインタラクティブ世界モデルのベースラインと比較し、平均 blinded win rate 86%を達成した。
詳細
ShadowDancerの背景には、既存のインターフェースがアクションを大まかに符号化するか、特定のファミリーにしか使えない構造化信号で正確に符号化するかのどちらかであり、多様なダイナミクスにわたる正確な制御が実用的でないという問題がある。デモ動画はフレームごとにダイナミクスを指定する自然な解決策だが、動画は特定の外観(シャドウ)しか示さず、学習したアクションは新しいシーンにうまく転移しない。 ShadowDancerは、シャドウペア(同じダイナミクスを独立に再サンプリングした外観で再生する動画ペア)をShadow Libraryで大規模に構築し、クロスシャドウ予測(一方のシャドウから他方を予測してアクションを学習)により、ペアリングで再サンプリングされたものを破棄し、保存されたものをアクションとして抽出する。これにより、統一されたダイナミクス表現がブロック因果世界モデルを駆動する。デモクリップは再利用可能なアクション資産となり、アクションラベルやモーション推定器、ファインチューニングなしで新しい環境で再生できる。
Key Facts
| ShadowDancerは、動画世界モデルに対する任意アクションのフレームレベル制御を実現する新手法である。 | [1] |
| ShadowDancerは、シャドウペアとクロスシャドウ予測という2つの革新を導入した。 | [1] |
| シャドウペアは、同じダイナミクスを独立に再サンプリングした外観で再生する動画ペアであり、Shadow Libraryによって大規模に構築される。 | [1] |
| クロスシャドウ予測は、一方のシャドウから他方を予測することでアクションを学習する。 | [1] |
| ShadowDancerは、デモクリップを再利用可能なアクション資産に変換し、アクションラベル、モーション推定器、ファインチューニングなしで新しい環境で再生できる。 | [1] |
| 実験では、強力な潜在アクションモデルとインタラクティブ世界モデルのベースラインと比較し、平均blinded win rate 86%を達成した。 | [1] |
| 論文は2026年7月30日にarXivで公開された。 | [1] |
| 動画結果はhttps://ShadowDancer-1.github.ioで公開されている。 | [1] |
なぜ重要か
ShadowDancerは、動画世界モデルの制御における表現上の障壁を解決し、デモ動画から任意のダイナミクスを正確に制御する方法を提供する。これにより、アクションラベルやモーション推定器を必要とせず、多様な環境でのアクション転移と長期ロールアウトが改善される可能性がある。