日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデルarXiv:2609.08230

ActionSplice: インタラクティブな世界モデルのための飛行中アクション編集

ActionSplice: In-Flight Action Editing for Interactive World Models

シェア:XThreadsFacebookLINEはてブBluesky

ビデオ世界モデルで、生成中にアクションが変更された際に、ロールバックせずに状態を補正してサンプリングを再開する推論フレームワークActionSpliceを提案した。

詳しい要約

1. どんなもの?

ActionSpliceは、chunk-autoregressive video world modelsにおける推論時のアクション編集を可能にするフレームワークである。従来、サンプリング中に新しいアクションが到着すると、次のチャンクまで待つか、前のアクションで生成された状態に基づいて将来のソルバー評価を行うか、ロールバックして再実行する必要があった。ActionSpliceはこの問題をCounterfactual State Transport (CST)として定式化し、軽量なコレクタが中断されたバックボーン表現を、修正されたアクションによって同じソルバーステップで誘導される状態へ輸送する。ワールドモデルとサンプラーは凍結されたままで、完了した評価を再生することなくサンプリングを再開する。

2. 先行研究と比べてどこがすごい?

先行研究では、アクション編集はチャンク境界での待機、状態の不一致、またはロールバックによる再計算を必要としていた。ActionSpliceは、ロールバックなしでアクション変更を即座に反映できる点で優れている。特に、直接的な条件付けの交換と比較して、ロールバック相対のLPIPSを大幅に削減し、待機と比較してピクセル準備済みのスピードアップを達成する。

3. 技術・手法の肝は?

手法の核心はCounterfactual State Transport (CST)である。CSTは、修正されたアクションによって誘導される状態を推定し、現在のバックボーン表現をその状態に輸送する軽量なコレクタを使用する。2つの変種がある:CST_Rはアクティブなチャンク全体を更新し、CST_Tは時間的前綴を保持し、サフィックスのみを更新する。ワールドモデルとサンプラーは変更されず、推論時にのみ適用される。

4. どうやって有効だと検証した?

検証は、minWM-Wan Action2VとHY-WM1.5の2つのデータセットで行われた。CST_Rはロールバック相対のLPIPSを直接的な条件交換と比較して61.5%と75.9%削減した。CST_TはサフィックスLPIPSをそれぞれ56.1%と77.5%削減し、待機と比較して2.73倍と1.69倍のピクセル準備済みスピードアップを提供した。さらに、HY-WorldPlayプロトコルでは、CST_Rは元のロールアウトに対してPSNR 25.66 dB、SSIM 0.6902、LPIPS 0.1337を達成した。

5. 議論はある?

要旨からは、CSTの理論的保証や、異なるアクション編集シナリオでの一般化、コレクタの訓練方法、計算コストの詳細は不明である。また、CST_RとCST_Tの使い分けの基準や、他のワールドモデルへの適用可能性についての議論は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されている研究は、minWM-Wan Action2V、HY-WM1.5、HY-WorldPlayプロトコルである。これらは関連するデータセットやベンチマークであり、次に読むべき論文としては、これらのデータセットを提案した論文や、chunk-autoregressive video world modelsの基盤となる研究が挙げられる。具体的には、WanやHY-WM1.5のモデルに関する論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Pardis Taghavi, Tingyu Guo, Jonas Lossner, Gaurav Pandey, Reza Langari

分類: cs.CV, cs.LG

原文アブストラクト

Chunk-autoregressive video world models typically condition each generated chunk on one action. An action received during sampling must therefore wait for the next chunk, condition future solver evaluations on a state produced under the previous action, or trigger rollback that repeats completed evaluations. We introduce ActionSplice, an inference framework that formulates this problem as Counterfactual State Transport (CST). A lightweight corrector transports the interrupted backbone-native representation toward the matched state induced by the revised action at the same solver step. The world model and sampler remain frozen, and sampling resumes without replaying completed evaluations. The retargeting variant $\mathrm{CST}*{R}$ updates the entire active chunk, while the temporal-splicing variant $\mathrm{CST}*{T}$ preserves a temporal prefix and updates only the suffix. Across minWM-Wan Action2V and HY-WM1.5, $\mathrm{CST}*{R}$ reduces rollback-relative LPIPS by 61.5% and 75.9% relative to direct condition swapping. $\mathrm{CST}*{T}$ reduces suffix LPIPS by 56.1% and 77.5%, respectively, while providing $2.73\times$ and $1.69\times$ pixel-ready speedups over waiting. Under the HY-WorldPlay protocol, $\mathrm{CST}_{R}$ obtains a PSNR of 25.66 dB, an SSIM of 0.6902, and an LPIPS of 0.1337 against the original rollout.

関連論文