日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.11605

見ずして先を見通す:ワールドアクションモデルのための潜在的未来

Foresight Without Seeing: Latent Futures for World Action Models

シェア:XThreadsFacebookLINEはてブBluesky

未来のビデオを生成せずに、潜在的な未来の状態をアクション生成に活用する新しいワールドアクションモデル「ForeWAM」を提案し、LIBEROベンチマークで高い成功率を達成した。

詳しい要約

1. どんなもの?

本論文は、ロボットの行動生成に将来予測を組み込むWorld Action Models (WAMs)の新手法ForeWAMを提案する。ForeWAMは、将来のビデオを明示的に生成せずに、潜在的な将来状態を利用して行動生成に予測的文脈を提供する。具体的には、Future-KV機構により、現在の視覚潜在表現と確率的な将来スロットをVideo DiTで一度だけprefillし、その層ごとのkey-value状態を行動生成のdenoising過程で再利用する。また、凍結された潜在行動教師から学習するdynamics registersを導入し、将来状態が物体の動きや接触変化などの相互作用による遷移を捉えるようにする。訓練時のみ将来の観測と教師を使用し、推論時には不要で、将来ビデオ生成も行わない。

2. 先行研究と比べてどこがすごい?

既存のWAMsは、明示的将来予測型(explicit-future)と直接方策型(direct-policy)に大別される。明示的将来予測型は予測されたシーン進化への直接アクセスを提供するが、反復的なビデオdenoisingによる推論コストが大きい。一方、直接方策型は現在の観測から効率的に行動を予測するが、予測ダイナミクスを行動生成に明示的に公開するインターフェースが欠如している。ForeWAMは、このギャップを埋めるため、将来ビデオを復号せずに予測的文脈を行動生成に提供するダイナミクス条件付き直接方策WAMを提案しており、効率性と予測ダイナミクスの利用可能性を両立している点が新しい。

3. 技術・手法の肝は?

手法の核心は、Future-KV機構とdynamics registersの導入にある。Future-KVは、現在の視覚潜在表現と確率的な将来スロットを入力としてVideo DiTを一度だけprefillし、その結果得られる層ごとのkey-value状態を行動生成のdenoising過程で再利用する。これにより、将来予測のための追加のビデオ生成を不要にする。dynamics registersは、凍結された潜在行動教師によって教師信号が与えられ、将来状態が相互作用による遷移(物体の動き、接触変化、タスク進行)を捉えるように学習される。訓練時のみ将来の観測と教師を使用し、推論時には不要である。

4. どうやって有効だと検証した?

有効性の検証は、LIBEROベンチマークとLIBERO-Plusで行われた。標準および高速化されたForeWAMは、LIBEROで平均成功率96.7%と96.9%を達成し、標準版はLIBERO-Plusで61.6%の成功率を達成した。これらの結果は、直接方策WAMが効率的な行動予測を維持しつつ、将来ビデオを明示的に生成せずに予測ダイナミクスを行動経路に公開できることを示している。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、提案手法が将来ビデオ生成を不要にすることで推論コストを削減しつつ、予測ダイナミクスを行動生成に活用できることを示している。また、教師モデルと将来観測を訓練時のみ使用する点で、実環境での展開が容易である可能性が示唆される。しかし、LIBERO-Plusでの成功率が標準版で61.6%とLIBEROに比べて低いことから、より複雑なタスクや一般化の課題が残る可能性がある。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、World Action Models (WAMs)の既存手法(explicit-future WAMsやdirect-policy WAMs)が挙げられる。具体的には、将来ビデオ予測を明示的に行う手法や、直接行動を予測する手法が関連する。また、Video DiTやAction DiT、潜在行動教師などの技術も関連する。次に読むべき論文としては、これらの基盤となる研究や、LIBEROベンチマークを提案した論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

分類: cs.AI

原文アブストラクト

World Action Models (WAMs) couple future visual prediction with robot action generation, enabling policies to model how the physical world evolves during interaction. Existing WAMs differ in how predictive dynamics are exposed to the action pathway. Explicit-future WAMs provide direct access to predicted scene evolution, but incur substantial inference costs from iterative video denoising. In contrast, direct-policy WAMs efficiently predict actions from the current observation but lack an explicit inference-time interface for exposing predictive dynamics to the Action DiT. To bridge this gap, we propose ForeWAM, a dynamics-conditioned direct-policy WAM that provides predictive context for action generation without decoding future videos. At its core, Future-KV performs a single Video DiT prefill over the current visual latent and stochastic future slots, and reuses the resulting layer-wise key-value states throughout action denoising. We further introduce dynamics registers supervised by a frozen latent action teacher, encouraging the implicit future states to capture interaction-induced transitions such as object motion, contact changes, and task progress. Ground-truth future observations and the teacher are used only during training; deployment requires neither and performs no future video generation. Without embodied robot data pretraining, the standard and accelerated variants of ForeWAM achieve average success rates of 96.7% and 96.9% on LIBERO, respectively. The standard variant further achieves 61.6% success on LIBERO-Plus. These results demonstrate that direct-policy WAMs can retain efficient action prediction while exposing predictive dynamics to the action pathway without explicitly generating future observations.

関連論文