何が起きたか

2026年8月12日にarXivで公開された論文「Foresight Without Seeing: Latent Futures for World Action Models」において、ForeWAMという新しいWorld Action Modelが提案された。ForeWAMは将来の映像を生成せずに予測的文脈を行動生成に提供する手法で、LIBEROベンチマークで平均成功率96.7%を達成した。

詳細

ForeWAMは、将来の映像をデコードせずに予測的文脈を行動生成に提供するダイナミクス条件付き直接ポリシーWAMである。中核となるFuture-KVは、現在の視覚的潜在変数と確率的な将来スロットに対して単一のVideo DiTプレフィルを実行し、得られた層ごとのキー・バリュー状態を行動デノイジング全体で再利用する。また、凍結された潜在行動教師によって教師されるダイナミクスレジスタを導入し、暗黙の将来状態が物体の動きや接触変化、タスク進行などの相互作用誘発遷移を捉えることを促す。実環境での推論では将来の観測や教師は不要で、将来の映像生成も行わない。標準および高速化された変種はLIBEROで平均成功率96.7%と96.9%を達成し、標準変種はLIBERO-Plusで61.6%の成功率を達成した。

Key Facts

ForeWAMは、将来の映像を生成せずに予測的文脈を行動生成に提供するダイナミクス条件付き直接ポリシーWAMである。[1]
Future-KVは、現在の視覚的潜在変数と確率的な将来スロットに対して単一のVideo DiTプレフィルを実行し、得られた層ごとのキー・バリュー状態を行動デノイジング全体で再利用する。[1]
ダイナミクスレジスタは凍結された潜在行動教師によって教師され、暗黙の将来状態が相互作用誘発遷移を捉えることを促す。[1]
標準および高速化されたForeWAMはLIBEROで平均成功率96.7%と96.9%を達成した。[1]
標準ForeWAMはLIBERO-Plusで61.6%の成功率を達成した。[1]

本紙の見方

今回のForeWAMの提案は、World Action Models(WAM)の設計における重要な転換点を示す。従来のWAMは、将来の視覚予測を明示的に生成するか(explicit-future)、現在の観測から直接行動を予測するか(direct-policy)の二択に分かれていた。前者は予測ダイナミクスを行動経路に直接提供できるが、反復的なビデオデノイジングによる推論コストが大きい。後者は効率的だが、推論時に予測ダイナミクスを行動生成に明示的に提供するインターフェースが欠けていた。ForeWAMは、将来の映像をデコードせずに予測的文脈を提供することで、この二律背反を解消しようとする。具体的には、Future-KVが単一のVideo DiTプレフィルで将来の潜在状態を符号化し、そのキー・バリュー状態を行動デノイジング全体で再利用する。これにより、将来の映像生成を回避しつつ、予測ダイナミクスを行動生成に組み込むことを可能にしている。また、ダイナミクスレジスタを導入し、凍結された潜在行動教師から教師信号を得ることで、暗黙の将来状態が物体の動きや接触変化などの相互作用誘発遷移を捉えるようにしている。この設計は、実環境での推論時に将来の観測や教師を必要とせず、将来の映像生成も行わないため、実用的な展開を見据えたものと言える。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、ロボット学習におけるWAMの進展は、近年の基盤モデル研究の流れと連続している。特に、ビデオ生成モデルをロボットの行動予測に活用する試みは、複数の研究グループで進められており、ForeWAMはその中で推論効率を重視したアプローチとして位置づけられる。 業界構造への含意としては、ForeWAMの手法が実ロボットへの展開を意識している点が挙げられる。将来の映像生成を回避することで、推論時の計算コストを削減し、リアルタイム性が求められる実環境での適用可能性を高める。これは、ロボットの知能化を目指す企業や研究機関にとって、計算資源の制約を緩和する可能性がある。一方で、LIBEROベンチマークでの成功率は高いものの、実世界の多様な環境での汎用性は未検証であり、今後の検証が焦点となる。 未確定の論点としては、まず、ForeWAMが実ロボットに適用された際の性能が挙げられる。シミュレーション環境での成功率は高いが、実環境でのノイズや不確実性への頑健性は不明である。また、ダイナミクスレジスタが捉える「相互作用誘発遷移」の質が、実際のタスク遂行にどの程度寄与するのかも検証が必要である。さらに、Future-KVのプレフィル計算のコストが、従来の直接ポリシーWAMと比較してどの程度増加するのか、定量的な評価が求められる。加えて、学習データの規模や多様性が性能に与える影響も、今後の研究で明らかにされるべき点である。

なぜ重要か

ForeWAMは、将来の映像生成を回避しながら予測的文脈を行動生成に組み込むことで、WAMの推論効率と性能の両立を目指す。これは、ロボットの実環境展開における計算資源の制約を緩和し、より実用的な行動予測モデルの実現につながる可能性がある。今後の実ロボットでの検証が、この手法の有効性を左右するだろう。