何が起きたか
arXivは2026-09-27、ロボット操作向けのWorld-Action Model「DeltaWAM: Change-Centric Visual Foresight via Delta Tokens for an Efficient World-Action Model」を掲載した。DeltaWAMは、将来のシーン全体を毎回再構成するのではなく、連続するDINO特徴マップ間の変化を1つのベクトルで表すデルタトークンを予測単位にする。論文では、256 GPU時間を使ってH100 2基で学習し、0.725BパラメータでLIBEROの平均成功率92.8%を達成したとしている。
詳細
論文は、DeltaWAMが大規模動画で事前学習した潜在世界モデルDeltaWorldを基盤にし、未来の各フレームにつきデルタトークンを1つずつ自己回帰的に予測すると説明している。さらに、flow-matchingのaction expertが、予測した遷移と現在のDINO特徴を条件にしてアクションチャンクを生成する構成だとしている。 性能面では、LIBEROで平均成功率92.8%を記録し、LIBERO-Proでは手続き的な摂動下でも頑健な汎化を示したとしている。推論は1アクションチャンク当たり142.1ms、ピークメモリは3.86GBと記載されている。
Key Facts
| DeltaWAMは、変化量を表すデルタトークンを未来予測の単位にするWorld-Action Modelである。 | [1] |
| 論文は2026-09-27にarXivへ掲載された。 | [1] |
| 学習はH100 2基で256 GPU時間とされる。 | [1] |
| モデル規模は0.725Bパラメータとされる。 | [1] |
| LIBEROでの平均成功率は92.8%、推論は1アクションチャンク当たり142.1ms、ピークメモリは3.86GBとされる。 | [1] |
本紙の見方
DeltaWAMの新しさは、ロボットの未来予測を「画像を丸ごと再生する」方向ではなく、「連続フレームの差分を圧縮して扱う」方向へ寄せた点にある。World-Action Model自体は既存の枠組みだが、ここではデルタトークンを予測の基本単位に置くことで、計算と冗長性の問題に対処しようとしている。これは、出力の見た目よりも行動に必要な変化だけを表現する設計であり、視覚予測を制御に接続する際の実装上の焦点を変えているとみられる。 本紙の過去報道との接続はないが、論文内の構成を見ると、DeltaWorldで事前学習した潜在世界モデルに、DINO特徴を空間的なアンカーとして重ね、さらにflow-matchingのaction expertで行動チャンクを生成する三層構造になっている。つまり、入力の動画表現、変化の予測、行動生成を分けている点が重要である。単一モデルで全体を再構成するより、差分・錨・行動を役割分担させた方が、計算資源3.86GBという比較的軽い推論条件につながった可能性がある。ただし、論文に書かれているのは結果であり、その因果を断定するのは早い。 業界構造への含意としては、ロボット向け基盤モデルの競争軸が、単純な精度だけでなく、GPU時間、パラメータ規模、推論メモリ、アクションチャンク単位のレイテンシに移っている点が挙げられる。256 GPU時間で0.725B規模を学習し、142.1msで動くなら、研究室内の評価だけでなく、実機制御ループへの接続が論点になる。LIBEROとLIBERO-Proの両方で性能が示されたことから、静的ベンチマークだけでなく手続き的摂動への耐性も評価対象になっていることが分かる。 未確定の論点は、DeltaWAMがどの程度の実機条件で再現できるか、行動チャンクの長さや生成条件が性能にどう効くか、そしてDeltaWorldやDINO特徴のどの部分が支配的に寄与したのかである。論文は数値を提示しているが、どの要素が効率化の主因かまでは本文だけでは切り分けにくい。
なぜ重要か
論文が示す0.725Bパラメータ、256 GPU時間、3.86GBピークメモリという条件は、ロボットの未来予測モデルに求められる計算資源の見積もりを具体化する。研究開発側にとっては、画像生成的な世界モデルよりも、差分表現を使う設計が制御用途でどこまで効くかを判断する材料になる。
日本への影響
日本のロボット研究・実装では、実機制御に接続する際の推論遅延とメモリ使用量が論点になりやすい。142.1msと3.86GBという論文の数値は、こうした制約下での採用可否を考える際の比較対象になりうる。