何が起きたか
arXivに2026-09-23付で掲載された論文で、DeltaWAM: Delta World Action Models for Bimanual Manipulation が公開された。両腕操作向けの世界行動モデルとして、視覚変化の差分と行動を同時に予測する手法を提案している。RoboTwinでは、DeltaWAM with SDMがFast-WAMに対し、クリーン条件で平均成功率81.3%から85.4%へ、視覚ランダム化下で75.8%から83.9%へ改善した。
詳細
論文は、dense-anchor、sparse-delta、actionの3ストリームを用いて、表示変化と行動を分離して扱う構成を示した。さらに、Streaming Delta Memory(SDM)によって、キャッシュしたアンカー文脈をコンパクトな観測差分で更新し、重いvideo-expertの処理を減らす設計を導入した。 計算面では、3つのアーキテクチャーが学習FLOPsを17.78%〜23.77%削減し、SDMは1ステップ推論のレイテンシーを36.57%、FLOPsを31.55%削減した。論文はまた、実世界評価で評価対象の方策の中で最も高い全体成功率と正規化進捗を示したとしている。
Key Facts
| DeltaWAMは、visual deltas と actions を同時に予測する world-action models として提案された。 | [1] |
| 3つのアーキテクチャーは、dense-anchor、sparse-delta、action の各ストリームを使い、表現と計算共有の度合いが異なる。 | [1] |
| Streaming Delta Memory(SDM)は、キャッシュした anchor context を observed deltas で更新する。 | [1] |
| RoboTwinでの平均成功率は、Fast-WAM比で 81.3%→85.4%(clean)と 75.8%→83.9%(visual randomization)に改善した。 | [1] |
| 学習FLOPsは17.78%〜23.77%削減され、SDMは1-step inference latencyを36.57%、FLOPsを31.55%削減した。 | [1] |
本紙の見方
DeltaWAMの新しさは、世界行動モデルを「次フレーム予測」の重い処理から切り離し、visual deltas と action を分けて扱った点にある。既存WAMが訓練時に密な将来フレームを予測し、推論時には完全な観測を重いvideo expertで処理していたのに対し、今回は dense-anchor、sparse-delta、action の3ストリームと SDM で、更新対象を差分中心に圧縮した。つまり、単なる精度改善ではなく、学習計算と推論計算の両方を減らす構造提案である。 本紙の見方では、注目点は成功率の上昇そのものより、同じ RoboTwin での性能向上と計算削減が同時に示されたことだ。クリーン条件で81.3%から85.4%、視覚ランダム化下で75.8%から83.9%という改善は、外観変化への耐性を差分表現で補った可能性を示す。ただし、論文本文だけでは、どの要素が改善に最も寄与したかは切り分けきれない。3つのアーキテクチャーのうち、表現共有と計算共有の違いが性能と速度にどう効いたかが次の論点になる。 業界構造で見ると、この成果はロボット制御の入力を「連続動画そのもの」から「変化量と行動」へ寄せる流れを示す。生成系の動画モデルを土台にしつつ、実機制御では差分更新で回す設計は、計算資源が限られる場面で有効になりやすい。一方で、RoboTwinの指標が実機の安定運用をどこまで代表するか、実世界評価の条件がどこまで広いかは、まだ確認が必要である。特に、両腕操作のどのタスクで優位だったのか、学習データの規模、失敗モード、安全性の扱いは本文からは十分に見えない。 本件は、ロボット基盤モデルの焦点が「大きな生成モデルをそのまま使うこと」から、「制御に必要な情報だけをどう保持し更新するか」へ移っていることを示す事例とみられる。性能を落とさずに FLOPs と遅延を削る設計は、実装上の制約が強い両腕操作で特に意味を持つが、今後は実機での再現性とタスク範囲の確認が焦点になる。
なぜ重要か
RoboTwinでの成功率改善と、学習・推論の計算削減が同時に示されたことで、両腕ロボットの制御で「精度」と「実行コスト」を両立させる設計の参考になる。発表者である論文は、SDMが重いvideo-expert処理を減らすとしており、限られた計算資源で動かす前提のロボット実装に関係する。
日本への影響
日本のロボット研究・実装では、両腕操作や省計算の制御基盤をどこまで実機に載せられるかが論点になるとみられる。特に、動画そのものではなく差分と行動を扱う設計は、計算資源を抑えたい現場で関心を持たれる可能性があるが、実機の安定性は個別検証が必要である。