何が起きたか

arXivは2026年9月24日、論文「Rolling-WAM: World Action Models with Rolling Imagination」を公開した。論文は、ロボット操作向けのWorld Action Models(WAMs)で各再計画サイクルごとに動画と行動の両方を一括でノイズ除去すると遅延が大きくなる点に対し、処理を複数サイクルに分散するRolling-WAMを提案している。評価ではLIBERO、RoboTwin、実世界のUnitree G1ヒューマノイドで競争力のある操作性能を示し、標準的なjoint WAMsに対して定常状態の再計画速度を4.5倍にしたとしている。

詳細

論文は、将来の動画・行動チャンクを複数の再計画サイクルにまたがって扱うスライディングウィンドウ方式を採る。各ステップでは、直近に実行する行動チャンクを完全にデノイズし、より先のチャンクは部分的に精緻化する。新しいカメラ観測が入るとウィンドウを前進させ、残された将来チャンクのデノイジングを継続する設計である。これにより、予測ホライゾン全体を毎回ゼロから処理し直す必要をなくし、計算負荷を時間方向に分散する構成だとしている。

Key Facts

arXivは2026年9月24日に「Rolling-WAM: World Action Models with Rolling Imagination」を公開した。[1]
Rolling-WAMは、World Action Models(WAMs)の再計画サイクルごとの動画・行動の一括デノイジングによる遅延を抑える手法である。[1]
手法は、ノイズレベルの異なる動画・行動チャンクを保持するスライディングウィンドウを用いる。[1]
評価先はLIBERO、RoboTwin、実世界のUnitree G1ヒューマノイドである。[1]
論文は、標準的なjoint WAMsに対して定常状態の再計画速度が4.5倍になったとしている。[1]

本紙の見方

Rolling-WAMの新規性は、ロボットが次の行動を選ぶたびに将来映像と行動を全区間まとめて再計算するのではなく、計算を複数の再計画サイクルに分割した点にある。ここで重要なのは、性能向上の主張そのものより、遅延の発生源を「予測の質」ではなく「再計画時の一括処理」に見立てて、時間方向の配分で解いた構成である。WAMsの枠組み自体は既存だが、Rolling-WAMはその実行形態を変えているため、モデルの表現力というより推論の運用設計に差分があると読める。なお、論文は「競争力のある操作性能」としているが、性能の絶対値や失敗例は本文要約だけでは読めない。 本紙の関連記事はないため、過去報道との連続性は置けない。ただし、今回の要点はUnitree G1実機での評価が含まれる点で、シミュレーションだけの手法提案より一段実装寄りである。一方で、LIBEROとRoboTwinの結果が実機の挙動や再計画の安定性をどこまで代表するかは別問題で、論文の4.5倍という速度改善がどの条件で維持されるかが焦点になる。スライディングウィンドウ方式は計算を平準化しやすい半面、保持する未来チャンクの長さ、ノイズスケジュール、観測更新頻度の設計が性能と遅延の両方を左右するとみられる。 業界構造でみると、この論文が効くのはロボット本体よりも、閉ループ制御の上流にある視覚・行動生成の推論基盤である。操作性能が同等でも再計画が速ければ、実機では応答遅れを短くできる可能性があるため、研究の焦点は「どのモデルが最も賢いか」から「どの再計画設計が実機の制約下で回るか」に移る。未確定の論点は、4.5倍改善の測定条件、行動チャンク長、カメラ更新条件、実機での失敗率、そして他のロボットやタスクで同じ設計が維持されるかである。

なぜ重要か

論文が示すのは、ロボット操作のボトルネックがモデルの予測精度だけでなく、再計画時の遅延にもあるという点である。Unitree G1実機を含む評価で4.5倍の再計画速度をうたっているため、閉ループ応答を重視する操作系では、推論をどう分割するかが実用性の条件になり得る。