何が起きたか

arXivは2026-09-29、論文「Staircase Policy: Streaming Inference for World-Action Models with Large Action Chunks」を公開した。論文は、World-Action Models(WAMs)の推論負荷を抑えるため、大きな行動チャンクを段階的なサブチャンクに分けて処理する「STAIRCASE POLICY」を提案している。近い時点の行動は利用可能になり次第実行し、後続行動は最新観測で更新し続ける方式である。

詳細

論文によると、STAIRCASE POLICYは、flow-matching VLAをJEPA風のWAMに変換し、denoisingの段階をずらしながら大きな行動チャンクを分割する。各サブチャンクの境界では、最新の観測からfuture latentを再予測し、未実行の行動を更新することで、推論を全体で繰り返さずに長い実行区間へ対応する。 性能面では、S-WAMはLIBEROで97.7%、LIBERO-Plusで87.9%を達成した。実行速度は292.7 actions per secondで、従来の同等精度の実行方法に対して3.62倍のスループットとされる。time-to-first-actionは123.6 msから73.3 msへ短縮し、追加の推論最適化を加えると642.9 actions per secondに達した。

Key Facts

論文「Staircase Policy: Streaming Inference for World-Action Models with Large Action Chunks」は2026-09-29にarXivで公開された。[1]
STAIRCASE POLICYは、大きな行動チャンクをサブチャンクに分け、近い将来の行動を先に実行しながら後続行動を最新観測で更新する推論・学習枠組みである。[1]
S-WAMはLIBEROで97.7%、LIBERO-Plusで87.9%を達成した。[1]
S-WAMの実行速度は292.7 actions per secondで、従来の同等精度の実行方法の3.62倍とされた。[1]
time-to-first-actionは123.6 msから73.3 msへ短縮し、追加の推論最適化で642.9 actions per secondに達した。[1]

本紙の見方

この論文の新しさは、ロボットの行動生成を「一括で出す」か「逐次で出す」かの二択ではなく、大きな行動チャンクをサブチャンクへ切り分け、実行と再予測を重ねる点にある。World-Action Modelsは未来観測を条件にするぶん推論が重くなりやすいが、著者らはその負荷を段階化で吸収しようとしている。したがって主題はモデル性能そのものより、長い実行区間での推論配置の設計にあるとみられる。 数値を見ると、LIBEROの97.7%、LIBERO-Plusの87.9%という精度は、単なる高速化実験ではなく、精度を維持したまま実行効率を上げられるかが焦点であることを示す。292.7 actions per second、time-to-first-action 73.3 ms、さらに642.9 actions per secondという値は、どの時点で動作を確定し、どこまでを再推論に回すかという境界設計が実運用のボトルネックに直結することを示している。ここで重要なのは、未来潜在の再予測を各サブチャンク境界で行うという構造であり、単なるキャッシュやバッチ処理ではない点である。 本紙の見方としては、これはロボット政策モデルの系譜の中で、精度向上よりも「実行しながら更新する」推論構造を前面に出した提案だと位置づけられる。flow-matching VLAをJEPA-style WAMへ転用するという記述は、学習表現と推論スケジュールを一体で設計していることを示す一方、実機でどの程度安定して動くか、どのバックボーンで同様の速度・精度が再現するかはまだ見極めが必要である。加えて、追加最適化で642.9 actions per secondまで伸びるとしているが、その最適化の内訳は本文からは限定的にしか読めないため、再現可能性の条件は今後の確認点になる。 業界構造への含意としては、ロボット制御の競争軸が「より大きいモデル」だけでなく、「どれだけ早く最初の動作を出し、未確定部分を後追いで修正できるか」に移る可能性がある。特に、視覚・行動・未来予測を同時に扱うWAM系では、推論コストがそのまま導入障壁になりやすく、サブチャンク化のような設計はエッジ側の実装条件や実時間制御との相性が問われる。未確定の論点は、S-WAMのアーキテクチャ詳細、追加推論最適化の具体策、実ロボットタスクでの失敗条件、そして長期実行時にどの程度再予測誤差が蓄積するかである。

なぜ重要か

著者らは、同手法が従来の同等精度の実行方法より3.62倍のスループットを示したとしており、ロボット制御では精度だけでなく応答遅延と実行密度が導入条件になることを示す。time-to-first-actionが123.6 msから73.3 msへ短縮した点は、対話的な操作や短い応答遅延が求められる場面で評価軸になりやすい。