何が起きたか
arxiv.orgは2026-10-07付で、World Action Models(WAMs)向けの訓練不要フレームワーク「RealtimeWAM」を公表した。狙いは、WAMsの推論遅延を下げ、ロボット制御の応答性を高めることである。評価ではFastWAMとOpenWAMを対象に、RoboTwin、LIBERO、LIBERO-Plusで検証した。 RTX 4090上の平均推論遅延はFastWAMで24.09ms、OpenWAMで63.09msだった。平均速度向上はそれぞれ8.90倍、10.67倍で、平均成功率は82.75%と87.41%だった。
詳細
RealtimeWAMは、観測処理と予測を並列化しつつ、視覚的に安定した領域では観測特徴を再利用し、Transformerの残差も再利用する方式を取る。さらに、小さな予測変化には追加の精緻化を残すことで、閉ループ制御で変化する計算需要に合わせて計算量を調整する。 評価対象はFastWAMとOpenWAMで、ベンチマークはRoboTwin、LIBERO、LIBERO-Plusである。論文は、実世界タスク5件でも検証し、native inferenceに対してFastWAMで平均成功率を17.2ポイント、OpenWAMで37.2ポイント改善したとしている。
Key Facts
| RealtimeWAMはWorld Action Models(WAMs)向けの訓練不要フレームワークである | [1] |
| 観測処理と予測を並列化し、視覚的に安定した領域で特徴再利用やTransformer残差の再利用を行う | [1] |
| RTX 4090上での平均推論遅延はFastWAMで24.09ms、OpenWAMで63.09msである | [1] |
| 平均速度向上はFastWAMで8.90倍、OpenWAMで10.67倍である | [1] |
| 実世界タスク5件で、native inference比の平均成功率改善はFastWAMで17.2ポイント、OpenWAMで37.2ポイントである | [1] |
本紙の見方
RealtimeWAMの新しさは、WAMの推論を速くする点そのものより、訓練を追加せずに推論時の計算配分を変えるところにある。FastWAMのように未来動画生成を外す専用設計とは異なり、RealtimeWAMはlayerwise dependencies、特徴の選択的再利用、Transformer残差の再利用を組み合わせ、複数のWAMアーキテクチャにまたがる一般フレームワークとして提示されている。ここで主役なのはモデル精度ではなく、閉ループ制御で問題になる待ち時間を、観測・予測・再計算の配分で抑える設計である。 本紙の観点では、この論文は「モデルを作る」話ではなく、「モデルを制御ループに載せる」ための実装論に近い。RoboTwin、LIBERO、LIBERO-Plusというシミュレーション系の評価軸に加え、実世界タスク5件でも成功率を示しているため、単なる速度最適化ではなく、遅延短縮と成功率維持を同時に扱っている点が重要である。ただし、RTX 4090での結果はGPU世代を固定した条件であり、他の推論基盤やロボット実装にそのまま移るかは別問題である。 業界構造への含意としては、WAM系の実装で重要なのが学習済みモデル単体の性能だけでなく、推論時のキャッシュ戦略、並列実行、残差再利用といったシステム設計に移っている点が読める。ロボット制御では、入力画像の変化が小さい場面でどこまで再計算を省けるかが遅延と精度の両立に効くため、モデル設計と実行系設計の境界が曖昧になる。次に確認すべき論点は、他GPUや他アーキテクチャで同じ速度向上が得られるか、実機ロボットでのレイテンシ分布がどうか、そして selective reuse がどの程度の視覚変化まで安定するかである。
なぜ重要か
この研究は、WAMをロボット制御に使う際のボトルネックが学習精度だけでなく推論遅延にあることを、RTX 4090上の計測と実世界タスク5件の結果で示した。発表元のarxiv.orgによれば、訓練を追加せずに平均遅延24.09msと63.09ms、平均成功率82.75%と87.41%を両立させた点が焦点である。
日本への影響
日本のロボット開発では、視覚入力に基づく閉ループ制御を実装する際に、モデル精度だけでなく推論時の遅延管理が課題になる。RealtimeWAMが示したような特徴再利用や残差再利用は、計算資源を増やす以外の方法で応答性を高める設計として、制御ソフトと推論基盤の両方を持つ企業に関係しうる。