何が起きたか

RealtimeWAMは、動画生成バックボーンの視覚表現を用いて行動予測を行うWorld Action Models向けに、1ステップの行動生成と非同期推論を導入した手法である。掲載日は2026-10-05で、arxiv.org上で公表された。既存の効率的なWAMでは、アクションを複数回整える段階と、動画側とアクション側の処理を順番に待たせる構造が推論効率を下げていた。

詳細

同手法は、Teacher-Anchored Consistency Distillation(TACD)とCross-Expert Wavefront Pipelining(CEWP)の2つを中核に置く。TACDは、固定した教師モデルのマルチステップのロールアウト終端を明示的に監督し、局所的一貫性だけでは最終行動の精度を保証できないというずれに対処する。CEWPは、動画KVキャッシュをブロック単位で共有しながら2つのエキスパートを重ね、対応するアクション側のアテンションが使う直前だけ同期する。

Key Facts

RealtimeWAMはWorld Action Models向けの1ステップ行動生成と非同期推論を提案した。[1]
Teacher-Anchored Consistency Distillation(TACD)を用いて、固定教師のマルチステップ終端を監督した。[1]
Cross-Expert Wavefront Pipelining(CEWP)により、動画KVキャッシュをブロック単位で共有しつつ待ち時間を減らした。[1]
LIBERO、LIBERO-Plus、RoboTwinで評価し、Fast-WAMとFaster-WAMのモデル変種にも適用した。[1]
H100上で約25倍のエンドツーエンド高速化を示し、性能低下は1%未満だった。[1]

本紙の見方

RealtimeWAMの新規性は、WAMの精度を保ったまま推論の二重の無駄を削った点にある。1つはアクション生成を複数段階で整える既存方式、もう1つは動画側とアクション側を直列に待たせる構造である。今回の提案は、TACDで1ステップ生成の精度を支え、CEWPで実行の重なりを作るため、単なる蒸留や単なるパイプライン化ではなく、学習法と実行系の両方を同時に詰めている。性能を<1%の低下に抑えたままH100で約25倍高速化したという結果は、行動予測モデルでは速度と精度の両立が依然として中心課題であることを示す。 ただし公開情報だけを見ると、今回の焦点はモデルの新規タスク追加ではなく、既存のWorld Action Modelsの推論設計をどう再編するかにある。Fast-WAMやFaster-WAMを対象に含めている点からも、特定の単一アーキテクチャ専用というより、効率化の共通部品として位置づけようとしていると読める。 業界構造への含意は、学習済みモデルの性能競争が「どれだけ賢いか」だけでなく、「どれだけ待たずに動けるか」に移っている点にある。動画KVキャッシュの共有やブロック単位の同期は、計算量そのものよりも推論の実装方式が速度差を生むことを示しており、GPU上の実行最適化がモデル設計と一体で問われる。LIBERO系とRoboTwinでの結果は、評価系によって改善幅が変わる可能性も示唆するため、次に確認すべき論点は、異なるロボットタスクや実機環境で同じ約25倍級の改善が維持されるか、またTACDとCEWPのどちらが支配的に効いているかである。

なぜ重要か

発表資料が示す通り、RealtimeWAMは性能低下を1%未満に抑えながら約25倍の高速化を示しており、ロボットの行動予測を実時間に近づける条件を具体化した。研究段階のモデルでも、推論の待ち時間と多段階生成を減らせれば、同じGPU資源でより多くの試行を回せる可能性がある点が重要である。