何が起きたか
arXiv掲載の論文『Flash-WAM: Modality-Aware Distillation for World Action Models』は、世界行動モデル(WAMs)の推論を各モダリティ1ステップに圧縮する手法を2026-06-03に示した。対象は、未来の動画とロボット動作を反復拡散で同時生成するモデルで、従来は多数のデノイジング・ステップが必要だった。論文は、RoboTwin 2.0で1チャンク当たりの遅延を8.1秒から348ミリ秒に短縮し、NVIDIA L40S上で23倍の高速化を達成したとしている。
詳細
論文は、動画ストリームと動作ストリームでノイズ分布が異なる点に着目し、各モダリティに合わせて整合関数を選ぶ蒸留枠組みを提案した。動作側には低ノイズ領域向けの線形勾配スケーリング、動画側には高ノイズ領域向けの分散保存パラメータ化を組み合わせている。 性能面では、RoboTwin 2.0で85.5%、LIBEROで95.7%のタスク成功率を保ち、実機のUnitree G1ヒューマノイドでは平均60%の性能を回復した。一方、同じステップ予算での単純な整合蒸留は24%まで低下したと報告している。
Key Facts
| Flash-WAMは、動画とロボット動作を同時生成する世界行動モデル向けのモダリティ対応ステップ蒸留枠組みである。 | [1] |
| NVIDIA L40S上のRoboTwin 2.0で、1チャンク当たりの遅延を8.1秒から348ミリ秒に短縮した。 | [1] |
| 論文は23倍の高速化と、リアルタイム推論への到達を示したとしている。 | [1] |
| シミュレーションではRoboTwin 2.0で85.5%、LIBEROで95.7%の成功率を示した。 | [1] |
| 実機のUnitree G1ヒューマノイドでは平均60%の性能を回復し、単純な整合蒸留の24%を上回った。 | [1] |
本紙の見方
Flash-WAMの新しさは、WAMの推論を速くした点そのものより、動画と動作で異なるノイズ条件を前提に蒸留設計を分けた点にある。単一の蒸留法をそのまま当てるのではなく、動作側に線形勾配スケーリング、動画側に分散保存パラメータ化を置いたことで、両者の非対称性を処理した構成だと読める。これは、世界モデル系の遅さを単純な計算削減ではなく、生成過程の設計で詰める試みである。 本紙の過去報道はないため、連続性は外部事実との照合に限られるが、論文内では「tens of denoising steps」が実時間制御を妨げていたと明示しており、今回の1ステップ化はその制約への直接回答である。重要なのは、速度改善がシミュレーションだけでなく、Unitree G1で平均60%という実機結果まで示した点である。これにより、単なるベンチマーク圧縮ではなく、実世界のロボット制御に近い場面で蒸留が機能するかが焦点になった。 業界構造でみると、論点はモデル精度よりも推論遅延の位置づけにある。動画生成と行動生成を束ねるWAMは、実時間制御では計算待ちがそのまま制約になるため、GPU上での推論効率が製品化の前提条件になる。今回のようにRoboTwin 2.0で8.1秒から348ミリ秒へ縮むなら、学習済みモデルの価値は精度だけでなく、制御ループ内に入るかどうかで再評価される。もっとも、論文が示したのは単一環境・特定の実機での結果であり、他のロボット、別タスク、異なる計算環境でも同じ遅延と成功率が出るかは未確定である。加えて、1ステップ化で失われる長期整合性や、動画側と動作側のバランスがどこまで一般化するかは今後の確認点である。
なぜ重要か
論文が示したのは、世界行動モデルのボトルネックが「生成できるか」ではなく「実時間で間に合うか」に移っていることだ。RoboTwin 2.0で8.1秒から348ミリ秒へ短縮し、実機のUnitree G1でも平均60%を示した以上、ロボット制御向けモデルは蒸留後の遅延が採用条件になるとみられる。
日本への影響
日本のロボット開発では、モデル精度に加えて推論遅延が実機導入の前提になるため、世界行動モデルを使う場合は計算基盤と制御周期の整合が論点になる。特に、動画と動作の両方を扱う蒸留設計は、実機評価を重視する国内の研究・開発でも参照点になりうる。