何が起きたか

2026年6月3日にarXivで公開された論文「Flash-WAM: Modality-Aware Distillation for World Action Models」は、動画とロボット動作を同時生成する世界行動モデルの推論を高速化する手法を提案した。同手法はNVIDIA L40S上で推論レイテンシを8.1秒から348ミリ秒へ23倍短縮し、Unitree G1ヒューマノイドロボットで平均60%の実世界性能を達成したと報告している。

詳細

Flash-WAMは、動画と動作の各モダリティのノイズ分布の非対称性に着目し、それぞれに適した整合性関数を選択する。動作ストリームには線形勾配スケーリング、動画ストリームには分散保存パラメータ化を適用する。RoboTwin 2.0でタスク成功率85.5%、LIBEROで95.7%を維持し、単純な整合性蒸留では同じステップ数で24%に低下するのに対し、Flash-WAMは60%を達成した。

Key Facts

Flash-WAMは世界行動モデルの推論を単一ステップに圧縮し、NVIDIA L40S上でレイテンシを8.1秒から348ミリ秒へ23倍高速化した。[1]
RoboTwin 2.0でタスク成功率85.5%、LIBEROで95.7%を達成した。[1]
Unitree G1ヒューマノイドロボットで実世界性能平均60%を達成した。[1]
単純な整合性蒸留では同じステップ数で24%に低下した。[1]

本紙の見方

今回のFlash-WAMは、世界行動モデル(WAM)の実時間制御への障壁とされてきた推論コストを、モダリティごとのノイズ特性に応じた蒸留手法で解決した点で新規性がある。従来の蒸留手法が動画と動作のノイズ分布の非対称性を考慮せず性能を落とすのに対し、Flash-WAMは各モダリティに適した整合性関数を選ぶことで、単一ステップでも性能を維持した。これは、ロボットの身体能力の進歩に比べて遅れているとされる音声対話技術と同様に、推論速度が実用化の鍵となる分野での進展と位置づけられる。 本紙の過去報道では、NVIDIAがエッジAI向けJetsonのメモリー最適化や、LGとの二足歩行ヒューマノイド共同開発など、ロボット向けAI基盤を強化している。Flash-WAMはNVIDIA L40S上で高速化を実証しており、NVIDIAのハードウェア上で動作するソフトウェア最適化の一環とみられる。また、推論シフトが半導体業界に変化をもたらすという本紙の報道とも整合的で、推論効率の向上がAIロボットの実用化を後押しする可能性がある。 業界構造への含意として、推論の高速化はエッジAIやロボットのリアルタイム制御を可能にし、クラウド依存からエッジ処理への移行を加速させる。これにより、NVIDIAのGPUやJetsonモジュールの需要がさらに高まる一方、メモリーや光電融合など周辺技術の重要性も増すとみられる。また、Unitree G1のようなヒューマノイドロボットの実用性が向上すれば、ロボット市場の拡大につながる可能性がある。 未確定の論点として、Flash-WAMの実世界性能は平均60%であり、タスク成功率の詳細やロボットの種類によるばらつきが不明である。また、単一ステップでの推論が実際のロボット制御でどの程度の安定性を持つか、さらなる検証が必要である。

なぜ重要か

Flash-WAMは、世界行動モデルの推論を実時間可能な水準に引き下げることで、ヒューマノイドロボットの実用化を前進させる可能性がある。推論効率の向上は、ロボットの身体能力と知能のギャップを埋める一歩となり、AIロボット市場の拡大に寄与するとみられる。