何が起きたか
arxiv.orgに2026年6月6日付で掲載された論文「Light-WAM: Efficient World Action Models with State-Fusion Action Decoding」において、ロボット操作のための軽量な世界行動モデル(WAM)が提案された。Light-WAMは、コンパクトなビデオバックボーンと潜在空間での将来ビデオ監視を用い、StateFusionActionExpertにより単一のフォワードパスでアクションを予測する。実験では、0.44Bの学習可能パラメータでLIBEROとRoboTwin 2.0で性能を維持し、72.03msの推論遅延と4.1GiBのピークGPUメモリを達成した。
詳細
Light-WAMは、World Action Models(WAM)の枠組みを軽量化したもので、将来予測を追加の学習目的として組み込む。従来のWAMは大規模な生成アーキテクチャに依存し、訓練コストと推論遅延が高い。Light-WAMは、コンパクトなビデオバックボーンを使用し、ダウンサンプリングされた潜在空間で将来ビデオ監視を行うことで、ビデオ共同訓練のコストを削減しつつ表現学習の利点を維持する。アクション予測には、複数のバックボーン層から適応された状態を読み取り、学習可能なクエリプーリングで融合し、単一のフォワードパスでアクションを直接予測するStateFusionActionExpertを導入する。これにより、重い生成アクションエキスパートを回避する。実験では、LIBEROで強い性能を維持し、RoboTwin 2.0で使用可能なマルチタスク性能を達成した。
Key Facts
| Light-WAMは0.44Bの学習可能パラメータを使用する。 | [1] |
| Light-WAMは72.03msの推論遅延と4.1GiBのピークGPUメモリを達成した。 | [1] |
| Light-WAMはLIBEROで強い性能を維持し、RoboTwin 2.0で使用可能なマルチタスク性能を達成した。 | [1] |
| Light-WAMはStateFusionActionExpertを導入し、単一のフォワードパスでアクションを予測する。 | [1] |
| Light-WAMは将来ビデオ監視をダウンサンプリングされた潜在空間で行う。 | [1] |
本紙の見方
今回の提案は、ロボット操作における世界行動モデル(WAM)の実用性を高める点で新規性がある。WAMは将来予測を学習に組み込むことで、タスクに関連する時間構造を表現にエンコードするが、従来は大規模な生成アーキテクチャが必要で、訓練コストと推論遅延が課題だった。Light-WAMは、コンパクトなビデオバックボーンと潜在空間での監視により、ビデオ共同訓練のコストを削減しつつ、その利点を維持する。さらに、StateFusionActionExpertにより、重い生成アクションエキスパートを回避し、単一のフォワードパスでアクションを予測する。これにより、0.44BパラメータでLIBEROとRoboTwin 2.0で性能を維持し、72.03msの推論遅延と4.1GiBのピークGPUメモリを達成した。これは、ロボット操作のための効率的な閉ループポリシーとしての展開可能性を示す。 本紙の過去報道との接続は、関連記事が提供されていないため、直接の言及は避ける。しかし、ロボット学習の分野では、モデルの軽量化と実時間推論は常に重要な課題であり、Light-WAMはその流れに沿ったものと位置づけられる。 業界構造への含意としては、ロボット操作の学習モデルにおいて、計算資源の制約が大きいエッジデバイスや実機展開を考慮すると、軽量なモデルは導入障壁を下げる可能性がある。特に、推論遅延72.03msは実時間制御に近い水準であり、実機での利用が視野に入る。また、訓練コストの削減は、データ収集やモデル更新の頻度を高めることを可能にし、ロボットの適応性向上につながる可能性がある。 未確定の論点としては、Light-WAMの性能がLIBEROとRoboTwin 2.0で検証されているが、実世界の多様なタスクでの汎化性や、より複雑な操作への適用可能性は不明である。また、0.44Bパラメータでの性能維持が、どの程度のタスク複雑性まで有効かは、今後の検証が必要である。さらに、StateFusionActionExpertの設計が、他のバックボーンやタスクにどの程度一般化するかも焦点になる。
なぜ重要か
Light-WAMは、ロボット操作における世界行動モデルの計算コストを大幅に削減し、実時間推論を可能にする点で、ロボットの実用化に向けた一歩となる。軽量なモデルは、限られた計算資源での展開を可能にし、ロボットの学習と適応のサイクルを加速させる可能性がある。