何が起きたか
研究チームは、ロボットの行動予測とビデオ世界モデルを組み合わせたWAMの新アーキテクチャ「Faster-WAM」を発表した。従来のWAMは共有バックボーンやMixture-of-Transformers設計により、行動モジュールの深さがビデオバックボーンに縛られ、計算コストと推論遅延が大きかった。新たに導入されたDoTは、事前学習済みビデオTransformerを表現ハブとして扱い、ドッキングインターフェースを介して軽量な出力ヘッドを接続する。これにより、バックボーンの全層の表現に直接アクセスしつつ、柔軟なヘッド設計が可能になる。Faster-WAMは30層のビデオバックボーンに単層の行動ヘッドをドッキングし、全ビデオ層のキーとバリューを融合し、RoPE再調整を適用する。追加の具現化事前学習なしで、LIBEROとRoboTwin 2.0で競争力のある性能を達成し、LIBERO-Plusで強い分布外汎化を示した。制御比較では、推論あたり66.5msという最低のエンドツーエンドレイテンシを記録し、Fast-WAM比3.2倍の高速化を実現した。
Key Facts
| 既存のWAMは共有バックボーンやMixture-of-Transformers設計により、行動モジュールの深さがビデオバックボーンに縛られ、計算オーバーヘッドと推論遅延が大きい。 | [0] |
| DoTは事前学習済みビデオTransformerを表現ハブとし、ドッキングインターフェースを介して軽量な出力ヘッドを接続する設計原理である。 | [0] |
| Faster-WAMは30層のビデオバックボーンに単層の行動ヘッドをドッキングし、全ビデオ層のキーとバリューを融合し、RoPE再調整を適用する。 | [0] |
| 追加の具現化事前学習なしで、LIBEROとRoboTwin 2.0で競争力のある性能を達成し、LIBERO-Plusで強い分布外汎化を示した。 | [0] |
| Faster-WAMは推論あたり66.5msのエンドツーエンドレイテンシを達成し、Fast-WAM比3.2倍の高速化を実現した。 | [0] |
なぜ重要か
この研究は、世界行動モデル(WAM)の設計において、ビデオ中心のアプローチが行動予測の性能を維持しつつ、推論遅延を大幅に削減できることを示した。ロボットの実時間制御やエッジ展開において、低レイテンシは重要であり、DoTアーキテクチャはタスク固有のヘッド設計の柔軟性も提供する。今後のロボット基盤モデルの効率化に寄与するとみられる。