何が起きたか
arxiv.orgに2026年8月23日付で掲載された論文で、世界行動モデル(WAM)のオン方針蒸留手法WAM-OPDが提案された。RoboTwin 2.0の2タスクで、公開済みのFlash-WAMの成功率がHANDOVER MICで0.0%から58.3%、PUT OBJECT CABINETで16.7%から33.3%に向上した。
詳細
WAM-OPDは、ビデオ優先のWAMに対する展開整合的なポストトレーニング手法。学生モデルが環境で行動し履歴分布を決定、凍結された教師モデルがその履歴に整合するビデオと行動のターゲットをラベル付けする。学生の行動ブランチは展開時と同様に自身が生成したビデオ計画の下で訓練され、共有バックボーンの軽量アダプタをビデオと行動の損失、および行動フローマッチング正則化子で更新する。
Key Facts
| WAM-OPDはオン方針蒸留により、加速された学生モデルのタスク能力喪失を修復する手法として提案された。 | [1] |
| RoboTwin 2.0の2タスクで、Flash-WAMの成功率がHANDOVER MICで0.0%から58.3%、PUT OBJECT CABINETで16.7%から33.3%に改善した。 | [1] |
| WAM-OPDでは、凍結された教師モデルが学生の履歴に整合するビデオと行動のターゲットをラベル付けし、学生の行動ブランチは自身が生成したビデオ計画の下で訓練される。 | [1] |
| 共有バックボーンの軽量アダプタは、ビデオと行動の損失、および行動フローマッチング正則化子で更新される。 | [1] |
| 論文は、これらのタスク固有の結果は初期の能力証明であり、広範または均一な汎化の証拠ではないとしている。 | [1] |
本紙の見方
本手法の新規性は、オン方針蒸留という枠組みにある。従来の蒸留はオフラインの固定データセットを用いるが、WAM-OPDは学生自身が環境で行動し、その履歴分布に基づいて教師がラベルを生成する。これにより、オフラインデータでは表現が不十分な状態への対応が期待される。また、学生の行動ブランチを展開時と同じ条件(自身が生成したビデオ計画)で訓練する点は、訓練と推論の不一致を減らす工夫であり、実用上の重要な設計と言える。 本紙の過去報道は存在しないが、ロボット学習における蒸留手法の進展として位置づけられる。特に、ビデオ生成と行動生成を統合したWAMの文脈で、蒸留後の能力低下を修復する手段として、スパース報酬の強化学習を避けられる点は実用性が高い。 業界構造への含意として、この手法はロボットのポリシー学習におけるデータ効率と展開整合性の重要性を示す。特に、実環境でのデータ収集コストが高い中で、オン方針蒸留はシミュレーションと実機のギャップを埋める可能性がある。ただし、RoboTwin 2.0はシミュレーション環境であり、実機での検証は未確認である。 未確定の論点として、まず、2タスクのみの検証であり、他のタスクや複雑な環境での汎化性が不明である。また、Flash-WAMの具体的なモデル規模や計算コスト、蒸留にかかる時間などの詳細は論文本文に記載がない。さらに、オン方針蒸留の際の安全性や、実機での適用可能性も今後の課題である。
なぜ重要か
ロボット学習における蒸留後の能力低下は実用上の大きな障壁であり、WAM-OPDはその修復をオン方針で行う新たな選択肢を示した。成功率の大幅な改善は、ビデオ優先のWAMの実用化に向けた一歩となるが、汎化性と実機適用の検証が次の焦点となる。