何が起きたか

arxiv.orgに掲載された論文(2026年6月11日付)で、RepWAMという世界行動モデルが発表された。RepWAMは、表現型ビジュアル・アクショントークナイザーを訓練し、視覚入力と潜在アクションを整列させたトークンに変換する。これにより、将来の視覚状態とそれを結ぶ潜在アクションを言語指示の下で共同予測する事前学習を行い、実ロボット軌道への適応を経て閉ループ操作を実現する。

詳細

RepWAMは、再構成指向のビデオトークナイザーを継承する既存のWAMとは異なり、意味的な視覚・潜在アクション空間を学習する。具体的には、表現型ビジュアル・アクショントークナイザーを訓練し、視覚入力を整列された視覚トークンと潜在アクショントークンにマッピングする。その後、言語指示の下で将来の視覚状態と潜在アクションを共同予測するようにWAMを事前学習し、実ロボットの軌道に適応させて閉ループ操作を行う。実験では、実世界の操作タスクとシミュレーションベンチマークで多様な操作設定において高い性能を示し、アブレーション研究では再構成指向の代替手法よりも意味的ビジュアル・アクショントークン化の価値が確認された。コードと重みはhttps://github.com/wdrink/RepWAMで公開予定。

Key Facts

RepWAMは表現型ビジュアル・アクショントークナイザーに基づく世界行動モデル(WAM)である。[1]
既存のWAMは再構成指向のビデオトークナイザーを継承しているが、RepWAMは意味的な視覚・潜在アクション空間を学習する。[1]
RepWAMは言語指示の下で将来の視覚状態と潜在アクションを共同予測するように事前学習され、実ロボット軌道に適応して閉ループ操作を行う。[1]
実世界の操作タスクとシミュレーションベンチマークで高い性能を示し、アブレーションで意味的トークン化の価値が確認された。[1]
コードと重みはhttps://github.com/wdrink/RepWAMで公開予定。[1]

本紙の見方

今回の発表は、世界行動モデル(WAM)の設計において、再構成指向のビデオトークナイザーから表現型のトークナイザーへの転換を提案する点で新規性がある。従来のWAMは、事前学習されたビデオ生成モデルのトークナイザーをそのまま利用し、ピクセル再構成に重点を置いていたが、RepWAMは意味的な視覚・潜在アクション空間を学習することで、指示追従のダイナミクスを改善しようとする。これは、ロボット制御における将来予測と行動生成の接続をより直接的に学習する試みであり、一般化可能なロボットポリシーへの一歩と位置づけられる。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及はできないが、ロボット学習における世界モデルの進展という文脈では、再構成から表現学習へのシフトは近年のトレンドと一致する。特に、視覚と言語の統合が進む中で、トークン化の方法がモデルの性能に与える影響は大きく、RepWAMの結果はその重要性を再確認させる。 業界構造への含意としては、ロボットポリシーの学習方法に影響を与える可能性がある。再構成ベースのトークナイザーは計算コストが高く、意味的なトークン化は効率性と性能の両面で優位性をもたらすかもしれない。また、コードと重みの公開は、研究コミュニティでの再現性と応用を促進し、競争を加速させる可能性がある。 未確定の論点としては、実世界の操作タスクの具体的な内容や、シミュレーションベンチマークの詳細が論文本文に記載されていないため、性能の一般化可能性や限界を評価するには追加情報が必要である。また、トークナイザーの学習に必要なデータ量や計算資源、実ロボットへの適応プロセスの詳細も不明であり、今後の検証が焦点になる。

なぜ重要か

RepWAMは、世界行動モデルの設計において再構成から表現学習へのパラダイムシフトを示唆する。ロボットポリシーの一般化に向けた新たな基盤を提供し、今後の研究開発の方向性に影響を与える可能性がある。