何が起きたか
arXivは2026-10-08、論文「MiniWAM: Learning Compact Future Targets for Efficient World-Action Modeling」を公開した。著者らは、ロボットのWorld Action Models(WAMs)が将来状態を予測する際の高次元ターゲットを、圧縮した未来表現に置き換える手法を提案した。論文では、native future feature tokensを65倍少なくしつつ、world-action trainingの速度を最大8倍高めたとしている。
詳細
MiniWAMは、事前学習済みの視覚バックボーンが持つnative representation spaceで未来状態を予測するのではなく、privileged current-future transitionsから学んだコンパクトな未来表現を予測する構成である。そのための前段として、Inverse Spatiotemporal Modeling(PRISM)を導入し、inverse-dynamics supervisionとfeature reconstructionを組み合わせて、制御に関係する遷移情報を強調する。 PRISM encoderを固定したうえで、MiniWAMは現在の観測から、PRISMで得たターゲットとロボット行動を同時に予測する。論文は、DINOv3とWAN2.1 VAEの両方の特徴で、native future-feature predictionより一貫して高い性能を示したとしている。また、0.25B parametersのMiniWAMは、LIBERO、LIBERO-Plus、RoboTwin 2.0のシミュレーションベンチマークで、より大きなWAMと競争力があるとしている。
Key Facts
| 論文「MiniWAM: Learning Compact Future Targets for Efficient World-Action Modeling」は2026-10-08にarXivで公開された。 | [1] |
| MiniWAMは、native future feature tokensを65倍少なくして学習する。 | [1] |
| world-action trainingの速度を最大8倍高めたとしている。 | [1] |
| MiniWAMは0.25B parametersである。 | [1] |
| LIBERO、LIBERO-Plus、RoboTwin 2.0のシミュレーションベンチマークで競争力があるとしている。 | [1] |
本紙の見方
今回の論文で新しいのは、World Action Modelsが未来状態をどう予測するかという問題に対し、予測対象そのものを圧縮してしまう設計を前面に出した点である。従来のWAMは、事前学習済み視覚バックボーンのnative representation spaceで高次元の未来特徴を当てにいくため、学習コストが重くなりやすい。MiniWAMはそこを、PRISMで作ったコンパクトな未来表現に切り替え、さらに行動予測と同時に学習させる構成にした。ここで主役はモデル規模の拡大ではなく、ターゲット設計の圧縮だと読める。 本紙の関連記事はないが、公開情報だけから見ると、MiniWAMは「大きいモデルをさらに大きくする」方向ではなく、世界モデルの学習信号を制御に必要な部分へ絞り込む方向にある。PRISMがinverse-dynamics supervisionとfeature reconstructionを組み合わせる点は、単なる再構成ではなく、行動に結びつく遷移の表現を優先する設計であることを示す。一方で、論文が示すのは主にシミュレーションベンチマークでの結果であり、実機での安定性や、どの程度のタスク群に一般化するかは別問題である。 産業構造への含意としては、計算資源の使い方が「巨大な未来予測」から「圧縮した制御関連表現」へ移る可能性がある。これは、ロボット政策の学習で必要なGPU時間やデータ量の圧縮に関わるため、同じ計算予算で試せるモデル数や訓練反復の回数に影響しうる。ただし、論文中で示されているのは65倍少ないtokensと最大8倍の学習高速化であり、その効果がどの条件で維持されるかは、ベンチマークごとの設定依存が大きいとみられる。 次に確認すべき論点は、0.25B parameters以外のモデルサイズ比較、PRISMの学習に要する前処理コスト、実機ロボットでの性能、そしてDINOv3とWAN2.1 VAE以外の表現でも同様の優位が出るかである。特に、圧縮した未来表現が、タスクの複雑化や長期予測でどこまで破綻しないかが焦点になる。
なぜ重要か
arXiv論文が示す65倍のtoken削減と最大8倍の学習高速化は、世界モデルの学習で計算資源をどこに配分するかという課題に直接関係する。0.25B parametersでより大きなWAMに競争力があるとしている点は、モデルの大型化以外の効率化余地があることを示す。
日本への影響
日本のロボット研究や実装で論点になるのは、世界モデルの学習を支える計算資源と、シミュレーションから実機へ移す際の検証コストである。MiniWAMのように未来表現を圧縮する設計は、限られた計算予算で反復実験を回す場面で意味を持つ可能性があるが、実機での再現性が確認されない限り、適用範囲は限定的とみられる。